Lokálna AI na notebooku: vlastná služba pre ďalšie aplikácie

Notebook vám odpovie na otázku aj úplne bez internetu. Potom bez akejkoľvek zmeny odpovie na tú istú otázku aj druhej aplikácii na tom istom počítači. Práve vtedy sa z notebooku, ktorý už používate, stáva malá vlastná AI služba pre ďalšie aplikácie a skripty.

Ide o spustenie stiahnutého modelu, nie o jeho trénovanie. Ak ste si ešte neoverili, či má váš notebook dosť RAM alebo VRAM, prečítajte si článok koľko RAM potrebuje váš notebook na lokálnu AI. Ak už viete, že váš notebook požiadavky spĺňa, pokračujte.

Štyri vrstvy, z ktorých sa skladá lokálna AI

Lokálna AI má štyri samostatné vrstvy. Keď viete, čo ktorá robí, v ďalších krokoch sa ľahšie zorientujete.

Váhy modelu predstavujú súbor, ktorý si stiahnete, napríklad kvantizovanú verziu malého modelu s veľkosťou 3,4 GB. Táto veľkosť udáva miesto na disku; nezaručuje, že modelu pri behu stačí rovnaká kapacita RAM.

Inferenčný nástroj je program, ktorý načíta váhy modelu a odpovedá na požiadavky. V tomto návode túto úlohu plní Ollama s vlastným lokálnym HTTP API. Vďaka nej môžu model na notebooku využívať aj ďalšie aplikácie.

Klientská časť posiela požiadavky a určuje, či zadanie zostane na notebooku, alebo sa odošle inam. Môže ísť o chat v Ollame, krátky skript alebo samostatnú aplikáciu.

Voliteľný index dokumentov umožňuje chatovaciemu modelu prehľadávať vaše súbory. Vyžaduje samostatný model na vytváranie embeddingov a vlastné úložisko. Nevzniká automaticky a v tomto návode sa mu nevenujeme.

Stručne: aplikácia alebo skript pošle požiadavku na adresu 127.0.0.1:11434, kde beží Ollama. Tá načíta model, ktorý ste si stiahli. Vymazaním stiahnutého modelu nevymažete históriu chatu uloženú v klientskej aplikácii. Model a história sú uložené na rôznych miestach.

Pred inštaláciou: má váš notebook výbavu ako niektorý z týchto dvoch?

Vyhraďte si dve minúty a spíšte si základné parametre notebooku: kapacitu RAM, operačný systém, procesor, prípadnú samostatnú grafickú pamäť (VRAM) a voľné miesto na SSD. Podrobné vysvetlenie, koľko RAM a VRAM lokálna AI potrebuje, nájdete v článku koľko RAM potrebuje váš notebook na lokálnu AI.

Oba notebooky uvedené nižšie sú aktuálne dostupné na refurbed. Sú repasované: odborne otestované, vyčistené a obnovené. Na oba sa vzťahuje 12-mesačná záruka. Prvý patrí do základnej triedy notebookov Apple s čipom Apple Silicon, druhý používa Windows a má vyhradenú grafickú pamäť. S oboma zvládnete všetky nasledujúce kroky.

Ollama pre macOS, Windows a Linux: ako ju nainštalovať

Na macOS a Windows použite oficiálnu aplikáciu Ollama, v Linuxe sa riaďte jej návodom na inštaláciu. Po inštalácii Ollamu spustite. Ak v Linuxe služba ešte nebeží, zadajte ollama serve.

Súčasná aplikácia ponúka lokálne modely aj cloudové možnosti. Vyberte si označenie konkrétneho stiahnutého modelu, ktorý spustíte lokálne. Na jeho spustenie sa prihlasovať nemusíte.

Pre tento návod si stiahnite presne označený model qwen3.5:4b-q4_K_M s veľkosťou 3,4 GB. Na označení záleží: všeobecné „latest“ môže bez upozornenia odkazovať na oveľa väčší model, než ste skúšali. Hodnota 3,4 GB označuje veľkosť súboru na disku, nie pamäť RAM, ktorú model potrebuje pri odpovedaní.

Stiahnite prvý model a vyskúšajte ho

Na prvý rozhovor s modelom stačia dva príkazy:

ollama pull qwen3.5:4b-q4_K_M

ollama run qwen3.5:4b-q4_K_M

Prvým si model stiahnete, druhým s ním začnete interaktívny rozhovor. Namiesto všeobecného pozdravu mu zadajte jednu malú, skutočnú úlohu. Napríklad: „Z týchto troch poznámok z porady vytvor zoznam úloh. Dátumy si nevymýšľaj.“

Keď skončíte, zadajte /bye a chat sa ukončí.

Pošlite požiadavku cez API: AI beží lokálne na notebooku

Doteraz posielal požiadavky inferenčnému nástroju chat v termináli. Teraz mu požiadavku pošlete priamo, rovnako ako ďalšia aplikácia.

Ak používate macOS alebo Linux:

curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Jednou vetou vysvetli lokálnu inferenciu."}],"stream":false,"options":{"num_ctx":4096}}'

Vo Windowse použite PowerShell:

Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Jednou vetou vysvetli lokálnu inferenciu."}],"stream":false,"options":{"num_ctx":4096}}'

V odpovedi hľadajte message.content. Pri stream nastavenom na false dostanete celú odpoveď naraz namiesto jej postupného odosielania. Nastavenie num_ctx: 4096 drží tento prvý test v skromnom rozsahu oproti oveľa vyššiemu maximu uvádzanému pri modeli.

Čo sa dozviete z odpovede

Ollama vám okrem samotnej odpovede v poli message.content vráti aj údaje o čase a počte tokenov: load_duration, prompt_eval_count, prompt_eval_duration, eval_count a eval_duration. Oplatí sa ich sledovať.

Pomôžu vám oddeliť čas načítania modelu do pamäte od času generovania odpovede. Jediné číslo „tokeny za sekundu“ tento rozdiel neukáže. Prvá požiadavka po spustení Ollamy býva najpomalšia, pretože sa pri nej model musí načítať. Pri ďalšej už toto načítanie odpadá.

Presné hodnoty závisia výlučne od vášho počítača, preto tu neuvádzame nijaké „typické“ čísla. Namiesto jediného údaja o rýchlosti porovnajte uvedené polia pri dvoch požiadavkách na tom istom notebooku.

Načítané a stiahnuté modely: ps, ls a uvoľnenie pamäte

Na základné úkony stačia tri príkazy: dvoma skontrolujete modely, tretím odstránite nepotrebný stiahnutý model.

ollama ps ukáže, ktoré modely sú práve načítané a na čom bežia. V stĺpci procesora uvidíte 100 % GPU, 100 % CPU alebo kombináciu oboch.

ollama ls vypíše všetky stiahnuté modely.

ollama rm qwen3.5:4b-q4_K_M odstráni stiahnutý model, ktorý už nepotrebujete.

Ollama v predvolenom nastavení uvoľní model z pamäte po piatich minútach nečinnosti. Ak ollama ps neukáže žiadny načítaný model, nemusí to znamenať, že niečo nefunguje. Najprv pošlite ďalšiu požiadavku.

Pripojte druhú aplikáciu cez lokálne API kompatibilné s OpenAI

Ollama tak nebude slúžiť len vlastnému chatu: druhú aplikáciu nasmerujete na notebook namiesto cloudovej služby.

Väčšina aplikácií s možnosťou nastaviť vlastnú adresu API kompatibilného s OpenAI sa pýta na tri údaje: základnú URL adresu, názov modelu a API kľúč. Ako základnú URL zadajte http://localhost:11434/v1/ a ako názov modelu qwen3.5:4b-q4_K_M.

Niektoré aplikácie nenechajú pole pre API kľúč prázdne. Dokumentácia Ollamy preto používa zástupnú hodnotu api_key='ollama' a výslovne uvádza, že lokálny server síce vyžaduje neprázdnu hodnotu, ale jej obsah ignoruje. Tento reťazec nikoho neoveruje: vypĺňa len políčko vo formulári, nie je to heslo.

Kompatibilita sa navyše vzťahuje len na časť funkcií jednotlivých API. Ak chcete napríklad posielať obrázky alebo využívať volanie nástrojov, otestujte danú funkciu vo svojej konkrétnej aplikácii. Nespoliehajte sa na to, že funguje všetko.

Odpojte internet a zopakujte požiadavku

Aj doterajšie odpovede by teoreticky mohli prichádzať cez internet. Odpojením to vylúčite.

Keď sa model úplne stiahne, vypnite na notebooku Wi-Fi alebo odpojte sieťový kábel. Potom v chate alebo cez API zopakujte tú istú požiadavku. Ak dostanete skutočnú odpoveď bez akéhokoľvek pripojenia, je to dôkaz, že model beží lokálne.

Za dôkaz nepovažujte odpoveď, ktorú dostanete iba online, odpoveď zo služby https://ollama.com namiesto localhost ani odpoveď z cloudového modelu namiesto stiahnutého. Požiadavka na lokálny model v Ollame zostáva na vašom počítači; pri cloudových modeloch využíva Ollama samostatnú hostovanú službu.

Súkromie pri lokálnej AI: na čo si dať pozor

Lokálny model ešte sám osebe nezaručuje súkromie. Dôležité je vedieť, ktoré nastavenia vás chránia a ktoré nie.

Ollama predvolene počúva len na adrese 127.0.0.1:11434 a prijíma tak spojenia iba z vášho notebooku. Predvolené nastavenie nemeňte. Nenastavujte OLLAMA_HOST=0.0.0.0 ani nepresmerujte port 11434 na verejný internet: zástupný API kľúč z predchádzajúcej časti nič neoveruje. Otvorený port by nechránilo žiadne heslo.

Vypnutie cloudových funkcií Ollamy je voliteľné: stiahnutý lokálny model beží na notebooku aj bez neho. Ak však chcete cloudové funkcie úplne vypnúť, pridajte do ~/.ollama/server.json nastavenie {"disable_ollama_cloud": true} alebo nastavte OLLAMA_NO_CLOUD=1. Potom Ollamu reštartujte, aby sa zmena prejavila.

Ak sa chcete k Ollame pripájať z inej miestnosti alebo zariadenia, ide už o pokročilejšie nastavenie. Potrebujete súkromnú sieť a sprostredkujúci server s overovaním prístupu. Tomu sa v tomto návode nevenujeme; priame sprístupnenie portu nie je správna cesta.

Keď niečo nefunguje

Tu sú najčastejšie zádrhy a prvé veci, ktoré sa oplatí skontrolovať.

Spojenie bolo odmietnuté. Skontrolujte, či je spustená aplikácia Ollama, prípadne služba cez ollama serve, a skúste požiadavku znova.

Prvá odpoveď trvá dlho, ďalšie sú rýchlejšie. Rozdiel je v čase načítania modelu, nie v rýchlosti generovania. Porovnajte údaje v odpovediach opísané vyššie.

Všetko beží oveľa pomalšie, než ste čakali. Spustite ollama ps a pozrite sa, či model využíva len CPU alebo sa práca delí medzi CPU a GPU. Potom overte podporu grafickej karty a jej ovládačov vo svojom operačnom systéme.

Dochádza pamäť alebo program padá. Zvoľte menší variant modelu, znížte num_ctx a pred ďalším pokusom zavrite ďalšie aplikácie náročné na pamäť.

Dochádza vám miesto na disku. Pomocou ollama ls si pozrite stiahnuté modely a tie, ktoré už nepotrebujete, odstráňte príkazom ollama rm.

Ak vám tento postup nevyhovuje, napríklad preto, že chcete modely prehliadať v grafickom rozhraní alebo podrobnejšie riadiť využitie CPU a GPU, pozrite sa na LM Studio a llama.cpp. V takom prípade má zmysel vymeniť inferenčný nástroj, nie spúšťať dve riešenia vedľa seba.

Časté otázky o lokálnej AI na notebooku

Potrebujem po nastavení internet? Nie. Keď sa model úplne stiahne, rozhovor s ním aj požiadavky cez API fungujú úplne bez pripojenia.

Chráni zástupný API kľúč prístup k serveru? Nie. Lokálny server Ollamy prijme akúkoľvek neprázdnu hodnotu a nekontroluje jej obsah. Kľúč, ktorý niektoré aplikácie vyžadujú, teda nie je bezpečnostnou ochranou.

Zostane moje zadanie na notebooku? Áno, ak si vyberiete označenie stiahnutého lokálneho modelu. Ollama ponúka aj samostatné cloudové modely, ktoré využívajú hostovanú službu. Rozhoduje teda zvolené označenie modelu, nie skryté predvolené nastavenie.

Potrebujem samostatnú grafickú kartu? Nie. Menší model spustíte aj na notebooku, ktorý využíva iba CPU, zvyčajne však pomalšie. ollama ps presne ukáže, ako sa konkrétna požiadavka spracovala.

Čo ak chcem väčší alebo iný model? Najprv skontrolujte kapacitu RAM a VRAM, potom v príkazoch ollama pull a ollama run zmeňte označenie modelu. Podrobnosti nájdete v článku koľko RAM potrebuje váš notebook na lokálnu AI.

Bude si model odteraz pamätať moje dokumenty? Nie. Chatovací model si sám od seba natrvalo nezapamätá obsah priečinka. Na prehľadávanie vlastných súborov potrebujete samostatný index dokumentov, voliteľnú súčasť nastavenia, ktorej sa tu nevenujeme.

Teraz ste na rade vy: skúste vlastnú AI službu v praxi

Vyberte si jednu skutočnú úlohu a vyskúšajte ju oboma pripravenými spôsobmi: vo vstavanom chate aj v druhej aplikácii, ktorú ste práve pripojili. Môžete napríklad zhrnúť osobnú poznámku, roztriediť viacero súborov do pomenovaných skupín alebo si nechať jednoducho vysvetliť krátky úsek kódu.

Nech si vyberiete čokoľvek, zapíšte si presné označenie modelu, verziu inferenčného nástroja, nastavenie kontextu, URL adresu aj samotnú úlohu. Vďaka tomu budete môcť výsledok neskôr zopakovať vy aj ktokoľvek iný, kto skúsi to isté.

Ak ste zistili, že vášmu notebooku na tento postup chýba RAM alebo VRAM, stojí za zváženie prechod na notebook s väčšou pamäťovou rezervou. V ďalšom diele série sa pozrieme na malú sadu modelov: jeden na chat, druhý na kód a tretí na vyhľadávanie.

Repasovaný notebook vhodný na lokálne spúšťanie AI, dostupný na refurbed

Prihláste sa na odber nášho newslettra po prvý raz a ušetrite 15 €!

Už nikdy nezmeškajte ponuku.

Informácie o používaní osobných údajov nájdete v našich Zásadách ochrany osobných údajov.