Koľko RAM potrebuje váš notebook na lokálne spúšťanie AI?

Stiahnutie s veľkosťou 3,4 GB s názvom qwen3.5:4b-q4_K_M (LLM, veľký jazykový model) vám dnes večer odpovie na otázku na bežnom notebooku so 16 GB RAM, bez cloudového účtu. Stiahnite si ho cez Ollama, položte mu otázku pri 4K kontexte a spustíte skutočný AI model lokálne, na hardvéri, ktorý už máte. Pracuje s textom aj obrázkami a ide o inferenciu, nie tréning: model sa tu nič nové neučí, len odpovedá.

Nejasná nálepka „AI PC“ na krabici notebooku nie je technická špecifikácia. Rozhoduje RAM, pamäť, ktorú môže využiť GPU, úložisko a reálna softvérová podpora. 16 GB pamäte je skutočný vstupný bod pre menšie AI modely. Nie je to niečo, čo môžete hneď odpísať ako holé minimum, ale ani prísľub všetkého, čo sľubuje technický list. Viac pamäte vám dá viac kontextu a viac priestoru na multitasking. So 16 GB sa dá začať.

Čo pri spustení AI v notebooku reálne využíva RAM

Veľkosť stiahnutého modelu a to, koľko RAM zaberá počas behu, sú dve rozdielne čísla. Ich zamieňanie je pri výbere notebooku na AI vôbec najčastejšia chyba. Tých 3,4 GB, ktoré sťahujete pri modeli qwen3.5:4b-q4_K_M, je súbor uložený na disku. Na načítanie však potrebujete skutočnú operačnú pamäť. Rovnako aj kontextové okno, teda priebežnú konverzáciu, ktorú si model počas odpovede drží v pamäti, nazývanú KV cache. A RAM potrebuje aj samotný engine spolu so všetkým, čo už využíva operačný systém a ostatné aplikácie.

Ollama štandardne načíta kontext so 4 096 tokenmi a vy ho môžete zvýšiť. Ak naraz beží viac požiadaviek, potreba pamäte na kontext sa násobí približne podľa ich počtu. Technický list modelu môže uvádzať kontextové okno 128K alebo 256K tokenov, ale berte to ako horný limit modelu, nie ako sľub, že váš notebook so 16 GB zvládne naraz využiť celý tento rozsah.

RAM, VRAM a jednotná pamäť nie sú jedna spoločná pamäť

Čipy Apple Silicon používajú jednotnú pamäť: CPU aj GPU čerpajú z rovnakého balíka 16, 24 alebo 32 GB, takže tu nie je samostatná grafická pamäť, ktorá by sa mohla minúť. Bežný notebook s Windowsom alebo Linuxom a dedikovanou grafikou NVIDIA funguje inak. Systémová RAM a vlastná VRAM grafiky sú dve oddelené pamäťové oblasti a 16 GB systémovej RAM plus 8 GB grafickej pamäte nie je jeden spoločný balík 24 GB, ktorý môže model voľne používať.

Ak sa model celý nezmestí do GPU, časť beží na CPU, teda ide o čiastočný offload, ktorý môže aj pri technicky spustiteľnom modeli citeľne spomaliť odozvu. Príkaz vám presne ukáže rozdelenie medzi CPU a GPU pre všetko, čo je práve načítané.

Kapacita je len polovica príbehu. Rovnako dôležitá je aj rýchlosť, akou sa táto pamäť presúva. Apple pri MacBooku Air M5 uvádza pamäťovú priepustnosť 153 GB/s a práve priepustnosť, nielen veľkosť, je dôležitou súčasťou toho, prečo jednotná pamäť pôsobí svižne, nie iba ako technicky postačujúce riešenie.

Kvantizácia: ako zmenšiť AI model 9B tak, aby sa zmestil do vašej RAM

Kvantizácia je mechanizmus, vďaka ktorému má toto stiahnutie len 3,4 GB: uloženie váh modelu s nižšou číselnou presnosťou zmenší súbor a práve vlastný 9B model Qwen3.5 to ukazuje veľmi jasne. Ten istý 9B model sa sťahuje ako 6,6 GB vo verzii Q4_K_M, 11 GB vo verzii Q8_0 a 19 GB pri plnej presnosti BF16. Stále ide o ten istý model, s rovnakým počtom parametrov, ale s tromi veľmi odlišnými veľkosťami súboru. A opäť platí, že ide o veľkosť stiahnutia, nie o RAM potrebnú počas behu.

Nižšia presnosť vo všeobecnosti znamená aj určitú stratu kvality, no jej rozsah závisí od konkrétnej úlohy, nie od pevne daného percenta. Ešte jedna praktická zvláštnosť, ktorú sa oplatí vedieť skôr, než si vyberiete Qwen ako prvý model: niektorí používatelia uvádzajú, že jeho krok „thinking“ prináša citeľné oneskorenie pred zobrazením odpovede v porovnaní s modelmi, ktoré odpovedajú priamočiarejšie. Preto sa oplatí vyskúšať oba prístupy na vlastných úlohách, namiesto toho, aby ste vopred predpokladali, že jeden je jednoducho lepší.

Už máte MacBook so 16 GB? Skúste toto skôr, než čokoľvek kúpite

Ak už máte MacBook so 16 GB, začnite s modelom 2-4B v presnosti Q4 a so 4K kontextom skôr, než začnete kupovať čokoľvek ďalšie. Načítať sa môže aj 9B model v Q4 alebo niečo ako Gemma 4 12B QAT. To, či sa to podarí, závisí od toho, koľko ďalších aplikácií máte otvorených, aký veľký kontext používate a ako veľmi je zariadenie už zahriate, preto to berte ako niečo, čo sa oplatí vyskúšať, nie ako záruku.

Chcete kupovať nový notebook vyslovene na toto použitie? MacBook Air 13-palcový s čipom M5 sa štandardne dodáva so 16 GB jednotnej pamäte a dá sa nakonfigurovať až na 32 GB. A ešte skôr, než vás ako upgrade zláka väčšia obrazovka: 15-palcový Air s M5 začína pri rovnakých možnostiach pamäte 16, 24 a 32 GB a s rovnakou priepustnosťou 153 GB/s ako 13-palcová verzia. Veľkosť obrazovky si vyberajte podľa pohodlia, nie preto, že by vám mala priniesť viac priestoru pre AI. Neprinesie ho.

MacBook Air 13-palcový s čipom M5

Už máte notebook s Windowsom alebo Linuxom a 16 GB? Začnite tu

Aj notebook s Windowsom alebo Linuxom so 16 GB bez dedikovanej grafiky zvládne spustiť malý model. Ollama beží natívne vo Windowse, takže si stiahnite 2-4B model v Q4 a najprv ho skúste na CPU alebo integrovanej grafike, skôr než miniete čo i len euro. Očakávajte však väčšie rozdiely v tom, ako to bude pôsobiť, než pri Apple Silicon: neexistuje jedno pevné číslo tokenov za sekundu, ktoré by platilo pre každý stroj, keďže nikto nezmeral každú konfiguráciu.

Lenovo ThinkPad T14 G2 aj HP EliteBook x360 1040 G7 majú 16 GB RAM a integrovanú grafiku, teda presne túto triedu. Jednu vec sa oplatí overiť ako prvú, najmä pri staršom repasovanom zariadení, ako je ktorýkoľvek z týchto dvoch modelov: LM Studio vo Windowse x64 vyžaduje podporu AVX2, teda sadu inštrukcií, ktorú nemajú všetky staršie procesory. Skôr než budete predpokladať, že akýkoľvek notebook z tejto kategórie spustí vami zvolený nástroj, overte si podporu pri konkrétnom procesore.

Notebook Lenovo ThinkPad T14 G2

Pasca v názvoch notebookových GPU: prečo „RTX 5070 Ti“ nie je jedno číslo

Notebookové GPU od NVIDIA nesú rovnaké názvy ako desktopové karty, no samotný názov prezradí menej, než by ste čakali. RTX 5060 Laptop GPU má 8 GB pamäte GDDR7 a zverejnený rozsah príkonu 45 až 100 wattov. RTX 5070 Ti Laptop GPU má 12 GB GDDR7 a 60 až 115 wattov. Výsledok desktopovej RTX 5070 Ti, ktorý nájdete online, nie je výsledok notebookovej RTX 5070 Ti, bez ohľadu na to, čo názov naznačuje.

V tom istom názve sa skrýva ešte jedna pasca. Dva notebooky môžu mať „RTX 5070 Ti Laptop GPU“ a napriek tomu pod dlhodobou záťažou podávať rozdielny výkon: tenké a ľahké šasi a hrubšie, ťažšie šasi pracujú s teplom odlišne a rovnaký názov GPU nezaručuje rovnakú reálnu rýchlosť po tom, čo už ventilátory bežia nejaký čas. Vždy si preto overte presnú kapacitu VRAM a konkrétne napájacie nastavenie notebooku, nielen názov rodiny GPU.

Kupujete nový Mac? Pohodlnejšia trieda s jednotnou pamäťou

Ak kupujete zariadenie vyslovene na pravidelné hostovanie lokálnej AI, 24 až 32 GB jednotnej pamäte je pri Apple pohodlnejšia trieda: necháva vám reálny priestor na väčší model, dlhší kontext alebo jednoducho na to, aby ste popri práci nechali otvorené aj ďalšie aplikácie. Ak očakávate, že to budete využívať často, a rozpočet vám to dovolí, siahnite po 32 GB.

MacBook Pro 13-palcový s čipom M2 je konkrétny repasovaný príklad, ktorý už je nad vstupnou úrovňou 16 GB: jeho 8-jadrové CPU a 10-jadrové GPU sa spájajú s jednotnou pamäťou až do 24 GB. Ide o staršiu generáciu čipu než pri Air s M5, takže práve strop 24 GB je to, čo tu môžete očakávať, nie samostatné možnosti konfigurácie 24/32 GB ako pri Air s M5.

MacBook Pro 13-palcový s čipom M2

Kupujete nový notebook s Windowsom alebo Linuxom? Hľadajte dedikovanú grafiku

Ak kupujete nový notebook s Windowsom alebo Linuxom najmä kvôli lokálnej AI, hľadajte 32 GB systémovej RAM spolu s dedikovaným notebookovým GPU od NVIDIA, ktoré má aspoň 8 GB vlastnej VRAM, ideálne 12 GB, ak vám vyhovuje o niečo ťažší alebo drahší notebook. 8 GB je realistický cieľ pre modely 4-7B v presnosti Q4 so stredne veľkým kontextom, no neberte to ako automatickú rezervu: aj 6,6 GB stiahnutie 9B modelu v Q4 môže na pohodlný beh potrebovať viac než len holých 8 GB a 12 GB jednoducho otvára väčší priestor na testovanie v tejto veľkosti.

Dell Precision 7730 je konkrétny repasovaný príklad tejto myšlienky, aj keď nie s presne tými novými čipmi, o ktorých bola reč vyššie: 32 GB systémovej pamäte tu dopĺňa dedikovaná NVIDIA Quadro P3200 s vlastnými 6 GB VRAM. Ide o inú generáciu a triedu GPU než pri dnešných notebookových GPU NVIDIA RTX 5060 a 5070 Ti, no princíp oddelených pamäťových oblastí zostáva rovnaký.

Mobilná pracovná stanica Dell Precision 7730

Rozumná alternatíva: notebookové čipy AMD s veľkou pamäťou

Procesor AMD Ryzen AI Max+ 395 podporuje až 128 GB systémovej pamäte LPDDR5x, podľa toho, ako je nakonfigurovaný konkrétny notebook. Ide o inú pamäťovú architektúru, ktorú sa oplatí poznať, a má aj dôležitý háčik: v zozname podpory ROCm pre Linux od Ollama je tento čip uvedený, no v aktuálnom zozname ROCm pre Windows nie.

To je dôvod overiť si presne nainštalovanú pamäť, operačný systém, GPU backend, ovládač aj správanie Ollamy na konkrétnom notebooku skôr, než ho odporučíte, nie dôvod tento čip hneď zavrhnúť. Notebook s AMD a veľkou pamäťou preto berte ako zaujímavú alternatívnu architektúru, ktorú sa oplatí dôkladne preskúmať, nie ako predvolený prvý nákup pre niekoho, kto s lokálnym spúšťaním AI ešte len začína.

Softvérová vrstva: Ollama a LM Studio bez zbytočného žargónu

Ollama je najjednoduchší spôsob, ako rozbehnúť model na vlastnom zariadení: stiahnete model, spustíte ho a máte lokálny server, ktorý odpovedá na požiadavky, bez potreby cloudového účtu pre stiahnutý model. Je to nástroj, na ktorom stojí každý príklad tu.

LM Studio ponúka grafickú alternatívu s vlastným prehliadačom modelov a chatovacím oknom. Zverejňuje aj svoje minimálne požiadavky: aspoň 16 GB RAM na Macu alebo Windowse, vo Windowse x64 je povinná podpora AVX2 a vo Windowse sa odporúčajú 4 GB dedikovanej VRAM. Správne nastavenie ktoréhokoľvek z týchto nástrojov je téma sama osebe.

Ešte jedno upozornenie skôr, než uveríte jedinému číslu o rýchlosti, ktoré nájdete online: oficiálny nástroj llama-bench oddeľuje rýchlosť spracovania promptu od rýchlosti generovania a uvádza aj rozdiely medzi opakovanými meraniami namiesto jedného čísla. Príspevok na fóre s jediným údajom o počte tokenov za sekundu málokedy povie, ktorú z týchto dvoch hodnôt vlastne meral, alebo koľkokrát test prebehol.

Kontrolný zoznam pri kúpe alebo upgrade notebooku pripraveného na AI

Ak kupujete alebo upgradujete notebook vyslovene kvôli lokálnej AI, sledujte konkrétne parametre, nie marketing.

Presný model GPU a VRAM. Nestačí len názov rodiny GPU, ale konkrétna verzia notebooku a presná kapacita jeho pamäte, pretože rovnaký názov môže skrývať rôzne veľkosti VRAM.

Pripájkovaná alebo rozšíriteľná RAM. Pri niektorých notebookoch môžete pamäť doplniť neskôr, pri mnohých moderných tenkých a ľahkých modeloch nie. Je dobré vedieť, ktorý typ kupujete.

Voľné miesto na SSD. Stiahnuté modely majú od menej než jedného gigabajtu až po výrazne viac než desať a rastúca zbierka sa vedľa vašich ďalších súborov nazbiera rýchlo.

Teplotné správanie pri dlhšej záťaži. Jedna odpoveď modelu a notebook, ktorý vybavuje viac požiadaviek za sebou, sú dva rozdielne testy. Hluk ventilátorov a throttling po opakovaných promptoch vám povedia viac než jedno rýchle demo.

Podpora operačného systému a ovládačov. Skôr než budete niečo predpokladať, overte si, či vaša presná kombinácia GPU backendu a operačného systému podporuje Ollamu alebo LM Studio.

Údaj NPU TOPS na krabici nie je zárukou priepustnosti. Je to marketingové číslo, nie otestovaný výsledok z enginu, ktorý budete používať. Nejasné označenie „AI PC“ nenahrádza žiadnu z kontrol uvedených vyššie.

Časté otázky o spúšťaní AI na notebooku

Potrebujem na lokálne spúšťanie AI dedikovanú grafiku?

Nie. Malý model beží na CPU alebo integrovanej grafike na mnohých notebookoch so 16 GB, len s väčšími rozdielmi v rýchlosti než pri notebooku s dedikovaným GPU. Začnite modelom 2-4B skôr, než budete predpokladať, že dedikovanú grafiku vôbec potrebujete.

Bude stačiť 8 GB RAM?

Nie pohodlne pri modeloch, ktorým sa venujeme tu. 16 GB je realistický štartovací bod, keď zohľadníte, že model, jeho kontextové okno, engine aj operačný systém zdieľajú tú istú pamäť.

Je lokálne spustenie modelu to isté ako jeho trénovanie?

Nie. Všetko vyššie je inferencia, teda kladenie otázok už natrénovanému modelu. Trénovanie vytvára model od nuly a vyžaduje oveľa viac hardvéru než ktorýkoľvek notebook spomenutý tu.

Zaručí viac RAM rýchlejšie odpovede?

Nie. Viac pamäte znamená väčšiu rezervu pre väčšie modely, dlhší kontext a viac otvorených aplikácií, no reálna rýchlosť závisí od pamäťovej priepustnosti, GPU backendu a konkrétneho modelu, nielen od veľkosti pamäte.

Sú moje dáta súkromné, keď model beží lokálne?

Áno, v tom zmysle, že vaše prompty zostávajú vo vašom zariadení namiesto odoslania poskytovateľovi cloudu. Ollama je štandardne naviazaná na váš vlastný notebook a neposiela požiadavky nikam inam, pokiaľ si zámerne nenastavíte cloudový prístup.

Vyskúšajte to ešte dnes večer a potom nakupujte s istotou

Už máte notebook so 16 GB? Nainštalujte si ešte dnes Ollamu a spustite jeden malý model skôr, než miniete jediné euro na niečo nové. Kupujete zariadenie vyslovene na toto? Berte kontrolný zoznam vyššie aj päť repasovaných notebookov, ktoré sme práve prešli, ako východiskové porovnanie namiesto marketingového technického listu.

Každý notebook na refurbed prejde pred zaradením do ponuky testovaním a hodnotením, takže RAM a konfigurácia, ktoré kupujete, sú presne tie, ktoré dostanete. Ďalší sprievodca v tejto sérii ukáže, ako pripojiť prvú aplikáciu k modelu, ktorý ste si práve vyskúšali.

Otvorený MacBook Air na stole pripravený na spustenie lokálneho AI modelu

Prihláste sa na odber nášho newslettra po prvý raz a ušetrite 15 €!

Už nikdy nezmeškajte ponuku.

Informácie o používaní osobných údajov nájdete v našich Zásadách ochrany osobných údajov.