Cât VRAM îți trebuie pentru un model LLM (7B, 32B, 70B)
Memoria plăcii video (VRAM) decide ce model poți rula local. Tabel practic pe dimensiuni de model și nivel de cuantizare, plus ce placă alegi pentru fiecare.
De ce VRAM-ul e factorul decisiv
Ca să ruleze fluent, un model AI trebuie să încapă în memoria plăcii video (VRAM). Dacă modelul nu încape, fie nu pornește, fie se „revarsă" în memoria RAM a sistemului și încetinește de zeci de ori. De aceea VRAM-ul, nu procesorul, este prima limitare când rulezi AI local.
Dimensiunea unui model se dă în miliarde de parametri (B, de la „billion"): 7B, 14B, 32B, 70B și mai mult. Cu cât modelul e mai mare, cu atât e mai capabil — dar cere mai mult VRAM.
Cuantizarea: cum încap modele mari în VRAM mai mic
Cuantizarea reduce precizia numerelor din model (de la 16 biți la 8, 4 sau chiar mai puțin), micșorând memoria necesară cu un cost mic de calitate. Cuantizarea pe 4 biți (Q4) este standardul practic pentru rulare locală: taie memoria la aproximativ un sfert față de precizia completă, cu o pierdere de calitate greu sesizabilă în uz real.
Regula rapidă: la 4 biți, un model are nevoie de aproximativ 0,6–0,7 GB VRAM pentru fiecare miliard de parametri, plus o rezervă pentru fereastra de context. Un model de 7B intră confortabil în ~6–8 GB, unul de 70B în ~40–48 GB.
Tabel: VRAM pe dimensiune de model (cuantizare 4 biți)
| Model | VRAM minim (Q4) | Placă recomandată | Bun pentru |
|---|---|---|---|
| 7–8B | 8–12 GB | RTX 2000 Ada / RTX PRO 2000 | Asistenți de cod, chat, sarcini simple |
| 13–14B | 12–16 GB | RTX 4000 Ada 20GB | Rezumat, extragere, RAG mic |
| 32B | 24–32 GB | RTX 5000 Ada 32GB | Raționament bun, RAG pe volume medii |
| 70B | 40–48 GB | RTX 6000 Ada 48GB | Calitate ridicată, agenți, RAG mare |
| 100B+ | 80 GB+ / multi-GPU | Z8 multi-GPU / HP ZGX | Echipe, modele mari, training |
Nu uita de fereastra de context
Pe lângă model, memoria mai e consumată de contextul activ (documentele și istoricul din prompt). Un context lung (de exemplu 32K–128K tokeni) poate adăuga câțiva GB de VRAM peste dimensiunea modelului. De aceea recomandăm mereu o rezervă: alege cu o treaptă de VRAM peste minimul strict.
Ca principiu: VRAM-ul e cel mai greu de compensat ulterior. E mai înțelept să iei mai mult VRAM decât crezi că îți trebuie azi, ca să nu fii blocat de următoarea generație de modele.
Întrebări frecvente
Pot rula un model de 70B pe o singură placă?
Da, un model de 70B cuantizat pe 4 biți intră pe o placă cu 48 GB VRAM (de exemplu NVIDIA RTX 6000 Ada). Fără cuantizare (precizie completă) ar cere mult mai mult și ai avea nevoie de configurație multi-GPU.
Ce se întâmplă dacă modelul nu încape în VRAM?
Modelul se „revarsă" în memoria RAM a sistemului, iar viteza scade dramatic (de zeci de ori). Practic devine inutilizabil pentru lucru real. De aceea VRAM-ul suficient e obligatoriu, nu opțional.
Contează și memoria RAM a sistemului, nu doar VRAM-ul?
RAM-ul de sistem ajută la încărcarea modelului și la contextul foarte mare, dar rularea propriu-zisă se face în VRAM. Recomandăm ca RAM-ul de sistem să fie cel puțin egal cu VRAM-ul, ideal dublu.
Vrei să începi cu AI local?
Îți dimensionăm un workstation exact pe modelul și fluxul tău. Consultanță gratuită.