6 min citire

Cât VRAM îți trebuie pentru un model LLM (7B, 32B, 70B)

Memoria plăcii video (VRAM) decide ce model poți rula local. Tabel practic pe dimensiuni de model și nivel de cuantizare, plus ce placă alegi pentru fiecare.

De ce VRAM-ul e factorul decisiv

Ca să ruleze fluent, un model AI trebuie să încapă în memoria plăcii video (VRAM). Dacă modelul nu încape, fie nu pornește, fie se „revarsă" în memoria RAM a sistemului și încetinește de zeci de ori. De aceea VRAM-ul, nu procesorul, este prima limitare când rulezi AI local.

Dimensiunea unui model se dă în miliarde de parametri (B, de la „billion"): 7B, 14B, 32B, 70B și mai mult. Cu cât modelul e mai mare, cu atât e mai capabil — dar cere mai mult VRAM.

Cuantizarea: cum încap modele mari în VRAM mai mic

Cuantizarea reduce precizia numerelor din model (de la 16 biți la 8, 4 sau chiar mai puțin), micșorând memoria necesară cu un cost mic de calitate. Cuantizarea pe 4 biți (Q4) este standardul practic pentru rulare locală: taie memoria la aproximativ un sfert față de precizia completă, cu o pierdere de calitate greu sesizabilă în uz real.

Regula rapidă: la 4 biți, un model are nevoie de aproximativ 0,6–0,7 GB VRAM pentru fiecare miliard de parametri, plus o rezervă pentru fereastra de context. Un model de 7B intră confortabil în ~6–8 GB, unul de 70B în ~40–48 GB.

Tabel: VRAM pe dimensiune de model (cuantizare 4 biți)

ModelVRAM minim (Q4)Placă recomandatăBun pentru
7–8B8–12 GBRTX 2000 Ada / RTX PRO 2000Asistenți de cod, chat, sarcini simple
13–14B12–16 GBRTX 4000 Ada 20GBRezumat, extragere, RAG mic
32B24–32 GBRTX 5000 Ada 32GBRaționament bun, RAG pe volume medii
70B40–48 GBRTX 6000 Ada 48GBCalitate ridicată, agenți, RAG mare
100B+80 GB+ / multi-GPUZ8 multi-GPU / HP ZGXEchipe, modele mari, training

Nu uita de fereastra de context

Pe lângă model, memoria mai e consumată de contextul activ (documentele și istoricul din prompt). Un context lung (de exemplu 32K–128K tokeni) poate adăuga câțiva GB de VRAM peste dimensiunea modelului. De aceea recomandăm mereu o rezervă: alege cu o treaptă de VRAM peste minimul strict.

Ca principiu: VRAM-ul e cel mai greu de compensat ulterior. E mai înțelept să iei mai mult VRAM decât crezi că îți trebuie azi, ca să nu fii blocat de următoarea generație de modele.

Întrebări frecvente

Pot rula un model de 70B pe o singură placă?

Da, un model de 70B cuantizat pe 4 biți intră pe o placă cu 48 GB VRAM (de exemplu NVIDIA RTX 6000 Ada). Fără cuantizare (precizie completă) ar cere mult mai mult și ai avea nevoie de configurație multi-GPU.

Ce se întâmplă dacă modelul nu încape în VRAM?

Modelul se „revarsă" în memoria RAM a sistemului, iar viteza scade dramatic (de zeci de ori). Practic devine inutilizabil pentru lucru real. De aceea VRAM-ul suficient e obligatoriu, nu opțional.

Contează și memoria RAM a sistemului, nu doar VRAM-ul?

RAM-ul de sistem ajută la încărcarea modelului și la contextul foarte mare, dar rularea propriu-zisă se face în VRAM. Recomandăm ca RAM-ul de sistem să fie cel puțin egal cu VRAM-ul, ideal dublu.

Vrei să începi cu AI local?

Îți dimensionăm un workstation exact pe modelul și fluxul tău. Consultanță gratuită.

Consultanță gratuită

Alte ghiduri