Lab — cât de repede rulează AI local

Viteza de generare (tokeni pe secundă) pentru modele AI open-source rulate local, pe plăci video profesionale și workstation-uri HP Z. Cifrele te ajută să știi la ce să te aștepți înainte să cumperi.

Cifrele marcate estimat sunt referință orientativă (cuantizare Q4), nu măsurători pe o mașină anume. Le înlocuim cu valori măsurate, cu dată, pe măsură ce testăm configurațiile din stoc. Vrei cifre pe configurația ta exactă? Îți rulăm un benchmark real.

Llama 3.1 8B

8B parametri
Placă videoWorkstationTokeni/secSursă
NVIDIA RTX 2000 Ada 16GBHP Z2 G1i4560estimat
NVIDIA RTX 4000 Ada 20GBHP Z2 G1i5575estimat
NVIDIA RTX 5000 Ada 32GBHP Z4 G57095estimat
NVIDIA RTX 6000 Ada 48GBHP Z4 G585115estimat

Qwen 2.5 14B

14B parametri
Placă videoWorkstationTokeni/secSursă
NVIDIA RTX 2000 Ada 16GBHP Z2 G1i2838estimat
NVIDIA RTX 4000 Ada 20GBHP Z2 G1i3548estimat
NVIDIA RTX 5000 Ada 32GBHP Z4 G54865estimat
NVIDIA RTX 6000 Ada 48GBHP Z4 G56080estimat

Qwen 2.5 32B

32B parametri
Placă videoWorkstationTokeni/secSursă
NVIDIA RTX 5000 Ada 32GBHP Z4 G52230estimat
NVIDIA RTX 6000 Ada 48GBHP Z4 G52840estimat

Llama 3.3 70B

70B parametri
Placă videoWorkstationTokeni/secSursă
NVIDIA RTX 6000 Ada 48GBHP Z4 G51422estimat
Multi-GPU (2× RTX 6000 Ada)HP Z8 Fury2234estimat

Metodologie

Cuantizare
Q4_K_M (cuantizare pe 4 biți)
Rulare
llama.cpp / Ollama pe Windows 11
Context
context 4K, prompt scurt
Sarcină
un singur utilizator (batch = 1)
Metrică
viteza de generare a răspunsului (output), tokeni pe secundă

Viteza reală variază cu modelul exact, lungimea contextului, cuantizarea și driverul. Cifrele sunt un punct de plecare pentru dimensionare — nu o garanție. Pentru cifre pe configurația ta, îți rulăm un benchmark real.

Vrei cifre pe configurația ta exactă?

Îți rulăm un benchmark real cu modelul tău, pe workstation-ul potrivit, înainte să cumperi.

Cere un benchmark real