Ce sunt tokenii AI și cum se calculează costul unui model
Tokenii sunt „moneda" cu care lucrează și se plătesc modelele AI. Îți explicăm ce sunt, cum se numără și de ce contează enorm când alegi între cloud și local.
Ce este un token
Un token este cea mai mică bucată de text pe care o „vede" un model AI. Nu e neapărat un cuvânt: poate fi un cuvânt scurt întreg, o parte dintr-un cuvânt lung, un semn de punctuație sau un spațiu. Modelele nu citesc litere sau cuvinte, ci aceste fragmente numite tokeni.
Ca regulă practică pentru limbile europene, un token înseamnă în medie aproximativ 4 caractere, iar 100 de tokeni acoperă cam 75 de cuvinte. Un paragraf obișnuit are în jur de 100 de tokeni, iar o pagină A4 de text în jur de 500–600.
Input, output și fereastra de context
Orice interacțiune cu un model are doi termeni: tokenii de intrare (input) — tot ce trimiți tu, adică întrebarea plus istoricul conversației plus eventualele documente atașate — și tokenii de ieșire (output) — răspunsul generat de model.
Fereastra de context este numărul maxim de tokeni pe care modelul îi poate ține „în minte" simultan (input + output). Un model cu 128K context poate procesa aproximativ 300 de pagini deodată. Cu cât trimiți mai mult context (documente lungi, istoric mare), cu atât consumi mai mulți tokeni de input.
Cum se calculează costul în cloud
La serviciile de tip API (cloud), plătești la mia de tokeni, iar tokenii de output costă de regulă de 3–5 ori mai mult decât cei de input, pentru că generarea e partea scumpă. Factura ta lunară = (tokeni input × preț input) + (tokeni output × preț output), însumat pe toate cererile.
Exemplu simplu: un asistent care procesează zilnic 200 de documente de câte o pagină înseamnă ~200 × 600 = 120.000 tokeni de input pe zi, plus outputul. La volum mare și continuu (agenți, procesare de documente, echipe de dezvoltatori), suma lunară crește rapid — și aici intră în discuție varianta locală.
De ce contează tokenii când alegi hardware
Când rulezi un model local, nu mai plătești pe token — plătești o singură dată hardware-ul. În schimb, viteza se măsoară în tokeni pe secundă: cât de repede „scrie" modelul răspunsul. O placă video profesională cu memorie mare generează mai mulți tokeni pe secundă și ține modele mai mari.
Așadar, tokenii leagă cele două lumi: în cloud sunt unitatea de cost, local sunt unitatea de viteză. Dacă volumul tău de tokeni pe lună e mare și constant, un workstation local se amortizează. Îți facem calculul concret gratuit.
Întrebări frecvente
Câți tokeni are un cuvânt?
În medie, pentru limbile europene, un cuvânt înseamnă aproximativ 1,3 tokeni, iar 100 de tokeni acoperă cam 75 de cuvinte. Cuvintele lungi sau rare se împart în mai mulți tokeni.
De ce costă outputul mai mult decât inputul?
Pentru că generarea răspunsului (output) cere modelului să facă un calcul pas cu pas pentru fiecare token nou, în timp ce cititul inputului e procesat mai eficient. De aceea tokenii de output sunt de regulă de 3–5 ori mai scumpi la API-uri.
Local plătesc pe tokeni?
Nu. Când rulezi modelul pe hardware-ul tău, nu plătești pe token — plătești o singură dată echipamentul, apoi rulezi nelimitat. Tokenii devin doar o măsură a vitezei (tokeni pe secundă).
Vrei să începi cu AI local?
Îți dimensionăm un workstation exact pe modelul și fluxul tău. Consultanță gratuită.