Note di ingegneria
Compromessi pratici nell'esecuzione e nell'utilizzo di modelli aperti.
Quanto costa davvero un milione di token
Un milione di token di input e un milione di token di output sono prodotti diversi. Con Qwen3 32B, 800,000 token di input e 200,000 token di output costano $0.16 alle tariffe indicate. Lo stesso totale con una quota di output dell'80% costa $0.19.
Leggi la guidaStima il consumo prima di migrare
Seleziona una settimana rappresentativa e raggruppa le richieste per flusso di lavoro. Conserva il conteggio dei token e i tempi senza mantenere contenuti sensibili nelle analisi.
Leggi la guidaLatenza e throughput rispondono a domande diverse
Il TTFT include l'accodamento e il prefill. Determina quanto a lungo un utente attende prima di vedere l'output.
Leggi la guidaLa quantizzazione è un compromesso, non un aggiornamento gratuito
Una precisione inferiore riduce l'uso della memoria e può migliorare il throughput. Se la qualità cambi dipende dal modello, dal metodo di quantizzazione e dall'attività.
Leggi la guidaSelf-hosting rispetto all'API: fai i calcoli
Il costo mensile dedicato diviso per il costo API effettivo per milione di token fornisce il volume di pareggio prima dei costi di ingegneria e affidabilità. Un H100 a $1,690 e un costo effettivo di $0.16 per milione di token danno circa 10.56 miliardi di token al mese. Ciò non dimostra che una singola H100 possa servire quel carico di lavoro.
Leggi la guida