Technische notities
Praktische afwegingen bij het draaien en gebruiken van open modellen.
Wat een miljoen tokens werkelijk kosten
Een miljoen inputtokens en een miljoen outputtokens zijn verschillende producten. Met Qwen3 32B kosten 800,000 input- en 200,000 outputtokens $0.16 tegen de vermelde tarieven. Hetzelfde totaal met een outputmix van 80% kost $0.19.
Lees de handleidingSchat het verbruik in voordat u migreert
Selecteer een representatieve week en groepeer aanvragen per workflow. Bewaar tokenaantallen en tijdsregistraties zonder gevoelige inhoud in analytics te bewaren.
Lees de handleidingLatentie en doorvoer beantwoorden verschillende vragen
TTFT omvat wachtrij- en prefilltijd. Het bepaalt hoe lang een gebruiker wacht voordat er output zichtbaar is.
Lees de handleidingKwantisering is een afweging, geen gratis upgrade
Lagere precisie vermindert het geheugengebruik en kan de doorvoer verbeteren. Of de kwaliteit verandert, hangt af van het model, de kwantiseringsmethode en de taak.
Lees de handleidingZelf hosten versus API: reken het uit
Dedicated maandelijkse kosten gedeeld door effectieve API-kosten per miljoen tokens geeft het volume-omslagpunt vóór engineering- en betrouwbaarheidskosten. Een H100 tegen $1,690 en een effectieve $0.16 per miljoen tokens geeft ongeveer 10.56 miljard tokens per maand. Dit bewijst niet dat een enkele H100 die workload kan bedienen.
Lees de handleiding