Notes d'ingénierie
Compromis pratiques dans l'exécution et l'utilisation de modèles ouverts.
Ce que coûte réellement un million de jetons
Un million de jetons d'entrée et un million de jetons de sortie sont des produits différents. Avec Qwen3 32B, 800 000 jetons d'entrée et 200 000 jetons de sortie coûtent $0,16 aux tarifs indiqués. Le même total avec 80 % de sortie coûte $0,19.
Lire le guideEstimez la consommation avant de migrer
Sélectionnez une semaine représentative et regroupez les requêtes par flux de travail. Conservez le nombre de jetons et les horodatages sans garder de contenu sensible dans les analyses.
Lire le guideLa latence et le débit répondent à des questions différentes
Le TTFT inclut la mise en file d'attente et le préremplissage. Il détermine combien de temps un utilisateur attend avant de voir la sortie.
Lire le guideLa quantification est un compromis, pas une mise à niveau gratuite
Une précision réduite diminue l'utilisation de la mémoire et peut améliorer le débit. L’effet sur la qualité dépend du modèle, de la méthode de quantification et de la tâche.
Lire le guideAuto-hébergement versus API : faites le calcul
Le coût mensuel dédié divisé par le coût API effectif par million de jetons donne le volume d'équilibre avant les coûts d'ingénierie et de fiabilité. Un H100 à $1 690 et un coût effectif de $0,16 par million de jetons donnent environ 10,56 milliards de jetons par mois. Cela ne prouve pas qu'un seul H100 peut servir cette charge de travail.
Lire le guide