Technische Hinweise
Praktische Kompromisse beim Betrieb und der Nutzung offener Modelle.
Was eine Million Tokens tatsächlich kostet
Eine Million Eingabetokens und eine Million Ausgabetokens sind unterschiedliche Produkte. Bei Qwen3 32B kosten 800.000 Eingabe- und 200.000 Ausgabetokens zu den angegebenen Tarifen $0.16. Dieselbe Gesamtzahl mit einem Ausgabeanteil von 80 % kostet $0.19.
Leitfaden lesenSchätzen Sie den Verbrauch, bevor Sie migrieren
Wählen Sie eine repräsentative Woche und gruppieren Sie Anfragen nach Workflow. Bewahren Sie Token-Zahlen und Zeitangaben, ohne sensible Inhalte in Analysen zu speichern.
Leitfaden lesenLatenz und Durchsatz beantworten unterschiedliche Fragen
TTFT umfasst Warteschlangen und Prefill. Es bestimmt, wie lange ein Benutzer wartet, bevor er eine Ausgabe sieht.
Leitfaden lesenQuantisierung ist ein Kompromiss, kein kostenloses Upgrade
Geringere Präzision reduziert den Speicherverbrauch und kann den Durchsatz verbessern. Ob sich die Qualität ändert, hängt vom Modell, der Quantisierungsmethode und der Aufgabe ab.
Leitfaden lesenSelf-Hosting versus API: Rechnen Sie nach
Die monatlichen Kosten für dedizierte Kapazität geteilt durch die effektiven API-Kosten pro eine Million Tokens ergeben die Volumenschwelle vor Engineering- und Zuverlässigkeitskosten. Eine H100 für $1,690 und effektive $0.16 pro eine Million Tokens ergeben etwa 10.56 Milliarden Tokens pro Monat. Das beweist nicht, dass eine einzelne H100 diese Arbeitslast bedienen kann.
Leitfaden lesen