Zeit bis zum ersten Token#
TTFT umfasst Warteschlangen und Prefill. Es bestimmt, wie lange ein Benutzer wartet, bevor er eine Ausgabe sieht.
Tokens pro Sekunde#
Der Dekodierdurchsatz bestimmt, wie schnell die Antwort fortgesetzt wird. Der aggregierte Serverdurchsatz ist nicht dasselbe wie die Generierungsgeschwindigkeit pro Benutzer.
Veröffentlichen Sie den Workload#
Eingabelänge, Ausgabelänge, Parallelität, GPU und Region gehören neben jede Zahl. Ein schnelles Ergebnis bei kurzem Prompt sagt keine Langkontext-RAG-Anfrage voraus.