weightsapi.INFERENCIAConsola
Navegación
La latencia y el rendimiento responden a preguntas diferentes

La latencia y el rendimiento responden a preguntas diferentes

El TTFT incluye la cola y el prellenado. Determina cuánto espera un usuario antes de ver la salida.

Tiempo hasta el primer token#

El TTFT incluye la cola y el prellenado. Determina cuánto espera un usuario antes de ver la salida.

Tokens por segundo#

El rendimiento de decodificación determina la rapidez con la que continúa la respuesta. El rendimiento agregado del servidor no es lo mismo que la velocidad de generación por usuario.

Publique la carga de trabajo#

La longitud de entrada, la longitud de salida, la concurrencia, la GPU y la región deben acompañar a cada número. Un resultado rápido con un prompt corto no predice una solicitud RAG de contexto largo.