weightsapi.INFERENCIAConsola
Navegación
Autoalojamiento frente a API: haga los cálculos

Autoalojamiento frente a API: haga los cálculos

El costo mensual dedicado dividido por el costo efectivo por millón de tokens de la API da el volumen de equilibrio antes de los costos de ingeniería y fiabilidad. Una H100 a $1,690 y un costo efectivo de $0.16 por millón de tokens da unos 10.56 mil millones de tokens al mes. Esto no demuestra que una sola H100 pueda servir esa carga de trabajo.

Encuentre su punto de equilibrio#

El costo mensual dedicado dividido por el costo efectivo por millón de tokens de la API da el volumen de equilibrio antes de los costos de ingeniería y fiabilidad. Una H100 a $1,690 y un costo efectivo de $0.16 por millón de tokens da unos 10.56 mil millones de tokens al mes. Esto no demuestra que una sola H100 pueda servir esa carga de trabajo.

Añada la utilización#

Una GPU reservada se factura aunque esté inactiva. Incluya el rendimiento de tokens a su concurrencia, la capacidad máxima, el tiempo de carga, la conmutación por error, la observabilidad y el esfuerzo de guardia.

Tome la decisión#

Use la capacidad compartida de la API para una demanda variable. Evalúe un endpoint dedicado cuando tenga una carga estable, un modelo compatible y un rendimiento medido.