weightsapi.INFERENTIEConsole
Navigatie
Zelf hosten versus API: reken het uit

Zelf hosten versus API: reken het uit

Dedicated maandelijkse kosten gedeeld door effectieve API-kosten per miljoen tokens geeft het volume-omslagpunt vóór engineering- en betrouwbaarheidskosten. Een H100 tegen $1,690 en een effectieve $0.16 per miljoen tokens geeft ongeveer 10.56 miljard tokens per maand. Dit bewijst niet dat een enkele H100 die workload kan bedienen.

Vind uw omslagpunt#

Dedicated maandelijkse kosten gedeeld door effectieve API-kosten per miljoen tokens geeft het volume-omslagpunt vóór engineering- en betrouwbaarheidskosten. Een H100 tegen $1,690 en een effectieve $0.16 per miljoen tokens geeft ongeveer 10.56 miljard tokens per maand. Dit bewijst niet dat een enkele H100 die workload kan bedienen.

Voeg benutting toe#

Een gereserveerde GPU wordt gefactureerd terwijl deze inactief is. Neem tokendoorvoer bij uw gelijktijdigheid, piekcapaciteit, laadtijd, failover, observability en on-call-inspanning mee.

Neem de beslissing#

Gebruik gedeelde API-capaciteit voor variabele vraag. Evalueer een dedicated endpoint wanneer u een stabiele belasting, een compatibel model en gemeten doorvoer hebt.