weightsapi.INFERÊNCIAConsole
Navegação
Auto-hospedagem versus API: faça as contas

Auto-hospedagem versus API: faça as contas

O custo mensal dedicado dividido pelo custo efetivo da API por milhão de tokens fornece o volume de equilíbrio antes dos custos de engenharia e confiabilidade. Uma H100 a US$ 1.690 e um custo efetivo de US$ 0,16 por milhão de tokens resultam em cerca de 10,56 bilhões de tokens por mês. Isso não prova que uma única H100 pode atender a essa carga de trabalho.

Encontre seu ponto de equilíbrio#

O custo mensal dedicado dividido pelo custo efetivo da API por milhão de tokens fornece o volume de equilíbrio antes dos custos de engenharia e confiabilidade. Uma H100 a US$ 1.690 e um custo efetivo de US$ 0,16 por milhão de tokens resultam em cerca de 10,56 bilhões de tokens por mês. Isso não prova que uma única H100 pode atender a essa carga de trabalho.

Inclua a utilização#

Uma GPU reservada é cobrada enquanto está ociosa. Inclua a vazão de tokens na sua concorrência, capacidade de pico, tempo de carregamento, failover, observabilidade e esforço de plantão.

Tome a decisão#

Use a capacidade compartilhada da API para demanda variável. Avalie um endpoint dedicado quando você tiver carga estável, um modelo compatível e vazão medida.