Znajdź swój próg rentowności#
Miesięczny koszt dedykowany podzielony przez efektywny koszt API za milion tokenów daje próg rentowności wolumenu, zanim uwzględni się koszty inżynieryjne i niezawodności. H100 w cenie $1,690 i efektywny koszt $0.16 za milion tokenów daje około 10.56 miliarda tokenów miesięcznie. To nie dowodzi, że pojedynczy H100 może obsłużyć takie obciążenie.
Uwzględnij wykorzystanie#
Zarezerwowany GPU jest rozliczany również w czasie bezczynności. Uwzględnij przepustowość tokenów przy swojej współbieżności, pojemność szczytową, czas ładowania, przełączanie awaryjne, obserwowalność i wysiłek dyżurowy.
Podejmij decyzję#
Użyj współdzielonej pojemności API przy zmiennym zapotrzebowaniu. Rozważ dedykowany punkt końcowy, gdy masz stabilne obciążenie, kompatybilny model i zmierzoną przepustowość.