weightsapi.INFERENZKonsole
Navigation
Ratenbegrenzungen und Kontingente

Ratenbegrenzungen und Kontingente

Token-Fenster, Zugang für finanzierte Konten und Anfragegrenzen.

Es gibt standardmäßig kein festes Produktlimit für Anfragen pro Minute. Die Zulassung unterliegt weiterhin dem Guthaben, den Schlüsselobergrenzen, der Modellverfügbarkeit und der physischen Kapazität. Ein dedizierter Endpunkt reserviert die Maschine; gemeinsame Kapazität kann in die Warteschlange gestellt werden.

Kontofinanzierter Spielplatz#

Melden Sie sich an und bestätigen Sie eine Aufladung von mindestens 100 USD vor der KI-Nutzung. Jede spätere Aufladung hat dasselbe Minimum; nach der Qualifizierung bleibt ein kleineres Restguthaben nutzbar, wenn es die Anfrage abdeckt. Schlüsselberechtigungen, Ausgabenobergrenzen und Modellverfügbarkeit gelten weiterhin. Ausstehende Zahlungen schalten den Zugriff nicht frei. Überprüfen Sie den Dienststatus, bevor Sie Anfragen senden.

Kontextfenster#

Eingabe plus generierte Token müssen in den konfigurierten Bereitstellungskontext passen. Veröffentlichte modellnative Fenster und Service-Obergrenzen werden separat angezeigt.

Dedizierte Kapazität#

Dedizierte Maschinen verwenden einen monatlichen Prepaid-Preis ohne Token-Gebühren. Der Durchsatz bleibt durch Maschine und Arbeitslast begrenzt. Hardwareverfügbarkeit und Bereitstellung erfordern Bestätigung; der Dienstzeitraum beginnt mit der Aktivierung.

Anfragebeispiel

curl https://weightsapi.com/v1/chat/completions \
  -H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "Qwen/Qwen3-32B",
  "messages": [
    {
      "role": "user",
      "content": "Hello!"
    }
  ],
  "stream": true
}'