weightsapi.INFERENZKonsole
Navigation
So funktioniert es

Von einer Aufgabe zu einem klareren Inferenz-Workflow.

Verstehen Sie Managed Inference, wählen Sie ein Modell, bereiten Sie eine Anfrage vor und verfolgen Sie den Zusammenhang zwischen Guthaben, reservierten Beträgen und Nutzung.

Auf einen Blick

Wähle ein Modell, lege Zugriffs- und Ausgabenkontrollen fest und verfolge dann Anfragenutzung und Zahlungsstatus. Prüfe die Modellverfügbarkeit, bevor du Traffic sendest.

Verstehen Sie, was der Dienst verwaltet

Managed Inference stellt die Modellbereitstellung hinter eine API, sodass Ihre Anwendung Antworten anfordern kann, ohne selbst den GPU-Server zu betreiben. WeightsAPI verwendet ein OpenAI-kompatibles Anfrageformat für Open-Weight-Modelle; prüfen Sie den Servicestatus auf Verfügbarkeit.

Sie besitzen weiterhin die Anwendung: ihre Prompts, Datenauswahl, Berechtigungen, Wiederholungsverhalten und Ausgabeprüfungen. Beginnen Sie mit einer konkreten Aufgabe und entscheiden Sie, wie eine nützliche Antwort aussehen soll. Der Anwendungsfall-Leitfaden bietet Ansatzpunkte, ohne zu versprechen, dass jedes Modell jede Funktion unterstützt.

Wählen Sie ein Modell für die tatsächliche Aufgabe

Nutzen Sie den Modellkatalog, um Fähigkeiten, Lizenzen, Kontext und Ein-/Ausgaberaten zu vergleichen. Lesen Sie die Modellseite und verwenden Sie dann die exakte API-Modell-ID in Ihrer Anfrage. Unterscheiden Sie den nativen Kontext des Herausgebers von der bestätigten Deployment-Grenze: Eingabe und beabsichtigte Ausgabe müssen in Letztere passen.

Ein Katalogeintrag beweist nicht, dass ein Deployment verfügbar ist. Die Modellentdeckung listet verbundene Deployments auf, wenn ein Backend verfügbar ist. Vergleichen Sie die relevanten Raten auf Preise, statt anzunehmen, dass alle Modelle gleich viel kosten.

Bereiten Sie eine kleine, überprüfbare Anfrage vor

Beginnen Sie mit einem kurzen Prompt, der exakten Modell-ID und einer begrenzten Ausgabe. Der Schnellstart erklärt das Chat-Completions-Format. Fügen Sie nur den für die Aufgabe erforderlichen Gesprächsverlauf hinzu und bewahren Sie API-Zugangsdaten auf Ihrem Server auf.

Streaming ist optional: Es liefert die Antwort in Ereignissen statt als eine vollständige Antwort. Lesen Sie den Streaming-Leitfaden, bevor Sie es aktivieren, einschließlich des Umgangs mit unterbrochenen Antworten und dem endgültigen Nutzungsdatensatz.

Trennen Sie Zugriff und Ausgaben

Melden Sie sich bei der Konsole an. Erstellen Sie separate Schlüssel für Anwendungen oder Umgebungen, legen Sie eine positive Ausgabenobergrenze fest und beschränken Sie bei Bedarf erlaubte Modelle. Speichern Sie das Geheimnis, wenn es zum ersten Mal angezeigt wird.

Eine Schlüsselobergrenze gilt für die lebenslang erfasste Nutzung und ausstehende Reservierungen, nicht für ein monatliches Kontingent. Ersetzen Sie offengelegte Schlüssel und widerrufen Sie alte. Die FAQ erklärt, wie Schlüssel, Guthaben und ausstehende Anfragen zusammenhängen.

Der KI-Zugriff erfordert eine Anmeldung, eine bestätigte Aufladung von mindestens USD 100, einen autorisierten API-Schlüssel und ausreichend verfügbares Guthaben für die Anfrage. Jede spätere Aufladung hat ebenfalls ein Minimum von USD 100; kleinere Restguthaben bleiben nutzbar, wenn sie die Anfrage abdecken. Das Guthaben erfordert eine Transaktionsverifizierung. Prüfen Sie den Servicestatus auf Modellverfügbarkeit, bevor Sie Traffic senden.

Unterscheiden Sie verfügbares Guthaben von Endkosten

Bei einer zugelassenen kostenpflichtigen Anfrage deckt das verfügbare Guthaben die Eingabe und maximale Ausgabe ab, bevor die Generierung beginnt. Die Endkosten basieren auf der tatsächlichen Ein-/Ausgabenutzung; die anfängliche Reservierung ist nicht die endgültige Gebühr. Anfragen, die auf Abrechnung warten, können daher das verfügbare Guthaben verringern.

Wenn eine Antwort stoppt, bevor die endgültige Nutzung bestätigt ist, kann die Reservierung bis zur Abstimmung bestehen bleiben. Eine Finanzierungsbestellung liefert Zahlungsanweisungen; das Guthaben erfordert eine Transaktionsverifizierung. Siehe Abrechnung für Angebotsfristen, Bestätigungen und verfügbares Guthaben.

Überprüfen Sie das Ergebnis, bevor Sie expandieren

Lassen Sie bei Dokumentfragen Ihre Anwendung relevante Passagen auswählen, eine Antwort mit Zitaten anfordern und diese Zitate mit den Quellen abgleichen. Halten Sie Dokumentberechtigungen und Endprüfung in Ihrer Anwendung.

Bewerten Sie Antwortqualität, Kontextnutzung und erwartete Ausgaben mit repräsentativen Beispielen. Erweitern Sie erst nach dem Testen der erforderlichen Fähigkeiten. Bei Fehlern, unterbrochenen Streams oder ausstehendem Guthaben folgen Sie dem Support-Leitfaden und bewahren Sie einen bereinigten Bericht auf.

Brauchen Sie einen nächsten Schritt?

Finden Sie den passenden Leitfaden oder bereiten Sie die Details Ihres Problems vor.

Support öffnen