Begrijp wat de service beheert
Managed inference plaatst modelserving achter een API, zodat uw applicatie een antwoord kan aanvragen zonder de GPU-server zelf te draaien. WeightsAPI gebruikt een OpenAI-compatibel aanvraagformaat voor open-weight modellen; controleer de servicestatus voor beschikbaarheid.
U bezit nog steeds de applicatie: de prompts, gegevensselectie, machtigingen, retry-gedrag en uitvoercontroles. Begin met een specifieke taak en bepaal hoe een nuttig antwoord eruit zou zien. De use-casegids biedt startpunten zonder te beloven dat elk model elke functie ondersteunt.
Kies een model voor de daadwerkelijke taak
Gebruik de modelcatalogus om mogelijkheden, licenties, context en invoer-/uitvoertarieven te vergelijken. Lees de modelpagina en gebruik vervolgens de exacte API-model-ID in uw aanvraag. Maak onderscheid tussen de native context van de uitgever en de bevestigde implementatielimiet: invoer en beoogde uitvoer moeten binnen de laatste passen.
Een catalogusvermelding bewijst niet dat een implementatie beschikbaar is. Modelontdekking toont verbonden implementaties wanneer een backend beschikbaar is. Vergelijk de relevante tarieven op prijzen in plaats van aan te nemen dat alle modellen evenveel kosten.
Bereid een klein, inspecteerbaar verzoek voor
Begin met een korte prompt, de exacte model-ID en een begrensde uitvoer. De quickstart legt het chat-completions-formaat uit. Voeg alleen de gespreksgeschiedenis toe die nodig is voor de taak en bewaar API-referenties op uw server.
Streaming is optioneel: het levert het antwoord in gebeurtenissen in plaats van als één volledige respons. Lees de streaminggids voordat u streaming inschakelt, inclusief hoe u onderbroken responsen en het uiteindelijke verbruiksrecord moet afhandelen.
Scheid toegang en uitgaven
Meld u aan bij de console. Maak afzonderlijke sleutels voor applicaties of omgevingen, stel een positieve uitgavenlimiet in en beperk toegestane modellen indien nuttig. Bewaar het geheim wanneer het voor het eerst wordt getoond.
Een sleutellimiet is van toepassing op levenslang geregistreerd gebruik en openstaande reserveringen, niet op een maandelijkse toelage. Vervang blootgestelde sleutels en trek oude in. De FAQ legt uit hoe sleutels, krediet en lopende aanvragen zich verhouden.
AI-toegang vereist aanmelding, één bevestigde opwaardering van ten minste USD 100, een geautoriseerde API-sleutel en voldoende beschikbaar krediet voor de aanvraag. Elke latere opwaardering heeft ook een minimum van USD 100; kleinere resterende saldi blijven bruikbaar wanneer ze de aanvraag dekken. Krediet vereist transactieverificatie. Controleer de servicestatus op modelbeschikbaarheid voordat u verkeer verstuurt.
Onderscheid beschikbaar krediet van uiteindelijke kosten
Voor een toegelaten betaalde aanvraag dekt het beschikbare krediet de invoer en maximale uitvoer voordat de generatie start. Uiteindelijke kosten gebruiken het werkelijke invoer-/uitvoerverbruik; de initiële reservering is niet de uiteindelijke afschrijving. Aanvragen die op afwikkeling wachten, kunnen daarom het beschikbare krediet verminderen.
Als een reactie stopt voordat het uiteindelijke verbruik is bevestigd, kan de reservering blijven staan tot reconciliatie. Een financieringsorder geeft betalingsinstructies; krediet vereist transactieverificatie. Bekijk facturering voor offertedeadlines, bevestigingen en beschikbaar krediet.
Bekijk het resultaat voordat u uitbreidt
Laat voor documentvragen uw applicatie relevante passages selecteren, een antwoord met citaten aanvragen en die citaten controleren tegen de bronnen. Houd documentmachtigingen en eindbeoordeling in uw applicatie.
Evalueer antwoordkwaliteit, contextgebruik en verwachte uitgaven met representatieve voorbeelden. Breid pas uit na het testen van de vereiste mogelijkheden. Volg voor fouten, onderbroken streams of lopend krediet de ondersteuningsgids en bewaar een gesaneerd rapport.