weightsapi.INFÉRENCEConsole
Navigation
Comment ça marche

D’une tâche à un flux de travail d’inférence plus clair.

Comprenez l’inférence gérée, choisissez un modèle, préparez une requête et suivez la relation entre crédit, montants réservés et utilisation.

En un coup d'œil

Choisissez un modèle, définissez des contrôles d'accès et de dépenses, puis suivez l'utilisation des requêtes et l'état des paiements. Vérifiez la disponibilité du modèle avant d'envoyer du trafic.

Comprenez ce que le service gère

L'inférence gérée place la diffusion du modèle derrière une API afin que votre application puisse demander une réponse sans exécuter elle-même le serveur GPU. WeightsAPI utilise un format de requête compatible OpenAI pour les modèles à poids ouverts ; consultez le statut du service pour connaître la disponibilité.

Vous restez propriétaire de votre application : ses invites, la sélection des données, les autorisations, le comportement de nouvelle tentative et les vérifications des sorties. Commencez par une tâche spécifique et déterminez à quoi ressemblerait une réponse utile. Le guide des cas d'usage propose des points de départ sans promettre que chaque modèle prend en charge toutes les fonctionnalités.

Choisissez un modèle pour la tâche réelle

Utilisez le catalogue de modèles pour comparer les capacités, les licences, le contexte et les tarifs d'entrée/sortie. Lisez la page du modèle, puis utilisez son identifiant API exact dans votre requête. Distinguez le contexte natif de l'éditeur de la limite de déploiement confirmée : l'entrée et la sortie prévue doivent tenir dans cette dernière.

Une entrée du catalogue ne prouve pas qu'un déploiement est disponible. La découverte de modèles répertorie les déploiements connectés lorsqu'un backend est disponible. Comparez les tarifs pertinents sur tarification plutôt que de supposer que tous les modèles coûtent le même prix.

Préparez une petite requête inspectable

Commencez par une invite courte, l’ID de modèle exact et une sortie limitée. Le guide de démarrage rapide explique le format chat-completions. N’ajoutez que l’historique de conversation nécessaire à la tâche et conservez les identifiants API sur votre serveur.

Le streaming est facultatif : il fournit la réponse sous forme d’événements plutôt qu’une seule réponse complète. Lisez le guide de streaming avant de l’activer, y compris comment gérer les réponses interrompues et l’enregistrement d’utilisation final.

Séparez l'accès et les dépenses

Connectez-vous à la console. Créez des clés distinctes pour les applications ou les environnements, définissez un plafond de dépenses positif et limitez les modèles autorisés lorsque c'est utile. Enregistrez le secret lors de sa première affichage.

Un plafond de clé s'applique à l'utilisation enregistrée à vie et aux réservations en cours, pas à une allocation mensuelle. Remplacez les clés exposées et révoquez les anciennes. La FAQ explique comment les clés, le crédit et les requêtes en attente sont liés.

L'accès à l'IA nécessite une connexion, un premier rechargement confirmé d'au moins 100 USD, une clé API autorisée et suffisamment de crédit disponible pour la requête. Chaque rechargement ultérieur a également un minimum de 100 USD ; les soldes restants plus petits restent utilisables lorsqu'ils couvrent la requête. Le crédit nécessite une vérification de transaction. Consultez le statut du service pour la disponibilité des modèles avant d'envoyer du trafic.

Distinguez le crédit disponible du coût final

Pour une requête payante admise, le crédit disponible couvre l'entrée et la sortie maximale avant le début de la génération. Le coût final dépend du nombre réel de tokens d'entrée et de sortie ; la réservation initiale n'est pas le montant définitif facturé. Les requêtes en attente de règlement peuvent donc réduire le crédit disponible.

Si une réponse s'arrête avant que l'utilisation finale ne soit confirmée, la réservation peut rester jusqu'à la réconciliation. Une commande de financement fournit des instructions de paiement ; le crédit nécessite une vérification de transaction. Consultez facturation pour les délais de devis, les confirmations et le crédit disponible.

Examinez le résultat avant d'étendre

Pour les questions sur les documents, demandez à votre application de sélectionner les passages pertinents, de demander une réponse avec des citations et de vérifier ces citations par rapport aux sources. Conservez les autorisations des documents et l'examen final dans votre application.

Évaluez la qualité des réponses, l'utilisation du contexte et les dépenses prévues avec des exemples représentatifs. Étendez seulement après avoir testé les capacités requises. Pour les erreurs, les flux interrompus ou le crédit en attente, suivez le guide de support et conservez un rapport expurgé.

Besoin d’une prochaine étape ?

Trouvez le guide pertinent ou préparez les détails de votre problème.

Ouvrir l’assistance