weightsapi.INFERÊNCIAConsole
Navegação
Como funciona

De uma tarefa a um fluxo de trabalho de inferência mais claro.

Entenda a inferência gerenciada, escolha um modelo, prepare uma solicitação e acompanhe a relação entre crédito, valores reservados e uso.

Visão geral

Escolha um modelo, defina controles de acesso e gastos e depois acompanhe o uso das solicitações e o status do pagamento. Verifique a disponibilidade do modelo antes de enviar tráfego.

Entenda o que o serviço gerencia

A inferência gerenciada coloca o serviço do modelo atrás de uma API para que seu aplicativo possa solicitar uma resposta sem executar o servidor GPU diretamente. O WeightsAPI usa um formato de solicitação compatível com OpenAI para modelos de pesos abertos; verifique o status do serviço para disponibilidade.

Você ainda é o dono do aplicativo: seus prompts, seleção de dados, permissões, comportamento de repetição e verificações de saída. Comece com uma tarefa específica e decida como seria uma resposta útil. O guia de casos de uso oferece pontos de partida sem prometer que todos os modelos suportam todos os recursos.

Escolha um modelo para a tarefa real

Use o catálogo de modelos para comparar capacidades, licenças, contexto e taxas de entrada/saída. Leia a página do modelo e use o ID exato do modelo da API em sua solicitação. Distinga o contexto nativo do editor do limite de implantação confirmado: a entrada e a saída pretendida devem caber neste último.

Uma listagem no catálogo não prova que uma implantação está disponível. A descoberta de modelos lista implantações conectadas quando um backend está disponível. Compare as taxas relevantes em preços em vez de assumir que todos os modelos custam o mesmo.

Prepare uma solicitação pequena e inspecionável

Comece com um prompt curto, o ID exato do modelo e uma saída limitada. O início rápido explica o formato de chat-completions. Adicione apenas o histórico de conversa necessário para a tarefa e mantenha as credenciais da API no seu servidor.

O streaming é opcional: ele entrega a resposta em eventos, em vez de uma resposta completa. Leia o guia de streaming antes de ativá-lo, incluindo como lidar com respostas interrompidas e o registro de uso final.

Separe acesso e gastos

Faça login no console. Crie chaves separadas para aplicativos ou ambientes, defina um limite de gastos positivo e restrinja os modelos permitidos quando útil. Salve o segredo quando ele for mostrado pela primeira vez.

Um limite de chave se aplica ao uso vitalício registrado e reservas pendentes, não a uma franquia mensal. Substitua chaves expostas e revogue as antigas. O FAQ explica como chaves, crédito e solicitações pendentes se relacionam.

O acesso à IA requer login, uma recarga confirmada de pelo menos USD 100, uma chave de API autorizada e crédito disponível suficiente para a solicitação. Cada recarga posterior também tem um mínimo de USD 100; saldos restantes menores permanecem utilizáveis quando cobrem a solicitação. O crédito requer verificação da transação. Verifique o status do serviço para disponibilidade do modelo antes de enviar tráfego.

Distinga crédito disponível de custo final

Para uma solicitação paga admitida, o crédito disponível cobre a entrada e a saída máxima antes de a geração começar. O custo final usa o uso real de entrada/saída; a reserva inicial não é a cobrança final. Solicitações aguardando liquidação podem, portanto, reduzir o crédito disponível.

Se uma resposta parar antes de o uso final ser confirmado, a reserva pode permanecer até a reconciliação. Uma ordem de financiamento fornece instruções de pagamento; o crédito requer verificação da transação. Revise faturamento para prazos de cotação, confirmações e crédito disponível.

Revise o resultado antes de expandir

Para perguntas sobre documentos, faça com que seu aplicativo selecione passagens relevantes, solicite uma resposta com citações e verifique essas citações em relação às fontes. Mantenha as permissões do documento e a revisão final em seu aplicativo.

Avalie a qualidade da resposta, o uso do contexto e o gasto esperado com exemplos representativos. Expanda somente após testar as capacidades necessárias. Para erros, fluxos interrompidos ou crédito pendente, siga o guia de suporte e retenha um relatório higienizado.

Precisa de um próximo passo?

Encontre o guia relevante ou prepare os detalhes do seu problema.

Abrir suporte