Entenda o que o serviço gerencia
A inferência gerenciada coloca o serviço do modelo atrás de uma API para que seu aplicativo possa solicitar uma resposta sem executar o servidor GPU diretamente. O WeightsAPI usa um formato de solicitação compatível com OpenAI para modelos de pesos abertos; verifique o status do serviço para disponibilidade.
Você ainda é o dono do aplicativo: seus prompts, seleção de dados, permissões, comportamento de repetição e verificações de saída. Comece com uma tarefa específica e decida como seria uma resposta útil. O guia de casos de uso oferece pontos de partida sem prometer que todos os modelos suportam todos os recursos.
Escolha um modelo para a tarefa real
Use o catálogo de modelos para comparar capacidades, licenças, contexto e taxas de entrada/saída. Leia a página do modelo e use o ID exato do modelo da API em sua solicitação. Distinga o contexto nativo do editor do limite de implantação confirmado: a entrada e a saída pretendida devem caber neste último.
Uma listagem no catálogo não prova que uma implantação está disponível. A descoberta de modelos lista implantações conectadas quando um backend está disponível. Compare as taxas relevantes em preços em vez de assumir que todos os modelos custam o mesmo.
Prepare uma solicitação pequena e inspecionável
Comece com um prompt curto, o ID exato do modelo e uma saída limitada. O início rápido explica o formato de chat-completions. Adicione apenas o histórico de conversa necessário para a tarefa e mantenha as credenciais da API no seu servidor.
O streaming é opcional: ele entrega a resposta em eventos, em vez de uma resposta completa. Leia o guia de streaming antes de ativá-lo, incluindo como lidar com respostas interrompidas e o registro de uso final.
Separe acesso e gastos
Faça login no console. Crie chaves separadas para aplicativos ou ambientes, defina um limite de gastos positivo e restrinja os modelos permitidos quando útil. Salve o segredo quando ele for mostrado pela primeira vez.
Um limite de chave se aplica ao uso vitalício registrado e reservas pendentes, não a uma franquia mensal. Substitua chaves expostas e revogue as antigas. O FAQ explica como chaves, crédito e solicitações pendentes se relacionam.
O acesso à IA requer login, uma recarga confirmada de pelo menos USD 100, uma chave de API autorizada e crédito disponível suficiente para a solicitação. Cada recarga posterior também tem um mínimo de USD 100; saldos restantes menores permanecem utilizáveis quando cobrem a solicitação. O crédito requer verificação da transação. Verifique o status do serviço para disponibilidade do modelo antes de enviar tráfego.
Distinga crédito disponível de custo final
Para uma solicitação paga admitida, o crédito disponível cobre a entrada e a saída máxima antes de a geração começar. O custo final usa o uso real de entrada/saída; a reserva inicial não é a cobrança final. Solicitações aguardando liquidação podem, portanto, reduzir o crédito disponível.
Se uma resposta parar antes de o uso final ser confirmado, a reserva pode permanecer até a reconciliação. Uma ordem de financiamento fornece instruções de pagamento; o crédito requer verificação da transação. Revise faturamento para prazos de cotação, confirmações e crédito disponível.
Revise o resultado antes de expandir
Para perguntas sobre documentos, faça com que seu aplicativo selecione passagens relevantes, solicite uma resposta com citações e verifique essas citações em relação às fontes. Mantenha as permissões do documento e a revisão final em seu aplicativo.
Avalie a qualidade da resposta, o uso do contexto e o gasto esperado com exemplos representativos. Expanda somente após testar as capacidades necessárias. Para erros, fluxos interrompidos ou crédito pendente, siga o guia de suporte e retenha um relatório higienizado.