Entenda o que o serviço gerencia
A inferência gerenciada coloca o serviço de modelo atrás de uma API para que seu aplicativo possa solicitar uma resposta sem executar o servidor GPU em si. O WeightsAPI usa um formato de solicitação compatível com OpenAI para modelos de peso aberto; verifique o status do serviço para disponibilidade.
Você ainda possui o aplicativo: seus prompts, seleção de dados, permissões, comportamento de nova tentativa e verificações de saída. Comece com uma tarefa específica e decida como seria uma resposta útil. O guia de casos de uso oferece pontos de partida sem prometer que todos os modelos suportem todos os recursos.
Escolha um modelo para a tarefa real
Use o catálogo de modelos para comparar capacidades, licenças, contexto e taxas de entrada/saída. Leia a página do modelo e use seu ID de modelo exato da API em sua solicitação. Distinga o contexto nativo do editor do limite de implantação confirmado: a entrada e a saída pretendida devem caber no último.
Uma listagem no catálogo não prova que uma implantação está disponível. A descoberta de modelos lista implantações conectadas quando um backend está disponível. Compare as taxas relevantes em preços em vez de assumir que todos os modelos custam o mesmo.
Prepare una solicitud pequeña e inspeccionable
Comience con un prompt corto, el ID de modelo exacto y una salida acotada. La guía de inicio rápido explica el formato de chat-completions. Añada solo el historial de conversación necesario para la tarea y mantenga las credenciales de API en su servidor.
La transmisión (streaming) es opcional: entrega la respuesta en eventos en lugar de una única respuesta completa. Lea la guía de streaming antes de habilitarla, incluido cómo manejar respuestas interrumpidas y el registro de uso final.
Separe acesso e gastos
Entre no console. Crie chaves separadas para aplicativos ou ambientes, defina um limite de gastos positivo e restrinja modelos permitidos quando útil. Salve o segredo quando for mostrado pela primeira vez.
Um limite de chave se aplica ao uso vitalício registrado e reservas pendentes, não a uma franquia mensal. Substitua chaves expostas e revogue as antigas. O FAQ explica como chaves, crédito e solicitações pendentes se relacionam.
O acesso à IA requer login, uma recarga confirmada de pelo menos USD 100, uma chave de API autorizada e crédito disponível suficiente para a solicitação. Cada recarga posterior também tem um mínimo de USD 100; saldos restantes menores permanecem utilizáveis quando cobrem a solicitação. O crédito requer verificação da transação. Verifique o status do serviço para disponibilidade do modelo antes de enviar tráfego.
Distinga crédito disponível do custo final
Para uma solicitação paga admitida, o crédito disponível cobre a entrada e a saída máxima antes do início da geração. O custo final usa o uso real de entrada/saída; a reserva inicial não é a cobrança final. Solicitações aguardando liquidação podem, portanto, reduzir o crédito disponível.
Se uma resposta parar antes do uso final ser confirmado, a reserva pode permanecer até a reconciliação. Uma ordem de financiamento fornece instruções de pagamento; o crédito requer verificação da transação. Revise faturamento para prazos de cotação, confirmações e crédito disponível.
Revise o resultado antes de expandir
Para perguntas sobre documentos, faça seu aplicativo selecionar trechos relevantes, solicitar uma resposta com citações e verificar essas citações nas fontes. Mantenha as permissões do documento e a revisão final em seu aplicativo.
Avalie a qualidade da resposta, o uso do contexto e os gastos esperados com exemplos representativos. Expanda somente após testar as capacidades necessárias. Para erros, fluxos interrompidos ou crédito pendente, siga o guia de suporte e retenha um relatório higienizado.