weightsapi.INFERÊNCIAConsole
Navegação
Sem KYC · Sem filtros de conteúdo adicionais

Inferência de LLM gerenciada. Modelos abertos, uma API.

Escolha modelos de pesos abertos publicados por meio de uma API compatível com OpenAI. Mantenha ferramentas familiares, compare custos de tokens e combine o modelo com sua carga de trabalho.

Sem KYC

Nenhum upload de documento de identidade ou etapa de KYC no fluxo de login atual. O acesso e o uso permanecem vinculados à sua conta.

Sem filtros de conteúdo adicionais

A WeightsAPI não adiciona nenhum filtro de conteúdo no gateway. O próprio treinamento de um modelo ainda pode levá-lo a recusar uma solicitação.

Dê forma à sua primeira solicitação.

Escolha um modelo do catálogo, escreva um prompt curto e inspecione o código correspondente. Mantenha o primeiro exemplo simples para que a solicitação e a resposta esperada sejam fáceis de verificar.

Acesso à conta Faça login e confirme uma recarga de pelo menos USD 100, depois gaste seu crédito pré-pago. Cada recarga tem o mesmo mínimo; saldos restantes menores permanecem utilizáveis. Verifique o status do serviço para disponibilidade do modelo.

PlaygroundConta financiada obrigatória
128K contexto*
Verificando acesso à conta…
O conteúdo do prompt não é salvo por este gateway.
RespostaPronto quando as verificações de conta, chave e serviço passarem

Verifique o acesso antes da sua primeira solicitação

Entre, confirme uma recarga de pelo menos USD 100 e selecione uma chave de API para enviar sua primeira solicitação.
curl https://weightsapi.com/v1/chat/completions \
  -H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "Qwen/Qwen3-32B",
  "messages": [
    {
      "role": "user",
      "content": "Hello!"
    }
  ],
  "stream": true,
  "max_tokens": 512
}'
A mesma solicitação, no seu aplicativo.Leia o guia de início rápido

* Contexto do serviço. Consulte a página do modelo para a janela nativa e os requisitos de configuração.

Construa em torno da sua aplicação

Comece com uma tarefa útil.

O cookbook oferece pequenos exemplos para você adaptar, com a aplicação ainda no controle.

Assistentes conversacionais

Construa um loop de conversa, gerencie o histórico de mensagens e valide as respostas que seus usuários recebem. Comece com um exemplo no terminal antes de adicionar uma interface de usuário.

Receita de chatbot

Programação e ferramentas

Explore um loop de chamada de ferramentas com uma lista de permissões explícita e verificações de argumentos. O suporte do modelo e da implantação deve ser verificado antes de habilitar ações.

Receita de chamada de ferramentas

Respostas a partir de documentos

Traga seu próprio recuperador, forneça passagens selecionadas e verifique as citações. O exemplo usa correspondência simples de texto; o serviço de embeddings não está disponível.

Receita de documentos
Casos de uso
Um ponto de partida prático

Planeje seu primeiro fluxo de trabalho.

Decida o que sua aplicação precisa antes de aumentar o tráfego ou adicionar mais recursos.

  1. Escolha para a tarefa

    Compare capacidades, licenças de modelo, contexto e taxas de entrada/saída. Verifique o status do serviço e os limites de implantação confirmados antes de encaminhar solicitações a um modelo.

    Compare modelos
  2. Prepare uma solicitação pequena

    Use o formato chat-completions com um ID de modelo exato e uma saída limitada. Leia os guias de streaming e erros antes de adicionar repetições ou ferramentas.

    Abra o início rápido
  3. Mantenha o uso compreensível

    Separe aplicações com chaves distintas e limites de gastos. O console é o lugar para revisar o uso e o crédito disponível, incluindo valores reservados para solicitações pendentes.

    Explore o console
Como funciona
Catálogo de modelos

Escolha a compensação certa.

Compare as opções publicadas abaixo e abra a página de um modelo para ver suas capacidades, licença e notas de implantação. O preço por si só não estabelece qualidade ou velocidade.

ModeloEntradaSaídaContexto do serviço
LLlama 3.1 8BUS$ 0,03US$ 0,05131.072
QQwen3 32BUS$ 0,15US$ 0,20131.072
DDeepSeek V3US$ 0,25US$ 0,85131.072
DDeepSeek R1US$ 0,50US$ 2,15131.072

As taxas de entrada e saída são em USD por milhão de tokens. Os limites de contexto do serviço exigem confirmação da implantação; os limites nativos do modelo são separados.

Suas ferramentas existentes

Traga suas ferramentas existentes.

Conecte ferramentas familiares usando suas configurações documentadas. Valide os recursos que seu aplicativo precisa na implantação selecionada antes de mover o tráfego.

Explorar todas as integrações
Conheça os limites

Entenda os limites do serviço.

Revise os controles da conta, o tratamento de dados e os requisitos de implantação antes de escolher um modelo.

Um limite de dados definido

O gateway não persiste prompts ou respostas. A retenção do provedor e o registro de infraestrutura ainda precisam de verificação; isso não é uma garantia de retenção de ponta a ponta.

Leia a visão geral de confiança

Tarifas que você pode inspecionar

Compare entrada e saída separadamente e estime com sua própria carga de trabalho. Capacidade dedicada segue um modelo de reserva diferente.

Explore os preços

Um caminho através de problemas

Use o guia de suporte para diagnosticar erros e preparar um relatório. Verifique o status do serviço para disponibilidade e informações de monitoramento.

Abra o guia de suporte
Sobre
Antes de começar

Perguntas antes de começar.

Entenda disponibilidade, compatibilidade, custos e tratamento de dados antes de incorporá-los à sua aplicação.

Preciso concluir o KYC?

O fluxo de login atual não possui upload de documento de identidade ou etapa de verificação KYC. Uma conta logada ainda é necessária, e o uso permanece associado a essa conta.

Leia mais

Os modelos são sem censura?

O WeightsAPI não adiciona filtro de conteúdo no gateway. O catálogo inclui modelos originais e variantes com ajuste fino publicadas por seus respectivos criadores, incluindo Dolphin e Hermes. Algumas variantes são projetadas para reduzir recusas; o treinamento do modelo ainda pode causar recusas. Leia as notas de origem e comportamento de cada modelo.

Leia mais

O que posso usar hoje?

Gerencie chaves de API, crie ordens de financiamento em cripto e faça pedidos de GPUs dedicadas. Verifique o status do serviço para disponibilidade de modelos; crédito de pagamento e ativação de GPU requerem confirmação.

Leia mais

O que significa compatível com OpenAI aqui?

A API usa rotas de Chat Completions, Completions legado e descoberta de modelos. Verifique as capacidades do deployment selecionado; APIs específicas de provedores não são intercambiáveis.

Leia mais

Como uma solicitação de modelo é precificada?

Os custos usam taxas de modelo separadas para tokens reais de entrada e saída, liquidados a partir do uso confirmado pelo provedor após uma reserva inicial de crédito.

Leia mais

O WeightsAPI armazena meus prompts ou respostas de modelo?

O gateway não persiste prompts ou respostas em seu banco de dados de aplicação. Registros de conta permanecem, e a retenção do provedor requer verificação separada.

Leia mais
Leia o FAQ completo

Escolha um modelo. Torne a primeira solicitação clara.

Comece com o catálogo e um pequeno exemplo. A documentação explica o formato da solicitação; o FAQ ajuda a resolver as decisões em torno dela.