weightsapi.INFERÊNCIAConsole
Navegação
Referência da API

Referência da API

Endpoints, campos de solicitação e contratos de resposta.

Completions de chat#

POST /v1/chat/completions aceita model e messages. Cada message tem role e content. Os campos opcionais incluem temperature, max_tokens, stream, tools, tool_choice e response_format quando o modelo implantado os suporta. Em caso de sucesso, retorna id, object, choices e usage. O streaming retorna text/event-stream.

Completions legadas#

POST /v1/completions aceita model e prompt. Suportado apenas quando o backend de serviço expõe o modo de completion para o modelo solicitado.

Embeddings#

POST /v1/embeddings usa model e input. Confirme uma implantação de embedding suportada antes de usar este endpoint; um serviço indisponível retorna 503 service_unavailable. Verifique o status do serviço para disponibilidade.

Descoberta de modelos#

GET /v1/models lista IDs de implantação conectados. Uma entrada no catálogo descreve o modelo e suas tarifas; use a descoberta de modelos e o status do serviço para verificar a disponibilidade.

Campos de resposta#

Respostas sem streaming incluem usage.prompt_tokens e usage.completion_tokens. O SSE termina com um registro de uso autoritativo seguido por [DONE]. Os erros do provedor são normalizados e excluem credenciais internas.

Serviços auxiliares#

Transcrição de áudio, geração de imagens, reranking e processamento em lote gerenciado requerem suas próprias implantações suportadas. Verifique o status do serviço antes de usá-los; operações indisponíveis retornam service_unavailable. Uma tarifa listada não estabelece um serviço ativo.

Exemplo de solicitação

curl https://weightsapi.com/v1/chat/completions \
  -H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "Qwen/Qwen3-32B",
  "messages": [
    {
      "role": "user",
      "content": "Hello!"
    }
  ],
  "stream": true
}'