Completions de chat#
POST /v1/chat/completions aceita model e messages. Cada message tem role e content. Os campos opcionais incluem temperature, max_tokens, stream, tools, tool_choice e response_format quando o modelo implantado os suporta. Em caso de sucesso, retorna id, object, choices e usage. O streaming retorna text/event-stream.
Completions legadas#
POST /v1/completions aceita model e prompt. Suportado apenas quando o backend de serviço expõe o modo de completion para o modelo solicitado.
Embeddings#
POST /v1/embeddings usa model e input. Confirme uma implantação de embedding suportada antes de usar este endpoint; um serviço indisponível retorna 503 service_unavailable. Verifique o status do serviço para disponibilidade.
Descoberta de modelos#
GET /v1/models lista IDs de implantação conectados. Uma entrada no catálogo descreve o modelo e suas tarifas; use a descoberta de modelos e o status do serviço para verificar a disponibilidade.
Campos de resposta#
Respostas sem streaming incluem usage.prompt_tokens e usage.completion_tokens. O SSE termina com um registro de uso autoritativo seguido por [DONE]. Os erros do provedor são normalizados e excluem credenciais internas.
Serviços auxiliares#
Transcrição de áudio, geração de imagens, reranking e processamento em lote gerenciado requerem suas próprias implantações suportadas. Verifique o status do serviço antes de usá-los; operações indisponíveis retornam service_unavailable. Uma tarifa listada não estabelece um serviço ativo.
Exemplo de solicitação
curl https://weightsapi.com/v1/chat/completions \
-H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3-32B",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"stream": true
}'