Completions de chat#
POST /v1/chat/completions acepta model y messages. Cada mensaje tiene role y content. Los campos opcionales incluyen temperature, max_tokens, stream, tools, tool_choice y response_format cuando el modelo desplegado los admite. El éxito devuelve id, object, choices y usage. El streaming devuelve text/event-stream.
Completions heredadas#
POST /v1/completions acepta model y prompt. Soportado solo cuando el backend de servicio expone el modo de completado para el modelo solicitado.
Incrustaciones#
POST /v1/embeddings utiliza model y input. Confirme una implementación de incrustaciones compatible antes de usar este punto final; un servicio no disponible devuelve 503 service_unavailable. Verifique el estado del servicio para conocer la disponibilidad.
Descubrimiento de modelos#
GET /v1/models enumera los ID de implementación conectados. Una entrada del catálogo describe el modelo y sus tarifas; utilice el descubrimiento de modelos y el estado del servicio para verificar la disponibilidad.
Campos de respuesta#
Las respuestas no transmitidas incluyen usage.prompt_tokens y usage.completion_tokens. SSE finaliza con un registro de uso autoritativo seguido de [DONE]. Los errores del proveedor se normalizan y excluyen credenciales internas.
Servicios auxiliares#
La transcripción de audio, la generación de imágenes, la reclasificación y el procesamiento por lotes administrado requieren sus propias implementaciones compatibles. Verifique el estado del servicio antes de usarlos; las operaciones no disponibles devuelven service_unavailable. Una tarifa listada no establece un servicio activo.
Ejemplo de solicitud
curl https://weightsapi.com/v1/chat/completions \
-H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3-32B",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"stream": true
}'