채팅 완성#
POST /v1/chat/completions는 model과 messages를 받습니다. 각 메시지에는 role과 content가 있습니다. 배포된 모델이 지원하는 경우 temperature, max_tokens, stream, tools, tool_choice, response_format이 선택 필드에 포함됩니다. 성공 시 id, object, choices, usage를 반환합니다. 스트리밍은 text/event-stream을 반환합니다.
레거시 완성#
POST /v1/completions는 model과 prompt를 받습니다. 서빙 백엔드가 요청된 모델에 대해 완성 모드를 노출할 때만 지원됩니다.
임베딩#
POST /v1/embeddings은(는) model 및 input을(를) 사용합니다. 이 엔드포인트를 사용하기 전에 지원되는 임베딩 배포를 확인하세요. 이용할 수 없는 서비스는 503 service_unavailable을(를) 반환합니다. 가용성은 서비스 상태를 확인하세요.
모델 검색#
GET /v1/models은(는) 연결된 배포 ID를 나열합니다. 카탈로그 항목은 모델과 요금을 설명합니다. 모델 검색과 서비스 상태를 사용하여 가용성을 확인하세요.
응답 필드#
비스트리밍 응답에는 usage.prompt_tokens와 usage.completion_tokens가 포함됩니다. SSE는 권위 있는 사용량 레코드 뒤에 [DONE]으로 끝납니다. 공급자 오류는 정규화되며 내부 자격 증명을 제외합니다.
보조 서비스#
오디오 전사, 이미지 생성, 재랭킹, 관리형 배치 처리는 자체 지원 배포가 필요합니다. 사용하기 전에 서비스 상태를 확인하세요. 이용할 수 없는 작업은 service_unavailable을(를) 반환합니다. 나열된 요금이 활성 서비스를 보장하지 않습니다.
요청 예시
curl https://weightsapi.com/v1/chat/completions \
-H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3-32B",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"stream": true
}'