weightsapi.추론콘솔
내비게이션
API 참조

API 참조

엔드포인트, 요청 필드 및 응답 계약.

채팅 완성#

POST /v1/chat/completions는 model과 messages를 받습니다. 각 메시지에는 role과 content가 있습니다. 배포된 모델이 지원하는 경우 temperature, max_tokens, stream, tools, tool_choice, response_format이 선택 필드에 포함됩니다. 성공 시 id, object, choices, usage를 반환합니다. 스트리밍은 text/event-stream을 반환합니다.

레거시 완성#

POST /v1/completions는 model과 prompt를 받습니다. 서빙 백엔드가 요청된 모델에 대해 완성 모드를 노출할 때만 지원됩니다.

임베딩#

POST /v1/embeddings은(는) modelinput을(를) 사용합니다. 이 엔드포인트를 사용하기 전에 지원되는 임베딩 배포를 확인하세요. 이용할 수 없는 서비스는 503 service_unavailable을(를) 반환합니다. 가용성은 서비스 상태를 확인하세요.

모델 검색#

GET /v1/models은(는) 연결된 배포 ID를 나열합니다. 카탈로그 항목은 모델과 요금을 설명합니다. 모델 검색과 서비스 상태를 사용하여 가용성을 확인하세요.

응답 필드#

비스트리밍 응답에는 usage.prompt_tokens와 usage.completion_tokens가 포함됩니다. SSE는 권위 있는 사용량 레코드 뒤에 [DONE]으로 끝납니다. 공급자 오류는 정규화되며 내부 자격 증명을 제외합니다.

보조 서비스#

오디오 전사, 이미지 생성, 재랭킹, 관리형 배치 처리는 자체 지원 배포가 필요합니다. 사용하기 전에 서비스 상태를 확인하세요. 이용할 수 없는 작업은 service_unavailable을(를) 반환합니다. 나열된 요금이 활성 서비스를 보장하지 않습니다.

요청 예시

curl https://weightsapi.com/v1/chat/completions \
  -H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "Qwen/Qwen3-32B",
  "messages": [
    {
      "role": "user",
      "content": "Hello!"
    }
  ],
  "stream": true
}'