Uzupełnienia czatu#
POST /v1/chat/completions przyjmuje model i wiadomości. Każda wiadomość ma rolę i treść. Opcjonalne pola obejmują temperature, max_tokens, stream, tools, tool_choice i response_format, jeśli wdrożony model je obsługuje. Sukces zwraca id, object, choices i usage. Strumieniowanie zwraca text/event-stream.
Starsze uzupełnienia#
POST /v1/completions przyjmuje model i prompt. Obsługiwane tylko wtedy, gdy backend serwujący udostępnia tryb uzupełnień dla żądanego modelu.
Osadzenia#
POST /v1/embeddings używa model i input. Potwierdź obsługiwane wdrożenie osadzania przed użyciem tego punktu końcowego; niedostępna usługa zwraca 503 service_unavailable. Sprawdź status usługi pod kątem dostępności.
Odkrywanie modeli#
GET /v1/models wyświetla podłączone identyfikatory wdrożeń. Wpis katalogu opisuje model i jego stawki; użyj odkrywania modeli i statusu usługi do sprawdzenia dostępności.
Pola odpowiedzi#
Odpowiedzi niestrumieniowane zawierają usage.prompt_tokens i usage.completion_tokens. SSE kończy się autorytatywnym rekordem użycia, po którym następuje [DONE]. Błędy dostawcy są normalizowane i nie zawierają wewnętrznych poświadczeń.
Usługi pomocnicze#
Transkrypcja audio, generowanie obrazów, ponowne rankingowanie i zarządzane przetwarzanie wsadowe wymagają własnych obsługiwanych wdrożeń. Sprawdź status usługi przed ich użyciem; niedostępne operacje zwracają service_unavailable. Wymieniona stawka nie oznacza aktywnej usługi.
Przykład żądania
curl https://weightsapi.com/v1/chat/completions \
-H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3-32B",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"stream": true
}'