Чат-завершення#
POST /v1/chat/completions приймає model та messages. Кожне повідомлення має role та content. До необов'язкових полів належать temperature, max_tokens, stream, tools, tool_choice та response_format, якщо розгорнута модель їх підтримує. У разі успіху повертаються id, object, choices та usage. Потоковий режим повертає text/event-stream.
Застарілі завершення#
POST /v1/completions приймає model та prompt. Підтримується лише тоді, коли обслуговуючий бекенд надає режим завершення для запитаної моделі.
Ембедінги#
POST /v1/embeddings використовує model та input. Підтвердьте підтримуване розгортання ембедінгів перед використанням цієї кінцевої точки; недоступний сервіс повертає 503 service_unavailable. Перевірте статус сервісу щодо доступності.
Виявлення моделей#
GET /v1/models перелічує підключені ідентифікатори розгортань. Запис у каталозі описує модель та її тарифи; використовуйте виявлення моделей та статус сервісу, щоб перевірити доступність.
Поля відповіді#
Відповіді без потокового режиму містять usage.prompt_tokens та usage.completion_tokens. SSE завершується авторитетним записом використання, після якого йде [DONE]. Помилки провайдера нормалізуються та не включають внутрішні облікові дані.
Допоміжні сервіси#
Транскрипція аудіо, генерація зображень, ранжування та керована пакетна обробка вимагають власних підтримуваних розгортань. Перевірте статус сервісу перед використанням; недоступні операції повертають service_unavailable. Перелічений тариф не встановлює активний сервіс.
Приклад запиту
curl https://weightsapi.com/v1/chat/completions \
-H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3-32B",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"stream": true
}'