weightsapi.INFERENCIAConsola
Navegación
Límites de velocidad y cuotas

Límites de velocidad y cuotas

Ventanas de tokens, acceso con cuenta financiada y límites de solicitudes.

No hay un límite fijo de solicitudes por minuto por producto de forma predeterminada. La admisión sigue sujeta al saldo, los límites de la clave, la disponibilidad del modelo y la capacidad física. Un endpoint dedicado reserva la máquina; la capacidad compartida puede ponerse en cola.

Zona de pruebas financiada por cuenta#

Inicie sesión y confirme una recarga de al menos USD 100 antes de usar IA. Cada recarga posterior tiene el mismo mínimo; después de la calificación, un saldo restante más pequeño sigue siendo utilizable cuando cubre la solicitud. Los permisos de clave, los límites de gasto y la disponibilidad del modelo aún se aplican. Los pagos pendientes no desbloquean el acceso. Verifique el estado del servicio antes de enviar solicitudes.

Ventanas de contexto#

Los tokens de entrada más los generados deben caber en el contexto del despliegue configurado. Las ventanas nativas publicadas del modelo y los límites máximos del servicio se muestran por separado.

Capacidad dedicada#

Las máquinas dedicadas utilizan un precio mensual prepago sin cargos por token. El rendimiento permanece limitado por la máquina y la carga de trabajo. La disponibilidad de hardware y el aprovisionamiento requieren confirmación; el período de servicio comienza en la activación.

Ejemplo de solicitud

curl https://weightsapi.com/v1/chat/completions \
  -H "Authorization: Bearer $WEIGHTSAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "Qwen/Qwen3-32B",
  "messages": [
    {
      "role": "user",
      "content": "Hello!"
    }
  ],
  "stream": true
}'