weightsapi.INFERÊNCIAConsole
Navegação
Perguntas Frequentes

Perguntas frequentes

Respostas práticas sobre acesso WeightsAPI, integração de API, crédito cripto, cobrança e tratamento de dados.

Visão geral

Respostas claras sobre acesso, modelos, custos, dados e disponibilidade do serviço.

Primeiros passos

Entenda o que está disponível hoje e prepare sua primeira integração.

O que posso usar hoje?

Gerencie chaves de API, crie ordens de financiamento em cripto e faça pedidos de GPUs dedicadas. Verifique o status do serviço para disponibilidade de modelos; crédito de pagamento e ativação de GPU requerem confirmação.

Navegue pelo catálogo de modelos e documentação, entre no console e crie ou revogue chaves de API. O checkout em cripto fornece o valor, a rede, o endereço e o prazo de pagamento; o crédito requer uma transação verificada. Pedidos dedicados podem ser feitos e pagos com crédito confirmado, com hardware ativado após provisionamento. Verifique o status e o guia rápido antes de enviar solicitações de modelo.

Entre e confirme uma recarga de pelo menos USD 100 antes de usar IA. Cada recarga posterior tem o mesmo mínimo; após a qualificação, um saldo restante menor permanece utilizável quando cobre a solicitação. Permissões de chave, limites de gastos e disponibilidade de modelos ainda se aplicam. Pagamentos pendentes não desbloqueiam o acesso. Verifique o status do serviço antes de enviar solicitações.

Preciso concluir o KYC?

O fluxo de login atual não possui upload de documento de identidade ou etapa de verificação KYC. Uma conta logada ainda é necessária, e o uso permanece associado a essa conta.

Como crio uma conta e uma chave de API?

Entre no console, crie uma chave com controles de gastos e modelos, e copie seu segredo imediatamente, pois ele aparece apenas uma vez.

Entre no console e crie uma chave nomeada com um limite de gastos positivo e, se útil, uma lista de modelos permitidos. Copie o segredo quando ele aparecer: o console o revela apenas na criação. Mantenha-o em uma variável de ambiente do lado do servidor ou em um gerenciador de segredos. As chaves controlam o acesso; crédito disponível e um modelo disponível também são necessários. Consulte autenticação.

O que preciso para minha primeira solicitação bem-sucedida?

Use um modelo disponível, uma chave autorizada e crédito confirmado suficiente. Escolha um ID de modelo exato e mantenha a saída dentro dos limites do deployment.

Use a URL base no guia rápido, envie sua chave de API como token Bearer e escolha um ID de modelo exato retornado por /v1/models. Defina um limite de tokens de saída que se ajuste ao seu orçamento e à janela de contexto do deployment. Verifique o status do serviço antes de enviar solicitações.

O acesso à IA requer login, uma recarga confirmada de pelo menos USD 100, uma chave de API autorizada e crédito disponível suficiente para a solicitação. Cada recarga posterior também tem um mínimo de USD 100; saldos restantes menores permanecem utilizáveis quando cobrem a solicitação. O crédito requer verificação da transação. Verifique o status do serviço para disponibilidade de modelos antes de enviar tráfego.

Posso reutilizar uma integração existente do OpenAI ou Anthropic?

O OpenAI Chat Completions precisa de uma nova URL base, chave e modelo; o Anthropic também exige alterações no SDK, formato de mensagem e análise de resposta.

Para uma integração do OpenAI Chat Completions, as principais mudanças são a URL base, a chave de API e o ID do modelo. APIs e recursos específicos do provedor precisam de verificações separadas. Uma integração do Anthropic também exige alterações no SDK, formato de mensagem, posicionamento do prompt do sistema e análise de resposta. Siga o guia de migração e, em seguida, teste prompts, ferramentas e saídas estruturadas representativas contra uma implantação conectada antes de mover o tráfego. A compatibilidade com um formato de solicitação familiar não garante comportamento idêntico do modelo.

Como devo escolher um modelo?

Avalie o menor modelo adequado em suas próprias tarefas e, em seguida, verifique sua disponibilidade, limites de contexto e suporte necessário a ferramentas ou esquemas.

Comece pela tarefa: chat interativo curto, codificação, raciocínio ou entrada de documentos mais longos. Compare as páginas de modelos para especificações do editor, contexto do serviço e taxas de entrada/saída. Verifique a disponibilidade do modelo e avalie o menor candidato adequado em suas próprias tarefas. Verifique o suporte a chamadas de ferramentas ou esquemas separadamente antes de comprometer uma aplicação com um modelo.

Modelos e recursos da API

Verifique o escopo da compatibilidade e os requisitos de cada recurso.

Os modelos são sem censura?

O WeightsAPI não adiciona filtro de conteúdo no gateway. O catálogo inclui modelos originais e variantes com ajuste fino publicadas por seus respectivos criadores, incluindo Dolphin e Hermes. Algumas variantes são projetadas para reduzir recusas; o treinamento do modelo ainda pode causar recusas. Leia as notas de origem e comportamento de cada modelo.

O que significa compatível com OpenAI aqui?

A API usa rotas de Chat Completions, Completions legado e descoberta de modelos. Verifique as capacidades do deployment selecionado; APIs específicas de provedores não são intercambiáveis.

O WeightsAPI aceita os formatos de solicitação Chat Completions, Completions legado e descoberta de modelos. A geração requer um deployment disponível que suporte a operação selecionada. Respostas, Assistants e ferramentas específicas de provedores não são substitutos diretos. Consulte a referência da API para operações suportadas e valide os recursos que sua aplicação usa antes de trocar o tráfego.

A API suporta respostas em streaming?

Use eventos enviados pelo servidor para respostas de chat em streaming em um deployment disponível e retenha o registro de uso final para cobrança.

Defina stream: true para um deployment de chat disponível e consuma eventos completos enviados pelo servidor. Um pedaço de rede não é necessariamente uma mensagem, e o registro de uso final pode chegar após o texto da resposta terminar. Mantenha a chave de API no seu servidor ao encaminhar um stream para um navegador. O guia de streaming cobre uso e conexões interrompidas; verifique o status do serviço para disponibilidade.

Um modelo pode chamar ferramentas ou executar ações para minha aplicação?

Sua aplicação valida e executa chamadas de ferramentas. O modelo e o deployment selecionados devem suportar o formato de ferramenta antes que as ações possam ser habilitadas.

O gateway encaminha definições de ferramentas para o modelo selecionado. Um modelo pode retornar um nome de ferramenta e argumentos solicitados; sua aplicação decide se executa a ação. Valide ambos contra uma lista de permissões e as permissões do usuário atual e, em seguida, retorne o resultado na conversa. O WeightsAPI não executa as ferramentas da sua aplicação. Verifique o suporte do deployment e siga chamada de função antes de habilitar ações.

Posso exigir que uma resposta corresponda a um esquema JSON?

JSON estrito requer um deployment com decodificação restrita compatível. Valide cada resposta contra seu esquema e trate saídas inválidas ou incompletas.

A saída de esquema estrito requer decodificação restrita e suporte ao seu esquema no deployment selecionado. Pedir a um modelo para "retornar JSON" sozinho não garante uma correspondência de esquema. O gateway encaminha response_format; confirme o suporte ao modo estrito para o deployment antes de confiar nele. Siga o guia de saída estruturada, valide cada resultado com o mesmo esquema e trate truncamento ou rejeição explicitamente.

Serviços de embeddings, batch, áudio e imagem estão disponíveis?

Verifique a referência da API e o status do serviço antes de usar embeddings, reranking, processamento em lote gerenciado, transcrição de áudio ou geração de imagens.

Essas operações precisam de seu próprio deployment suportado. Uma capacidade ou taxa listada não estabelece um endpoint ativo, e enviar múltiplas solicitações de chat da sua aplicação é diferente de uma API de lote gerenciada. Verifique a referência da API e o status do serviço antes de projetar em torno de um serviço auxiliar.

Depósitos em cripto

Leia o ativo, a rede e o status de pagamento exatos antes de enviar fundos.

Quais criptomoedas e redes posso usar?

Use as opções de ativo e rede mostradas na configuração de pagamento atual; um endereço de recebimento exibido não estabelece crédito confirmado.

Escolha o ativo e a rede exatos mostrados no checkout e use o endereço de recebimento salvo com seu pedido. Um token em outra rede não é intercambiável. O pedido mantém seu ativo, rede e endereço mesmo se a configuração de pagamento mudar. O crédito aparece somente após a transação recebida ser correspondida e verificada. Consulte cobrança.

Como adiciono crédito em cripto?

O checkout calcula o valor em cripto para sua recarga em USD e exibe o endereço de recebimento fixo, a rede, a taxa de câmbio e o prazo de pagamento.

Crie uma ordem de financiamento de pelo menos USD 100. O servidor obtém uma taxa de mercado recente e fixa o valor a enviar por 10 minutos, inclusive para USDT e USDC. Mantenha a referência do pedido e pague as taxas de rede separadamente. A correspondência da transação e a confirmação do crédito permanecem etapas verificadas separadas; criar um pedido ou atualizar seu status não adiciona crédito. Consulte o guia de cobrança.

Por que um depósito pode permanecer pendente?

Um pedido permanece pendente até que sua transferência seja correspondida, verificada e creditada. Iniciar um pagamento ou atualizar seu status não o confirma.

Um pedido começa em um estado de aguardando confirmação. Sua transferência deve ser correspondida e verificada antes que o crédito da conta seja registrado. Uma declaração de pagamento ou atualização de status não pode marcá-lo como pago. Mantenha a referência do pedido e o identificador público da transação e não envie outro pagamento apenas porque o primeiro está pendente. O guia de suporte lista os detalhes a reter; os tempos de confirmação e resolução não são garantidos.

O que acontece se eu enviar o ativo errado ou usar a rede errada?

A recuperação e reembolsos para transferências com ativo ou rede errados não estão estabelecidos; use o destino exato registrado em sua ordem de financiamento.

Uma política de recuperação para transferências com rede ou ativo errados não foi estabelecida. Não presuma que uma transferência possa ser creditada, recuperada ou reembolsada. Antes de transferir, verifique o ativo, a rede, o endereço e o valor em relação às instruções de depósito atuais antes de enviar. Se ocorrer um problema na transferência, forneça a referência da ordem e o identificador público da transação por meio do suporte; nunca compartilhe uma frase-semente de carteira ou chave privada.

Como o valor em criptomoeda é calculado e quando expira?

O valor alvo em USD é convertido a uma taxa de mercado recente. O valor em criptomoeda é arredondado para cima para a menor unidade do ativo e fica fixo por 10 minutos.

O checkout mostra a fonte da taxa, o horário da taxa e o prazo de pagamento. USDT e USDC usam suas taxas de mercado reais, não uma paridade presumida de um dólar. Se não houver taxa recente disponível, tente novamente o cálculo antes de enviar fundos. Um pedido existente sem cotação pode receber uma sem alterar sua referência ou endereço.

Após a expiração, obtenha uma nova cotação somente se ainda não tiver enviado fundos. Mantenha o pedido original para uma transferência já enviada; confirmações podem chegar mais tarde. Um pagamento exato recebido dentro da janela da cotação se qualifica para o crédito em USD cotado após verificação. Transferências atrasadas ou valores diferentes exigem revisão; um pagamento pendente não libera o acesso à IA. Consulte cobrança.

Cobrança e chaves de API

Entenda as cobranças de uso, o crédito reservado e os controles em cada chave.

Como uma solicitação de modelo é precificada?

Os custos usam taxas de modelo separadas para tokens reais de entrada e saída, liquidados a partir do uso confirmado pelo provedor após uma reserva inicial de crédito.

A inferência compartilhada tem taxas de entrada e saída separadas para cada modelo. Uma solicitação admitida reserva crédito suficiente para a entrada contada e a saída máxima solicitada, e depois liquida contra o uso autoritativo nas taxas salvas com essa reserva. Use a tabela de preços para estimar sua carga de trabalho. Modelos sem preços publicados não podem aceitar solicitações pagas. Uma solicitação rejeitada antes do despacho da inferência não cria cobrança de tokens. Consulte cobrança.

Por que meu crédito disponível pode ser menor que meu saldo?

O crédito disponível é o saldo contábil menos as reservas de inferência pendentes, que permanecem retidas até que o uso autoritativo possa ser liquidado.

O saldo vem do livro-razão da conta; o crédito disponível também subtrai as reservas de inferência pendentes. Uma reserva retém o custo máximo admitido da solicitação para que solicitações simultâneas não possam gastar o mesmo crédito. Quando o uso autoritativo chega, a cobrança final substitui a retenção. Se um stream for interrompido ou o uso do provedor estiver ausente, essa reserva pode permanecer pendente de reconciliação. Um cliente desconectado não prova que a geração parou. Consulte streaming e cobrança e relate uma retenção não resolvida por meio do suporte.

O que os limites de gastos e restrições de modelo protegem?

Os limites de gastos cobrem o uso vitalício de cada chave e reservas pendentes, enquanto as listas de permissões de modelos restringem seus modelos permitidos; os limites não são reiniciados mensalmente.

Cada chave tem um limite de gastos vitalício em USD que inclui uso registrado e reservas pendentes. Ele não é reiniciado mensalmente. Uma lista de permissões de modelos limita os IDs exatos de modelo que a chave pode usar; uma lista vazia permite todos os modelos disponíveis no catálogo. Use chaves separadas para distinguir aplicações e ambientes nos registros de uso. Os controles de chave não adicionam crédito à conta nem alteram a disponibilidade de modelos. Consulte autenticação.

O que devo fazer se perder ou expor uma chave de API?

Revogue uma chave exposta prontamente, crie uma substituta e atualize seu aplicativo; segredos existentes não podem ser exibidos novamente.

O console não pode mostrar um segredo existente novamente. Crie uma chave substituta, armazene-a com segurança, atualize os aplicativos que a usam e revogue a chave antiga. Se a chave foi exposta, revogue-a prontamente e inspecione os registros de uso da conta. A revogação impede que novas solicitações sejam admitidas com essa chave; trabalhos já admitidos ainda podem ser liquidados. Nunca cole uma chave de API em uma mensagem de suporte, repositório público ou pacote de navegador. Siga o guia de autenticação.

Posso sacar crédito não utilizado ou obter um reembolso automático?

Saques de carteira estão indisponíveis no momento. Crédito confirmado pode pagar pelo uso do serviço; cancelar um pedido de GPU antes da ativação devolve seu pagamento ao saldo da conta.

Saques de carteira estão indisponíveis no momento. Use crédito pré-pago confirmado para solicitações de modelo elegíveis ou pedidos de GPU dedicada. Cancelar um pedido de GPU pago antes da ativação devolve esse pagamento de aluguel ao saldo da sua conta WeightsAPI; não envia criptomoeda para uma carteira. Nenhum reembolso automático ou pagamento para carteira é prometido. Revise cobrança antes de adicionar crédito.

Dados e privacidade

Separe o tratamento de prompts dos registros necessários para operar uma conta.

O WeightsAPI armazena meus prompts ou respostas de modelo?

O gateway não persiste prompts ou respostas em seu banco de dados de aplicação. Registros de conta permanecem, e a retenção do provedor requer verificação separada.

O gateway não persiste prompts, texto de conclusão ou argumentos de ferramentas em seu banco de dados de aplicação, e os logs de aplicação omitem corpos de solicitações. Registros de autenticação, uso e pagamento são armazenados separadamente. A retenção do provedor e o registro de infraestrutura exigem verificação independente; o comportamento do gateway não é uma garantia de retenção zero de ponta a ponta. Leia manuseio de dados e a página de confiança para o escopo.

Quais registros são mantidos se o conteúdo do prompt não for registrado?

Identificadores de conta, hashes de chave, registros de pagamento, contagens de tokens, cobranças e metadados de reserva são retidos para autenticação e contabilidade sem armazenar texto de conversa.

O sistema de conta mantém identificadores, hashes de chave de API e metadados, registros de depósito e retirada, contagens de tokens, cobranças e agregados de uso. As reservas de solicitação também registram o modelo, as taxas aplicáveis e o estado de liquidação para que a cobrança possa ser reconciliada. Esses registros suportam autenticação, controles de gastos e contabilidade sem armazenar texto de conversa. "Sem registro de conteúdo" portanto não significa uso anônimo ou ausência de registros retidos. Consulte tratamento de dados; os períodos de retenção e os procedimentos de direitos de dados em produção ainda precisam de termos publicados e verificados.

Pedidos de GPU dedicada retêm o hardware e modelo selecionados, preço mensal, status de pagamento e cancelamento, e datas de serviço e detalhes do endpoint quando o provisionamento for confirmado.

A declaração de privacidade também cobre o provedor de inferência?

Não: a política de conteúdo do gateway não estabelece as práticas de retenção ou treinamento de um provedor de inferência, que ainda precisam de verificação.

O comportamento do gateway não estabelece a política de retenção ou treinamento de outro provedor. Atender a uma solicitação requer compartilhar seu conteúdo com o provedor de inferência. Registros do provedor, subprocessadores e termos contratuais exigem verificação separada. Se sua carga de trabalho tiver requisitos de confidencialidade ou regulatórios, revise a página de confiança e confirme os arranjos relevantes antes de enviar conteúdo sensível.

Onde as solicitações serão processadas e posso escolher uma região?

Dallas, Ashburn e Portland são locais planejados, sem disponibilidade de frota verificada, região selecionada pelo cliente ou compromisso de residência de dados em produção.

Dallas, Ashburn e Portland são locais-alvo de GPU. Disponibilidade, roteamento e residência de dados exigem confirmação para o deployment real; nomes de locais por si só não estabelecem essas condições. A escolha de região e compromissos de residência de ponta a ponta devem ser acordados para o deployment. Revise manuseio de dados e a página de confiança antes de comprometer uma carga de trabalho com requisitos regionais.

É necessária uma recarga confirmada antes de usar IA?

Toda interação de IA requer uma recarga confirmada qualificada; o mínimo é USD 100 por recarga, não um saldo mínimo permanente.

Sim. Sua conta deve receber uma recarga confirmada de pelo menos USD 100 antes de qualquer interação de IA; não há permissão de teste gratuita pública. Cada recarga posterior também começa em USD 100. Após a recarga qualificada inicial, o crédito restante abaixo de USD 100 ainda pode pagar por solicitações até ser insuficiente. Use uma chave ativa com as permissões de modelo e orçamento necessárias. O checkout fornece instruções de pagamento e uma cotação de cripto com tempo limitado. O crédito requer uma transação correspondida e verificada; criar ou atualizar um pedido não confirma o pagamento.

Desempenho e suporte

Planeje a capacidade com cuidado e reúna detalhes úteis quando algo falhar.

Que latência ou taxa de transferência posso esperar?

O desempenho depende do modelo, hardware, carga de trabalho, configuração de serviço e concorrência. Valide-o com sua própria carga de trabalho; nenhuma garantia de latência ou taxa de transferência é oferecida.

O desempenho depende do modelo, hardware, comprimento do prompt, comprimento gerado, concorrência e configuração de serviço. Em um deployment disponível, meça o tempo até o primeiro token e a velocidade de geração separadamente usando uma carga de trabalho representativa. Características de modelo publicadas e especificações de hardware não são um SLA. Revise capacidade dedicada para cargas de trabalho que precisam de recursos reservados e status do serviço para disponibilidade.

As solicitações são ilimitadas se eu tiver crédito suficiente?

O crédito não torna o uso ilimitado: capacidade, contexto, limites de saída, permissões de modelo e limites de gastos da chave ainda restringem as solicitações.

Não. O design atual não impõe um limite fixo padrão de solicitações por minuto no tráfego pago, mas a admissão ainda depende do crédito disponível, limites da chave, modelos permitidos, limites de saída, tamanho do contexto e capacidade do backend. O serviço compartilhado pode enfileirar, e o playground segue as mesmas regras de recarga confirmada, crédito disponível e orçamento da chave que as solicitações da API. A janela de contexto nativa de um modelo também pode exceder o teto de serviço configurado. Revise limites e trate erros com tentativas limitadas; não trate o crédito como garantia de capacidade.

Posso pedir um endpoint de GPU dedicada agora?

Sim. Escolha uma GPU, selecione um modelo e faça um pedido mensal. O pagamento é feito com crédito confirmado da conta; o hardware fica disponível após o provisionamento ser confirmado.

Use a página de GPU dedicada para escolher uma configuração e abrir o checkout. Se seu saldo for insuficiente, recarregue-o em cripto e retorne quando o crédito for confirmado para pagar pelo pedido. Uma recarga não paga o aluguel automaticamente. O mês pré-pago começa na ativação, sem renovação automática. Antes da ativação, o cancelamento devolve qualquer pagamento de aluguel ao saldo da sua conta. A disponibilidade do hardware e o prazo de entrega exigem confirmação do operador; um pedido não é uma máquina ativa.

Como devo interpretar a página de status e um erro 503?

Um 503 significa que o serviço requerido está indisponível. Verifique o status do serviço e a mensagem de erro antes de tentar novamente; uma configuração de conexão não estabelece tempo de atividade.

Um 503 service_unavailable significa que o deployment requerido ou serviço auxiliar não pode aceitar a solicitação. Verifique a página de status e o guia de erros antes de usar tentativas limitadas. Uma configuração de conexão sozinha não é prova de serviço saudável ou tempo de atividade medido. Solicitações rejeitadas antes do despacho da inferência não criam cobrança de tokens.

Que informações devo incluir ao pedir ajuda?

Inclua a operação, hora e fuso horário, modelo, código de erro e referências relevantes; remova chaves de API, segredos de carteira e conteúdo de prompt desnecessário.

Use a página de suporte para preparar a operação afetada, hora aproximada e fuso horário, ID do modelo, código de erro e resultado esperado. Para cobrança ou depósitos, adicione a referência da solicitação ou do pedido e o identificador público da transação, quando aplicável. Remova chaves de API, segredos de carteira e conteúdo de prompt desnecessário. Copiar um relatório não o envia. Contatos de suporte oficiais, horários de serviço e metas de resposta não são publicados.

Precisa de um próximo passo?

Encontre o guia relevante ou prepare os detalhes do seu problema.

Abrir suporte