weightsapi.INFERÊNCIAConsole
Navegação
RAG com citações

RAG com citações

Um pequeno pipeline de recuperação com IDs de origem verificáveis.

Requisitos#

Python 3.11 ou mais recente. Sem pacotes adicionais. Defina WEIGHTSAPI_API_KEY com sua própria chave. O acesso à IA requer login, uma recarga confirmada de pelo menos USD 100, uma chave de API autorizada e crédito suficiente disponível para a solicitação. Cada recarga posterior também tem um mínimo de USD 100; saldos restantes menores permanecem utilizáveis quando cobrem a solicitação. O crédito requer verificação da transação. Verifique o status do serviço para disponibilidade de modelos antes de enviar tráfego.

Execute a receita#

import os, json, urllib.request
BASE = os.environ.get("WEIGHTSAPI_BASE_URL", "https://weightsapi.com/v1")
KEY = os.environ["WEIGHTSAPI_API_KEY"]
def chat(messages, model="Qwen/Qwen3-32B", **options):
    payload = dict(model=model, messages=messages, max_tokens=512, **options)
    req = urllib.request.Request(BASE+"/chat/completions", json.dumps(payload).encode(),
        {"Authorization": "Bearer "+KEY, "Content-Type": "application/json"})
    with urllib.request.urlopen(req, timeout=120) as response:
        return json.load(response)
documents = [
    {"id":"S1","text":"A KV cache reuses attention keys and values from previous tokens."},
    {"id":"S2","text":"Prefill processes the prompt; decode generates new output tokens."},
    {"id":"S3","text":"Longer contexts increase KV cache memory usage."}]
question = "How does caching affect generation?"
terms = set(question.lower().split())
ranked = sorted(documents, key=lambda d: len(terms & set(d["text"].lower().split())), reverse=True)[:2]
context = "\n".join("["+d["id"]+"] "+d["text"] for d in ranked)
r = chat([{"role":"system","content":"Answer only from the sources. Cite [S1], [S2], etc. Say when evidence is missing."},
          {"role":"user","content":context+"\nQuestion: "+question}])
print(r["choices"][0]["message"]["content"])
print("Retrieved sources:", [d["id"] for d in ranked])

Antes da produção#

Este pequeno exemplo usa classificação lexical e fontes de amostra incorporadas para funcionar de forma independente. Substitua o corpus e a classificação pelo seu recuperador e verifique se as citações realmente sustentam cada afirmação.