weightsapi.INFERENTIEConsole
Navigatie
RAG met citaten

RAG met citaten

Een compacte retrieval-pijplijn met verifieerbare bron-ID's.

Vereisten#

Python 3.11 of nieuwer. Geen extra pakketten. Stel WEIGHTSAPI_API_KEY in op uw eigen sleutel. AI-toegang vereist aanmelding, één bevestigde opwaardering van ten minste USD 100, een geautoriseerde API-sleutel en voldoende beschikbaar tegoed voor het verzoek. Elke latere opwaardering heeft ook een minimum van USD 100; kleinere resterende saldi blijven bruikbaar wanneer ze het verzoek dekken. Tegoed vereist transactieverificatie. Controleer de servicestatus voor modelbeschikbaarheid voordat u verkeer verzendt.

Voer het recept uit#

import os, json, urllib.request
BASE = os.environ.get("WEIGHTSAPI_BASE_URL", "https://weightsapi.com/v1")
KEY = os.environ["WEIGHTSAPI_API_KEY"]
def chat(messages, model="Qwen/Qwen3-32B", **options):
    payload = dict(model=model, messages=messages, max_tokens=512, **options)
    req = urllib.request.Request(BASE+"/chat/completions", json.dumps(payload).encode(),
        {"Authorization": "Bearer "+KEY, "Content-Type": "application/json"})
    with urllib.request.urlopen(req, timeout=120) as response:
        return json.load(response)
documents = [
    {"id":"S1","text":"A KV cache reuses attention keys and values from previous tokens."},
    {"id":"S2","text":"Prefill processes the prompt; decode generates new output tokens."},
    {"id":"S3","text":"Longer contexts increase KV cache memory usage."}]
question = "How does caching affect generation?"
terms = set(question.lower().split())
ranked = sorted(documents, key=lambda d: len(terms & set(d["text"].lower().split())), reverse=True)[:2]
context = "\n".join("["+d["id"]+"] "+d["text"] for d in ranked)
r = chat([{"role":"system","content":"Answer only from the sources. Cite [S1], [S2], etc. Say when evidence is missing."},
          {"role":"user","content":context+"\nQuestion: "+question}])
print(r["choices"][0]["message"]["content"])
print("Retrieved sources:", [d["id"] for d in ranked])

Vóór productie#

Dit kleine voorbeeld gebruikt lexicale rangschikking en ingesloten voorbeeldbronnen, zodat het zelfstandig draait. Vervang het corpus en de rangschikking door uw retriever en controleer dat citaten elke bewering daadwerkelijk ondersteunen.