Agentic RAG mit Claude in der EU 2026
Agentic RAG mit Claude in der EU: Bedrock Managed Knowledge Bases in Frankfurt oder Irland, AgenticRetrieveStream, Preise und wann Sie den Index selbst hosten.
TL;DR
Agentic RAG mit Claude in der EU heißt: der Index liegt in Frankfurt oder Irland, die Suche plant mehrere Teilfragen, die Antwort zitiert Quellen. Nutzen Sie eine Managed Knowledge Base und AgenticRetrieveStream. Die Anthropic-API hat kein EU-Inference. Token laufen über das EU-Geo-Profil eu.anthropic.claude-sonnet-5.
Was unterscheidet Agentic RAG von klassischem RAG?
Klassisches RAG holt einmal Chunks und schreibt sie in den Prompt. Agentic RAG zerlegt die Frage, sucht mehrfach, prüft ob die Treffer reichen, und zieht bei Bedarf das ganze Dokument. Auf Bedrock macht das AgenticRetrieveStream. Es läuft nur auf Managed Knowledge Bases, nicht auf einem selbst betriebenen Vektorindex.
AWS beschreibt den Ablauf in sechs Schritten: Sitzungshistorie laden, Teilfragen planen, gegen bis zu fünf Retriever suchen, bei Bedarf GetDocumentContent für das volle Dokument, Antwort synthetisieren, Ergebnisse und Zitate zurückgeben. Vor der ersten Planung läuft oft eine spekulative Suche mit der Rohfrage, damit die erste Runde nicht leer startet. generateResponse steht standardmäßig auf true. Setzen Sie es auf false, wenn Ihr eigener Orchestrator die Chunks an Claude geben soll.
Das ist der Unterschied zu RetrieveAndGenerate. Diese API holt einmal und generiert mit Zitaten. AWS schreibt klar: sie funktioniert nicht mit Managed Knowledge Bases. Für den verwalteten Index bleiben Retrieve (eine Hybridsuche) und AgenticRetrieveStream (mehrere Iterationen). maxAgentIteration hat als Untergrenze 2. Weniger Iterationen kürzen Kosten und können komplexe Fragen abschneiden.
Ein Beispiel aus der Doku: „Welche Zeitschrift erschien zuerst, Arthur’s Magazine oder First for Women?“ wird zu zwei Teilfragen nach den Gründungsjahren. Genau so zerlegt ein interner Leitfaden eine Frage nach AVV, Aufbewahrung und Löschfrist. Ein einzelner Vektortreffer reicht dafür selten.
Die Anthropic-API kann denselben Loop selbst bauen. Ein Werkzeug gibt search_result-Blöcke zurück, Claude zitiert sie, wenn citations.enabled true ist. Search Results sind Teil der normalen Messages-API, ohne Beta-Header, auf allen aktiven Modellen außer Claude Haiku 3. Zitate sind standardmäßig aus. Der Haken für Europa: inference_geo akzeptiert nur us und global. Workspace-Geo ist nur us. Wer Personenbezug in der EU halten muss, holt Claude über Bedrock oder Google Cloud, nicht über api.anthropic.com.
Welche Bedrock-Knowledge-Base läuft in der EU?
Eine Managed Knowledge Base gibt es in Europa in Frankfurt (eu-central-1), Irland (eu-west-1) und London (eu-west-2). Für Residenz in der Union nehmen Sie Frankfurt oder Irland. London ist Vereinigtes Königreich. AWS verwaltet Ingestion, Speicher, Embeddings und Rerank. Sie liefern die Quellen.
Die Regionenliste nennt acht Regionen weltweit, darunter die drei europäischen. Structured-Data-Knowledge-Bases (natürliche Sprache nach SQL) stehen zusätzlich in Zürich und Paris. Das ist ein anderer Produktzweig: Tabellen, keine unstrukturierten PDFs.
AWS stellt Managed und Customer-managed Knowledge Bases einander gegenüber. Agentic Retrieval, sieben native Konnektoren und der dienstverwaltete Embedder sitzen nur auf der Managed-Seite. Customer-managed lässt Sie den Vektorspeicher selbst wählen, erlaubt aber kein Agentic Retrieval und nur S3 plus Custom als Quellen.
| Merkmal | Managed Knowledge Base | Customer-managed |
|---|---|---|
| Agentic Retrieval | ja | nein |
| Konnektoren | 7 (S3, SharePoint, Confluence, Web Crawler, Google Drive, OneDrive, Custom) | S3 und Custom |
| Embeddings und Rerank | dienstverwaltet, ohne Aufpreis | eigenes Bedrock-Embedding |
| Vektorspeicher | AWS betreibt ihn | Sie betreiben ihn |
| Abfrage-API | Retrieve oder AgenticRetrieveStream |
Retrieve oder RetrieveAndGenerate |
| EU-Regionen (unstrukturiert) | Frankfurt, Irland, London | abhängig vom gewählten Store |
Sonnet 5 als Generator gehört auf bedrock-runtime mit dem EU-Geo-Profil eu.anthropic.claude-sonnet-5. Die Modellkarte listet Knowledge Bases dort als unterstützt, auf bedrock-mantle als nicht unterstützt. Mantle ist der Weg für eine einzelne Region in Irland oder Stockholm. Wer Agentic RAG und Single-Region gleichzeitig will, bekommt das mit Sonnet 5 nicht. EU-Geo aus Frankfurt routet nach Frankfurt, Stockholm, Mailand, Spanien, Irland und Paris. Das bleibt in der EU, ist aber keine Festlegung auf genau eine Region. AWS warnt: bei Cross-Region-Inference können Daten Regionen teilen. Die Regionstabelle und das IAM-Gerüst stehen in unserem Amazon-Bedrock-Überblick.
Embeddings, wenn Sie selbst wählen: Titan Text Embeddings V2 (amazon.titan-embed-text-v2:0) in unter anderem eu-central-1, eu-west-1, eu-west-2, eu-west-3, Dimensionen 256, 512 oder 1024. Titan G1 bleibt bei 1536 Dimensionen und weniger EU-Regionen. Cohere Embed English und Multilingual liegen in Frankfurt, Irland, London und Paris, fest 1024 Dimensionen. Der Data-Automation-Parser für Bilder ist nur in Oregon und Preview. Für EU-RAG bleiben Textparser oder ein Foundation-Model-Parser, der in der Quellregion verfügbar ist.
Was kostet Agentic RAG auf Bedrock?
Der Index kostet 5,00 USD je GB Rohdaten und Monat. Eine Standard-Suche kostet 1,00 USD je 1.000 Retrieve-Aufrufe. Agentic Retrieval kostet 4,00 USD je 1.000 AgenticRetrieveStream-Aufrufe plus 1,00 USD je 1.000 darunterliegende Retrieve. Dienstverwaltete Embeddings und der dienstverwaltete Reranker stehen auf der PreisSeite mit 0 USD.
AWS rechnet zwei Beispiele mit 50 GB und 100.000 Dokumenten. 100.000 Standard-Suchen: 250 USD Speicher plus 100 USD Retrieve, 350 USD im Monat. 100.000 Agentic-Aufrufe mit im Schnitt zwei darunterliegenden Retrieve: 250 plus 400 plus 200, 850 USD im Monat. Parser und Rerank sind in beiden Beispielen inklusive. Die Claude-Token für die sichtbare Antwort kommen extra, sobald Sie ein eigenes Foundation-Modell wählen. Beim Typ MANAGED steckt die Planung im Agentic-Preis. Beim Typ CUSTOM zahlen Sie die Modellpreise des Anbieters zusätzlich.
| Posten | Preis |
|---|---|
| Indexspeicher | 5,00 USD je GB Rohdaten / Monat |
| Standard Retrieve | 1,00 USD je 1.000 Aufrufe |
| Agentic Retrieve (Managed-LLM) | 4,00 USD je 1.000 Aufrufe plus 1,00 USD je 1.000 darunterliegende Retrieve |
| Agentic Retrieve (eigenes LLM) | 1,00 USD je 1.000 darunterliegende Retrieve plus Modellpreis |
| Managed Embeddings und Rerank | 0 USD |
| Bedrock Data Automation als Parser | 0,010 USD je Seite Standard Output |
| Claude Sonnet 5.5 (API) | 2 USD Input / 10 USD Output je 1 Mio Token |
| Regionaler Aufschlag ab Sonnet 4.5 | 10 Prozent gegenüber Global |
Anthropic-Preise setzen Sonnet 5.5 auf 2 / 10 USD und Opus 5.5 auf 4 / 20 USD je Million Token. Ab Sonnet 4.5, Haiku 4.5 und Opus 4.5 verlangen regionale und Multiregion-Endpunkte auf Bedrock und Google Cloud 10 Prozent Aufschlag gegenüber Global. Das ist der Preis des EU-Profils. Batch halbiert Input und Output. Ein Cache-Treffer auf Sonnet 5.5 kostet 0,10 USD je Million, 0,05-fach. US-only inference_geo auf der Anthropic-API kostet 1,1-fach und löst Ihr Residenzproblem nicht.
Cohere Rerank 3.5, wenn Sie den dienstverwalteten Reranker ersetzen, kostet 2,00 USD je 1.000 Queries. Eine Query darf bis zu 100 Dokument-Chunks tragen. 350 Chunks zählen als 4 Queries. Jeder Chunk liegt bei höchstens 512 Token inklusive Query. Die Tokenpreise hinter dem Generator stehen im Claude-API-Kostenvergleich.
Default-Quotas aus der Quotaliste: 10.000 Managed Knowledge Bases je Konto und Region (erhöhbar), 200 Datenquellen (fest), 50 parallele Ingestion-Jobs (fest), 10 TB Rohdaten je Knowledge Base (fest), 10.000 Zeichen je Query, 600 Retrieve-RPM je Knowledge Base mit Burst 25 RPS, 300 AgenticRetrieveStream-RPM je Konto. 10 TB bei 5 USD/GB wären 51.200 USD nur für Speicher. Die meisten Teams bleiben weit darunter.
Wie starten Sie AgenticRetrieveStream in Frankfurt?
Legen Sie die Knowledge Base in eu-central-1 an, verbinden Sie S3 oder SharePoint, warten Sie die Ingestion ab, rufen Sie AgenticRetrieveStream mit dienstverwalteten Modellen auf. IAM braucht bedrock:AgenticRetrieveStream, bedrock:Retrieve, bedrock:GetDocumentContent und bedrock:InvokeModelWithResponseStream. Guardrails am Agent unterstützen nur BLOCK, nicht MASK.
- Wählen Sie
eu-central-1(Frankfurt) odereu-west-1(Irland).eu-west-2(London) ist kein EU-Mitgliedstaat. - Legen Sie eine Managed Knowledge Base an. Lassen Sie Embeddings und Rerank auf
MANAGED, solange Sie keinen Grund für ein eigenes Modell haben. - Hängen Sie eine Datenquelle an. S3 im selben Konto und in derselben Region ist der kürzeste Weg. SharePoint, Confluence, Google Drive und OneDrive brauchen die jeweiligen Konnektorrechte.
- Starten Sie die Ingestion. Maximal 50 Jobs laufen parallel. Rohdaten dürfen 10 TB je Knowledge Base nicht überschreiten.
- Testen Sie zuerst
Retrieve. Eine Hybridsuche ohne Planung zeigt, ob Chunks und Metadaten stimmen, bevor der Agent Iterationen verbraucht. - Schalten Sie
AgenticRetrieveStreammitfoundationModelTypeundrerankingModelTypeaufMANAGED. Setzen SiemaxAgentIterationbewusst, Untergrenze 2. - Hängen Sie ein Guardrail mit Aktion
BLOCKan, wenn Eingaben oder Antworten gefiltert werden sollen. AWS wendet Guardrails auf Eingabe und generierte Antwort an, nicht auf die gelieferten Referenzen.
import boto3
client = boto3.client("bedrock-agent-runtime", region_name="eu-central-1")
events = client.agentic_retrieve_stream(
messages=[
{
"role": "user",
"content": {"text": "Welche Freigabe gilt für den Auftragsverarbeitungsvertrag?"},
}
],
retrievers=[
{
"configuration": {
"knowledgeBase": {"knowledgeBaseId": "KB12345678"}
}
}
],
agenticRetrieveConfiguration={
"foundationModelType": "MANAGED",
"rerankingModelType": "MANAGED",
"maxAgentIteration": 2,
},
generateResponse=True,
)
for event in events.get("stream", []):
if "responseEvent" in event:
print(event["responseEvent"].get("text", ""), end="")
Das ist der Pfad, den AWS in der API-Referenz zeigt. Bis zu fünf Retriever dürfen in einem Aufruf stehen, jeder eine eigene Managed Knowledge Base. retrievalConfigs für AgentCore Memory nimmt höchstens einen Eintrag mit höchstens fünf metadataFilters. sessionBinding und eine selbst mitgeschickte Historie in messages schließen einander aus.
Wer den Generator selbst steuern will, setzt generateResponse auf false und schickt die Treffer als search_result an Claude auf eu.anthropic.claude-sonnet-5. Dann sehen Sie Planung und Hybridsuche bei AWS, Formulierung und Zitate bei Claude. Gateway und Budgets davor, etwa LiteLLM im eigenen EU-Netz, bleiben sinnvoll, sobald mehrere Apps denselben Index teilen.
Wann hosten Sie den Index selbst?
Selbst hosten, wenn Metadatenfilter, ACL oder der Vektorspeicher Ihre Bedingung sind, oder wenn Agentic Retrieval Sie nicht überzeugt. Bleiben Sie bei der Managed Knowledge Base, wenn Konnektoren, dienstverwalteter Embedder und der Planungsloop die Arbeit sind, die Sie nicht betreiben wollen.
Selbst hosten heißt: Chunks in OpenSearch, pgvector oder Qdrant in Frankfurt, Embeddings über Titan V2 in eu-central-1, Claude nur als Generator über das EU-Geo-Profil. Die Search-Results-API erwartet source, title und ein Array von Textblöcken. Ein Block ist die kleinste zitierbare Einheit. Für satzgenaue Zitate splitten Sie jeden Chunk in einen eigenen Block. Bilder in search_result gibt es nicht.
from anthropic import AnthropicBedrock
client = AnthropicBedrock(aws_region="eu-central-1")
knowledge_base_tool = {
"name": "search_knowledge_base",
"description": "Durchsucht den internen Index",
"input_schema": {
"type": "object",
"properties": {"query": {"type": "string"}},
"required": ["query"],
},
}
# Nach dem Tool-Call geben Sie Treffer so zurück:
tool_result = {
"type": "tool_result",
"tool_use_id": "toolu_01example",
"content": [
{
"type": "search_result",
"source": "kb://avv-2026",
"title": "Auftragsverarbeitung",
"content": [{"type": "text", "text": "Der AVV gilt für alle personenbezogenen Prompts."}],
"citations": {"enabled": True},
}
],
}
Dieser Weg braucht Eval, Tracing und ein Budget. Langfuse selbst gehostet in der EU hält die Traces in Ihrem Netz. Das LLMOps-Betriebsmodell trennt Retrieval-Precision von End-to-End-Richtigkeit. Bedrock Model Evaluation rechnet Judge-Token zum On-Demand-Preis und die Knowledge-Base-Nutzung extra.
Google Cloud ist die Alternative, wenn Ihr Bestand auf GCP liegt. Die RAG-Engine-Dokumentation führt europe-west3 (Frankfurt) und europe-west4 (Eemshaven) als GA. Claude auf dem eu-Endpunkt bleibt die Residenzsteuerung für den Generator, Details in Claude auf Vertex AI in Europa. Die Anthropic-API mit inference_geo: "us" ist kein EU-Setup, auch wenn der Index in Frankfurt steht. Den Anbietervergleich mit Foundry und der First-Party-API steht unter Claude DSGVO-konform.
Wir empfehlen die Managed Knowledge Base in Frankfurt, sobald SharePoint oder Confluence die Quelle sind und niemand einen Vektorcluster betreiben will. Wir empfehlen den eigenen Index, sobald Sie Felder filtern, Mandanten trennen oder den Embedder tauschen müssen. Mischen Sie beides nicht in derselben Anfrage: Agentic Retrieval akzeptiert nur Managed Knowledge Bases.
FAQ
Was kostet Agentic RAG auf Bedrock in der EU?
50 GB Index plus 100.000 Standard-Suchen liegen laut AWS-Beispiel bei 350 USD im Monat. Dieselbe Menge als Agentic Retrieval mit zwei darunterliegenden Retrieve je Aufruf liegt bei 850 USD. Claude-Token für die Antwort kommen dazu, sobald Sie ein eigenes Modell wählen. Regionale Endpunkte ab Sonnet 4.5 kosten 10 Prozent mehr als Global.
Managed Knowledge Base oder selbst gehosteter Index?
Die Managed Knowledge Base, wenn Sie Konnektoren, dienstverwaltete Embeddings und Agentic Retrieval wollen. Den eigenen Index, wenn ACL, Metadatenfilter oder ein bestimmter Vektorspeicher Pflicht sind. Agentic Retrieval läuft nicht auf Customer-managed Knowledge Bases.
AgenticRetrieveStream oder RetrieveAndGenerate?
AgenticRetrieveStream plant, sucht iterativ und zitiert, nur auf Managed Knowledge Bases. RetrieveAndGenerate holt einmal und generiert, nur auf Customer-managed Knowledge Bases. AWS verbietet RetrieveAndGenerate auf dem verwalteten Index. Für eine einzige Hybridsuche ohne Planung bleibt Retrieve.
Bleiben Prompts in der EU, wenn Claude über die Anthropic-API antwortet?
Nein. inference_geo ist us oder global. Workspace-Geo ist nur us. Legen Sie den Index in Frankfurt an und schicken die Chunks an api.anthropic.com, verlässt der Prompt die Union. Nutzen Sie eu.anthropic.claude-sonnet-5 auf bedrock-runtime oder den Google-eu-Endpunkt.
Welche Quotas gelten für eine Managed Knowledge Base?
10.000 Knowledge Bases je Konto und Region, 200 Datenquellen, 50 parallele Ingestion-Jobs, 10 TB Rohdaten, 10.000 Zeichen je Query, 600 Retrieve-RPM je Knowledge Base, 300 AgenticRetrieveStream-RPM je Konto. Die ersten und die letzten beiden Werte sind erhöhbar.
Reicht eine Knowledge Base in London für die DSGVO?
London (eu-west-2) steht in der AWS-Liste als Europe, ist aber kein Mitgliedstaat. Für Residenz in der Union wählen Sie Frankfurt oder Irland. Structured-Data-Knowledge-Bases gibt es zusätzlich in Paris und Zürich. Zürich ist Schweiz, ebenfalls außerhalb der Union.
Quellen
- AWS: Managed Knowledge Bases Regionen (8. Oktober 2026)
- AWS: Managed vs Customer-managed Knowledge Bases (8. Oktober 2026)
- AWS: Agentic Retrieval (8. Oktober 2026)
- AWS: Servicequotas für Managed Knowledge Bases (8. Oktober 2026)
- AWS: Unterstützte Modelle und Regionen für Knowledge Bases (8. Oktober 2026)
- AWS: RetrieveAndGenerate (8. Oktober 2026)
- AWS: Bedrock-Preise (8. Oktober 2026)
- AWS: Modellkarte Claude Sonnet 5 (8. Oktober 2026)
- Anthropic: Search Results für RAG (8. Oktober 2026)
- Anthropic: Preise (8. Oktober 2026)
- Anthropic: Data Residency (8. Oktober 2026)
- Google Cloud: RAG Engine Überblick (8. Oktober 2026)