llm-integration.eu

RAG agentique Claude en Europe 2026

RAG agentique avec Claude en Europe: Knowledge Bases Bedrock gérées à Francfort ou Dublin, AgenticRetrieveStream, tarifs et quand héberger l'index vous-même.

Mis à jour 11 min de lectureFaits vérifiés le 8 octobre 2026

TL;DR

Le RAG agentique avec Claude en Europe, c’est un index à Francfort ou à Dublin, une recherche qui planifie plusieurs sous-questions, une réponse citée. Utilisez une Knowledge Base gérée et AgenticRetrieveStream. L’API Anthropic n’a pas d’inférence UE. Passez les tokens par le profil eu.anthropic.claude-sonnet-5.

En quoi le RAG agentique diffère-t-il du RAG classique ?

Le RAG classique récupère une fois et pousse les extraits dans le prompt. Le RAG agentique découpe la question, cherche plusieurs fois, vérifie si les résultats suffisent, et charge le document entier au besoin. Sur Bedrock, cette boucle s’appelle AgenticRetrieveStream. Elle ne tourne que sur les Knowledge Bases gérées, pas sur un index vectoriel que vous exploitez.

AWS décrit six étapes : charger l’historique de session, planifier des sous-questions, interroger jusqu’à cinq retrievers, appeler GetDocumentContent si le document complet est nécessaire, synthétiser une réponse, renvoyer résultats et citations. Une recherche spéculative part souvent de la question brute avant le premier plan, pour que le premier tour ne soit pas vide. generateResponse vaut true par défaut. Passez-le à false si votre orchestrateur envoie lui-même les extraits à Claude.

Ce n’est pas RetrieveAndGenerate. Cet appel récupère une fois et génère avec citations. AWS indique qu’il ne fonctionne pas avec une Knowledge Base gérée. Sur l’index géré, il reste Retrieve (une recherche hybride) ou AgenticRetrieveStream (plusieurs itérations). maxAgentIteration a un minimum de 2. Moins d’itérations réduisent le coût et peuvent couper une question complexe.

L’exemple d’AWS découpe « Which magazine was started first, Arthur’s Magazine or First for Women ? » en deux questions de date de création. Une question interne sur un accord de sous-traitance, une durée de conservation et une suppression fonctionne de la même façon. Un seul extrait vectoriel suffit rarement.

L’API Anthropic peut construire la même boucle. Un outil renvoie des blocs search_result et Claude les cite si citations.enabled vaut true. Les search results font partie de l’API Messages standard, sans en-tête bêta, sur tous les modèles actifs sauf Claude Haiku 3. Les citations sont désactivées par défaut. Le point européen : inference_geo n’accepte que us et global. La géo d’espace de travail est us seulement. Si des données personnelles doivent rester dans l’UE, appelez Claude sur Bedrock ou Google Cloud, pas sur api.anthropic.com.

Quelle Knowledge Base Bedrock tourne en Europe ?

Une Knowledge Base gérée existe en Europe à Francfort (eu-central-1), en Irlande (eu-west-1) et à Londres (eu-west-2). Pour une résidence dans l’Union, prenez Francfort ou l’Irlande. Londres est le Royaume-Uni. AWS gère l’ingestion, le stockage, les embeddings et le rerank. Vous fournissez les sources.

La liste des régions en cite huit dans le monde, dont ces trois en Europe. Les Knowledge Bases sur données structurées (langage naturel vers SQL) existent aussi à Zurich et à Paris. C’est un autre produit : des tables, pas des PDF non structurés.

AWS oppose bases gérées et bases gérées par le client. Le retrieval agentique, sept connecteurs natifs et l’embarqueur géré par le service ne sont que du côté géré. Une base customer-managed vous laisse choisir le store vectoriel, sans retrieval agentique, avec S3 et Custom seulement.

Caractéristique Knowledge Base gérée Gérée par le client
Retrieval agentique oui non
Connecteurs 7 (S3, SharePoint, Confluence, Web Crawler, Google Drive, OneDrive, Custom) S3 et Custom
Embeddings et rerank gérés par le service, sans surcoût votre embedding Bedrock
Store vectoriel AWS l’exploite vous l’exploitez
API de requête Retrieve ou AgenticRetrieveStream Retrieve ou RetrieveAndGenerate
Régions UE (non structuré) Francfort, Irlande, Londres selon le store choisi

Utilisez Sonnet 5 comme générateur sur bedrock-runtime avec le profil UE eu.anthropic.claude-sonnet-5. La fiche modèle indique les Knowledge Bases comme prises en charge là, et non prises en charge sur bedrock-mantle. Mantle est le chemin mono-région en Irlande ou à Stockholm. RAG agentique et inférence mono-région ne se recouvrent pas sur Sonnet 5. Le profil UE depuis Francfort route vers Francfort, Stockholm, Milan, l’Espagne, l’Irlande et Paris. Cela reste dans l’UE, ce n’est pas un pinning sur une seule région. AWS prévient : l’inférence inter-régions peut partager des données entre régions. Tables de régions et IAM figurent dans notre guide Amazon Bedrock Europe.

Embeddings si vous les choisissez : Titan Text Embeddings V2 (amazon.titan-embed-text-v2:0) notamment à eu-central-1, eu-west-1, eu-west-2, eu-west-3, en 256, 512 ou 1024 dimensions. Titan G1 reste à 1536 dimensions et moins de régions UE. Cohere Embed English et Multilingual sont à Francfort, Dublin, Londres et Paris, 1024 dimensions fixes. Le parseur Data Automation pour les images n’existe qu’en Oregon, en preview. Pour un RAG UE, restez sur un parseur texte ou un parseur de modèle de fondation disponible dans la région source.

Combien coûte le RAG agentique sur Bedrock ?

Le stockage d’index coûte 5,00 USD par Go de données brutes et par mois. Une recherche standard coûte 1,00 USD les 1 000 appels Retrieve. Le retrieval agentique coûte 4,00 USD les 1 000 appels AgenticRetrieveStream plus 1,00 USD les 1 000 Retrieve sous-jacents. Embeddings et reranker gérés par le service sont à 0 USD sur la page de tarifs.

AWS calcule deux exemples sur 50 Go et environ 100 000 documents. 100 000 recherches standard : 250 USD de stockage plus 100 USD de retrieve, 350 USD par mois. 100 000 appels agentiques à deux Retrieve sous-jacents : 250 plus 400 plus 200, 850 USD par mois. Parseur et rerank sont inclus dans les deux exemples. Les tokens Claude de la réponse visible s’ajoutent dès que vous choisissez votre propre modèle de fondation. Le type MANAGED inclut la planification dans le prix agentique. Le type CUSTOM ajoute les tarifs du fournisseur.

Poste Prix
Stockage d’index 5,00 USD par Go de données brutes / mois
Retrieve standard 1,00 USD les 1 000 appels
Retrieve agentique (LLM géré) 4,00 USD les 1 000 appels plus 1,00 USD les 1 000 Retrieve sous-jacents
Retrieve agentique (votre LLM) 1,00 USD les 1 000 Retrieve sous-jacents plus le prix du modèle
Embeddings et rerank gérés 0 USD
Bedrock Data Automation comme parseur 0,010 USD par page en sortie standard
Claude Sonnet 5.5 (API) 2 USD en entrée / 10 USD en sortie par million de tokens
Surcoût régional à partir de Sonnet 4.5 10 pour cent au-dessus du global

Les tarifs Anthropic placent Sonnet 5.5 à 2 / 10 USD et Opus 5.5 à 4 / 20 USD par million de tokens. À partir de Sonnet 4.5, Haiku 4.5 et Opus 4.5, les endpoints régionaux et multirégion sur Bedrock et Google Cloud ajoutent 10 pour cent par rapport au global. C’est le prix du profil UE. Le mode batch divise les deux côtés par deux. Un succès de cache sur Sonnet 5.5 coûte 0,10 USD par million, soit 0,05 fois. inference_geo limité aux États-Unis sur l’API Anthropic coûte 1,1 fois et ne règle pas la résidence.

Cohere Rerank 3.5, si vous remplacez le reranker géré, coûte 2,00 USD les 1 000 requêtes. Une requête peut porter jusqu’à 100 extraits. 350 extraits comptent pour 4 requêtes. Chaque extrait tient au plus 512 tokens, requête comprise. Les tarifs du générateur sont dans notre comparatif des prix de l’API Claude.

Quotas par défaut sur la page des quotas : 10 000 bases gérées par compte et par région (ajustable), 200 sources (fixe), 50 jobs d’ingestion simultanés (fixe), 10 To de données brutes par base (fixe), 10 000 caractères par requête, 600 Retrieve RPM par base avec un burst de 25 RPS, 300 AgenticRetrieveStream RPM par compte. 10 To à 5 USD/Go feraient 51 200 USD de seul stockage. La plupart des équipes restent très en dessous.

Comment démarrer AgenticRetrieveStream à Francfort ?

Créez la Knowledge Base dans eu-central-1, rattachez S3 ou SharePoint, attendez l’ingestion, puis appelez AgenticRetrieveStream avec les modèles gérés. IAM exige bedrock:AgenticRetrieveStream, bedrock:Retrieve, bedrock:GetDocumentContent et bedrock:InvokeModelWithResponseStream. Les garde-fous de l’agent n’acceptent que BLOCK, pas MASK. Faites cela avant de brancher un générateur custom.

  1. Choisissez eu-central-1 (Francfort) ou eu-west-1 (Irlande). eu-west-2 (Londres) n’est pas un État membre.
  2. Créez une Knowledge Base gérée. Laissez embeddings et rerank sur MANAGED tant que vous n’avez pas de raison d’apporter votre modèle.
  3. Attachez une source. S3 dans le même compte et la même région est le chemin le plus court. SharePoint, Confluence, Google Drive et OneDrive exigent les droits de connecteur.
  4. Lancez l’ingestion. Au plus 50 jobs tournent en parallèle. Les données brutes ne doivent pas dépasser 10 To par base.
  5. Testez d’abord Retrieve. Une recherche hybride sans planification montre si extraits et métadonnées tiennent avant que l’agent consomme des itérations.
  6. Activez AgenticRetrieveStream avec foundationModelType et rerankingModelType à MANAGED. Fixez maxAgentIteration exprès. Le plancher est 2.
  7. Attachez un garde-fou en action BLOCK si vous filtrez entrées ou réponses. AWS applique les garde-fous à l’entrée et à la réponse générée, pas aux références récupérées.
import boto3

client = boto3.client("bedrock-agent-runtime", region_name="eu-central-1")

events = client.agentic_retrieve_stream(
    messages=[
        {
            "role": "user",
            "content": {"text": "Quelle validation s'applique à l'accord de sous-traitance ?"},
        }
    ],
    retrievers=[
        {
            "configuration": {
                "knowledgeBase": {"knowledgeBaseId": "KB12345678"}
            }
        }
    ],
    agenticRetrieveConfiguration={
        "foundationModelType": "MANAGED",
        "rerankingModelType": "MANAGED",
        "maxAgentIteration": 2,
    },
    generateResponse=True,
)

for event in events.get("stream", []):
    if "responseEvent" in event:
        print(event["responseEvent"].get("text", ""), end="")

C’est la forme de la référence d’API. Un appel peut lister jusqu’à cinq retrievers, chacun une Knowledge Base gérée. retrievalConfigs pour AgentCore Memory accepte au plus une entrée, avec au plus cinq metadataFilters. sessionBinding et un historique envoyé dans messages s’excluent.

Si vous voulez piloter le générateur, passez generateResponse à false et envoyez les résultats à Claude sur eu.anthropic.claude-sonnet-5 en blocs search_result. Planification et recherche hybride restent chez AWS. Formulation et citations restent chez Claude. Une passerelle et des budgets devant, par exemple LiteLLM dans votre réseau européen, restent utiles dès que plusieurs applications partagent le même index.

Quand faut-il héberger l’index vous-même ?

Hébergez-le lorsque les filtres de métadonnées, les ACL ou le store vectoriel sont une exigence, ou lorsque le retrieval agentique n’est pas la boucle que vous voulez. Restez sur la Knowledge Base gérée lorsque les connecteurs, l’embarqueur géré et la boucle de planification sont un travail que vous ne voulez pas exploiter.

Héberger, c’est des extraits dans OpenSearch, pgvector ou Qdrant à Francfort, des embeddings Titan V2 à eu-central-1, Claude seulement comme générateur sur le profil UE. L’API search results attend source, title et un tableau de blocs texte. Un bloc est la plus petite unité citable. Pour des citations phrase par phrase, découpez chaque extrait en son propre bloc. Les images sont interdites dans search_result.

from anthropic import AnthropicBedrock

client = AnthropicBedrock(aws_region="eu-central-1")

knowledge_base_tool = {
    "name": "search_knowledge_base",
    "description": "Interroge l'index interne",
    "input_schema": {
        "type": "object",
        "properties": {"query": {"type": "string"}},
        "required": ["query"],
    },
}

# Après l'appel d'outil, renvoyez les résultats ainsi :
tool_result = {
    "type": "tool_result",
    "tool_use_id": "toolu_01example",
    "content": [
        {
            "type": "search_result",
            "source": "kb://ast-2026",
            "title": "Sous-traitance",
            "content": [{"type": "text", "text": "L'accord couvre chaque prompt qui contient des données personnelles."}],
            "citations": {"enabled": True},
        }
    ],
}

Ce chemin exige évaluations, traces et budget. Langfuse auto-hébergé dans l’UE garde les traces dans votre réseau. Le modèle d’exploitation LLMOps sépare la précision du retrieval de l’exactitude de bout en bout. L’évaluation de modèles Bedrock facture les tokens du juge au tarif à la demande, plus l’usage de la Knowledge Base.

Google Cloud est l’alternative si votre patrimoine est déjà sur GCP. La documentation RAG Engine indique europe-west3 (Francfort) et europe-west4 (Eemshaven) en GA. Claude sur l’endpoint eu reste le contrôle de résidence du générateur ; le détail est dans Claude sur Vertex AI en Europe. L’API Anthropic avec inference_geo: "us" n’est pas un montage UE, même si l’index est à Francfort. Le comparatif avec Foundry et l’API first-party est dans Claude et le RGPD.

Nous recommandons la Knowledge Base gérée à Francfort lorsque SharePoint ou Confluence est la source et que personne ne veut exploiter un cluster vectoriel. Nous recommandons votre propre index lorsque vous devez filtrer des champs, isoler des locataires ou changer d’embarqueur. Ne mélangez pas les deux dans la même requête : le retrieval agentique n’accepte que les Knowledge Bases gérées.

FAQ

Combien coûte le RAG agentique sur Bedrock en Europe ?

L’exemple AWS place 50 Go plus 100 000 recherches standard à 350 USD par mois. Le même volume en retrieval agentique avec deux Retrieve sous-jacents par appel arrive à 850 USD. Les tokens Claude de la réponse s’ajoutent dès que vous choisissez votre modèle. Les endpoints régionaux à partir de Sonnet 4.5 coûtent 10 pour cent de plus que le global.

Knowledge Base gérée ou index auto-hébergé ?

La Knowledge Base gérée si vous voulez les connecteurs, les embeddings gérés et le retrieval agentique. Votre index si les ACL, les filtres de métadonnées ou un store précis sont obligatoires. Le retrieval agentique ne tourne pas sur une base customer-managed.

AgenticRetrieveStream ou RetrieveAndGenerate ?

AgenticRetrieveStream planifie, récupère en itérant et cite, uniquement sur une base gérée. RetrieveAndGenerate récupère une fois et génère, uniquement sur une base customer-managed. AWS interdit RetrieveAndGenerate sur l’index géré. Pour une seule recherche hybride sans planification, restez sur Retrieve.

Les prompts restent-ils dans l’UE si Claude répond via l’API Anthropic ?

Non. inference_geo vaut us ou global. La géo d’espace de travail est us seulement. Si l’index est à Francfort et que les extraits partent vers api.anthropic.com, le prompt quitte l’Union. Utilisez eu.anthropic.claude-sonnet-5 sur bedrock-runtime ou l’endpoint eu de Google.

Quels quotas pour une Knowledge Base gérée ?

10 000 bases par compte et par région, 200 sources, 50 jobs d’ingestion simultanés, 10 To de données brutes, 10 000 caractères par requête, 600 Retrieve RPM par base, 300 AgenticRetrieveStream RPM par compte. La première valeur et les deux dernières sont ajustables.

Une Knowledge Base à Londres suffit-elle pour le RGPD ?

Londres (eu-west-2) figure dans la liste Europe d’AWS et n’est pas un État membre. Pour une résidence dans l’Union, prenez Francfort ou l’Irlande. Les bases sur données structurées existent aussi à Paris et à Zurich. Zurich est la Suisse, hors Union.

Sources

  1. AWS : régions des Knowledge Bases gérées (8 octobre 2026)
  2. AWS : Knowledge Bases gérées ou gérées par le client (8 octobre 2026)
  3. AWS : retrieval agentique (8 octobre 2026)
  4. AWS : quotas des Knowledge Bases gérées (8 octobre 2026)
  5. AWS : modèles et régions pris en charge (8 octobre 2026)
  6. AWS : RetrieveAndGenerate (8 octobre 2026)
  7. AWS : tarifs Bedrock (8 octobre 2026)
  8. AWS : fiche Claude Sonnet 5 (8 octobre 2026)
  9. Anthropic : search results pour le RAG (8 octobre 2026)
  10. Anthropic : tarifs (8 octobre 2026)
  11. Anthropic : résidence des données (8 octobre 2026)
  12. Google Cloud : aperçu RAG Engine (8 octobre 2026)

Guides associés