Limites d'utilisation Claude: plans vs API 2026
Limites d'utilisation Claude 2026: session de cinq heures, paliers API Start/Build/Scale de 500 à 200 000 USD, plus quotas Bedrock, Google et Foundry pour l'UE.
TL;DR
Les limites d’utilisation Claude sont trois systèmes. Les abonnements chat ont un pool de cinq heures et un plafond hebdomadaire. L’API utilise Start, Build et Scale, plafonds 500, 1 000 ou 200 000 USD. Bedrock, Google Cloud et Foundry tiennent leurs propres quotas. Pour traiter dans l’Union, prenez Bedrock eu.anthropic.claude-sonnet-5-5, pas l’API Claude.
Que sont les limites d’utilisation Claude sur les plans chat ?
Les limites d’utilisation Claude sur claude.ai sont un budget de conversation, pas un quota de requêtes par minute. Les formules payantes ont une session de cinq heures et un plafond hebdomadaire un jour fixe. Chat, Claude Code et Claude Desktop puisent dans le même pool. Il n’existe pas de nombre de messages publié. La longueur, c’est la fenêtre de contexte.
L’article usage et longueur du 10 octobre 2026 sépare les deux. L’usage est ce que vous pouvez faire sur tous les chats avant d’attendre. La longueur est ce qu’un chat unique peut tenir. Les modèles les plus récents des formules payantes vont jusqu’à 1 million de tokens de contexte, d’autres 500 000 ou 200 000. Une part de la fenêtre reste réservée à la réponse.
La FAQ tarifs donne les coefficients. Free couvre le quotidien. Pro donne au moins 5 fois plus d’usage par session de cinq heures que Free. Max 5x et Max 20x donnent 5 ou 20 fois plus que Pro. Team Standard dépasse Pro. Premium donne 5 fois plus que Standard, soit 1,25x et 6,25x Pro dans l’article Team. Les limites sont par personne. Un siège à plat n’arrête pas les autres.
| Formule | Coefficient de session | Plafond hebdo | Ensuite |
|---|---|---|---|
| Free | base | pas de pool hebdo payant | attendre ou monter |
| Pro (20 USD / mois, 17 USD / an) | au moins 5x Free | oui, tous modèles | crédits aux tarifs API |
| Max 5x / 20x (100 / 200 USD) | 5x ou 20x Pro | oui, plus un plafond Fable hebdo | crédits ; 100 ou 200 USD de crédits API / mois |
| Team Standard (25 / 20 USD) | 1,25x Pro | oui, par siège | crédits de l’organisation |
| Team Premium (125 / 100 USD) | 6,25x Pro | oui, par siège ; Fable à 50 % du pool hebdo | crédits de l’organisation |
| Enterprise (20 USD / siège, annuel) | aucun sur les sièges usage | aucun | chaque token aux tarifs API |
Sources : claude.com/pricing, Pro, Max, Team, Enterprise. Prix listés US, hors taxe. Team : 2 à 150 personnes. Enterprise en libre-service : 20 sièges, via sales : 50.
L’Enterprise facturé à l’usage sort du schéma. L’article Enterprise le dit : le siège paie l’accès. Il n’y a pas d’allocation de tokens. Les admins posent des plafonds de dépense. Les organisations plus anciennes encore en sièges Standard et Premium gardent ces plafonds jusqu’au renouvellement.
Les crédits d’usage, dans l’article crédits, basculent un plan payant vers le tarif API une fois le pool vide. Ce ne sont pas les crédits API mensuels de Max et Team. Ces crédits API ne paient pas Claude, Claude Code ni Cowork après le pool. Toute l’échelle de prix est dans Claude pricing 2026. L’admin Team est dans le plan Team Claude.
Quelles sont les limites de débit et les plafonds de l’API Claude ?
Les limites de l’API Claude sont des RPM, ITPM et OTPM par classe de modèle, plus un plafond mensuel par palier. Start s’arrête à 500 USD, Build à 1 000 USD, Scale à 200 000 USD. Custom n’a pas de plafond publié. Un 429 de plafond n’a pas de retry-after jusqu’à 00:00 UTC le premier du mois suivant.
La page des limites de ce passage liste trois paliers standard. Une organisation nouvelle ou peu active peut commencer en Evaluation, sous ces chiffres, puis monter seule. Les limites suivent un seau à jetons. Un plafond de 60 RPM peut s’appliquer à 1 requête par seconde, une rafale déclenche quand même un 429. Les limites sont partagées entre inference_geo: "us" et "global".
| Palier | Plafond / mois | Sonnet 5.5 / Opus 5.5 RPM | ITPM | OTPM | Fable 5.x RPM / ITPM / OTPM |
|---|---|---|---|---|---|
| Start | 500 USD | 1 000 | 2 000 000 | 400 000 | 1 000 / 500 000 / 100 000 |
| Build | 1 000 USD | 5 000 | 5 000 000 | 1 000 000 | 2 000 / 1 500 000 / 300 000 |
| Scale | 200 000 USD | 10 000 | 10 000 000 | 2 000 000 | 4 000 / 4 000 000 / 800 000 |
Sonnet 5, Haiku 5.5 et Haiku 4.5 partagent les mêmes chiffres Start, Build et Scale que Sonnet 5.5 et Opus 5.5. Les lectures de cache ne comptent pas dans l’ITPM sur la plupart des modèles. Les écritures de cache et l’entrée non cachée comptent. Exemple de la doc : 2 000 000 d’ITPM à 80 % de cache, soit 10 000 000 de tokens d’entrée totaux par minute. Haiku 3.5 compte encore les lectures. max_tokens ne compte pas dans l’OTPM sur l’API first-party.
Les Message Batches ont leur propre file. Start : 1 000 RPM, 200 000 requêtes en file, 100 000 par lot. Build : 2 000 / 300 000 / 100 000. Scale : 4 000 / 500 000 / 100 000. Managed Agents : 300 RPM de création, 1 200 RPM de lecture.
Un plafond que vous posez sous le palier renvoie HTTP 400, pas 429. Les overrides de workspace peuvent être inférieurs aux valeurs d’organisation, jamais supérieurs. Vous ne pouvez pas limiter le Default Workspace. Workspaces, clés et Admin API sont dans la Claude Console. Les tarifs token sont dans prix API Claude Europe.
Lisez les limites configurées au lieu de les figer :
curl "https://api.anthropic.com/v1/organizations/rate_limits" \
-H "x-api-key: $ANTHROPIC_ADMIN_KEY" \
-H "anthropic-version: 2023-06-01"
Cet appel est la Rate Limits API. Il faut une clé Admin ou un jeton org:admin. Les clés de workspace échouent. Appelez-la au démarrage de la passerelle et à intervalle.
Un 429 avec encore du quota (limite de débit, pas plafond) :
# retry-after est en secondes. Le 429 de plafond n'a pas cet en-tête.
retry=$(curl -sS -D - -o /tmp/claude-body \
https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"claude-sonnet-5-5","max_tokens":256,"messages":[{"role":"user","content":"ping"}]}' \
| awk 'tolower($1)=="retry-after:" {print $2; exit}')
if [ -n "$retry" ]; then sleep "$retry"; fi
Nous recommandons cette coupure. Évals et playground dans la Console. Production avec données personnelles sur Bedrock ou Google Cloud. L’API first-party n’a pas d’inference_geo UE.
En quoi les quotas Bedrock, Google Cloud et Foundry diffèrent-ils ?
Les quotas cloud ne sont pas les paliers de l’API Claude. Bedrock compte les tokens par modèle et Région, avec un burndown sur bedrock-runtime. Google publie QPM plus TPM d’entrée et de sortie séparés. Foundry publie RPM, ITPM et OTPM par type d’abonnement Azure. Aucun de ces chiffres ne bouge si vous changez de palier Console.
Amazon Bedrock a deux points de terminaison. Sur bedrock-runtime, entrée et sortie partagent un quota TPM. La sortie brûle plus vite. La page burndown de ce passage : sortie Claude 4.8 à 15x ; Claude Opus 5.5, Sonnet 5, Opus 5 et Fable 5.1 à 10x ; Claude 4.7 et antérieurs à 5x. Les lectures de cache ne comptent pas. Au départ, Bedrock déduit l’entrée plus max_tokens. Un max_tokens trop haut peut 429 avant le premier mot. bedrock-mantle a des TPM d’entrée et de sortie séparés, donc pas de burndown.
La fiche Sonnet 5.5 (lancement 28 septembre 2026, contexte 1 M, sortie max 128 000) publie l’ID geo UE eu.anthropic.claude-sonnet-5-5. Depuis Francfort, les destinations sont Francfort, Stockholm, Milan, Espagne, Irlande et Paris. Londres comme source garde Londres. Les TPM par défaut sont dans Service Quotas et peuvent être inférieurs aux défauts publiés.
La page quotas Claude de Google indique que le traitement ML reste dans l’UE sur les points de terminaison régionaux et multi-région Europe. Sonnet 5.5 en multi-région : 1 250 QPM, 12 500 000 TPM d’entrée non cachée plus écriture cache, 1 250 000 TPM de sortie, contexte 1 000 000. Le point de terminaison global double (2 500 / 25 000 000 / 2 500 000). Opus 5.5 multi-région : 1 000 / 10 000 000 / 1 000 000. Les modèles lancés après le 26 mai 2026 partagent un seau de lignée. Les seaux global et eu sont indépendants.
La page quotas Claude de Foundry est le défaut le plus serré que nous ayons lu. Sonnet 5.5 et Opus 5.5 à l’usage : 40 RPM, 40 000 ITPM, 8 000 OTPM. Enterprise et MCA-E : 10 000 / 10 000 000 / 2 000 000. Essai gratuit : 0 / 0 / 0. Fable à l’usage aussi à 0. Data Zone Standard existe pour les États-Unis, pas pour l’UE.
| Plateforme | Ce qui s’applique | Défaut Sonnet 5.5 (ce passage) | Traitement UE ? |
|---|---|---|---|
| API Claude Start | RPM + ITPM + OTPM + plafond 500 USD | 1 000 / 2 M / 400 000 | Non. inference_geo vaut us ou global |
Bedrock eu. |
TPM (entrée+sortie) + burndown runtime | Service Quotas, propre au compte | Oui. eu.anthropic.claude-sonnet-5-5 |
| Google multi-région Europe | QPM + TPM entrée + TPM sortie | 1 250 / 12,5 M / 1,25 M | Oui sur eu |
| Foundry à l’usage | RPM + ITPM + OTPM | 40 / 40 000 / 8 000 | Pas de zone de données UE |
Premiers appels : Amazon Bedrock en Europe, Claude sur Vertex AI en Europe, Azure AI Foundry. Volet RGPD : Claude et hébergement des données.
Que se passe-t-il à la limite, et comment la lever ?
Un plafond de plan chat arrête cette personne jusqu’au reset de cinq heures ou hebdomadaire, sauf crédits activés. Une limite de débit API renvoie 429 avec retry-after. Un plafond de dépense API renvoie 429 sans retry jusqu’au mois suivant. Les 429 cloud sont des quotas. La correction est le backoff, puis un ticket, pas une montée de plan Claude.
Ordre :
- Lire l’erreur. Chat : Settings, Usage montre le prochain reset. API :
retry-aftercontreenforced_spend_limit_reached. Bedrock et Foundry : HTTP 429, puis CloudWatch ou la page Quota Foundry. - Sur un plan chat payant, activer les crédits sous Settings, Usage, prépayer un solde, poser un plafond mensuel. Les abonnés via store mobile doivent le faire sur le web.
- Sur l’API, ouvrir Settings, Rate limits et Request tier increase. Claude Platform on AWS n’a pas ce bouton. Écrire au support Anthropic avec le pic ITPM, OTPM et la part de cache.
- Sur Bedrock, lever Cross-Region InvokeModel tokens per minute pour le modèle dans Service Quotas. AWS proposera ensuite le couple TPM à la demande et tokens par jour. La priorité va aux comptes qui consomment déjà leur allocation.
- Sur Google Cloud, filtrer Quotas par
anthropic-claude-sonnetouanthropic-claude-opuset demander les métriques multi-régioneu, pas les globales, si la résidence compte. - Sur Foundry, ouvrir la page Quota et envoyer le formulaire. L’approbation n’est pas garantie. L’essai gratuit reste à zéro jusqu’à ce que vous quittiez l’offre.
- Couper le gaspillage : cache de prompt (les lectures évitent l’ITPM), Batch à 50 % du prix token, et un
max_tokensréaliste sur Bedrock runtime.
Sonnet 5.5 sur la page tarifs : 2 USD en entrée et 10 USD en sortie par million de tokens. Opus 5.5 : 4 / 20. Haiku 5.5 : 0,10 / 0,50 jusqu’à 100 000 tokens de prompt et 0,50 / 2,50 au-delà. L’inférence US-only (inference_geo: "us") à partir de Claude 4.6 vaut 1,1x. Les points de terminaison régionaux et multi-région à partir de Sonnet 4.5 ajoutent 10 %. Le Batch divise les deux côtés par deux. Le mode rapide sur Opus 5.5 est 8 / 40 et n’existe que sur l’API first-party.
Un préfixe caché de 200 000 tokens plus une question de 50 tokens compte pour 50 tokens d’entrée non cachés dans l’ITPM API. Le cache est un levier de limite, pas seulement de coût.
Quel système de limites une équipe UE doit-elle choisir ?
Choisissez d’après les données, pas d’après le nom marketing. Les plans chat sont pour les personnes. L’API est pour les produits qui peuvent quitter l’EEE. Bedrock UE ou Google Europe est pour les produits qui doivent rester dans les États membres. Foundry est un pool US ou global avec un défaut à l’usage très bas.
Nous recommandons, pour une entreprise européenne :
- Chat interne et Claude Code léger : Team Standard, Premium pour les quelques personnes qui cassent le plafond hebdo. Crédits d’organisation avec un montant mensuel dur.
- Beaucoup de code sans mandat de traitement UE : Max 20x pour une personne coûte moins qu’un siège Team Premium. À deux personnes, passez sur Team.
- API de production avec données personnelles : Bedrock
eu.anthropic.claude-sonnet-5-5ou multi-région Googleeu. Demandez le quota avant le go-live. N’attendez pas le premier 429. - API de production sans mandat de résidence : API Claude Scale, ou Foundry Enterprise si Azure tient déjà le contrat. Évitez Foundry à l’usage au-delà d’une démo. 40 RPM ne portent pas un lancement.
La page de résidence n’offre toujours que "us" et "global" pour inference_geo. La geo de workspace est "us" seulement et ne change plus après création. Les limites de débit sont partagées entre geos. Monter un palier Console ne crée pas une région UE.
Claude Platform on AWS démarre au palier Start et facture en Claude Consumption Units à 0,01 USD (100 CCU = 1,00 USD). Les limites par workspace et le mode rapide n’y sont pas. Foundry utilise la même unité CCU.
FAQ
Combien coûte une hausse des limites d’utilisation Claude ?
Les plans chat ne vendent pas une plus grande session comme ligne. Vous achetez une formule supérieure ou des crédits aux tarifs API. La hausse API est un changement de palier : Start 500 USD, Build 1 000 USD, Scale 200 000 USD par mois civil, puis Custom avec sales. Les tickets Bedrock, Google et Foundry sont gratuits à déposer. Vous payez toujours les tokens que vous exécutez.
Limites d’utilisation Claude vs limites de débit API : quelle différence ?
Les limites d’utilisation Claude d’un plan sont un budget de cinq heures plus hebdomadaire, partagé par le chat et Claude Code. Les limites de débit API sont RPM, ITPM et OTPM plus un plafond mensuel d’organisation. Un siège Team Premium à 6,25x Pro ne lève pas votre palier Start Console. Une org Scale à 10 000 RPM ne donne pas plus de messages claude.ai aux collaborateurs.
Les limites d’utilisation Claude s’appliquent-elles de la même façon dans l’UE ?
Oui pour les chiffres. Non pour la résidence. Les pools de plan et les paliers API sont globaux. inference_geo reste us ou global. La geo de workspace est us. Le traitement UE est un autre produit : profils Bedrock eu. ou points de terminaison Google Europe, avec leurs propres quotas.
Que se passe-t-il si un membre Team atteint une limite d’utilisation Claude ?
Les autres sièges continuent. Cette personne attend le reset de cinq heures ou hebdomadaire, ou l’organisation active les crédits. Le jour de reset est fixe par compte, visible sous Settings, Usage. Il ne bouge pas quand quelqu’un commence à utiliser Claude.
Le cache de prompt lève-t-il les limites effectives de l’API Claude ?
Oui sur la plupart des modèles. Les lectures de cache ne comptent pas dans l’ITPM. Les écritures et l’entrée non cachée comptent. La doc des limites calcule 2 000 000 d’ITPM à 80 % de cache comme 10 000 000 de tokens d’entrée totaux par minute. Haiku 3.5 compte encore les lectures. Le cache baisse aussi la facture : les hits Sonnet 5.5 coûtent 0,10 USD par million de tokens.
Pourquoi un 429 Bedrock après avoir relevé max_tokens ?
Sur bedrock-runtime, la première déduction est l’entrée plus max_tokens. Un max_tokens de 32 000 pour une réponse courte réserve ces tokens tout de suite. Posez max_tokens près de la taille réelle. Après la réponse, Bedrock ajuste à l’entrée plus la sortie fois le burndown (10x sur Sonnet 5 et Opus 5.5).
Sources
- Documentation Anthropic : Rate limits (10 octobre 2026)
- Claude Help Center : How do usage and length limits work? (10 octobre 2026)
- Claude : Tarifs (10 octobre 2026)
- Claude Help Center : What is the Team plan? (10 octobre 2026)
- Claude Help Center : What is the Enterprise plan? (10 octobre 2026)
- Documentation Anthropic : Tarifs (10 octobre 2026)
- Documentation Anthropic : Résidence des données (10 octobre 2026)
- AWS : How tokens are counted in Amazon Bedrock (10 octobre 2026)
- AWS : Fiche modèle Claude Sonnet 5.5 (10 octobre 2026)
- Google Cloud : Quotas des modèles Anthropic Claude (10 octobre 2026)
- Microsoft Learn : Quotas et limites Claude (10 octobre 2026)
- Documentation Anthropic : Rate Limits API (10 octobre 2026)