Claude Nutzungslimits: Abo vs API vs Bedrock 2026
Claude Nutzungslimits 2026: Fünf-Stunden-Abo, API-Tiers Start/Build/Scale mit 500 bis 200.000 USD Cap, plus Quotas auf Bedrock, Google und Foundry für EU-Teams.
TL;DR
Claude Nutzungslimits sind drei Systeme. Chat-Abos haben einen Fünf-Stunden-Pool und ein Wochenlimit. Die API arbeitet mit Start, Build und Scale, Caps 500, 1.000 oder 200.000 USD. Bedrock, Google Cloud und Foundry führen eigene Quotas. Für Verarbeitung in der Union nehmen Sie Bedrock eu.anthropic.claude-sonnet-5-5, nicht die Claude API.
Was sind Claude Nutzungslimits in den Chat-Plänen?
Claude Nutzungslimits auf claude.ai sind ein Gesprächsbudget, kein Request-pro-Minute-Kontingent. Bezahlte Pläne haben ein Session-Limit, das alle fünf Stunden neu startet, und ein Wochenlimit an einem festen Wochentag. Chat, Claude Code und Claude Desktop teilen denselben Pool. Eine veröffentlichte Nachrichtenzahl gibt es nicht. Längenlimits sind das Kontextfenster, eine andere Schranke.
Der Artikel zu Usage und Length vom 10. Oktober 2026 trennt beides. Usage ist, wie viel Sie über alle Chats arbeiten, bevor Sie warten. Length ist, wie viel ein einzelner Chat halten kann. Die neuesten Modelle in bezahlten Plänen unterstützen bis zu 1 Mio. Tokens Kontext, andere 500.000 oder 200.000. Ein Teil des Fensters bleibt für die Antwort reserviert.
Die Preis-FAQ nennt die Faktoren. Free reicht für Alltag. Pro gibt mindestens 5-mal so viel Nutzung pro Fünf-Stunden-Session wie Free. Max 5x und Max 20x geben 5- oder 20-mal so viel wie Pro. Team Standard liegt über Pro. Premium liegt 5-mal über Standard, das entspricht 1,25x und 6,25x Pro im Team-Artikel. Limits gelten pro Person. Wer am Anschlag ist, blockiert die anderen nicht.
| Plan | Session-Faktor | Wochenlimit | Danach |
|---|---|---|---|
| Free | Basis | kein bezahlter Wochenpool | warten oder upgraden |
| Pro (20 USD Monat, 17 USD Jahr) | mindestens 5x Free | ja, alle Modelle | Credits zu API-Tarifen |
| Max 5x / 20x (100 / 200 USD) | 5x oder 20x Pro | ja, plus eigenes Fable-Wochenlimit | Credits; 100 oder 200 USD API-Guthaben im Monat |
| Team Standard (25 / 20 USD) | 1,25x Pro | ja, pro Platz | Credits der Organisation |
| Team Premium (125 / 100 USD) | 6,25x Pro | ja, pro Platz; Fable 50 % des Wochenpools | Credits der Organisation |
| Enterprise (20 USD Platz, jährlich) | keines bei Usage-Plätzen | keines | jedes Token zu API-Tarifen |
Quellen: claude.com/pricing, Pro, Max, Team, Enterprise. Das sind US-Listenpreise ohne Steuer. Team braucht 2 bis 150 Personen. Self-Service-Enterprise startet bei 20 Plätzen, Vertrieb bei 50.
Usage-Enterprise fällt aus dem Schema. Der Enterprise-Artikel sagt: Die Platzgebühr ist nur Zugang. Es gibt kein Nutzungskontingent pro Platz. Admins setzen Ausgabenlimits. Ältere Orgs mit Standard- und Premium-Plätzen behalten diese Caps bis zur Verlängerung.
Usage Credits laut Credits-Artikel schalten nach dem Abo-Cap auf API-Tarife um. Sie sind nicht die monatlichen API-Credits von Max und Team. Die API-Credits zahlen Claude, Claude Code und Cowork nicht, wenn der Abo-Pool leer ist. Die ganze Preisleiter steht unter Claude Kosten 2026. Team-Admin steht im Claude Team Plan.
Was sind Claude API Rate Limits und Spend Caps?
Claude API Rate Limits sind RPM, ITPM und OTPM pro Modellklasse auf Organisationsebene, plus ein monatlicher Spend Cap je Usage-Tier. Start stoppt bei 500 USD, Build bei 1.000 USD, Scale bei 200.000 USD. Custom hat keinen veröffentlichten Cap. Ein 429 am Spend Cap hat kein retry-after bis 00:00 UTC am Ersten des Folgemonats.
Die Rate-Limits-Seite aus diesem Lauf listet drei Standard-Tiers. Neue oder wenig aktive Orgs können in Evaluation starten, unter diesen Zahlen, und automatisch aufsteigen. Limits nutzen einen Token-Bucket. Ein 60-RPM-Deckel kann als 1 Request pro Sekunde greifen, ein Burst liefert trotzdem 429. Rate Limits gelten gemeinsam für inference_geo: "us" und "global".
| Tier | Spend Cap / Monat | Sonnet 5.5 / Opus 5.5 RPM | ITPM | OTPM | Fable 5.x RPM / ITPM / OTPM |
|---|---|---|---|---|---|
| Start | 500 USD | 1.000 | 2.000.000 | 400.000 | 1.000 / 500.000 / 100.000 |
| Build | 1.000 USD | 5.000 | 5.000.000 | 1.000.000 | 2.000 / 1.500.000 / 300.000 |
| Scale | 200.000 USD | 10.000 | 10.000.000 | 2.000.000 | 4.000 / 4.000.000 / 800.000 |
Sonnet 5, Haiku 5.5 und Haiku 4.5 teilen sich dieselben Start-, Build- und Scale-Zahlen wie Sonnet 5.5 und Opus 5.5. Cache-Reads zählen bei den meisten Modellen nicht zum ITPM. Cache-Writes und uncached Input zählen. Beispiel der Docs: 2.000.000 ITPM bei 80 Prozent Cache-Treffer ergeben 10.000.000 Gesamttokens Input in der Minute. Haiku 3.5 zählt Reads weiter. max_tokens zählt auf der First-Party-API nicht zum OTPM.
Message Batches haben eine eigene Queue. Start: 1.000 RPM, 200.000 Requests in der Verarbeitung, 100.000 pro Batch. Build: 2.000 / 300.000 / 100.000. Scale: 4.000 / 500.000 / 100.000. Managed Agents liegen neben Messages: 300 Create-RPM, 1.200 Read-RPM.
Ein selbst gesetzter Cap unter dem Tier liefert HTTP 400, nicht 429. Workspace-Overrides dürfen unter den Org-Werten liegen, nicht darüber. Den Default Workspace können Sie nicht begrenzen. Workspaces, Keys und Admin API stehen in der Claude Console. Tokenpreise stehen unter Claude API Kosten EU.
Lesen Sie die konfigurierten Limits, statt sie fest einzubauen:
curl "https://api.anthropic.com/v1/organizations/rate_limits" \
-H "x-api-key: $ANTHROPIC_ADMIN_KEY" \
-H "anthropic-version: 2023-06-01"
Der Aufruf ist die Rate Limits API. Sie braucht einen Admin-Key oder ein org:admin-Token. Workspace-Keys scheitern. Rufen Sie sie beim Gateway-Start und im Takt auf.
Ein 429 mit Restkontingent (Rate Limit, kein Spend Cap):
# retry-after ist Sekunden. Der Spend-Cap-429 hat diesen Header nicht.
retry=$(curl -sS -D - -o /tmp/claude-body \
https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"claude-sonnet-5-5","max_tokens":256,"messages":[{"role":"user","content":"ping"}]}' \
| awk 'tolower($1)=="retry-after:" {print $2; exit}')
if [ -n "$retry" ]; then sleep "$retry"; fi
Unsere Empfehlung: Evals und Playground in die Console. Produktion mit personenbezogenen Daten auf Bedrock oder Google Cloud. Die First-Party-API hat kein EU-inference_geo.
Wie unterscheiden sich Quotas auf Bedrock, Google Cloud und Foundry?
Cloud-Quotas sind nicht die Claude-API-Tiers. Bedrock zählt Tokens pro Modell und Region, mit Burndown auf bedrock-runtime. Google veröffentlicht QPM sowie getrennte Input- und Output-TPM pro Endpunkt. Foundry veröffentlicht RPM, ITPM und OTPM je Azure-Abo-Typ. Keine dieser Zahlen ändert sich, wenn Sie ein Console-Tier heben.
Amazon Bedrock hat zwei Endpunkte. Auf bedrock-runtime teilen Input und Output ein TPM-Kontingent. Output brennt schneller. Die Burndown-Seite aus diesem Lauf: Claude 4.8 Output mit Faktor 15; Claude Opus 5.5, Sonnet 5, Opus 5 und Fable 5.1 mit Faktor 10; Claude 4.7 und älter mit Faktor 5. Cache-Reads zählen nicht. Zu Beginn zieht Bedrock Input plus max_tokens ab. Ein hohes max_tokens kann 429 liefern, bevor das Modell ein Wort schreibt. bedrock-mantle hat getrennte Input- und Output-TPM, dort gilt kein Burndown.
Die Sonnet-5.5-Model-Card (Start 28. September 2026, 1 Mio. Kontext, 128.000 max Output) nennt die EU-Geo-ID eu.anthropic.claude-sonnet-5-5. Von Frankfurt aus sind Ziele Frankfurt, Stockholm, Mailand, Spanien, Irland und Paris. London als Quelle behält London. Default-TPM stehen in Service Quotas und können unter den veröffentlichten Defaults liegen.
Googles Claude-Quota-Seite sagt: ML-Verarbeitung bleibt in der EU auf Europa-Regional- und Multi-Region-Endpunkten. Sonnet 5.5 auf Multi-Region: 1.250 QPM, 12.500.000 uncached-plus-Cache-Write Input-TPM, 1.250.000 Output-TPM, 1.000.000 Kontext. Der globale Endpunkt verdoppelt (2.500 / 25.000.000 / 2.500.000). Opus 5.5 Multi-Region: 1.000 / 10.000.000 / 1.000.000. Modelle nach dem 26. Mai 2026 teilen einen Lineage-Bucket. Global und eu sind getrennte Töpfe.
Foundrys Claude-Quota-Seite ist der engste Default, den wir gelesen haben. Pay-as-you-go Sonnet 5.5 und Opus 5.5: 40 RPM, 40.000 ITPM, 8.000 OTPM. Enterprise und MCA-E: 10.000 / 10.000.000 / 2.000.000. Free Trial ist 0 / 0 / 0. Fable auf Pay-as-you-go ebenfalls 0. Data Zone Standard gibt es für die USA, nicht für die EU.
| Plattform | Was greift | Sonnet 5.5 Default (dieser Lauf) | EU-Verarbeitung? |
|---|---|---|---|
| Claude API Start | RPM + ITPM + OTPM + 500-USD-Cap | 1.000 / 2 Mio. / 400.000 | Nein. inference_geo nur us oder global |
Bedrock eu. |
TPM (Input+Output) + Burndown auf Runtime | Service Quotas, kontoabhängig | Ja. eu.anthropic.claude-sonnet-5-5 |
| Google Europa-Multi-Region | QPM + Input-TPM + Output-TPM | 1.250 / 12,5 Mio. / 1,25 Mio. | Ja auf eu |
| Foundry Pay-as-you-go | RPM + ITPM + OTPM | 40 / 40.000 / 8.000 | Keine EU-Datenzone |
Einstieg: Amazon Bedrock erklärt, Claude auf Vertex AI in Europa, Azure AI Foundry. Rechtsweg: Claude DSGVO-Anbietervergleich.
Was passiert am Limit, und wie heben Sie es?
Ein Abo-Cap hält diese Person bis zum Fünf-Stunden- oder Wochenreset an, außer Credits sind an. Ein API-Rate-Limit liefert 429 mit retry-after. Ein API-Spend-Cap liefert 429 mit enforced_spend_limit_reached ohne Retry-Header bis zum nächsten Monat. Cloud-429 sind Service Quota oder Foundry/Google-Quota. Die Lösung ist Backoff, dann ein Quota-Ticket, kein Abo-Upgrade.
Reihenfolge:
- Fehler lesen. Chat: Settings, Usage zeigt das nächste Reset. API:
retry-aftergegenenforced_spend_limit_reached. Bedrock und Foundry: HTTP 429, dann CloudWatch oder die Foundry-Quota-Seite. - Im bezahlten Chat-Plan unter Settings, Usage Credits einschalten, Guthaben kaufen, monatlichen Spend Cap setzen. Mobile-Store-Abos müssen das im Web tun.
- In der API unter Settings, Rate limits Request tier increase nutzen. Claude Platform on AWS hat diesen Knopf nicht. Mail an Anthropic Support mit Peak-ITPM, OTPM und Cache-Anteil.
- Auf Bedrock Cross-Region InvokeModel tokens per minute für das Modell in Service Quotas heben. AWS bietet danach das On-Demand-TPM und Tokens-per-Day-Paar an. Vorrang haben Konten, die ihr Kontingent schon nutzen.
- Auf Google Cloud Quotas nach
anthropic-claude-sonnetoderanthropic-claude-opusfiltern und dieeu-Multi-Region-Metriken beantragen, nicht die globalen, wenn Residenz zählt. - Auf Foundry die Quota-Seite öffnen und das Formular senden. Genehmigung ist nicht sicher. Free Trial bleibt bei null, bis Sie das Angebot verlassen.
- Verschwendung kappen: Prompt-Cache (Reads sparen ITPM), Batch zum halben Tokenpreis, realistisches
max_tokensauf Bedrock Runtime.
Sonnet 5.5 auf der Preisseite: 2 USD Input und 10 USD Output je Million Tokens. Opus 5.5: 4 / 20. Haiku 5.5: 0,10 / 0,50 bis 100.000 Prompt-Tokens und 0,50 / 2,50 darüber. US-only-Inferenz (inference_geo: "us") ab Claude 4.6 kostet 1,1x. Regionale und Multi-Region-Cloud-Endpunkte ab Sonnet 4.5 liegen 10 Prozent darüber. Batch halbiert beide Seiten. Fast Mode auf Opus 5.5 ist 8 / 40 und gibt es nur auf der First-Party-API.
Ein 200.000-Token-Cache plus 50-Token-Frage zählt als 50 uncached Input-Tokens zum API-ITPM. Caching ist ein Limit-Hebel, nicht nur ein Kostenhebel.
Welches Limit-System soll ein EU-Team wählen?
Wählen Sie nach den Daten, nicht nach dem Produktnamen. Chat-Pläne sind für Menschen. Die API ist für Produkte, die den EWR verlassen dürfen. Bedrock EU oder Google Europa ist für Produkte, die in Mitgliedstaaten bleiben müssen. Foundry ist ein US- oder Global-Pool mit sehr niedrigem Pay-as-you-go-Default.
Unsere Empfehlung für ein Unternehmen in der Union:
- Mitarbeiterchat und leichtes Claude Code: Team Standard, Premium für die wenigen, die das Wochenlimit reißen. Org-Credits mit hartem Monatsbetrag.
- Viel Code ohne EU-Verarbeitungsmandat: Max 20x für eine Person ist günstiger als ein Team-Premium-Platz. Ab zwei Personen gehört das auf Team.
- Produktions-APIs mit personenbezogenen Daten: Bedrock
eu.anthropic.claude-sonnet-5-5oder Google-eu-Multi-Region. Quota vor Go-live beantragen. Nicht auf den ersten 429 warten. - Produktions-APIs ohne Residenzpflicht: Claude API Scale, oder Foundry Enterprise, wenn Azure den Vertrag schon hält. Foundry Pay-as-you-go nicht über ein Demo hinaus. 40 RPM tragen keinen Launch.
Die Residenzseite bietet für inference_geo weiter nur "us" und "global". Workspace-Geo ist nur "us" und nach dem Anlegen fest. Rate Limits gelten über Geos hinweg. Ein höheres Console-Tier schafft keine EU-Region.
Claude Platform on AWS startet im Start-Tier und rechnet in Claude Consumption Units zu 0,01 USD (100 CCU = 1,00 USD). Workspace-Rate-Limits und Fast Mode gibt es dort nicht. Foundry nutzt dieselbe CCU.
FAQ
Was kostet es, Claude Nutzungslimits zu erhöhen?
Chat-Pläne verkaufen keine größere Session als Position. Sie kaufen einen höheren Plan oder Credits zu API-Tarifen. Die API-Erhöhung ist ein Tier-Wechsel: Start 500 USD, Build 1.000 USD, Scale 200.000 USD im Kalendermonat, danach Custom mit Vertrieb. Bedrock-, Google- und Foundry-Tickets sind kostenlos. Die Tokens, die Sie fahren, zahlen Sie weiter.
Claude Nutzungslimits vs API Rate Limits: wo liegt der Schnitt?
Claude Nutzungslimits im Abo sind ein Fünf-Stunden- plus Wochenbudget, geteilt von Chat und Claude Code. API Rate Limits sind RPM, ITPM und OTPM plus monatlicher Spend Cap einer Organisation. Ein Team-Premium-Platz mit 6,25x Pro hebt Ihr Console-Start-Tier nicht. Eine Scale-Org mit 10.000 RPM gibt Mitarbeitern keine zusätzlichen claude.ai-Nachrichten.
Gelten Claude Nutzungslimits in der EU genauso?
Ja bei den Zahlen. Nein bei der Residenz. Abo-Pools und API-Tiers sind global. inference_geo ist weiter nur us oder global. Workspace-Geo ist us. EU-Verarbeitung ist ein anderes Produkt: Bedrock-eu.-Profile oder Google-Europa-Endpunkte, mit eigenen Quotas.
Was passiert, wenn ein Team-Mitglied das Claude Nutzungslimit erreicht?
Die anderen Plätze laufen weiter. Diese Person wartet auf das Fünf-Stunden- oder Wochenreset, oder die Org schaltet Credits ein. Der Reset-Wochentag ist am Konto fest und steht unter Settings, Usage. Er wandert nicht, wenn jemand Claude neu nutzt.
Hebt Prompt-Caching die effektiven Claude-API-Limits?
Ja bei den meisten Modellen. Cache-Reads zählen nicht zum ITPM. Cache-Writes und uncached Input zählen. Die Rate-Limits-Docs rechnen 2.000.000 ITPM bei 80 Prozent Treffer als 10.000.000 Gesamttokens Input pro Minute. Haiku 3.5 zählt Reads weiter. Caching senkt außerdem die Rechnung: Sonnet-5.5-Cache-Hits kosten 0,10 USD je Million Tokens.
Warum 429 auf Bedrock, nachdem ich max_tokens erhöht habe?
Auf bedrock-runtime ist der erste Abzug Input plus max_tokens. Ein max_tokens von 32.000 bei kurzer Antwort reserviert diese Tokens sofort. Setzen Sie max_tokens nahe der echten Antwortlänge. Nach der Antwort justiert Bedrock auf Input plus Output mal Burndown (10x bei Sonnet 5 und Opus 5.5).
Quellen
- Anthropic Docs: Rate limits (10. Oktober 2026)
- Claude Help Center: How do usage and length limits work? (10. Oktober 2026)
- Claude: Preise (10. Oktober 2026)
- Claude Help Center: What is the Team plan? (10. Oktober 2026)
- Claude Help Center: What is the Enterprise plan? (10. Oktober 2026)
- Anthropic Docs: Preise (10. Oktober 2026)
- Anthropic Docs: Datenresidenz (10. Oktober 2026)
- AWS: How tokens are counted in Amazon Bedrock (10. Oktober 2026)
- AWS: Claude Sonnet 5.5 Model Card (10. Oktober 2026)
- Google Cloud: Quotas for Anthropic Claude models (10. Oktober 2026)
- Microsoft Learn: Claude-Quotas und Rate Limits (10. Oktober 2026)
- Anthropic Docs: Rate Limits API (10. Oktober 2026)