Warum 90 % der KI-Agenten im Produktivbetrieb scheitern: Wie das MCP-Ouroboros-Muster Ambiguität und Budgetkontrolle adressiert
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau — ich entwickle agentenbasierte KI-Systeme für den DACH-B2B-Markt, produktiv im Einsatz, mit Claude, Supabase, n8n, Doppler und selbstgehostetem Postgres. Jede Produktionswoche zeigt: 90 % der Agenten-Ketten geraten entweder in Endlosschleifen oder verbrauchen das komplette Budget (Tokens, Zeit, Geld) in wenigen Stunden. Das ist kein Demo-Problem — auf live.gerdennisai.com können Sie die Realität beobachten: tägliches Monitori
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau — ich entwickle agentenbasierte KI-Systeme für den DACH-B2B-Markt, produktiv im Einsatz, mit Claude, Supabase, n8n, Doppler und selbstgehostetem Postgres. Jede Produktionswoche zeigt: 90 % der Agenten-Ketten geraten entweder in Endlosschleifen oder verbrauchen das komplette Budget (Tokens, Zeit, Geld) in wenigen Stunden. Das ist kein Demo-Problem — auf live.gerdennisai.com können Sie die Realität beobachten: tägliches Monitoring, Neustarts und Budgetalarme sind Standard.
Produktivbetrieb: Ambiguität und Budgetverlust als Hauptursachen für Instabilität
Im Gegensatz zu kontrollierten Demos sind im produktiven Betrieb zwei Faktoren entscheidend für Ausfälle von KI-Agenten:
- Ambiguität in der Aufgabenstellung oder im Agenten-zu-Agenten-Dialog („Bitte präzisieren Sie…“-Schleifen).
- Fehlende, zentrale Kontrolle über Token-, Zeit- oder externes API-Budget.
Die Stanford AI Index 2024 belegt: 85 % der Produktionsvorfälle mit LLMs entstehen durch unkontrollierte Folgeanfragen oder Runaway-Agents. Mein praktischer Audit: In mindestens 3 von 5 ausgelieferten Agenten-Pipelines mussten nachträglich „Circuit Breaker“ zur Budgetkontrolle eingebaut werden.
Das MCP-Ouroboros-Muster: Externe Prozesssteuerung für Agenten-Ketten
Einzelne Hotfixes oder Rate Limits reichen nicht. Ich setze das Muster „Minimaler Kontrollprozess“ (MCP, hier: Ouroboros-Pattern) ein, das:
- Harte Budgetlimits (Tokens, Zeit, Kosten) für die gesamte Agenten-Kette durchsetzt.
- Den Fortschritt anhand expliziter Checkpoints verfolgt, um Endlosschleifen früh zu erkennen.
- Ambiguität und fehlerhafte Strukturen durch externe Validierung (z. B. JSON-Prüfung) identifiziert und behandelt.
Wichtig: Die MCP-Ebene greift nicht in Prompts oder Modelldetails ein, sondern steuert ausschließlich Ablauf und Ressourcen.
Architektur: Claude + n8n + Supabase + MCP als separater Dienst
Das MCP ist als eigenständiger Python-(FastAPI)-Service implementiert, angebunden an n8n (Workflow), Supabase (Storage/Validierung) und Doppler (Secrets):
import time
import requests
class MCPOuroboros:
def __init__(self, budget_tokens, budget_seconds):
self.tokens_left = budget_tokens
self.time_left = budget_seconds
self.checkpoints = []
def step(self, agent_input, agent_output, tokens_used):
self.tokens_left -= tokens_used
self.checkpoints.append((time.time(), agent_input, agent_output))
if self.tokens_left < 0 or self.time_left < 0:
raise Exception("Budget überschritten")
if self.detect_ambiguity(agent_input, agent_output):
return self.external_validate(agent_output)
return agent_output
def detect_ambiguity(self, inp, out):
# Einfache Heuristik: Wiederholte Nachfragen zur selben Variablen
return "präzisieren" in out.lower()
def external_validate(self, output):
# JSON-Struktur über Supabase-Edge-Funktion prüfen
resp = requests.post("https://your.supabase.io/validate", json={"out": output})
return resp.json()
Jede Agenten-Kommunikation läuft über das MCP; so werden Ressourcenverbrauch und Auffälligkeiten zentral geloggt.
Warum Rate Limits und Exception Handling allein nicht ausreichen
API-Limits und klassische Fehlerbehandlung fangen keine Runaway-Szenarien ab, in denen sich Agenten gegenseitig aufrufen oder Aufgaben unkontrolliert verzweigen. Das MCP beobachtet und reguliert den gesamten Agenten-Graphen, nicht nur Einzelschritte.
Budgetkontrolle in der Praxis: Mehr als nur Kostenmanagement
Gerade im regulierten DACH-Umfeld (DSGVO, BSI Grundschutz, EU AI Act) sind Budgetgrenzen nicht allein monetär relevant:
- Antwortzeit (SLA, z. B. maximal 60 Sekunden pro Vorgang)
- Gesamtanzahl der Datenbank-Operationen (Supabase berechnet nach Reads/Writes)
- Limits für externe API/Webhook-Aufrufe (n8n, CRM, Zahlungsdienste)
| Parameter | Agenten-Ebene | MCP-Ebene |
|---|---|---|
| LLM-Tokens | + | ++ |
| Ausführungszeit | - | ++ |
| Externe Aufrufe | - | + |
| Strukturvalidierung | - | ++ |
Strukturvalidierung: Pflicht in Multi-Agenten-Ketten
Im Produktivbetrieb liefern LLM-Agenten häufig ungültiges JSON oder verlieren sich in Rückfragen. Neben statischen Codechecks (semgrep, gitleaks) schützt im Betrieb nur externe Validierung (Supabase-Edge, Python):
import jsonschema
schema = {
"type": "object",
"properties": {
"action": {"type": "string"},
"params": {"type": "object"}
},
"required": ["action", "params"]
}
def validate_json(data):
try:
jsonschema.validate(instance=data, schema=schema)
return True
except Exception as e:
return False
Die gesamte Kette stoppt, bis jede Agenten-Antwort eine gültige Struktur liefert — so werden Runaway-Prozesse früh unterbunden.
FAQ
Reichen Timeouts pro Anfrage nicht aus?
Timeouts greifen nur bei Einzel-Requests. In Agenten-Ketten können sich Runaway-Szenarien über wiederholte Aufrufe ausbreiten, die Timeouts umgehen.
Kann n8n als Regler allein genutzt werden?
Für einfache Flows ja, aber bei komplexen Agenten-Ketten ist ein externer Service per API/Webhook unverzichtbar.
Wie erkennt das MCP Ambiguität?
Durch explizite Regeln für Rückfragen und externe JSON-Strukturvalidierung bei jedem Agenten-Output.
Was passiert bei festgefahrenen Agenten?
Das MCP kann entweder an einen Menschen eskalieren oder vordefinierte Fallback-Logik triggern.
Wie oft werden Validierungsregeln aktualisiert?
Nach jedem Produktionsvorfall füge ich Heuristiken hinzu, mindestens monatlich erfolgt ein Audit der gesamten Kette.
Wo in Ihrer Agenten-Pipeline treten die meisten Runaway-Probleme auf — bei der Aufgabenstellung oder in der Agenten-Weitergabe? Das interessiert mich wirklich. Ich biete einen kostenfreien 30-Minuten-Stack-Audit für Gründer und CTOs im regulierten DACH-Markt. Kontaktieren Sie mich auf LinkedIn oder schreiben Sie an @ger_dennis_ai.
Turn your process into an AI system
Fixed price. Production quality. DACH B2B focus.