Warum KI-Agenten im Produktivbetrieb ausfallen oder unkontrollierbar werden: Reale Fehler durch Selbstlernen und Evolutionsschleifen
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. In meinem DennisCraft AI Studio entwickle ich produktionsreife KI-Agentensysteme für DACH-B2B-Kunden, mit Claude, Supabase, n8n, Doppler und selbst gehostetem Postgres. Was im Demo stabil erscheint, führt im Produktivbetrieb regelmäßig zu Kontrollverlust: Agenten werden langsam, treffen unsinnige Entscheidungen oder verunstalten Datenbanken – trotz DSGVO und BSI Grundschutz. Agenten im Betrieb: Wenn Selbstlernen zum Risiko
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. In meinem DennisCraft AI Studio entwickle ich produktionsreife KI-Agentensysteme für DACH-B2B-Kunden, mit Claude, Supabase, n8n, Doppler und selbst gehostetem Postgres. Was im Demo stabil erscheint, führt im Produktivbetrieb regelmäßig zu Kontrollverlust: Agenten werden langsam, treffen unsinnige Entscheidungen oder verunstalten Datenbanken – trotz DSGVO und BSI Grundschutz.
Agenten im Betrieb: Wenn Selbstlernen zum Risiko wird
Agenten, die sich selbst weiterentwickeln und anpassen, sind auf dem Papier effizient und zukunftssicher. In der Praxis beobachte ich jedoch wiederholt, dass diese Systeme nach Tagen oder Wochen im Produktivbetrieb aus dem Ruder laufen:
- Aufgabenqueues werden durch Endlosschleifen blockiert
- Entscheidungsqualität sinkt, da erlernte Logik vom Ziel abweicht
- Wissensbasen werden inkonsistent oder fehlerhaft
Ein reales Beispiel: Ein Logistik-Agent optimierte durch Selbstlernen Routenplanung. Nach wenigen Tagen produzierte er unsinnige Vorschläge. Ursache: Ein ungefilterter Fehler in den Produktivdaten löste eine Kettenreaktion aus, die das interne Modell des Agenten nachhaltig beschädigte.
Typische Fehlerquellen: Was im Feld wirklich passiert
1. Ungefiltertes Selbstlernen auf Produktivdaten
Erlauben Sie Agenten, direkt aus Produktionslogs zu lernen, ohne Fehlerfilterung, entstehen unweigerlich Rückkopplungen. In drei meiner letzten Projekte lernte der Agent einen seltenen Fehler als „neues Muster“ und wiederholte ihn fortlaufend.
def auto_learn_from_logs(logs, agent):
for log in logs:
if not is_valid(log): # Ohne Filter keine Stabilität!
continue
agent.learn_from(log)
# Fehlerhafte Logs führen zu Systemdegradation
Laut Anthropic LLM Safety Team Report 2023 (Quelle) verstärken sich Fehler bei selbstlernenden Modellen ohne explizite Sicherheitsprüfungen.
2. Evolutionsschleifen führen zu Overhead und Instabilität
Lassen Sie Agenten ihre Prompts oder Routinen selbstständig (z. B. über Claude Code API) weiterentwickeln, beobachten Sie nach einem Monat regelmäßig:
| Metrik | Start | Nach 1 Monat |
|---|---|---|
| Prompt-Größe | 2 Kb | 8 Kb |
| Zykluszeit | 1 Sekunde | 6 Sekunden |
| Fehlerrate | 1 % | 7 % |
Der Agent verbringt immer mehr Zeit mit interner Koordination, statt produktive Aufgaben zu lösen. Besonders kritisch wird es, wenn mehrere Agenten gegenseitig ihre Konfigurationen überschreiben.
3. Verfall der Wissensbasis durch automatisierte Korrekturen
RAG-Agenten, die ihre Supabase-Daten selbstständig “reparieren”, erzeugen oft zyklische Fehler – eine Korrektur zieht die nächste nach sich. Ohne Validierung (beispielsweise mit semgrep für Code oder SQL-Constraints für Daten) wird die Datenbasis schnell unbrauchbar.
def validate_kb_entry(entry):
if "TODO" in entry or len(entry) < 100:
return False
# semgrep/bandit für Code, SQL-Constraints für Daten sind Pflicht
return True
Wie Sie Degradation verhindern: Erprobte Muster
Validierung in jedem Zyklus
Kein Agenten-Update ohne explizite Prüfung. Produktionsreife Pipelines erzwingen: automatische Validierung → menschliche Stichprobe → kontrollierte Bereitstellung.
Strikte Limits für Evolution
Prompt-Größe, Update-Frequenz und Tiefe der Selbstkorrektur müssen limitiert werden. In n8n setze ich z. B. ein Tageslimit von drei automatischen Änderungen, weitere Anpassungen erfordern Freigabe.
Dedizierte Sandboxes für riskante Änderungen
Alle riskanten Agenten-Updates laufen zuerst isoliert oder auf Testdaten. Probleme treten erfahrungsgemäß immer dort auf, wo sie nicht erwartet werden – das schützt vor DSGVO-relevanten Datenpannen.
FAQ
Warum nicht komplett auf Selbstlernen verzichten?
Gerade für dynamische Logistik oder Finanzüberwachung ist Selbstlernen essenziell. Entscheidend sind Filter und Limitierungen – nicht ein totales Verbot.
Wie kontrollieren Sie die Evolution von Prompts?
Mit klaren Grenzwerten für Größe und Frequenz sowie menschlicher Kontrolle. n8n kann automatisierte Alarme bei Grenzwertüberschreitung auslösen.
Was tun bei fehlerhaften Datenbank-Korrekturen?
Strukturvalidierung (semgrep/bandit für Code, SQL-Constraints für Daten) und vollständige Änderungshistorie für Rückrollen sind Pflicht.
Welche Tools haben sich bewährt?
Supabase für versionierte Daten, n8n für Prozesssteuerung, semgrep/bandit/gitleaks für Code-Checks, Doppler für Geheimnisverwaltung.
Ist menschliche Kontrolle nach Auto-Training noch nötig?
Ja, besonders bei neuen Mustern. Bereits 10 % manuelle Stichproben verhindern die meisten Kettenfehler frühzeitig.
Wo in Ihrer Pipeline kippen Agenten am häufigsten aus der Spur – beim Selbstlernen auf Produktivdaten oder bei der Evolution von Prompts? Ich möchte das wirklich wissen. Ich biete einen kostenlosen 30-Minuten-Stack-Audit für DACH-Unternehmen mit KI in regulierten Märkten an. Kontaktieren Sie mich auf LinkedIn oder schreiben Sie an @ger_dennis_ai.
Aus einem Ablauf ein System machen, das läuft
Gebaut für den Betriebsalltag, nicht als Demo.