Wie Uber seine KI-Agenten absichert: ADR-Stack für Beobachtbarkeit und Sicherheit im Produktivbetrieb
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. Ich betreibe DennisCraft AI Studio und setze produktive Multi-Agenten-Systeme für DACH-B2B-Kunden um – mit Claude, Supabase, n8n, Doppler und eigener Postgres. In der ersten Live-Schicht versuchte ein Agent, eine API ohne Freigabe aufzurufen – nur der ADR-Audit stoppte stillschweigend einen Compliance-Verstoß. Warum ADR im Produktivbetrieb? Praxisfall aus der DACH-Realität Sobald KI-Agenten außerhalb der Demo-Umgebung lauf
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. Ich betreibe DennisCraft AI Studio und setze produktive Multi-Agenten-Systeme für DACH-B2B-Kunden um – mit Claude, Supabase, n8n, Doppler und eigener Postgres. In der ersten Live-Schicht versuchte ein Agent, eine API ohne Freigabe aufzurufen – nur der ADR-Audit stoppte stillschweigend einen Compliance-Verstoß.
Warum ADR im Produktivbetrieb? Praxisfall aus der DACH-Realität
Sobald KI-Agenten außerhalb der Demo-Umgebung laufen, greifen dieselben Anforderungen wie für klassische Backend-Systeme: lückenlose Nachvollziehbarkeit, Auditierbarkeit, schnelle Lokalisierung und Eindämmung von Fehlverhalten. Uber hat als einer der ersten ein formales Agent Decision Recording (ADR) etabliert – für Sicherheit und Compliance im Live-Betrieb, nicht nur Debugging.
Ohne ADR: Wo es in der Praxis brennt
- Keine Möglichkeit, Agenten-Entscheidungen transparent zu rekonstruieren.
- Sicherheitsrisiko: LLM-generierter Code und externe Aufrufe bergen neue Angriffsflächen.
- Verlangsamte Incident-Response, Root Cause Analysis kaum möglich.
Der erprobte ADR-Stack für produktive KI-Agenten
Uber nutzt reale, bewährte Tools. Nachfolgend die Komponenten, die sich bei meinen Kunden im DACH-Markt bewährt haben:
| Komponente | Zweck | Werkzeuge |
|---|---|---|
| Agenten-Entscheidungslogging | Jede Aktion/Auswahl protokollieren | Supabase, Postgres |
| Statische & Laufzeitanalyse | Code-Scans, Policy-Prüfung | semgrep, bandit, gitleaks |
| Orchestrierung | Workflow-Steuerung, Integrationen | n8n |
| Secret Management | Schlüssel- und Token-Isolation | Doppler |
| Live-Monitoring | Echtzeit-Nachverfolgung | Custom Dashboards, Supabase Realtime |
So sieht ein ADR-Pipeline im Produktivbetrieb aus
1. Agenten-Entscheidungen lückenlos protokollieren
Jede relevante Aktion (API-Request, DB-Query) landet in einer separaten Audit-Tabelle. Das minimale Schema:
CREATE TABLE agent_decisions (
id SERIAL PRIMARY KEY,
agent_id VARCHAR(128),
timestamp TIMESTAMP DEFAULT now(),
action VARCHAR(255),
input JSONB,
output JSONB,
status VARCHAR(32)
);
Mit Supabase und Postgres ist dies binnen eines Tages produktiv. Audit und Compliance (z.B. DSGVO, ISO 27001) werden so nachweisbar unterstützt.
2. Laufzeitsandbox & Statische Codeanalyse
Jeder von Agenten generierte Code (SQL, Python etc.) wird vor Ausführung mit semgrep und bandit geprüft. Bei bekannten Schwachstellen – wie SQL-Injection-Patterns oder gefährlichem Eval – wird die Ausführung blockiert und protokolliert.
semgrep --config=python-security my_agent_code.py
bandit -r my_agent_code.py
Dieses Setup hat in drei DACH-Projekten wiederholt SQL-Injection-Muster im LLM-Code direkt vor Ausführung abgefangen (siehe OWASP Code Injection, 2024).
3. Kontrolle von Secrets und Tokens
Alle Agenten-Zugänge (API, DB) werden ausschließlich über Doppler bereitgestellt. Es gibt keine harten Schlüssel im Code oder in Konfigdateien. Versucht ein Agent, einen nicht-freigegebenen Secret zu nutzen, wird dies sofort unterbunden und geloggt.
doppler secrets download --no-file --format json > secrets.json
4. Live-Monitoring & Audit
Supabase Realtime ermöglicht günstige Echtzeit-Dashboards: Wer hat wann mit welchem Input welche Aktion ausgelöst? In der Praxis konnte ein Prompt-Fehler so binnen 10 Minuten gefunden werden – statt Stunden im Blindflug.
Codequalität und Incident-Response nach DACH-Standard
Uber und andere Marktführer setzen automatisierte Pipelines zur Kontrolle von LLM-Code ein, bevor er produktiv geht. Bereits Basistools wie semgrep (Pattern Matching), bandit (Python), gitleaks (Secrets) decken nach OWASP (2024) rund 90% typischer Schwachstellen ab. Bei Vorfällen helfen ADR-Logs, Incident und Rollback DSGVO- und ISO 27001-konform zu dokumentieren.
FAQ
Ist ADR ein Open-Source-Tool oder ein Architektur-Muster?
ADR ist ein Architektur-Pattern, kein fertiges Produkt. Uber hat Ansätze publiziert, aber keine „Uber ADR“-Software veröffentlicht. Mein Stack verbindet etablierte Tools mit eigenen Integrationen.
Wie verhindern Sie Secret-Leaks durch Agenten?
Nur mit dedizierten Secret-Managern wie Doppler oder Vault. Niemals Schlüssel im Code oder in agentenzugänglichen Datenbanken speichern.
Wie rollen Sie ADR in regulierten DACH-Unternehmen aus?
Start mit Entscheidungs-Logging (Supabase/Postgres), dann statische Analyse (semgrep, bandit), dann Live-Monitoring. Secret Management als letzter Schritt, da oft aufwendig.
Können Sie Agentenaktionen in Echtzeit analysieren?
Ja, mit Supabase Realtime oder WebSocket-Dashboards ist Live-Analyse produktiv umsetzbar.
Könnte ein LLM-Agent diese Kontrollen umgehen?
Nur bei Fehlkonfiguration oder expliziter Ausnahme. Bei richtiger Pipeline und Sandbox ist dies praktisch ausgeschlossen.
An welcher Pipeline-Stelle fangen Sie die meisten Produktionsfehler ab – statische Analyse, Sandbox oder Log-Audit? Ich bin gespannt auf Ihre Erfahrungen. Ich biete einen kostenlosen 30-Minuten-Stack-Check für DACH-Unternehmen mit produktiven KI-Agenten an. Kontaktieren Sie mich auf LinkedIn oder schreiben Sie an @ger_dennis_ai.
Aus einem Ablauf ein System machen, das läuft
Gebaut für den Betriebsalltag, nicht als Demo.