186 Kommandos, 54 Agenten: Wie Claude Night Market TDD, Code Review und Wartung ohne manuelle Skripte automatisiert
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau — bei DennisCraft AI Studio entwickle und betreibe ich autonome Multi-Agenten-Systeme für DACH-Unternehmen im produktiven Einsatz. Mein Stack: Claude, Supabase, n8n, Doppler und selbstgehostetes Postgres. Im Alltag zähle ich nicht auf manuelle Skripte. Fehler, die erst im Produktivbetrieb auffallen, sind zu teuer – alles von TDD bis Wartung muss automatisiert und nachvollziehbar sein. Produktionsrealität: Manuelle Skripte si
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau — bei DennisCraft AI Studio entwickle und betreibe ich autonome Multi-Agenten-Systeme für DACH-Unternehmen im produktiven Einsatz. Mein Stack: Claude, Supabase, n8n, Doppler und selbstgehostetes Postgres. Im Alltag zähle ich nicht auf manuelle Skripte. Fehler, die erst im Produktivbetrieb auffallen, sind zu teuer – alles von TDD bis Wartung muss automatisiert und nachvollziehbar sein.
Produktionsrealität: Manuelle Skripte sind keine Option
Gerade in regulierten Märkten wie Deutschland, Österreich und der Schweiz scheitern Ad-hoc-Skripte und individuelle Pipelines schnell. Ich habe erlebt, dass LLM-generierter Code Tests überspringt, Zugangsdaten exponiert oder SQL-Injection-Risiken einführt – mitten im Sprint. Heute laufen in meinem Night Market 186 deklarative Kommandos und 54 spezialisierte Agenten-Muster, die Aufgaben wie TDD, Code Review und Wartung übernehmen – ohne Bash-Frickelei.
Das Agenten-Muster: Modular, produktiv, auditierbar
Es gibt keinen „Zauber-Framework“. Jedes Agenten-Muster ist ein konkretes Zusammenspiel aus Claude Code, Supabase, n8n und dedizierten Security-Tools. Beispiel für automatisiertes Testen:
import supabase
import subprocess
def run_pytest():
result = subprocess.run(["pytest", "--maxfail=2", "--tb=short"], capture_output=True, text=True)
return result.stdout
def log_supabase(client, log):
client.table("test_logs").insert({"log": log}).execute()
if __name__ == "__main__":
sb = supabase.create_client("SUPABASE_URL", "SUPABASE_KEY")
log = run_pytest()
log_supabase(sb, log)
Der Agent bezieht ein Kommando aus Supabase, führt aus, loggt das Ergebnis und stößt bei Bedarf via n8n Benachrichtigungen an. Kein manuelles Triggern, kein SSH.
186 Kommandos: Deklarativ, nicht geskriptet
Jede Aufgabe ist ein deklaratives JSON-Objekt, kein Skript. Beispiel für einen Security-Scan mit semgrep:
{
"type": "security_scan",
"tool": "semgrep",
"target": "repo/src/",
"ruleset": "p/ci"
}Der Agent interpretiert das Kommando, startet semgrep, speichert das Ergebnis in Supabase. Kritische Findings (z. B. CWE-89) führen zu automatischen Alerts in n8n und blockieren Pull Requests.
| Pattern | Tool | Trigger | Ergebnis |
|---|---|---|---|
| SQL Injection | semgrep | Security Scan | Alert + Log |
| Hardcoded Secrets | gitleaks | Pre-commit | Block PR |
| Veraltete API | bandit | CI/CD | Warnung |
Was Agenten im Produktivbetrieb tatsächlich finden
In drei aktuellen Projekten hat das System jeweils denselben Fehler gefunden: LLM-generierter Backend-Code mit unsicheren User-Inputs, der SQL-Injection-Lücken in Postgres öffnete. semgrep und bandit haben dies vor dem Merge erkannt, n8n hat das Team in Slack benachrichtigt. Ohne statische Analyse hätten diese Fehler die Produktion erreicht. Auch gitleaks verhinderte in zwei Fällen das Ausrollen von hartkodierten API-Keys.
Automatisiertes Code Review und Wartung
Ein dedizierter Agent übernimmt Code Reviews mittels Claude Code und OpenAI Cookbook (Beispiel). Der Ablauf:
- Diff-Parsing mit Claude Code.
- semgrep, bandit, gitleaks über den Diff laufen lassen.
- Abgleich mit bekannten Mustern in einer internen Datenbank.
- Erstellung einer Zusammenfassung und Empfehlung in Supabase.
- Benachrichtigung via n8n an den Reviewer.
Wartungsagenten reagieren auf Fehler-Logs in Supabase (Trigger). Tritt ein Fehler 3+ Mal binnen 24 Stunden auf, starten sie automatisiert Remediation-Skripte und dokumentieren alles auditierbar – ein wichtiger Punkt für ISO 27001 und DSGVO.
Sicherheitsmanagement: Doppler und Supabase
Keine Agenten oder Skripte speichern Zugangsdaten im Code. Doppler verwaltet sämtliche Secrets, Agenten holen temporäre Tokens via API und laufen in isolierten Containern. Bei Leaks oder veralteten Schlüsseln erfolgt die Rotation per Webhook – ein Muss für DSGVO und BSI Grundschutz.
Öffentliche Transparenz: Night Market Live
Ein Teil des Night Market ist öffentlich einsehbar: live.gerdennisai.com. Hier können Sie live beobachten, wie Agenten Kommandos abarbeiten, Reports erstellen und auf Incidents reagieren. Die Architektur basiert komplett auf Open-Source-Tools – keine Blackbox.
FAQ
Welche Tools integrieren sich am besten mit Claude Code?
Supabase für Aufgaben und Logs, n8n für Orchestrierung, Doppler für Secrets, dazu semgrep, bandit und gitleaks für Security-Prüfungen.
Wie viele Agenten sind für ein mittelständisches Team sinnvoll?
7–15 Agenten reichen für Tests, Review und Monitoring. Für Enterprise lassen sich 50+ Agenten problemlos skalieren.
Unterstützt das Muster auch Non-Python-Projekte?
Ja, durch Austausch der Tools (z. B. eslint für JS, shellcheck für Bash) ist das Muster sprachagnostisch.
Welche Pipeline-Stufe findet die meisten Schwachstellen?
Nach meiner Erfahrung: pre-commit und Code Review. Für komplexe Abläufe ist Runtime Monitoring entscheidend.
Wie erfüllt Night Market Compliance-Anforderungen?
Vollständige Protokollierung, Secret-Management nur über Doppler, keine LLM-Tokens im Klartext. Auditierbare Reports für externe Prüfer verfügbar.
Wo in Ihrer LLM-Pipeline werden die meisten Fehler im Produktivbetrieb erkannt – statische Analyse, Laufzeitüberwachung oder menschliches Review? Feedback interessiert mich. Ich biete einen kostenlosen 30-min Stack-Audit für DACH-Unternehmen mit KI-Projekten. Kontaktieren Sie mich auf LinkedIn oder schreiben Sie an @ger_dennis_ai.
Turn your process into an AI system
Fixed price. Production quality. DACH B2B focus.