KI-Coding-Agenten: 24 Plugins, 49 Agenten, 44 Skills – Wie Sie (fast) alles automatisieren
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. In meinem DennisCraft AI Studio implementiere und betreibe ich autonome KI-Systeme für B2B-Kunden im DACH-Raum: Logistik, Fintech, industrielle Automation. Tech-Stack: Claude, Supabase, n8n, Doppler, self-hosted Postgres. Die eigentliche Herausforderung besteht darin, Coding-Agenten produktiv und DSGVO-konform zu betreiben – nicht nur im Demo, sondern im Betrieb mit echten Daten und Integrationen. Das Produktionsproblem: Ma
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. In meinem DennisCraft AI Studio implementiere und betreibe ich autonome KI-Systeme für B2B-Kunden im DACH-Raum: Logistik, Fintech, industrielle Automation. Tech-Stack: Claude, Supabase, n8n, Doppler, self-hosted Postgres. Die eigentliche Herausforderung besteht darin, Coding-Agenten produktiv und DSGVO-konform zu betreiben – nicht nur im Demo, sondern im Betrieb mit echten Daten und Integrationen.
Das Produktionsproblem: Manuelle Review- und Prüfungs-Deadlocks
Sobald Compliance relevant wird, stocken Prozesse oft bei manuellen Code-Reviews, Security-Checks und Dokumentationspflege. Bei einem Fintech-Kunden konnte ich 80% der Pull-Request-Reviews mit 24 Plugins, 49 Agenten und 44 Skills automatisieren – inklusive Tests, statischer Analyse und Sicherheitsprüfung. Der Mensch bleibt für Architektur und Grenzfälle zuständig, die Routine übernimmt der Agent.
Architektur: So bauen Sie produktionsreife Agentenketten
Grundprinzipien
- Jeder Agent übernimmt genau eine Aufgabe (Tests generieren, statische Analyse, Secrets prüfen, Dokumentation aktualisieren).
- Orchestrierung in n8n, Status- und Logspeicherung über Supabase/Postgres.
- Claude Code als Codegenerator; Validierung durch semgrep, bandit, gitleaks und OWASP-Pattern.
Plugins und Integrationen im Überblick
| Plugin | Zweck | Integration |
|---|---|---|
| semgrep | Statische Analyse | CLI, API |
| bandit | Security-Scan Python | CLI |
| gitleaks | Secrets-Prüfung | CLI |
| Supabase | Status, Logs, Storage | API |
| n8n | Orchestrierung | Webhooks |
| Doppler | Secrets Management | API |
Beispiel: Agenten-Pipeline für Pull Requests
def agent_pipeline(pr_id):
# 1. Diff von GitHub holen
diff = get_github_diff(pr_id)
# 2. Unit-Tests mit Claude Code generieren
tests = claude_generate_tests(diff)
# 3. bandit und semgrep ausführen
sec_report = run_bandit(diff)
static_report = run_semgrep(diff)
# 4. gitleaks für Secrets-Prüfung
secrets = run_gitleaks(diff)
# 5. Status in Supabase speichern
save_pipeline_status(pr_id, tests, sec_report, static_report, secrets)
return aggregate_reports(tests, sec_report, static_report, secrets)
Was Agenten wirklich automatisieren – und was nicht
Wo Agenten Menschen überholen
- Unit-Tests: Claude Code ist laut meinen Messungen 7x schneller als manuell, mit >85% Genauigkeit.
- Automatisierte Sicherheits- und Secrets-Prüfungen: bandit und gitleaks finden Schwachstellen, die Menschen übersehen.
- Style-Checks und Linting: fehlerfrei, 100% automatisiert.
Wo Agenten an Grenzen stoßen
- Architekturentscheidungen: LLMs generieren „sauberen“ Code, erfassen aber keine Businesslogik.
- Refactoring von Legacy-Code: Aufgaben müssen kleinteilig vorbereitet und per Hand validiert werden.
- Integration mit proprietären APIs: Hier bleibt die menschliche Prüfung Pflicht.
Agentenrollen: Wer erledigt was?
| Agent | Funktion | Tools |
|---|---|---|
| Test-Generator | Unit/Integration Coverage | Claude Code |
| Security Checker | Schwachstellen finden | bandit, semgrep |
| Secrets Scanner | Keys-Leaks erkennen | gitleaks |
| Style Agent | Linting/Formatieren | black, flake8 |
| Doc Updater | Dokumentation | Claude Code |
n8n-Pipeline-Konfiguration: Beispiel
- name: pr_pipeline
steps:
- github_webhook
- claude_code_generate_tests
- bandit_check
- semgrep_scan
- gitleaks_scan
- update_supabase_status
- notify_slack
Validierung: Was Agenten in der Praxis entdecken
In meinen letzten drei Projekten haben Agenten folgende Fehler am häufigsten identifiziert:
- SQL-Injection (CWE-89): Laut Stanford CodeML 2024 enthalten 38% LLM-generierter Python-Code CWE-89-Muster.
- Fest eingebaute Tokens und Secrets: gitleaks findet Leaks auch in privaten Repos.
- Fehlerhafte Input-Validierung: semgrep deckt OWASP-Pattern ab.
FAQ
Welches Stack funktioniert DSGVO-konform und stabil mit Claude Code?
Claude Code + n8n für Orchestrierung, Supabase/Postgres für Status und Logs, bandit/semgrep/gitleaks für Validierung – das ist bei mir im DACH-Kontext praxiserprobt.
Wie verhindern Sie, dass Agenten Secrets leaken?
Mit Doppler für das Secrets Management. Lässt sich direkt in n8n und Python/TypeScript-Pipelines einbinden.
Kann man LLM-Agenten Code-Review komplett anvertrauen?
Nein. In der Praxis finden Agenten 70–80% der Fehler. Architektur und Businesslogik bleiben menschlich.
Wie behalten Sie Status und Fehler der Pipeline im Blick?
Status und Logs laufen in Supabase/Postgres; Monitoring erfolgt über ein eigenes Dashboard, live einsehbar auf live.gerdennisai.com.
Wie viel Zeitersparnis bringen die Agenten realistisch?
In den letzten 6 Monaten: 30–50% weniger Zeitaufwand bei Code-Review und Validierung.
In welchem Abschnitt Ihrer LLM-Pipeline entdecken Sie im Produktivbetrieb die meisten Fehler – statische Analyse, Laufzeit-Sandbox oder menschliches Review? Mich interessieren echte Zahlen. Ich biete für DACH-Unternehmen einen kostenlosen 30-min Stack-Audit für KI-Projekte im regulierten Umfeld. Kontaktieren Sie mich via LinkedIn oder @ger_dennis_ai.
Aus einem Ablauf ein System machen, das läuft
Gebaut für den Betriebsalltag, nicht als Demo.