43 Fehlschläge. Dann 250.000 GitHub-Sterne in 2 Monaten: Wie Business-Skills für KI-Agenten Wochen an Produktivarbeit sparen
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau — DennisCraft AI Studio, Stack: Claude, Supabase, n8n, Doppler, selbstgehostetes Postgres. Meine erste produktive Multi-Agenten-Lösung verursachte beim Kunden 43 Backend-Ausfälle in einer Woche. Zwei Monate später erreichte ein öffentliches Fork desselben Agenten-Stacks 250.000 GitHub-Sterne. Der Unterschied? Nicht der Code, sondern klar definierte Business-Skills für Agenten, die in regulierten Märkten wirklich liefern. War
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau — DennisCraft AI Studio, Stack: Claude, Supabase, n8n, Doppler, selbstgehostetes Postgres. Meine erste produktive Multi-Agenten-Lösung verursachte beim Kunden 43 Backend-Ausfälle in einer Woche. Zwei Monate später erreichte ein öffentliches Fork desselben Agenten-Stacks 250.000 GitHub-Sterne. Der Unterschied? Nicht der Code, sondern klar definierte Business-Skills für Agenten, die in regulierten Märkten wirklich liefern.
Warum Demo-Agenten im Produktivbetrieb scheitern
Ein Agent, der im Demo überzeugt, bringt im realen Betrieb oft neue Probleme: In der Praxis (Logistik, Finanzen) beobachte ich regelmäßig, dass Claude-Code-basierte Agenten im Deployment:
- SQL-Queries mit Injection-Risiken erzeugen (siehe OWASP Top 10, 2017)
- bei API-Ausfällen in Endlosschleifen hängen und Kosten verursachen
- den Geschäftskontext verlieren, z.B. wird eine Rechnung an den falschen Kunden gesendet, weil die USt-IdNr. nicht validiert wird
Grund: Fehlende Business-Skills. Die Agenten kennen keine Budgets, keine SLA-Grenzen, keine Compliance-Vorgaben wie DSGVO.
Business-Skills für KI-Agenten systematisch abbilden
1. Explizite Geschäftsregeln und Einschränkungen im Prompt
Jeder Agent muss wissen: Welche Aktionen sind erlaubt? Welche Ressourcen/Limits gelten? Wann ist eine Aufgabe “erfolgreich” abgeschlossen?
# Beispiel: Claude Code, API-Limit
PROMPT = f"""
Ihre Aufgabe: Auftragsstatus prüfen.
Einschränkungen: Maximal 2 API-Aufrufe pro Vorgang, keine Speicherung von personenbezogenen Daten.
Bei Fehler — nur 1 Retry, sonst Aufgabe abbrechen.
"""
Diese Vorgaben reduzieren Infrastrukturkosten und minimieren Ausreißer.
2. Validierung der Prozesskette — Geschäftsregeln und Compliance, nicht nur Syntax
Mit n8n lassen sich Workflows so modellieren, dass an jedem Schritt Geschäftsregeln und DSGVO-relevante Prüfungen erfolgen.
# n8n Workflow: USt-IdNr. prüfen vor Rechnungsversand
- name: kunde_abrufen
type: postgres
params: {query: "SELECT ust_id FROM kunden WHERE id = $id"}
- name: validate_ust_id
type: function
params: {code: "if (!isValidUStId(item.ust_id)) { throw Error('Ungültige USt-Id') }"}
- name: rechnung_versenden
type: http
params: {url: "https://api.invoice/send"}
Fehler bei der Validierung stoppen den Workflow und verhindern Compliance-Verstöße.
Wo Standard-LLM-Agenten zu kurz greifen
| Agententyp | Stärken | Defizite |
|---|---|---|
| Standard-LLM-Agent | Code-Generierung, Q&A | Budget-/SLA-Bewusstsein, Validierung, Compliance |
| Agent mit Business-Regeln | Einhaltung von Vorgaben, Geschäftsregel-Prüfung | Oft begrenzte Systemintegration |
| Hybrid: LLM + statische Analyse | Findet SQL-Injections, Token-Leaks (semgrep, bandit, gitleaks) | Echtzeit-Bewertung von Geschäfts-KPIs |
So sparen Sie Wochen an Produktivarbeit
1. Statische Codeanalyse in jeder Pipeline
Jeder Pull Request von Agenten-Code wird mit semgrep, bandit und gitleaks geprüft (semgrep, bandit). LLM-Agenten erzeugen regelmäßig subtile Schwachstellen, die nur so in CI/CD oder sogar direkt bei der Code-Generierung auffallen.
# semgrep + bandit in CI/CD
semgrep --config=python .
bandit -r .
gitleaks detect
Bei einer aktuellen Bereitstellung wurden so 5 kritische Token-Leaks vor dem Go-Live gefunden.
2. Agentenrollen trennen — keine All-in-One-Agenten
Ich trenne bewusst: Ein Agent für Kommunikation, einer für Dokumentenprüfung, einer für Freigabe. Das begrenzt Fehler auf einzelne Schritte und vereinfacht die Nachvollziehbarkeit gegenüber Compliance-Anforderungen (z.B. DSGVO, Audit-Trails nach ISO 27001).
// n8n: spezialisierte Agenten je Prozessschritt
[
{ agent: "dokumentenpruefer", input: "rechnung.pdf" },
{ agent: "regelpruefer", input: "gepruefte_rechnung" },
{ agent: "benachrichtiger", input: "freigegebene_rechnung" }
]
3. Lückenlose Audit-Logs — jede Agentenaktion nachvollziehen
Alle Agentenaktionen schreibe ich in Supabase/Postgres, nicht nur ins stdout. Das erlaubt schnelles Troubleshooting, Compliance-Reports und BSI-konforme Nachverfolgung.
import supabase
# Agentenaktion loggen
supabase.table("agent_logs").insert({
"agent": "regelpruefer",
"action": "ust_id_pruefung",
"status": "fail",
"timestamp": datetime.now()
})
FAQ
Welches Analyse-Tool erkennt LLM-Agenten-Fehler am besten?
semgrep (https://semgrep.dev/) ist für Python von Claude/OpenAI am flexibelsten. Zusammen mit bandit (Security) und gitleaks (Secrets) decken Sie die meisten Risiken ab.
Wie geben Sie Agenten klare Geschäftsregeln mit?
Explizit im Prompt: Limits für Zeit, Budget, API-Calls, Fehlerbehandlung. Validierung in n8n-Workflows als separate Schritte oder Funktionen.
Wie loggen Sie Agentenaktionen DSGVO-konform?
Mit Supabase oder selbstgehostetem Postgres. Erfolgreiche und fehlerhafte Aktionen werden geloggt — so erfüllen Sie Audit-Pflichten gemäß DSGVO und ISO 27001.
Muss jede Geschäftsregel einen eigenen Agenten haben?
Nein, aber für kritische Schritte (Validierung, Freigabe, Versand) empfiehlt sich klare Rollentrennung. Das mindert Compliance-Risiken und vereinfacht Troubleshooting.
Wie prüfen Sie, dass ein Agent Geschäftsregeln nicht verletzt?
In n8n lassen sich Validierungsschritte (manuell oder automatisch) an jedem wichtigen Punkt ergänzen. Python/JS-Funktionen prüfen Limits in Echtzeit.
In welcher Phase scheitern Ihre Agenten am häufigsten — Codegenerierung, Systemintegration oder Geschäftslogik-Validierung? Mich interessiert Ihre Erfahrung.
Ich biete einen kostenlosen 30-min Stack-Audit für DACH-Unternehmen mit KI-Projekten in regulierten Märkten. Kontaktieren Sie mich auf LinkedIn oder via @ger_dennis_ai.
Aus einem Ablauf ein System machen, das läuft
Gebaut für den Betriebsalltag, nicht als Demo.