Über mich Portfolio Referenzen Leistungen Blog Kontakt 🎙 Mit KI sprechen
EN DE RU
🎙 Mit KI sprechen
September 11, 2026 · 3 min read

43 Fehlschläge. Dann 250.000 GitHub-Sterne in 2 Monaten: Wie Business-Skills für KI-Agenten Wochen an Produktivarbeit sparen

von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau — DennisCraft AI Studio, Stack: Claude, Supabase, n8n, Doppler, selbstgehostetes Postgres. Meine erste produktive Multi-Agenten-Lösung verursachte beim Kunden 43 Backend-Ausfälle in einer Woche. Zwei Monate später erreichte ein öffentliches Fork desselben Agenten-Stacks 250.000 GitHub-Sterne. Der Unterschied? Nicht der Code, sondern klar definierte Business-Skills für Agenten, die in regulierten Märkten wirklich liefern. War

Denis Shokhirev
Denis Shokhirev
Agentic AI Systems Architect
Telegram LinkedIn

von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau — DennisCraft AI Studio, Stack: Claude, Supabase, n8n, Doppler, selbstgehostetes Postgres. Meine erste produktive Multi-Agenten-Lösung verursachte beim Kunden 43 Backend-Ausfälle in einer Woche. Zwei Monate später erreichte ein öffentliches Fork desselben Agenten-Stacks 250.000 GitHub-Sterne. Der Unterschied? Nicht der Code, sondern klar definierte Business-Skills für Agenten, die in regulierten Märkten wirklich liefern.

Warum Demo-Agenten im Produktivbetrieb scheitern

Ein Agent, der im Demo überzeugt, bringt im realen Betrieb oft neue Probleme: In der Praxis (Logistik, Finanzen) beobachte ich regelmäßig, dass Claude-Code-basierte Agenten im Deployment:

  • SQL-Queries mit Injection-Risiken erzeugen (siehe OWASP Top 10, 2017)
  • bei API-Ausfällen in Endlosschleifen hängen und Kosten verursachen
  • den Geschäftskontext verlieren, z.B. wird eine Rechnung an den falschen Kunden gesendet, weil die USt-IdNr. nicht validiert wird

Grund: Fehlende Business-Skills. Die Agenten kennen keine Budgets, keine SLA-Grenzen, keine Compliance-Vorgaben wie DSGVO.

Business-Skills für KI-Agenten systematisch abbilden

1. Explizite Geschäftsregeln und Einschränkungen im Prompt

Jeder Agent muss wissen: Welche Aktionen sind erlaubt? Welche Ressourcen/Limits gelten? Wann ist eine Aufgabe “erfolgreich” abgeschlossen?


# Beispiel: Claude Code, API-Limit
PROMPT = f"""
Ihre Aufgabe: Auftragsstatus prüfen.
Einschränkungen: Maximal 2 API-Aufrufe pro Vorgang, keine Speicherung von personenbezogenen Daten.
Bei Fehler — nur 1 Retry, sonst Aufgabe abbrechen.
"""

Diese Vorgaben reduzieren Infrastrukturkosten und minimieren Ausreißer.

2. Validierung der Prozesskette — Geschäftsregeln und Compliance, nicht nur Syntax

Mit n8n lassen sich Workflows so modellieren, dass an jedem Schritt Geschäftsregeln und DSGVO-relevante Prüfungen erfolgen.


# n8n Workflow: USt-IdNr. prüfen vor Rechnungsversand
- name: kunde_abrufen
  type: postgres
  params: {query: "SELECT ust_id FROM kunden WHERE id = $id"}
- name: validate_ust_id
  type: function
  params: {code: "if (!isValidUStId(item.ust_id)) { throw Error('Ungültige USt-Id') }"}
- name: rechnung_versenden
  type: http
  params: {url: "https://api.invoice/send"}

Fehler bei der Validierung stoppen den Workflow und verhindern Compliance-Verstöße.

Wo Standard-LLM-Agenten zu kurz greifen

AgententypStärkenDefizite
Standard-LLM-AgentCode-Generierung, Q&ABudget-/SLA-Bewusstsein, Validierung, Compliance
Agent mit Business-RegelnEinhaltung von Vorgaben, Geschäftsregel-PrüfungOft begrenzte Systemintegration
Hybrid: LLM + statische AnalyseFindet SQL-Injections, Token-Leaks (semgrep, bandit, gitleaks)Echtzeit-Bewertung von Geschäfts-KPIs

So sparen Sie Wochen an Produktivarbeit

1. Statische Codeanalyse in jeder Pipeline

Jeder Pull Request von Agenten-Code wird mit semgrep, bandit und gitleaks geprüft (semgrep, bandit). LLM-Agenten erzeugen regelmäßig subtile Schwachstellen, die nur so in CI/CD oder sogar direkt bei der Code-Generierung auffallen.


# semgrep + bandit in CI/CD
semgrep --config=python .
bandit -r .
gitleaks detect

Bei einer aktuellen Bereitstellung wurden so 5 kritische Token-Leaks vor dem Go-Live gefunden.

2. Agentenrollen trennen — keine All-in-One-Agenten

Ich trenne bewusst: Ein Agent für Kommunikation, einer für Dokumentenprüfung, einer für Freigabe. Das begrenzt Fehler auf einzelne Schritte und vereinfacht die Nachvollziehbarkeit gegenüber Compliance-Anforderungen (z.B. DSGVO, Audit-Trails nach ISO 27001).


// n8n: spezialisierte Agenten je Prozessschritt
[
  { agent: "dokumentenpruefer", input: "rechnung.pdf" },
  { agent: "regelpruefer", input: "gepruefte_rechnung" },
  { agent: "benachrichtiger", input: "freigegebene_rechnung" }
]

3. Lückenlose Audit-Logs — jede Agentenaktion nachvollziehen

Alle Agentenaktionen schreibe ich in Supabase/Postgres, nicht nur ins stdout. Das erlaubt schnelles Troubleshooting, Compliance-Reports und BSI-konforme Nachverfolgung.


import supabase
# Agentenaktion loggen
supabase.table("agent_logs").insert({
   "agent": "regelpruefer",
   "action": "ust_id_pruefung",
   "status": "fail",
   "timestamp": datetime.now()
})

FAQ

Welches Analyse-Tool erkennt LLM-Agenten-Fehler am besten?

semgrep (https://semgrep.dev/) ist für Python von Claude/OpenAI am flexibelsten. Zusammen mit bandit (Security) und gitleaks (Secrets) decken Sie die meisten Risiken ab.

Wie geben Sie Agenten klare Geschäftsregeln mit?

Explizit im Prompt: Limits für Zeit, Budget, API-Calls, Fehlerbehandlung. Validierung in n8n-Workflows als separate Schritte oder Funktionen.

Wie loggen Sie Agentenaktionen DSGVO-konform?

Mit Supabase oder selbstgehostetem Postgres. Erfolgreiche und fehlerhafte Aktionen werden geloggt — so erfüllen Sie Audit-Pflichten gemäß DSGVO und ISO 27001.

Muss jede Geschäftsregel einen eigenen Agenten haben?

Nein, aber für kritische Schritte (Validierung, Freigabe, Versand) empfiehlt sich klare Rollentrennung. Das mindert Compliance-Risiken und vereinfacht Troubleshooting.

Wie prüfen Sie, dass ein Agent Geschäftsregeln nicht verletzt?

In n8n lassen sich Validierungsschritte (manuell oder automatisch) an jedem wichtigen Punkt ergänzen. Python/JS-Funktionen prüfen Limits in Echtzeit.

In welcher Phase scheitern Ihre Agenten am häufigsten — Codegenerierung, Systemintegration oder Geschäftslogik-Validierung? Mich interessiert Ihre Erfahrung.

Ich biete einen kostenlosen 30-min Stack-Audit für DACH-Unternehmen mit KI-Projekten in regulierten Märkten. Kontaktieren Sie mich auf LinkedIn oder via @ger_dennis_ai.

Weiterlesen
OpenAI und Anthropic knacken ein Jahrtausendproblem: Wie 10.000 KI-Agenten Navier–Stokes in 88 Stunden lösten – und was das für Ihr Unternehmen bedeutet
Wie OpenAI und Anthropic Mathematik automatisierten: 10.000 Agenten lösten ein Jahrtausendproblem in 88 Stunden
GPT-6 Astra verbrennt Ihre Limits in 15 Minuten: Warum OpenAIs Top-Modell selbst für Pro-Pläne unbrauchbar ist
90 % weniger Token-Kosten: Wie ProjectAtlas KI-Coding-Agenten im Produktivbetrieb effizient macht
Alle Artikel →
Wo das im Betrieb ankommt
KI-Telefonassistent — Anrufe annehmen, wenn niemand kann
KI-Automatisierung für Betriebe in Freiburg und der Ortenau
DSGVO-konforme KI — was das praktisch bedeutet
Bereit für den nächsten Schritt?

Aus einem Ablauf ein System machen, das läuft

Gebaut für den Betriebsalltag, nicht als Demo.

Projekt anfragen → ← Alle Artikel