KI-Agenten-Kosten senken: Automatisches Routing zwischen kostenlosen und Premium-Modellen (Claude Code, Codex u.a.)
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. Ich liefere mit DennisCraft AI Studio produktive KI-Systeme für DACH-B2B-Kunden, basierend auf Claude, Supabase, n8n, Doppler, eigenem Postgres. In fast jedem Projekt stellt sich die Frage: „Warum explodieren unsere LLM-Kosten, und wie kann man Qualität und Compliance sichern – aber günstiger?“ Hier zeige ich Ihnen mein praxiserprobtes Muster, das die Inferenzkosten um über 60 % senkt – ohne Qualitätsverluste, DSGVO- oder EU-
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. Ich liefere mit DennisCraft AI Studio produktive KI-Systeme für DACH-B2B-Kunden, basierend auf Claude, Supabase, n8n, Doppler, eigenem Postgres. In fast jedem Projekt stellt sich die Frage: „Warum explodieren unsere LLM-Kosten, und wie kann man Qualität und Compliance sichern – aber günstiger?“ Hier zeige ich Ihnen mein praxiserprobtes Muster, das die Inferenzkosten um über 60 % senkt – ohne Qualitätsverluste, DSGVO- oder EU-AI-Act-Konflikte.
Kostentreiber im Produktivbetrieb: Zu viel Premium
Im Alltag von Logistik, Fintech und Industrieautomation sind 80–90 % der KI-Requests Routinefälle: Parsing, CRUD, einfache SQL-Generierung. Dennoch schicken Unternehmen 100 % der Anfragen an Claude Code, GPT-4o oder Codex. In drei aktuellen Projekten (Q1/Q2 2024) waren aber nur 13 % der Tasks wirklich auf Premium angewiesen; der Rest funktioniert stabil mit Open-Source-Modellen wie StarCoder, Code Llama oder Deepseek Coder – komplett ohne API-Gebühren. Ohne differenziertes Routing zahlen Sie für Rechenleistung, die Sie gar nicht brauchen.
Technisches Muster: Automatisches Modell-Routing
Der entscheidende Hebel: Das Agentensystem entscheidet pro Task, ob ein kostenloses Modell ausreicht oder ein Premiummodell (Claude Code, Anthropic API) angefragt wird. Die Pipeline gliedert sich in drei Phasen:
- Task-Klassifikation („kostenlos“ vs. „Premium“)
- Inferenz auf gewähltem Modell (on-prem oder Cloud)
- Qualitätsprüfung (Statischer Code-Check, Tests, Ranking)
1. Task-Klassifikation
Die Klassifikation erfolgt über ein leichtgewichtiges LLM (z. B. Phi-3 oder DistilBERT). Der Klassifizierer erhält Prompt/Code/Task und gibt ein Label zurück: „Sicher für Free-Modell“ oder „Muss zu Premium“. Das Training basiert auf echten Logs, die nach Fehlern oder Sicherheitsrisiken im Open-Source-Modell manuell markiert wurden. So bleiben False Positives gering und Compliance gesichert.
def classify_task(task: str) -> str:
from transformers import pipeline
classifier = pipeline("text-classification", model="distilbert-base-uncased")
label = classifier(task)[0]['label']
if label == "SAFE":
return "FREE"
return "PREMIUM"
2. Routing und Inferenz
Das Routing übernimmt n8n oder ein dedizierter FastAPI-Router. Tasks mit „FREE“-Label gehen an ein self-hosted StarCoder- oder Deepseek-Coder-Modell (über vLLM im Docker-Container, on-prem oder z. B. Hetzner-GPU). „PREMIUM“-Tasks werden per API an Claude Code (Anthropic) gesendet. Jede lokale Inferenz läuft isoliert, Ausgaben werden nachgelagert geprüft, bevor sie ins Produktivsystem gelangen.
def route_and_infer(task, code_input):
route = classify_task(task)
if route == "FREE":
return call_local_model(code_input)
else:
return call_claude_api(code_input)
3. Qualitätsprüfung: Statische Analyse und Tests
Jede Code-Generierung wird geprüft. Für Python verwende ich semgrep, bandit und gitleaks. SQL-Outputs werden gegen OWASP-Top-10-Schwachstellen getestet. Nur geprüfter Code wird ausgegeben; sicherheitskritische Fälle (z. B. Fintech-API) laufen immer über Premiummodell und manuelle Abnahme. Das entspricht den Vorgaben von DSGVO und EU AI Act für automatisierte Systeme.
semgrep --config=python .
bandit -r .
gitleaks detect --source=.
Direktvergleich: Kosten und Qualität
| Modell | Kosten | Latenz | Code-Qualität (Autotests bestanden) |
|---|---|---|---|
| StarCoder (self-hosted) | 0 € | 2–3 s | 87 % |
| Claude Code (Anthropic API) | ~8 $ pro 1 Mio. Token | 5–6 s | 98 % |
| Deepseek Coder (self-hosted) | 0 € | 3–4 s | 83 % |
Bei zwei DACH-B2B-Kunden reduzierte dieses Routing die Inferenzkosten um 67 %, ohne Qualitätseinbußen. Monitoring erfolgt mit Supabase und Grafana, alle Logs bleiben im EU-Raum.
Stack: Supabase, n8n, Postgres im regulierten Umfeld
Supabase speichert Logs und Trainingsdaten für den Klassifizierer. n8n steuert Workflows, Routing, Logging und Benachrichtigungen. Postgres hält Metadaten, Audit-Trails und Analyseergebnisse. Diese Architektur ist mit DSGVO, BSI Grundschutz und (bei On-Premises-Betrieb) dem EU AI Act konform: Sensitive Daten verlassen das Rechenzentrum nicht, bevor klar ist, ob der Task an die Cloud gehen muss.
FAQ
Wie wird der Schwellenwert für die Klassifikation festgelegt?
Ich starte vorsichtig: Alle unsicheren Tasks gehen direkt an das Premiummodell. Schwellenwerte werden erst nach Auswertung der Fehlerraten angepasst.
Welche Open-Source-Modelle sind im Alltag einsetzbar?
StarCoder, Code Llama, Deepseek Coder, Phi-3. Die Auswahl hängt von Sprache und Anwendungsfall ab. Für Python und SQL bewährt sich StarCoder.
Wie sichern Sie Code-Qualität bei Free-Modellen?
Durchgehende Unit-Tests, statische Analysen, manuelle Abnahme bei kritischen Fällen. Kein Output gelangt ohne Freigabe in die Produktion.
Wie messen Sie die Kosteneinsparung?
Tokenverbrauch und API-Kosten werden pro Agent erfasst und mit dem reinen Premium-Baseline verglichen. Visualisierung erfolgt in Grafana oder Supabase.
Wie hoch ist der Implementierungsaufwand?
Pilot: 2–3 Wochen mit Docker-, vLLM- und DevOps-Erfahrung. Danach skalierbar auf beliebige B2B-Use-Cases.
In welcher Pipeline-Phase entstehen bei Ihnen die meisten Prod-Fehler – Klassifikation, statische Analyse oder menschliche Abnahme? Ich freue mich auf den Austausch. Ich biete DACH-Teams, die KI im regulierten Umfeld bauen, einen kostenlosen 30-Minuten-Stack-Check an. Kontaktieren Sie mich auf LinkedIn oder bei @ger_dennis_ai.
Turn your process into an AI system
Fixed price. Production quality. DACH B2B focus.