Über mich Portfolio Referenzen Leistungen Blog Kontakt 🎙 Mit KI sprechen
EN DE RU
🎙 Mit KI sprechen
August 4, 2026 · 3 min read

KI-Agenten-Kosten senken: Automatisches Routing zwischen kostenlosen und Premium-Modellen (Claude Code, Codex u.a.)

von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. Ich liefere mit DennisCraft AI Studio produktive KI-Systeme für DACH-B2B-Kunden, basierend auf Claude, Supabase, n8n, Doppler, eigenem Postgres. In fast jedem Projekt stellt sich die Frage: „Warum explodieren unsere LLM-Kosten, und wie kann man Qualität und Compliance sichern – aber günstiger?“ Hier zeige ich Ihnen mein praxiserprobtes Muster, das die Inferenzkosten um über 60 % senkt – ohne Qualitätsverluste, DSGVO- oder EU-

Denis Shokhirev
Denis Shokhirev
Agentic AI Systems Architect
Telegram LinkedIn

von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. Ich liefere mit DennisCraft AI Studio produktive KI-Systeme für DACH-B2B-Kunden, basierend auf Claude, Supabase, n8n, Doppler, eigenem Postgres. In fast jedem Projekt stellt sich die Frage: „Warum explodieren unsere LLM-Kosten, und wie kann man Qualität und Compliance sichern – aber günstiger?“ Hier zeige ich Ihnen mein praxiserprobtes Muster, das die Inferenzkosten um über 60 % senkt – ohne Qualitätsverluste, DSGVO- oder EU-AI-Act-Konflikte.

Kostentreiber im Produktivbetrieb: Zu viel Premium

Im Alltag von Logistik, Fintech und Industrieautomation sind 80–90 % der KI-Requests Routinefälle: Parsing, CRUD, einfache SQL-Generierung. Dennoch schicken Unternehmen 100 % der Anfragen an Claude Code, GPT-4o oder Codex. In drei aktuellen Projekten (Q1/Q2 2024) waren aber nur 13 % der Tasks wirklich auf Premium angewiesen; der Rest funktioniert stabil mit Open-Source-Modellen wie StarCoder, Code Llama oder Deepseek Coder – komplett ohne API-Gebühren. Ohne differenziertes Routing zahlen Sie für Rechenleistung, die Sie gar nicht brauchen.

Technisches Muster: Automatisches Modell-Routing

Der entscheidende Hebel: Das Agentensystem entscheidet pro Task, ob ein kostenloses Modell ausreicht oder ein Premiummodell (Claude Code, Anthropic API) angefragt wird. Die Pipeline gliedert sich in drei Phasen:

  • Task-Klassifikation („kostenlos“ vs. „Premium“)
  • Inferenz auf gewähltem Modell (on-prem oder Cloud)
  • Qualitätsprüfung (Statischer Code-Check, Tests, Ranking)

1. Task-Klassifikation

Die Klassifikation erfolgt über ein leichtgewichtiges LLM (z. B. Phi-3 oder DistilBERT). Der Klassifizierer erhält Prompt/Code/Task und gibt ein Label zurück: „Sicher für Free-Modell“ oder „Muss zu Premium“. Das Training basiert auf echten Logs, die nach Fehlern oder Sicherheitsrisiken im Open-Source-Modell manuell markiert wurden. So bleiben False Positives gering und Compliance gesichert.


def classify_task(task: str) -> str:
    from transformers import pipeline
    classifier = pipeline("text-classification", model="distilbert-base-uncased")
    label = classifier(task)[0]['label']
    if label == "SAFE":
        return "FREE"
    return "PREMIUM"

2. Routing und Inferenz

Das Routing übernimmt n8n oder ein dedizierter FastAPI-Router. Tasks mit „FREE“-Label gehen an ein self-hosted StarCoder- oder Deepseek-Coder-Modell (über vLLM im Docker-Container, on-prem oder z. B. Hetzner-GPU). „PREMIUM“-Tasks werden per API an Claude Code (Anthropic) gesendet. Jede lokale Inferenz läuft isoliert, Ausgaben werden nachgelagert geprüft, bevor sie ins Produktivsystem gelangen.


def route_and_infer(task, code_input):
    route = classify_task(task)
    if route == "FREE":
        return call_local_model(code_input)
    else:
        return call_claude_api(code_input)

3. Qualitätsprüfung: Statische Analyse und Tests

Jede Code-Generierung wird geprüft. Für Python verwende ich semgrep, bandit und gitleaks. SQL-Outputs werden gegen OWASP-Top-10-Schwachstellen getestet. Nur geprüfter Code wird ausgegeben; sicherheitskritische Fälle (z. B. Fintech-API) laufen immer über Premiummodell und manuelle Abnahme. Das entspricht den Vorgaben von DSGVO und EU AI Act für automatisierte Systeme.


semgrep --config=python .
bandit -r .
gitleaks detect --source=.

Direktvergleich: Kosten und Qualität

Modell Kosten Latenz Code-Qualität (Autotests bestanden)
StarCoder (self-hosted) 0 € 2–3 s 87 %
Claude Code (Anthropic API) ~8 $ pro 1 Mio. Token 5–6 s 98 %
Deepseek Coder (self-hosted) 0 € 3–4 s 83 %

Bei zwei DACH-B2B-Kunden reduzierte dieses Routing die Inferenzkosten um 67 %, ohne Qualitätseinbußen. Monitoring erfolgt mit Supabase und Grafana, alle Logs bleiben im EU-Raum.

Stack: Supabase, n8n, Postgres im regulierten Umfeld

Supabase speichert Logs und Trainingsdaten für den Klassifizierer. n8n steuert Workflows, Routing, Logging und Benachrichtigungen. Postgres hält Metadaten, Audit-Trails und Analyseergebnisse. Diese Architektur ist mit DSGVO, BSI Grundschutz und (bei On-Premises-Betrieb) dem EU AI Act konform: Sensitive Daten verlassen das Rechenzentrum nicht, bevor klar ist, ob der Task an die Cloud gehen muss.

FAQ

Wie wird der Schwellenwert für die Klassifikation festgelegt?

Ich starte vorsichtig: Alle unsicheren Tasks gehen direkt an das Premiummodell. Schwellenwerte werden erst nach Auswertung der Fehlerraten angepasst.

Welche Open-Source-Modelle sind im Alltag einsetzbar?

StarCoder, Code Llama, Deepseek Coder, Phi-3. Die Auswahl hängt von Sprache und Anwendungsfall ab. Für Python und SQL bewährt sich StarCoder.

Wie sichern Sie Code-Qualität bei Free-Modellen?

Durchgehende Unit-Tests, statische Analysen, manuelle Abnahme bei kritischen Fällen. Kein Output gelangt ohne Freigabe in die Produktion.

Wie messen Sie die Kosteneinsparung?

Tokenverbrauch und API-Kosten werden pro Agent erfasst und mit dem reinen Premium-Baseline verglichen. Visualisierung erfolgt in Grafana oder Supabase.

Wie hoch ist der Implementierungsaufwand?

Pilot: 2–3 Wochen mit Docker-, vLLM- und DevOps-Erfahrung. Danach skalierbar auf beliebige B2B-Use-Cases.

In welcher Pipeline-Phase entstehen bei Ihnen die meisten Prod-Fehler – Klassifikation, statische Analyse oder menschliche Abnahme? Ich freue mich auf den Austausch. Ich biete DACH-Teams, die KI im regulierten Umfeld bauen, einen kostenlosen 30-Minuten-Stack-Check an. Kontaktieren Sie mich auf LinkedIn oder bei @ger_dennis_ai.

Weiterlesen
Wie Sie in 1 Tag aus Codechaos einen abfragbaren Wissensgraphen bauen: Das Graphify-Prinzip
Ihr KI-Agent kann über Plugins kompromittiert werden: So sichern Sie Claude Code und Codex Skills im Produktivbetrieb
OpenAI Codex: Plötzliche Quoten-Resets nach unerwarteten Drains – So schützen Sie Ihre Produktivsysteme vor API-Limit-Schocks
172 produktionsreife Claude Code Skills: So beschleunigen Sie die Integration von KI-Agenten in Geschäftsprozesse – ohne Schmerzen
Alle Artikel →
Ready to build?

Turn your process into an AI system

Fixed price. Production quality. DACH B2B focus.

Start a project → ← All articles