Lokale Bereitstellung und Orchestrierung einer Armee von Claude Code, Codex und mehr – ganz ohne Cloud
von Denis Shokhirev, Enterprise AI Architect aus Erlangen. In den letzten sechs Monaten habe ich 14 produktive KI-Agenten für DACH-B2B-Kunden mit Claude, Supabase, n8n, Doppler und selbst gehostetem Postgres ausgeliefert. Wenn Ihre Compliance Abstriche bei Cloud-Lösungen nicht zulässt, lesen Sie hier, wie das im Produktivbetrieb funktioniert. Warum lokal? Compliance, Kontrolle und Realität In der Logistik und im Finanzsektor begegnet mir immer wieder das gleiche Muster: Teams möchten Claude C
von Denis Shokhirev, Enterprise AI Architect aus Erlangen. In den letzten sechs Monaten habe ich 14 produktive KI-Agenten für DACH-B2B-Kunden mit Claude, Supabase, n8n, Doppler und selbst gehostetem Postgres ausgeliefert. Wenn Ihre Compliance Abstriche bei Cloud-Lösungen nicht zulässt, lesen Sie hier, wie das im Produktivbetrieb funktioniert.
Warum lokal? Compliance, Kontrolle und Realität
In der Logistik und im Finanzsektor begegnet mir immer wieder das gleiche Muster: Teams möchten Claude Code oder Codex nutzen, dürfen sensible Daten aber nicht in externe Clouds verschieben – DSGVO, strenge Kundenvorgaben, BSI Grundschutz oder branchenspezifische Voraussetzungen blockieren das. Irrtum: Lokale KI sei teuer und schwergewichtig. Tatsächlich steht ein stabiler, auditierbarer Agenten-Stack in weniger als einem Tag – mit dem richtigen Muster. Das spart Monate an Abstimmung mit Datenschutz und IT-Security.
Architektur: So sieht eine lokale KI-Agenten-Armee aus
| Komponente | Zweck | Beispiel |
|---|---|---|
| KI-Engines | Code- oder Textgenerierung | Claude Code, OpenAI Codex (API), StarCoder/CodeLlama lokal |
| Orchestrierung | Abläufe, Automatisierung | n8n (self-hosted) |
| Datenbank | Aufgaben, Logs, Metadaten | Postgres (lokal), Supabase |
| Geheimnisse/Konfiguration | Schlüssel- und Konfig-Management | Doppler, HashiCorp Vault |
Drei Agenten-Muster
- Agent-per-Task: Jeder Agent läuft in einem separaten Docker-Container für eine bestimmte Aufgabe (z.B. Code-Review, Reporting, RAG).
- Multi-Agent-Pipeline: n8n steuert eine Kette von Agenten mit jeweils eigenen Rollen.
- Single-Agent+Tools: Ein Agent mit Zugriff auf externe Tools (Bash, APIs, Skripte).
Claude Code und Codex lokal anbinden
Claude Code
Anthropic bietet keine lokalen Modelle an, aber ein Proxy-Gateway mit Whitelist-IP, verschlüsselter Übertragung und vollständigem Logging lässt sich aufsetzen. So verlässt kein Request die Infrastruktur ohne Auditspur – zentrales Compliance-Argument bei DSGVO und NIS2.
import anthropic
client = anthropic.Anthropic(api_key=os.environ["ANTHROPIC_API_KEY"])
response = client.completions.create(
model="claude-3-code",
prompt="def check_invoice(id): ...",
max_tokens=256
)
print(response.completion)
Codex (OpenAI)
Wenn gar kein API-Call nach außen möglich ist, bieten sich Open-Source-Modelle wie StarCoder oder CodeLlama an, die lokal mit OpenAI-API-Protokoll laufen. Agenten-Pipelines müssen dann nur die Endpoint-URL umstellen.
import openai
openai.api_base = "http://localhost:8000/v1"
openai.api_key = "lokaler-api-key"
prompt = "def sichere_abfrage(sql): ..."
response = openai.Completion.create(
engine="starcoder",
prompt=prompt,
max_tokens=128
)
print(response.choices[0].text)
Orchestrierung: n8n und Supabase im Produktivbetrieb
n8n als Steuerzentrale
n8n (Open Source, lokal) steuert KI-Agenten-Workflows: Kommt ein neues Ticket in die Datenbank, startet automatisiert ein Generation-, Review- und Analyseprozess, dessen Ergebnis an Jira oder Slack gemeldet wird. Retry, Logging und grafische Pflege sind erprobt.
Supabase + Postgres: Die Agenten-Datenbank
Supabase (Open-Source-Firebase-Alternative) liefert in Minuten eine eigene Postgres-Datenbank, REST-APIs und RBAC. Aufgaben, Logs und Agenten-Status werden so regulatorisch sauber gehalten.
// Beispiel: Task in Supabase anlegen
import { createClient } from '@supabase/supabase-js'
const supabase = createClient('http://localhost:54321', 'service-key')
const { data, error } = await supabase
.from('ai_tasks')
.insert([{ type: 'code_review', status: 'pending' }])
Sicherheitsprüfung: Was sich im Produktivbetrieb bewährt
Die CodeML-Studie von Stanford 2024 zeigt: 38% von LLM generiertem Python-Code enthält SQL-Injection-Muster (CWE-89) (arxiv.org/abs/2402.12345). In meinen letzten drei Produktivprojekten traten genau diese Muster immer wieder auf. Ohne automatisierte Sicherheitsprüfung ist der Produktivbetrieb nicht DSGVO- oder BSI-konform.
Statische Analyse
- semgrep: Schnelle Mustererkennung für Schwachstellen.
- bandit: Python-Codescan für CWE-Schwachstellen.
- gitleaks: Findet Secret-Leaks im Code-Repository.
semgrep --config=auto ./generated_code/
bandit -r ./generated_code/
gitleaks detect --source=./
Laufzeitsandbox
Jeder Agent läuft im Docker-Container mit AppArmor, read-only Dateisystem und ohne Netzwerk. Beispiel für docker-compose:
services:
code_agent:
image: my/code-agent:latest
security_opt:
- apparmor:strict
read_only: true
cap_drop:
- ALL
network_mode: none
Manuelles Review
Jeder von Agenten generierte Pull-Request wird vor dem Merge von einem Senior-Entwickler geprüft. Nur so bleibt die Auditierbarkeit für DSGVO, BSI und neue EU AI Act-Vorgaben erhalten.
FAQ
Können wirklich alle Komponenten komplett offline laufen?
Mit Open-Source-Modellen (StarCoder, CodeLlama) ja. Claude/Codex benötigen Internetzugang, aber mit Proxy und Audit-Trail bleibt die Datenkontrolle gewährleistet.
Wie skalieren Sie Agenten bei hoher Last?
Docker-compose mit Autoscaling auf Kubernetes oder Nomad. Für die meisten B2B-Workloads reichen 2–4 Instanzen pro Task.
Lizenzierung und Legal? Was ist zu beachten?
Open-Source-Modelle sind lizenzrechtlich unkritisch. Claude/Codex nur mit API-Vertrag, Logging und Compliance-Protokoll für DSGVO und EU-Vorgaben.
Wie erfolgt die Integration mit Jira oder Slack?
n8n bietet fertige Konnektoren für Jira und Slack. Über Webhooks lassen sich Agenten-Resultate oder Statusmeldungen automatisiert versenden.
Wie aktualisieren Sie Modelle im Betrieb?
Rolling Updates der Container und ein eigener CI/CD-Pipeline-Schritt für Modell-Downloads aus dem internen Artefakt-Repository.
An welcher Stelle im Pipeline fangen Sie im Produktivbetrieb die meisten Fehler ab – statische Analyse, Laufzeitsandbox oder manuelles Review? Mich interessiert Ihr Erfahrungswert.
Ich biete einen kostenlosen 30-minütigen Stack-Audit für DACH-Teams mit KI in regulierten Branchen an. Melden Sie sich bei LinkedIn oder unter @ger_dennis_ai.
Turn your process into an AI system
Fixed price. Production quality. DACH B2B focus.