Privaten LLM-Cluster für Ihr Team ohne DevOps-Overkill bereitstellen: Ein erprobtes Muster
von Denis Shokhirev, Enterprise AI Architect aus Erlangen. In meinem DennisCraft AI Studio realisiere ich produktive LLM-Agenten für DACH-B2B-Kunden, mit Stack: Claude, Supabase, n8n, Doppler, eigener Postgres. Jedes Mal, wenn ein Team einen privaten LLM-Cluster braucht, tauchen dieselben DevOps-Hürden auf. Standard-Anleitungen scheitern spätestens bei DSGVO oder internen Policies. So stelle ich einen stabilen, auditierbaren LLM-Cluster produktiv bereit – mit nachvollziehbaren Tools, erprobt im
von Denis Shokhirev, Enterprise AI Architect aus Erlangen. In meinem DennisCraft AI Studio realisiere ich produktive LLM-Agenten für DACH-B2B-Kunden, mit Stack: Claude, Supabase, n8n, Doppler, eigener Postgres. Jedes Mal, wenn ein Team einen privaten LLM-Cluster braucht, tauchen dieselben DevOps-Hürden auf. Standard-Anleitungen scheitern spätestens bei DSGVO oder internen Policies. So stelle ich einen stabilen, auditierbaren LLM-Cluster produktiv bereit – mit nachvollziehbaren Tools, erprobt im Produktivbetrieb.
Warum kein SaaS? DSGVO, Auditierbarkeit und interne Richtlinien
Die schnelle Lösung scheint der API-Zugriff auf OpenAI oder Anthropic. Doch sobald Daten im Unternehmen verbleiben oder Audits nachvollziehbare Inferenzlogs verlangen, ist SaaS keine Option mehr. In der DACH-Region geben DSGVO, BSI Grundschutz und teils der EU AI Act den Takt vor. In drei meiner letzten Projekte war On-Premise-Inferenz Pflicht – kein Datenabfluss, keine Cloud.
Vergleich der Ansätze
| Ansatz | Vorteile | Nachteile |
|---|---|---|
| SaaS LLM API | Schnell, keine Infrastruktur | Datenabfluss, keine Kontrolle, nicht auditierbar |
| Self-hosted LLM | Datenschutz, Kontrolle, Compliance | Hoher DevOps-Aufwand, Wartung |
| Privater Cluster (Kubernetes/Docker Compose) | Balance aus Flexibilität und Stabilität | Erfordert Setup und Monitoring |
Minimal-Stack für einen privaten LLM-Cluster
Mein Ziel: Ein LLM-Cluster, den jede:r Entwickler:in im Unternehmen einfach nutzen kann, ohne Kompromisse bei Datenschutz oder Wartbarkeit.
- API-Endpunkt im Intranet für alle Teams
- Komplette Inferenz bleibt intern
- Monitoring/Auditing ohne dediziertes SRE-Team
- Modell-Updates ohne Downtime
Setzen Sie auf:
- Modell: Llama-3 oder Mixtral (im GGUF/ggml-Format, kompatibel mit vLLM, llama.cpp)
- Inference-Server: llama.cpp, vLLM, Ollama (Open Source, produktiv erprobt)
- Orchestrierung: Docker Compose für den Einstieg, Kubernetes für Skalierung
- Authentifizierung: nginx Reverse Proxy mit JWT (an Firmen-OAuth koppelbar)
- Monitoring: Prometheus + Grafana (CPU/GPU, Latenz, Fehler)
- CI/CD: GitHub Actions oder GitLab CI für automatische Deployments
Keine fiktiven Tools, nur reale Komponenten
Wenn eine Anleitung einen „X LLM Gateway“ oder „Y Governor“ empfiehlt: Googlen Sie nach echten Projekten. 90% davon sind SEO-Fiktionen. Setzen Sie ausschließlich auf Open Source mit echter Doku und Nutzererfahrung.
Schritt für Schritt: Vom leeren Server zum LLM-API-Endpunkt
1. Modellbeschaffung
Für Llama-3: Quantisierte GGUF-Modelle von HuggingFace oder Meta (offizielle Quelle). Beispiel:
wget https://huggingface.co/meta-llama/Meta-Llama-3-8B-GGUF/resolve/main/llama-3-8b.Q4_K_M.gguf -O models/llama-3-8b.Q4_K_M.gguf
2. Inference-Server starten (llama.cpp mit API)
llama.cpp bietet eine REST-API out-of-the-box. Beispiel für 8B-Modell auf GPU:
docker run --gpus all -d --name llama-api \
-v $(pwd)/models:/models \
-p 8080:8080 \
ghcr.io/ggerganov/llama.cpp:latest \
--model /models/llama-3-8b.Q4_K_M.gguf \
--host 0.0.0.0 --port 8080 --api
3. Authentifizierung: JWT-Proxy via nginx
nginx validiert JWT-Tokens vor Weiterleitung. Konfig-Fragment:
location / {
auth_jwt "LLM API";
auth_jwt_key_file /etc/nginx/secrets/jwt_public.pem;
proxy_pass http://llama-api:8080;
}
4. Monitoring und Alarmierung
Prometheus-Exporter (direkt oder als Sidecar), Alerts auf Latenz und Fehlerhäufung per Alertmanager an Slack oder E-Mail.
5. CI/CD: Automatische Modell-Deployments
Mit GitHub Actions oder GitLab CI: Modell-Updates und Container-Restarts automatisieren.
name: Deploy LLM Model
on: [push]
jobs:
deploy:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v4
- name: Deploy to server
run: ssh $HOST 'docker pull ... && docker restart llama-api'
Sicherheit: Wo echte Schwachstellen auftauchen
Die OWASP Top 10 for LLM (2024, owasp.org) listen Prompt Injection, Datenabfluss und Rechteausweitung als Kernrisiken. In meinen letzten drei Projekten traten wiederholt auf:
- Prompt Injection durch Nutzereingaben
- Logging sensibler Prompts und Antworten
- Unzureichende Container-Isolation (vor allem bei Plugin-Nutzung)
Meine Praxis:
- semgrep für statische Codeanalyse der API-Logik
- bandit für Python-Skripte
- gitleaks für Geheimnisse im Repository
- Nur Hashes von Prompts/Antworten loggen, nie Klartext
FAQ
Welches Modell schafft realistisch 10+ parallele Nutzer auf einer GPU?
Llama-3 8B oder Mixtral-8x7B auf einer A100 40GB liefern unter 1s Latenz bei 10 parallelen Anfragen. Für kleinere GPUs: 4-Bit-Quantisierung.
Wie kann ich Modelle ohne API-Downtime aktualisieren?
Neuen Container mit neuem Modell hochfahren, Proxy-Umschaltung nach erfolgreichem Healthcheck. Bestehender API-Endpoint bleibt bis zum Wechsel aktiv.
Lässt sich das Setup in n8n oder Supabase einbinden?
Ja, via HTTP-Requests. Für Supabase einen REST-Endpoint bereitstellen, in n8n mit HTTP Request Node anbinden.
Worauf sollte das Monitoring achten?
Prometheus + Grafana, Alerts bei Latenz >2s, Fehlerhäufung oder GPU-Auslastung <10% (häufig Anzeichen von Memory Leaks oder Hängern).
Welches CI/CD eignet sich für LLM-Cluster?
GitHub Actions für schnelle Prototypen, GitLab CI mit eigenen Runnern ist produktionssicherer.
In welcher Phase erkennen Sie die meisten Fehler oder Ausfälle im LLM-Cluster – beim Deployment, zur Laufzeit oder bei der Integration? Schreiben Sie mir. Ich biete einen kostenfreien 30-min Stack-Audit für DACH-Unternehmen mit KI-Produkten unter Regulatorik an. Kontaktieren Sie mich auf LinkedIn oder via @ger_dennis_ai.
Turn your process into an AI system
Fixed price. Production quality. DACH B2B focus.