Über mich Portfolio Leistungen Blog Kontakt 🎙 Mit KI sprechen
EN DE RU
🎙 Mit KI sprechen
June 11, 2026 · 3 min read

Privaten LLM-Cluster für Ihr Team ohne DevOps-Overkill bereitstellen: Ein erprobtes Muster

von Denis Shokhirev, Enterprise AI Architect aus Erlangen. In meinem DennisCraft AI Studio realisiere ich produktive LLM-Agenten für DACH-B2B-Kunden, mit Stack: Claude, Supabase, n8n, Doppler, eigener Postgres. Jedes Mal, wenn ein Team einen privaten LLM-Cluster braucht, tauchen dieselben DevOps-Hürden auf. Standard-Anleitungen scheitern spätestens bei DSGVO oder internen Policies. So stelle ich einen stabilen, auditierbaren LLM-Cluster produktiv bereit – mit nachvollziehbaren Tools, erprobt im

Denis Shokhirev
Denis Shokhirev
Enterprise AI Architect
Telegram LinkedIn

von Denis Shokhirev, Enterprise AI Architect aus Erlangen. In meinem DennisCraft AI Studio realisiere ich produktive LLM-Agenten für DACH-B2B-Kunden, mit Stack: Claude, Supabase, n8n, Doppler, eigener Postgres. Jedes Mal, wenn ein Team einen privaten LLM-Cluster braucht, tauchen dieselben DevOps-Hürden auf. Standard-Anleitungen scheitern spätestens bei DSGVO oder internen Policies. So stelle ich einen stabilen, auditierbaren LLM-Cluster produktiv bereit – mit nachvollziehbaren Tools, erprobt im Produktivbetrieb.

Warum kein SaaS? DSGVO, Auditierbarkeit und interne Richtlinien

Die schnelle Lösung scheint der API-Zugriff auf OpenAI oder Anthropic. Doch sobald Daten im Unternehmen verbleiben oder Audits nachvollziehbare Inferenzlogs verlangen, ist SaaS keine Option mehr. In der DACH-Region geben DSGVO, BSI Grundschutz und teils der EU AI Act den Takt vor. In drei meiner letzten Projekte war On-Premise-Inferenz Pflicht – kein Datenabfluss, keine Cloud.

Vergleich der Ansätze

AnsatzVorteileNachteile
SaaS LLM APISchnell, keine InfrastrukturDatenabfluss, keine Kontrolle, nicht auditierbar
Self-hosted LLMDatenschutz, Kontrolle, ComplianceHoher DevOps-Aufwand, Wartung
Privater Cluster (Kubernetes/Docker Compose)Balance aus Flexibilität und StabilitätErfordert Setup und Monitoring

Minimal-Stack für einen privaten LLM-Cluster

Mein Ziel: Ein LLM-Cluster, den jede:r Entwickler:in im Unternehmen einfach nutzen kann, ohne Kompromisse bei Datenschutz oder Wartbarkeit.

  • API-Endpunkt im Intranet für alle Teams
  • Komplette Inferenz bleibt intern
  • Monitoring/Auditing ohne dediziertes SRE-Team
  • Modell-Updates ohne Downtime

Setzen Sie auf:

  • Modell: Llama-3 oder Mixtral (im GGUF/ggml-Format, kompatibel mit vLLM, llama.cpp)
  • Inference-Server: llama.cpp, vLLM, Ollama (Open Source, produktiv erprobt)
  • Orchestrierung: Docker Compose für den Einstieg, Kubernetes für Skalierung
  • Authentifizierung: nginx Reverse Proxy mit JWT (an Firmen-OAuth koppelbar)
  • Monitoring: Prometheus + Grafana (CPU/GPU, Latenz, Fehler)
  • CI/CD: GitHub Actions oder GitLab CI für automatische Deployments

Keine fiktiven Tools, nur reale Komponenten

Wenn eine Anleitung einen „X LLM Gateway“ oder „Y Governor“ empfiehlt: Googlen Sie nach echten Projekten. 90% davon sind SEO-Fiktionen. Setzen Sie ausschließlich auf Open Source mit echter Doku und Nutzererfahrung.

Schritt für Schritt: Vom leeren Server zum LLM-API-Endpunkt

1. Modellbeschaffung

Für Llama-3: Quantisierte GGUF-Modelle von HuggingFace oder Meta (offizielle Quelle). Beispiel:


wget https://huggingface.co/meta-llama/Meta-Llama-3-8B-GGUF/resolve/main/llama-3-8b.Q4_K_M.gguf -O models/llama-3-8b.Q4_K_M.gguf

2. Inference-Server starten (llama.cpp mit API)

llama.cpp bietet eine REST-API out-of-the-box. Beispiel für 8B-Modell auf GPU:


docker run --gpus all -d --name llama-api \
  -v $(pwd)/models:/models \
  -p 8080:8080 \
  ghcr.io/ggerganov/llama.cpp:latest \
  --model /models/llama-3-8b.Q4_K_M.gguf \
  --host 0.0.0.0 --port 8080 --api

3. Authentifizierung: JWT-Proxy via nginx

nginx validiert JWT-Tokens vor Weiterleitung. Konfig-Fragment:


location / {
  auth_jwt "LLM API";
  auth_jwt_key_file /etc/nginx/secrets/jwt_public.pem;
  proxy_pass http://llama-api:8080;
}

4. Monitoring und Alarmierung

Prometheus-Exporter (direkt oder als Sidecar), Alerts auf Latenz und Fehlerhäufung per Alertmanager an Slack oder E-Mail.

5. CI/CD: Automatische Modell-Deployments

Mit GitHub Actions oder GitLab CI: Modell-Updates und Container-Restarts automatisieren.


name: Deploy LLM Model
on: [push]
jobs:
  deploy:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v4
      - name: Deploy to server
        run: ssh $HOST 'docker pull ... && docker restart llama-api'

Sicherheit: Wo echte Schwachstellen auftauchen

Die OWASP Top 10 for LLM (2024, owasp.org) listen Prompt Injection, Datenabfluss und Rechteausweitung als Kernrisiken. In meinen letzten drei Projekten traten wiederholt auf:

  • Prompt Injection durch Nutzereingaben
  • Logging sensibler Prompts und Antworten
  • Unzureichende Container-Isolation (vor allem bei Plugin-Nutzung)

Meine Praxis:

  • semgrep für statische Codeanalyse der API-Logik
  • bandit für Python-Skripte
  • gitleaks für Geheimnisse im Repository
  • Nur Hashes von Prompts/Antworten loggen, nie Klartext

FAQ

Welches Modell schafft realistisch 10+ parallele Nutzer auf einer GPU?

Llama-3 8B oder Mixtral-8x7B auf einer A100 40GB liefern unter 1s Latenz bei 10 parallelen Anfragen. Für kleinere GPUs: 4-Bit-Quantisierung.

Wie kann ich Modelle ohne API-Downtime aktualisieren?

Neuen Container mit neuem Modell hochfahren, Proxy-Umschaltung nach erfolgreichem Healthcheck. Bestehender API-Endpoint bleibt bis zum Wechsel aktiv.

Lässt sich das Setup in n8n oder Supabase einbinden?

Ja, via HTTP-Requests. Für Supabase einen REST-Endpoint bereitstellen, in n8n mit HTTP Request Node anbinden.

Worauf sollte das Monitoring achten?

Prometheus + Grafana, Alerts bei Latenz >2s, Fehlerhäufung oder GPU-Auslastung <10% (häufig Anzeichen von Memory Leaks oder Hängern).

Welches CI/CD eignet sich für LLM-Cluster?

GitHub Actions für schnelle Prototypen, GitLab CI mit eigenen Runnern ist produktionssicherer.

In welcher Phase erkennen Sie die meisten Fehler oder Ausfälle im LLM-Cluster – beim Deployment, zur Laufzeit oder bei der Integration? Schreiben Sie mir. Ich biete einen kostenfreien 30-min Stack-Audit für DACH-Unternehmen mit KI-Produkten unter Regulatorik an. Kontaktieren Sie mich auf LinkedIn oder via @ger_dennis_ai.

Ready to build?

Turn your process into an AI system

Fixed price. Production quality. DACH B2B focus.

Start a project → ← All articles