OpenAI Dots: Ihr KI-Agent arbeitet rund um die Uhr – auch offline. Wie Sie bereitstellen und welche Risiken für Ihr Unternehmen bestehen
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. Bei DennisCraft AI Studio entwickle ich autonome Multi-Agent-Systeme für DACH-B2B-Kunden (Logistik, Fintech, industrielle Automatisierung). Mein Stack: Claude, Supabase, n8n, Doppler, self-hosted Postgres. KI-Agenten laufen in produktiven Umgebungen rund um die Uhr – auch wenn kein Mensch aktiv überwacht. Genau dort entstehen die echten Risiken und regulatorischen Anforderungen. Warum „24/7-Agenten“ mehr sind als Chatbots
von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. Bei DennisCraft AI Studio entwickle ich autonome Multi-Agent-Systeme für DACH-B2B-Kunden (Logistik, Fintech, industrielle Automatisierung). Mein Stack: Claude, Supabase, n8n, Doppler, self-hosted Postgres. KI-Agenten laufen in produktiven Umgebungen rund um die Uhr – auch wenn kein Mensch aktiv überwacht. Genau dort entstehen die echten Risiken und regulatorischen Anforderungen.
Warum „24/7-Agenten“ mehr sind als Chatbots
In Demos laufen KI-Systeme oft nur manuell oder mit Testdaten. Im Produktivbetrieb verarbeiten Agenten echte Geschäftsereignisse, greifen auf Kundenschnittstellen zu, schreiben direkt in Postgres und orchestrieren Prozesse via n8n – alles automatisiert. Ein Beispiel ist mein öffentlicher Agent unter live.gerdennisai.com mit Live-Transparenz.
- Der Agent wartet nicht – er überwacht, erkennt und handelt selbstständig.
- Stabilität bei Fehlern, Datenabweichungen und Cloud-Ausfällen ist Pflicht.
- Entscheidend ist nicht die Demo, sondern die Einhaltung von SLA, Auditierbarkeit und Compliance.
Architektur: So funktionieren OpenAI Dots produktiv
1. Ereignisgesteuerte Pipeline
Das Grundmuster: Ereignisse (z.B. Bestellung, Anomalie, E-Mail) landen in einer Queue (Supabase Realtime oder Webhook zu n8n). Der Agent übernimmt die Aufgabe und startet Workflows. Alle Aktionen und Kontexte werden in einer self-hosted Postgres-Datenbank für vollständige Rückverfolgbarkeit protokolliert – ein Muss für DSGVO, BSI und ISO 27001.
import supabase_py
from n8n_python import N8NClient
supabase = supabase_py.create_client(url, key)
n8n = N8NClient(api_url, token)
# Neue Ereignisse abrufen
events = supabase.table('events').select('*').execute()
for event in events.data:
if event['type'] == 'order_created':
n8n.trigger_workflow('process-order', payload=event)
2. Orchestrierung mit n8n und Claude
n8n steuert Integrationen und Prozessschritte. Claude (API) übernimmt Sprachverarbeitung und Entscheidungslogik. Doppler verwaltet Secrets, um Token-Leaks auszuschließen. Zustand und Logs werden stets in Postgres gespeichert – für Recovery und Compliance.
- n8n: Orchestrierung von externen API-Aufrufen und Workflows
- Claude: Sprachmodelle, promptgesteuerte Aktionen
- Supabase/Postgres: Zustandsmanagement, Logging, Audit-Trail
3. Überwachung, Idempotenz, Rollbacks
Idempotenz ist zwingend – Agenten müssen Ereignisse wiederholt verarbeiten können, ohne doppelte Effekte zu verursachen. Ich logge alle Zwischenstände und Prompts in separaten Tabellen. So werden Rollbacks möglich und Incident-Analysen nachvollziehbar.
CREATE TABLE agent_events (
id SERIAL PRIMARY KEY,
event_type TEXT,
payload JSONB,
status TEXT,
created_at TIMESTAMP DEFAULT now()
);
CREATE TABLE agent_prompts (
id SERIAL PRIMARY KEY,
event_id INT REFERENCES agent_events(id),
prompt TEXT,
response TEXT,
created_at TIMESTAMP DEFAULT now()
);
Risiken im Produktivbetrieb: Was tatsächlich schiefgeht
| Risiko | Beschreibung | Gegenmaßnahme |
|---|---|---|
| SQL-Injektion | LLMs generieren Datenbank-Queries mit User Input. In 3 Projekten fand ich CWE-89-Muster im generierten Agenten-Code. | Statische Analyse (semgrep, bandit), strikte Prompt-Validierung, Sandbox zur Laufzeit. |
| Datenleck | Claude/OpenAI geben sensible Kundendaten ungefiltert in Prompts weiter. | Doppler für Secrets, Filter in n8n, OWASP-Richtlinien. |
| Event Loops | Agenten verarbeiten fehlerhafte Ereignisse in Endlosschleifen (z.B. ungültiger Bestellstatus). | Idempotenz-Checks, Retry-Limits, Alerting in n8n. |
| API-Sperre | Zu viele Requests führen zu Rate Limits, die API blockiert den Agenten. | Rate Limiting in n8n, Throttling, Fehler-Monitoring. |
Sicherheit & Audit: Was in DACH-Compliance wirklich zählt
Statische Analyse und Sandbox zur Laufzeit
Statische Analyse (bandit, semgrep) erkennt nicht alle Prompt-Injection-Risiken. Die Bandit-Dokumentation (2024) weist darauf hin. Ich setze zusätzlich eine Sandbox in n8n ein: Jede Agentenaktion wird geloggt, verdächtige Fälle gehen zur manuellen Prüfung.
Prompt- und Aktions-Logging
Alle Prompts und LLM-Antworten landen in separaten Postgres-Tabellen. Für Banken und Industrie ist das für DSGVO und EU AI Act unerlässlich. Im Incident-Fall kann die gesamte Ereigniskette rekonstruiert werden.
Validierung eingehender Daten
Jede eingehende Payload wird mit Pydantic (Python) oder Zod (TypeScript) validiert – nie „raw“ Webhook-Daten an den Agenten weitergeben.
from pydantic import BaseModel
class OrderEvent(BaseModel):
order_id: int
status: str
customer_email: str
# Validierung vor Agenten-Call
event = OrderEvent.parse_obj(raw_data)
FAQ
Welche SLA sind bei 24/7-Agenten realistisch?
In meinen Projekten: 99,7 % Verfügbarkeit auf Integrationslayer (n8n + Supabase), aber nur mit aktivem Monitoring und manueller Kontrolle von Edge Cases.
Lässt sich Datenleckage durch LLMs vollständig verhindern?
Nein. Selbst mit Doppler und n8n-Filtern gibt es Restrisiken bei komplexen Prompts. Nur Logging und manuelle Kontrolle minimieren dies.
Welche LLMs sind im DACH-Regelbetrieb etabliert?
Claude (Anthropic), GPT-4 (Azure OpenAI), selbstgehostete Modelle via API-Gateway. Immer mit vollständigem Logging und Zugangskontrolle.
Wie werden Rollbacks agentischer Aktionen automatisiert?
Jede Operation wird mit einzigartiger event_id in Postgres abgelegt – so ist gezieltes Rollback möglich.
Was tun, wenn der Agent nicht mehr antwortet?
Fallback-Logik in n8n, z.B. menschliche Benachrichtigung, und Heartbeat-Monitoring in einer eigenen DB-Tabelle.
In welchem Schritt Ihrer Agenten-Pipeline werden produktiv die meisten Fehler entdeckt: statische Analyse, Laufzeit-Sandbox oder menschliche Kontrolle? Ich freue mich über Praxiserfahrungen. Ich biete einen kostenlosen 30-Minuten-Stack-Check für DACH-Teams im regulierten KI-Umfeld an. Kontaktieren Sie mich auf LinkedIn oder via @ger_dennis_ai.
Aus einem Ablauf ein System machen, das läuft
Gebaut für den Betriebsalltag, nicht als Demo.