KI-Chatbot on-premise mit Anything LLM, DSGVO-konform aus Deutschland

Wir liefern einen vollständigen Retrieval-Augmented-Generation-Stack als Docker-Compose-Deployment: Anything LLM als Frontend und Workspace-Layer, ein austauschbares LLM-Backend und eine Vektor-Datenbank. Der Chatbot kennt ausschließlich Ihre Dokumentation, antwortet mit Quellenangabe, und Ihre Daten verlassen Deutschland nicht.

Der Stack

Betrieb bei Mittwald oder in einem dedizierten Rechenzentrum, keine US-Hyperscaler im Datenpfad. Verschlüsselung Ende zu Ende, LUKS-verschlüsselte Volumes, Secrets über Docker-Secrets. Als Modell kommen wahlweise on-premise gehostete Varianten (Llama 3.1, Mistral, Qwen) über Ollama oder vLLM zum Einsatz.

Wie die Dokumente in den Index kommen

PDF, Markdown und Confluence-Exporte werden über einen Worker eingelesen, in Chunks von 400 bis 800 Tokens gesplittet und mit Metadaten angereichert. Die Ingestion läuft inkrementell: Der Worker erkennt Hash-Änderungen und berechnet nur betroffene Chunks neu.

Typische Einsatzfälle

Wissensdatenbank, FAQ, Onboarding-Dokumentation und Produkthandbücher werden indexiert. Wiederkehrende Fragen beantwortet das Widget direkt, Eskalationen gehen nur dann an Tier 2, wenn sie es wirklich brauchen.

Einführung in vier Wochen

Inventur der Dokumentation, Klassifizierung und Zugriffsmatrix. Danach wird der Compose-Stack im deutschen Rechenzentrum ausgerollt, mit TLS, Backups und Monitoring. Geplant, nicht gehofft.

Häufige Fragen

Welches LLM kommt zum Einsatz?

Sie haben die Wahl. Wir empfehlen on-premise Modelle (Llama 3.1 70B, Mistral Large, Qwen 2.5) über Ollama oder vLLM. Wenn Sie eine API bevorzugen, binden wir auch OpenAI-kompatible Provider an, sofern DSGVO-konform vertraglich abgesichert, etwa über Azure OpenAI EU.

Wie groß darf die Dokumentation sein?

Praktisch unlimitiert. pgvector skaliert horizontal, und die Ingestion läuft inkrementell. Wir hatten produktive Setups mit über 50.000 Dokumenten und 4 Millionen Chunks.

Können sensible Bereiche ausgeschlossen werden?

Ja. Workspaces in Anything LLM kapseln Embeddings strikt. Rollen und IP-Whitelist lassen sich pro Workspace definieren. Ein Vertrieb sieht keine HR-Daten.

Was passiert bei einem Update der Dokumente?

Der Ingest-Worker erkennt Hash-Änderungen und berechnet ausschließlich betroffene Chunks neu. Kein vollständiger Reindex, kein Wartungsfenster.

Wie hoch sind die Betriebskosten?

Abhängig von Modellgröße und Last. Ein typisches mittelständisches Setup mit lokal gehostetem 70B-Modell läuft auf einer GPU-Maschine (1× A6000 oder 2× L40S). Detaillierte Kalkulation auf Anfrage.

Wer betreut den Stack im Betrieb?

Standardmäßig wir: Patch-Management, Monitoring, Backup-Drills, Re-Tuning. Ein Service Level Agreement deckt die Reaktionszeiten ab. Eine Übergabe an Ihr Team ist jederzeit möglich, Stack und Dokumentation gehören Ihnen.

Kontakt

Odenwald IT Service UG (haftungsbeschränkt), Seckach. Schreiben Sie an info@odenwald-it-service.de. Zur Startseite · DORA-Hosting für Banken · Impressum.