Wir liefern einen vollständigen Retrieval-Augmented-Generation-Stack als Docker-Compose-Deployment: Anything LLM als Frontend und Workspace-Layer, ein austauschbares LLM-Backend und eine Vektor-Datenbank. Der Chatbot kennt ausschließlich Ihre Dokumentation, antwortet mit Quellenangabe, und Ihre Daten verlassen Deutschland nicht.
Betrieb bei Mittwald oder in einem dedizierten Rechenzentrum, keine US-Hyperscaler im Datenpfad. Verschlüsselung Ende zu Ende, LUKS-verschlüsselte Volumes, Secrets über Docker-Secrets. Als Modell kommen wahlweise on-premise gehostete Varianten (Llama 3.1, Mistral, Qwen) über Ollama oder vLLM zum Einsatz.
PDF, Markdown und Confluence-Exporte werden über einen Worker eingelesen, in Chunks von 400 bis 800 Tokens gesplittet und mit Metadaten angereichert. Die Ingestion läuft inkrementell: Der Worker erkennt Hash-Änderungen und berechnet nur betroffene Chunks neu.
Wissensdatenbank, FAQ, Onboarding-Dokumentation und Produkthandbücher werden indexiert. Wiederkehrende Fragen beantwortet das Widget direkt, Eskalationen gehen nur dann an Tier 2, wenn sie es wirklich brauchen.
Inventur der Dokumentation, Klassifizierung und Zugriffsmatrix. Danach wird der Compose-Stack im deutschen Rechenzentrum ausgerollt, mit TLS, Backups und Monitoring. Geplant, nicht gehofft.
Sie haben die Wahl. Wir empfehlen on-premise Modelle (Llama 3.1 70B, Mistral Large, Qwen 2.5) über Ollama oder vLLM. Wenn Sie eine API bevorzugen, binden wir auch OpenAI-kompatible Provider an, sofern DSGVO-konform vertraglich abgesichert, etwa über Azure OpenAI EU.
Praktisch unlimitiert. pgvector skaliert horizontal, und die Ingestion läuft inkrementell. Wir hatten produktive Setups mit über 50.000 Dokumenten und 4 Millionen Chunks.
Ja. Workspaces in Anything LLM kapseln Embeddings strikt. Rollen und IP-Whitelist lassen sich pro Workspace definieren. Ein Vertrieb sieht keine HR-Daten.
Der Ingest-Worker erkennt Hash-Änderungen und berechnet ausschließlich betroffene Chunks neu. Kein vollständiger Reindex, kein Wartungsfenster.
Abhängig von Modellgröße und Last. Ein typisches mittelständisches Setup mit lokal gehostetem 70B-Modell läuft auf einer GPU-Maschine (1× A6000 oder 2× L40S). Detaillierte Kalkulation auf Anfrage.
Standardmäßig wir: Patch-Management, Monitoring, Backup-Drills, Re-Tuning. Ein Service Level Agreement deckt die Reaktionszeiten ab. Eine Übergabe an Ihr Team ist jederzeit möglich, Stack und Dokumentation gehören Ihnen.
Odenwald IT Service UG (haftungsbeschränkt), Seckach. Schreiben Sie an info@odenwald-it-service.de. Zur Startseite · DORA-Hosting für Banken · Impressum.