Unsere Agentur stellt selbst gehostete KI mit Open WebUI und RAG bereit


Agentur
Über diesen Service
Automatische Übersetzung
Suchst du einen KI-Assistenten, der auf deiner eigenen Infrastruktur läuft, mit deinen eigenen Dokumenten?
WZ-IT setzt selbst gehostete LLM- und RAG-Stacks für Unternehmen ein, die keine internen Daten an eine US-API senden können. Open WebUI als Schnittstelle, LiteLLM als Gateway, Qdrant oder pgvector für die Suche, Langfuse für Nachverfolgung und Kostenkontrolle.
Je nach Umfang decken wir ab:
- Open WebUI mit SSO, Nutzergruppen und modellbezogenem Zugriff pro Team
- LiteLLM Gateway: eine API für lokale und externe Modelle, Budgets pro Team
- vLLM oder Ollama Inferenz, passend für dein GPU- oder CPU-Budget
- RAG-Pipeline: Ingestion, Chunking, Embeddings, Qdrant oder pgvector
- permission-aware Retrieval, damit Nutzer nur Dokumente sehen, die sie sehen dürfen
- Langfuse für Nachverfolgung, Bewertung und Kosten pro Team
- Deployment auf deinem GPU-Server, in der europäischen Cloud oder vor Ort
Der schwierige Teil ist nicht das Chat-Fenster. Es ist, dafür zu sorgen, dass die Retrieval die bereits vorhandenen Berechtigungen respektiert und die tatsächlichen monatlichen Kosten zu kennen.
Beginne mit der Beratung: eine Stunde mit den Gründern von WZ-IT, plus eine schriftliche Empfehlung, die du auf jeden Fall behältst. Alles Größere wird als individuelles Angebot kalkuliert, abgestimmt auf deine tatsächlichen Bedürfnisse.
Mehr von unserer Arbeit: wz-it.com
Über diese Agentur

Agentur
3 Angestellte
- AusDeutschland
- Mitglied seitOkt. 2019
- ⌀ Antwortzeit1 Stunde
- Letzte Lieferung1 Jahr
Sprachen
Deutsch, Englisch, Niederländisch
Automatische Übersetzung
Portfolio
FAQ
Automatische Übersetzung
Welches Modell sollten wir verwenden?
Das hängt von Aufgabe, Sprache und Hardware ab. Kleine open-weight Modelle bewältigen die meisten internen Assistenten; ein 70B Modell benötigt ein ernsthaftes GPU-Budget. Wir passen es an deinen Anwendungsfall an.
Respektiert RAG unsere bestehenden Berechtigungen?
Nur wenn es so aufgebaut ist. Das Filtern muss vor der Vektorsuche erfolgen, nicht indem das Modell gefragt wird, sich entsprechend zu verhalten. Das ist der Kern des RAG Platform Pakets.
Brauchen wir eine GPU?
Nicht immer. Kleine Modelle und CPU-Inferenz sind bei niedriger gleichzeitiger Nutzung machbar. Wir sagen dir, in welchem Fall du dich befindest, bevor du Hardware kaufst.
Kannst du es mit Nextcloud oder einem Dateifreigabesystem verbinden?
Ja, als Dokumentquelle im Ingestion-Pipeline, inklusive Berechtigungszuordnung.
4 Bewertungen für diesen Service
| (4) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Zusammensetzung der Bewertung
- Kommunikation
- An einen Freund weiterempfehlen
- Dienstleistung wie beschrieben
Sortieren nach:
P pawelpavlo

Deutschland
Very well and quickly executed order :) I recommend !!!
Hilfreich?D dnlnrx
Wiederkehrender Kunde

Deutschland
Exzellente Arbeit. 1A Kommunikation.
Hilfreich?S sbroderman

Schweden
Perfect delivery!
Hilfreich?S 
sangeorgean2
Wiederkehrender Kunde

Deutschland
Super, thank you!
Hilfreich?
4 Bewertungen für diesen Service
| (4) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Zusammensetzung der Bewertung
- Kommunikation
- An einen Freund weiterempfehlen
- Dienstleistung wie beschrieben
Sortieren nach:
P pawelpavlo

Deutschland
Very well and quickly executed order :) I recommend !!!
Hilfreich?D dnlnrx
Wiederkehrender Kunde

Deutschland
Exzellente Arbeit. 1A Kommunikation.
Hilfreich?S sbroderman

Schweden
Perfect delivery!
Hilfreich?S 
sangeorgean2
Wiederkehrender Kunde

Deutschland
Super, thank you!
Hilfreich?
