Ich baue eine production rag pipeline über dein geschäftliches Wissen auf


Über diesen Service
Automatische Übersetzung
RAG-Demos sind einfach. RAG, das echten Fragen standhält, ist es nicht.
Ich baue Retrieval-Pipelines, die auch bei unangenehmen Fragen eines echten Nutzers funktionieren: hybride Retrieval (Vektor plus Stichwort), eine Re-Ranking-Stufe, Chunking, das an deine Dokumentenform angepasst ist, anstatt an eine feste Tokenzahl, und ein Bewertungsset, mit dem du die Genauigkeit nachweisen kannst, anstatt darauf zu hoffen.
Was du bekommst:
- Ingestion deiner echten Quellen: PDFs, Dokumente, Tabellen, Webseiten, Datenbanktabellen, Support-Tickets
- Reinigung und eine einheitliche Dokumentenrepräsentation, der Schritt, den die meisten Pipelines überspringen
- hybrides Retrieval plus Cross-Encoder-Re-Ranking, abgestimmt auf deine eigenen Fragen
- Ein goldenes Fragenset mit bewerteten Ergebnissen, damit eine Regression sichtbar ist, bevor deine Nutzer sie finden
- fundierte Generierung mit Zitaten, die auf den Quellchunk verweisen
- Bereitstellung als API, die du besitzt, oder direkt in deine bestehende App
Ich betreibe das auf einem produktiven Multi-Tenant-System, inklusive der unspektakulären Teile: Re-Indexierung bei Inhaltsänderungen, Kosten pro Anfrage, Latenzbudgets und Failover-Lanes.
Sag mir, was deine Dokumente sind und was die Leute sie fragen müssen.
Lerne Ehsan kennen
AI Agent and RAG Engineer
- AusIndien
- Mitglied seitJuni 2024
- ⌀ Antwortzeit1 Stunde
Sprachen
Englisch
Automatische Übersetzung
FAQ
Automatische Übersetzung
Welche Vektordatenbank verwendest du?
Standardmäßig Postgres mit pgvector: günstig und ein System weniger zu betreiben. Pinecone, Qdrant oder Weaviate, falls du sie bereits nutzt oder bevorzugst.
Auf welchem LLM läuft das?
Deins oder meins. OpenAI, Anthropic, Gemini oder open-weight Modelle, die du hostest. Selbsthosting wird ab einem bestimmten Volumen wirklich günstiger, und ich sage dir ehrlich, wo diese Grenze für deinen Gebrauch liegt.
Kann es komplett auf unserer eigenen Infrastruktur laufen?
Ja, inklusive selbstgehosteter Modelle, ohne dass Dokumenteninhalte dein Umfeld verlassen. Sag mir deine Datenresidenz-Beschränkungen im Voraus, und ich passe den Umfang entsprechend an.
Wie weiß ich, dass das Retrieval wirklich genau ist?
Du bekommst ein goldenes Fragenset mit bewerteten Retrieval-Ergebnissen auf deinen eigenen Daten. Die Genauigkeit wird mit Zahlen angegeben, nicht nur behauptet. Bei Standard und Premium siehst du auch Vorher- und Nachher-Wertungen.
Können Sie mit gescannten Dokumenten oder Bildern arbeiten?
Ja, mit OCR. Markiere es, wenn du mir schreibst, damit ich den Umfang richtig einschätze, denn gescannte Quellen verändern den Ingestionsprozess erheblich.

