Ich baue AI-fähige Datenpipelines für RAG, LLM und AI-Agenten Anwendungen
Helfe kleinen und mittleren Unternehmen mit Daten und KI
Über diesen Service
Dein LLM ist nur so intelligent wie die Daten, die es abruft.
Ich erstelle produktionsreife Datenpipelines, die deine Dokumente, Datenbanken und SaaS-Tools in AI-fähige Wissensbasen für RAG, LLM und Agenten Anwendungen verwandeln, mit der Retrieval-Qualität, die dazu passt.
WAS DU BEKOMMST:
- Multi-Source-Ingestion (Notion, Confluence, Drive, S3, Datenbanken, Webseiten, PDFs)
- Intelligentes Chunking, abgestimmt auf deinen Content (nicht nur naive Aufteilungen)
- Embeddings mit deinem gewählten Modell (OpenAI, Cohere, Open-Source)
- Vektor-Datenbank-Setup (pgvector, Pinecone, Weaviate, Qdrant, Chroma)
- Metadaten-Filterung + Hybrid-Suche für präzises Retrieval
- Evaluierungs-Tool, damit du die Qualität wirklich messen kannst
- Saubere Dokumente, damit dein Team sie besitzen und erweitern kann
WARUM ICH:
- Google Certified Professional Data Engineer
- Über 20 abgeschlossene Datenprojekte, inklusive RAG-Arbeiten (ShareDat)
- Tiefgehender Data Engineering Hintergrund, ich sehe RAG zuerst als Datenproblem, dann als LLM-Problem
FÜR WEN DAS IST:
Gründer, die AI-Produkte bauen, Teams, die RAG in interne Tools integrieren, und Agenturen, die AI-Features ausliefern und genug von Prototypen wie "es funktioniert bei 5 Docs" haben, die bei größerem Umfang zusammenbrechen.
Schreib mir eine Nachricht, bevor du bestellst, damit ich deine Quellen, Volumen und Retrieval-Ziele einschätzen kann.
Mein Portfolio
Meine weiteren Dienstleistungen im Bereich Datentechnik
FAQ
Automatische Übersetzung
Mit welchen Vektor-Datenbanken arbeitest du?
pgvector (Postgres), Pinecone, Weaviate, Qdrant, Chroma, Milvus und cloud-native Optionen wie BigQuery Vektor-Suche und Snowflake Cortex. Wenn du unsicher bist, welches du wählen sollst, empfehle ich dir eine basierend auf deinem Umfang und Budget.
Von welchen Datenquellen kannst du ingestieren?
Notion, Confluence, Google Drive, SharePoint, Slack, Intercom, Zendesk, Webseiten, PDFs, Datenbanken (Postgres/MySQL/Mongo), S3/GCS und jede REST API. Wenn du eine individuelle Quelle hast, schreib mir zuerst.
Baust du auch den Chatbot / das Frontend?
Mein Kernauftrag ist die Daten- und Retrieval-Pipeline – das Fundament, das die meisten RAG-Projekte falsch machen. Ich kann ein einfaches Chat-Prototyp als Gig Extra hinzufügen. Für produktionsreife UIs empfehle ich Partner oder Übergabe an dein Frontend-Team.
Wie unterscheidet sich das von nur LangChain / LlamaIndex?
Das sind Frameworks, keine Pipelines. Die meisten Fehler bei RAG liegen nicht am Framework – sondern an Chunking, Metadaten, Datenqualität und Retrieval-Tuning. Ich baue die komplette Data Engineering-Schicht darunter, damit diese Frameworks in der Produktion wirklich gut funktionieren.
Hält die Pipeline die Wissensbasis bei Updates synchron?
Ja. Standard und Premium beinhalten inkrementelle Synchronisation, sodass neue und aktualisierte Dokumente automatisch im Zeitplan durchlaufen. Basic ist ein einmaliger Load, gut für statische Korpora.
Kannst du helfen, die Funktion des Retrievals zu evaluieren?
Ja, und das ist der Teil, den die meisten Projekte überspringen. Standard und Premium beinhalten eine Retrieval-Evaluierung mit Testabfragen, Trefferquoten und Feedback-Loop, damit die Qualität messbar ist und nicht nur auf Gefühl basiert.

