Ich bereinige deine Daten
ML-Ingenieur
Über diesen Service
Ich reinige und formatiere Rohdatensätze für das Training und Feinabstimmung von LLMs. Die Dienste umfassen Dublettenentfernung, PII-Redaktion, Rauschreduzierung und Umwandlung in Standardformate (JSONL, Alpaca, ChatML). Python-basiert, NDA-konform und auf die Architektur deines Modells zugeschnitten. Schreib mir vor der Bestellung, um die Datensatzgröße und Anforderungen zu besprechen.
Mein Portfolio
FAQ
Automatische Übersetzung
Unterschreibst du NDAs oder gehst du mit sensiblen Daten vertraulich um?
Ja. Ich unterschreibe NDA, bevor ich auf Daten zugreife, und lösche alle Dateien nach Abschluss des Projekts. Ich verwende Kundendaten niemals für meine eigenen Modelle.
Welche Formate akzeptieren und liefern Sie?
Ich akzeptiere CSV, JSON, JSONL, Parquet, TXT und SQL-Dumps. Lieferformate sind JSONL, Parquet, Alpaca, ChatML oder benutzerdefinierte Schemas für HuggingFace/Llama.cpp.
Kannst du mehrsprachige oder code-intensive Datensätze verarbeiten?
Ja. Gib die Sprachen und Codestandards im Voraus an, damit ich die passende Tokenisierung, Kodierungsanpassungen und Syntax-Validierung anwenden kann.
Wie stellst du die Qualität nach der Reinigung sicher?
Jede Lieferung enthält einen Validierungsbericht mit Metriken (Dublettenrate, PII-Anzahl, Formatkonformität) sowie 10–20 Beispielzeilen zur manuellen Überprüfung.
Was, wenn mein Datensatz größer ist als das Premium-Paket?
Schreib mir mit deiner Zeilenzahl und deinen Anforderungen. Für Datensätze über 1 Mio. Zeilen oder mit spezieller Verarbeitung erstelle ich individuelle Angebote.
Bietest du laufende oder wiederkehrende Reinigungsdienste an?
Ja. Viele Kunden benötigen eine kontinuierliche Pipeline-Unterstützung. Kontaktiere mich, um Retainer- oder Abonnementvereinbarungen zu besprechen.

