Ich erstelle ein massives Dataset für AI-Training
Python-Entwickler, Datenextraktionsspezialist
Geprüft von Fiverr Pro
Kawsar wurde vom Fiverr Pro-Team aufgrund besonderer Expertise ausgewählt.
Geprüft für
Daten-Scraping
Datenverarbeitung
Über diesen Service
Du brauchst ein großes, sauberes Dataset, um ein AI-Modell zu trainieren oder feinzuabstimmen – nicht einen unordentlichen Scrape-Dump oder eine kleine Musterdaten-Datei.
Genau das ist meine Arbeit. Ich bin Kawsar, ein Python-Entwickler, der Daten-Scraping für riesige Datasets für AI-Training aus öffentlichen Quellen, synthetische Generierung und strukturierte CSV- oder JSON-Exporte baut.
Was ich liefere:
- Maßgeschneiderte AI-Trainingsdatasets, passend zu deinem Paket und Schema
- Öffentliche Web-Sammlung und/oder synthetische Zeilen, wenn datenschutzsichere Daten benötigt werden
- Sauberes CSV, JSON oder Excel, bereit für ML- und LLM-Vorbereitung
- Feldzuordnung, grundlegende Duplikatentfernung und ein kurzer Datenwörterbuch
- Optionales Python-Sammelskript bei Premium
- Kostenlose Musterdatenzeilen vor dem vollständigen Aufbau, damit du das Schema zuerst freigeben kannst
- JSONL-Export, bereit für LLM-Feinabstimmung (OpenAI, Hugging Face und Llama-Formate)
Ich erstelle maßgeschneiderte Datasets für ML- und AI-Teams. Das Volumen hängt vom Paket und der Schwierigkeitsstufe der Quellen ab. Nur öffentliche Daten.
Schick mir dein Schema, Zielvolumen und Anwendungsfall, bevor du bestellst.
Hinweis:
- Nur öffentliche Daten. Käufer stellt Schema und Ziel-URLs beim Scraping bereit
- Maßgeschneiderte Erstellung nach Bestellung
- Kein Sammeln persönlicher Daten
- Keine Schul- oder Universitätsaufgaben
Plattform:
mySQL
•
PL/SQL
•
PostgreSQL
•
SQLite
•
SQL Server
Expertise:
Design
•
Normalisierung
•
SQL
•
NoSQL
•
Performance
Kunden, mit denen ich zusammengearbeitet habe
MyHeritage
Internet Software & Services
I've been hired to carry out certain web extraction-related jobs in order to build a database for user reviews, which will be used to develop the product and make changes in certain instances.
Mai 2022-Mai 2023
Fiverr
Internet Software & Services
The project was to gather a detailed list of 5000 keywords from various profession types and list their Google Rank, Link, and even Local Search Results, etc. Information and make a Report with these!
Juli 2024
Mein Portfolio
FAQ
Automatische Übersetzung
Welche Art von Datasets erstellst du?
Strukturierte AI-Trainingsdatasets für ML- und LLM-Vorbereitung: tabellarische CSV/JSON, Textkorpora und Sammlungen aus öffentlichen Quellen. Bildlastiges CV-Labeling kann bei Bedarf eingeschlossen werden.
Scrapst du das Web oder generierst du synthetische Daten?
Beides. Wir wählen öffentliche Sammlungen, synthetische Generierung oder eine Mischung, basierend auf deinem Schema, Datenschutzbedarf und Zielvolumen.
Wirst du auch mein Modell trainieren?
Dieses Gig ist für die Erstellung des Datasets. Modelltraining und LLM-Feinabstimmung sind separate Gigs, falls du das brauchst.
Welche Dateien erhalte ich?
CSV, JSON, JSONL oder Excel plus ein kurzes Datenwörterbuch. Premium kann ein Python-Skript enthalten, das zum Erstellen oder Aktualisieren des Sets verwendet wird.
Muss ich ein Schema bereitstellen?
Ja. Schick mir Spaltennamen, Labels, Formate und Beispielzeilen, falls vorhanden. Das hält das Dataset modellbereit.
Ist LoRA oder AI-Influencer-Dataset-Arbeit enthalten?
Nein. Dieses Gig ist für ML/AI-Trainingsdaten, nicht für Influencer-LoRA-Packs.
Ist das für Schul- oder Universitätsaufgaben?
Nein. Ich nehme keine Schul- oder Universitätsaufgaben an.

