Ich werde LLM feinabstimmen, Datensatz bewerten und maßgeschneidertes KI-Modell für Qualität und Sicherheit trainieren
Spezialist für AI-Datenannotation und LLM-Antwortbewertung
Über diesen Service
Brauchst du Experten für menschliche Validierung deiner KI-Modelle?
Ich biete gründliche Bewertung der LLM-Antworten, Prompt-Tests und Qualitätsprüfung der KI-Daten, um sicherzustellen, dass deine großen Sprachmodelle faktenbasierte, sichere und zuverlässige Ausgaben liefern.
Meine Leistungen:
- Bewertung der LLM-Antworten
- Faktenprüfung & Halluzinationserkennung
- Bewertung der Befolgung von Anweisungen
- Relevanz- & Vollständigkeitsprüfung
- Sicherheitsbewertung & Toxizitätsprüfung
- Fehlerklassifikation & Schweregrad-Taxonomie
- Paarweise Präferenzrangliste (RLHF)
- Prompt-Tests & Red-Teaming
- Gesundheits-LLM-Bewertung
- Qualitätskontrolle der Daten & Dataset-Erstellung
Tools & Formate:
Microsoft Excel, Google Sheets, CSV, JSON und individuelle Bewertungsrichtlinien.
Qualitätssicherung:
Jedes Prompt-Antwort-Paar wird mehrfach manuell geprüft anhand deiner genauen Bewertungsrichtlinien, Scoring-Kriterien und Referenzquellen.
Kontaktiere mich, um deine Richtlinien zu besprechen oder eine Musterbewertung anzufordern!
Relevante Suchbegriffe:
llm evaluation, ai evaluation, prompt testing, factuality evaluation, ai safety, rlhf, data annotation, response quality, hallucination detection, text evaluation data annotation data labeling image annotation ai data-annotation
Programmiersprache:
Python
•
keras
•
Pytorch
•
R
•
Tensorflow
KI-Modell-Frameworks & -Tools:
tensorflow
•
PyTorch
•
keras
Datentyp:
Text
•
BILDER
•
Multimodal
Mein Portfolio
FAQ
Automatische Übersetzung
Welche Bewertungsdimensionen deckst du ab?
Ich bewerte Antworten anhand von Fakten, Befolgung von Anweisungen, Relevanz, Vollständigkeit, Sicherheit, Argumentationslogik und Ton/Klarheit auf einer standardisierten Skala von 1 bis 5.
Wie überprüfst du die Fakten und erkennst Halluzinationen?
Ich vergleiche die generierten Behauptungen mit deinem bereitgestellten Quellenkontext, vertrauenswürdigen Referenzquellen und primärer Dokumentation, um erfundene Fakten, Kontextverschiebungen oder unsupported extrapolations zu erkennen.
Kannst du Antworten mit meinem firmeneigenen Bewertungsraster oder Richtlinien bewerten?
Ja. Ich passe mich strikt an deine bestehenden Annotationsrichtlinien, Scoring-Kriterien, Edge-Case-Regeln und spezifischen Fehlerdefinitionen an.
Welche Ergebnisse und Dateiformate bietest du an?
Ich liefere strukturierte Bewertungs-Tabellen in Microsoft Excel (.xlsx), Google Sheets oder CSV/JSON, inklusive Punktzahlen, Fehlerkategorie-Tags, Schweregradbewertungen und Begründungsnotizen.
Kann ich eine kleine Probe durchführen, bevor ich eine vollständige Bestellung aufgebe?
Ja. Schick mir deine Richtlinien und 3–5 Beispiel-Prompt-Antwort-Paare, und ich mache eine kostenlose Testbewertung, damit du meine Bewertungsgenauigkeit und Rationale prüfen kannst.

