Als Machine Learning Engineer mit Schwerpunkt auf NLP und symbolischer KI biete ich umfassende Bewertung, Benchmarking und Red-Teaming für deine Large Language Models (LLMs) und RAG-Pipelines an. Ich helfe Engineering-Teams, Edge-Case-Fehler zu erkennen, Halluzinationen zu eliminieren und strenge Sicherheitsvorkehrungen durchzusetzen.
Was ich anbiete:
- LLM-Benchmark & Performance-Audit: Bewertung der Modellgenauigkeit, Latenz, Kontextnutzung und Reasoning-Fähigkeiten anhand maßgeschneiderter Testkriterien.
- Halluzinationen & Edge-Case-Erkennung: Belastungstests für System-Inputs, RAG-Retrieval-Genauigkeit und faktische Konsistenz unter adversarialen Bedingungen.
- Red Teaming & Sicherheitstests: Identifikation von Schwachstellen wie Prompt-Injection-Angriffen, Jailbreaks und System-Prompt-Lecks.
- Schema- & Output-Validierung: Überprüfung der Einhaltung strenger JSON/Pydantic-Strukturen, Ausführung von Funktionsaufrufen und Zuverlässigkeit der API-Integration.
- Detaillierter Audit-Bericht & Aktionsplan: Umfassende Fehleranalyse mit umsetzbaren Prompt-Engineering-Optimierungen und Sicherheitsvorkehrungsempfehlungen.