Ich führe Regressionstests für deinen AI-Chatbot oder Agenten auf kostspielige Fehler durch

Einige Informationen wurden automatisch übersetzt.

Vereinigte Staaten

Ich spreche Englisch, Chinesisch

35 Aufträge abgeschlossen

AI-Systeme, Automatisierungs- und Zuverlässigkeitsingenieur

Hi, ich bin Dylan Feng, ein ehemaliger OpenAI-Ingenieur und YC-geförderter Gründer, der sich auf zuverlässige KI-Systeme, Workflow-Automatisierung und Produktionsinfrastruktur spezialisiert hat. Ich u...
Über diesen Service

Eine Änderung eines Prompts kann einen Fehler beheben und gleichzeitig einen anderen stillschweigend erzeugen. Ich verwandle deine Agentenanforderungen in wiederholbare Bestehens-/Fehler-Tests, führe normale und adversariale Gespräche durch und zeige die genauen Beweise für jeden Fehler.


Du erhältst:

deterministische Anforderungen und Akzeptanzchecks

exakte Prompts, Antworten und reproduzierbare Fehlerbeweise

kritische, hohe, mittlere und niedrige Priorisierung

eine Freigabeempfehlung

ein wiederverwendbares Testpaket in Standard und Premium


Der Umfang kann Grounding, halluzinierte Behauptungen, Datenschutz, Prompt-Injection, unsichere Antworten sowie Tool- und Aktionsgrenzen umfassen. Ergebnisse mit hoher und kritischer Schwere werden manuell überprüft. Dies ist kein vager AI-generierter Score oder ein Versprechen auf null Fehler.


Der anfängliche Bereich umfasst textbasierte Unterstützung, Lead-Generation, E-Commerce und Termin-Agents. Regulierte medizinische, rechtliche und finanzielle Systeme sind ausgeschlossen.


Eine Staging-Umgebung ist dringend zu empfehlen. Ich werde keine zerstörerischen Aktionen in der Produktion testen. Du stellst Testzugangsdaten, Quellen-der-Wahrheit-Dokumente, erforderliches und verbotenes Verhalten bereit und bestätigst, dass die Umgebung keine echten Kunden-Geheimnisse oder persönlichen Daten enthält.

Anwendung testen:

Web-Applikation

Gerät:

PC

Mac

Linux