Ich teste deinen AI-Chatbot auf Halluzinationen und liefere einen Bericht

Einige Informationen wurden automatisch übersetzt.

Mexiko

Ich spreche Spanisch, Englisch

KI-Automatisierungsentwickler

Ich erstelle Automatisierungen, die nicht versagen: n8n-Workflows, API/Webhook-Integrationen und AI-Agenten (OpenAI, Claude), die mit WhatsApp, Google Sheets, Notion, Slack und CRMs verbunden sind. M...
Über diesen Service

Du hast einen Chatbot installiert. Wie erkennst du, wann er einen Preis, eine Richtlinie oder eine Frist erfindet – bevor sich ein Kunde beschwert?


Die meisten KI-Assistenten werden gebaut, gestartet und nie gemessen. Ich messe sie.


Was ich tue:

  1. Du gibst mir 30-50 echte Fragen, die dein Bot bereits erhalten hat (oder ich erstelle sie aus deinen Unterlagen).
  2. 2. Gemeinsam definieren wir die richtige Antwort für jede Frage (Ground Truth).
  3. 3. Ich teste sie gegen deinen Bot und bewerte jede Antwort.
  4. 4. Du erhältst einen Bericht: Genauigkeitsrate, Verwirrungsmatrix nach Fragetyp, Fehlermodus-Katalog mit den genauen Gesprächen, die teuersten falschen Antworten (Geld/Richtlinie) und eine konkrete Lösung pro Fehlermodus.

Funktioniert mit: benutzerdefinierten GPTs, OpenAI Assistants, Claude, RAG-Bots (LangChain, Flowise, Botpress, Voiceflow), WhatsApp-Bots, Website-Widgets. Ich brauche nur eine Möglichkeit, dem Bot Fragen zu stellen – kein Code-Zugang erforderlich.


Hintergrund: Ich habe eine Bewertungs-Harness für meinen eigenen Retail-Compliance-Assistenten gebaut und veröffentlicht (104 Testfragen, Verwirrungsmatrix pro Regel, Fehlermodus-Bericht mit Ursachen). Dieselbe Methode, angewandt auf deinen Bot.


Sprachen: Englisch und Spanisch.

Anwendung testen:

Software

Entwicklungstechnologie:

Node.js

•

Python

Gerät:

PC

•

Android-Mobiltelefon

Mein Portfolio