Ich werde deine AI-Benchmark- oder LLM-Eval-Zahlen auf statistische Validität prüfen

Einige Informationen wurden automatisch übersetzt.

Finnland

Ich spreche Finnisch, Englisch

Trading-Bot-Experte

Ich bin ein Quantitative Engineer, der maßgeschneiderte Trading-Bots und API-Pipelines entwickelt. Ich verkaufe keine "schnell reich werden"-Skripte. Ich baue solide, zuverlässige Trading-Architektur....
Über diesen Service

 Du erhältst ein klares Urteil darüber, ob dein Benchmark- oder Eval-Wert die Checks besteht, die er vorher übersprungen hat, bevor du ihn veröffentlichst.

 Ich nehme ein Hauptergebnis (eine Leaderboard-Platzierung, eine LLM-als-Richter-Gewinnrate, ein "schlägt Baseline um X%", einen Skalierungsgesetz-Exponent) und teste es adversarial: Korrektur für Mehrfachvergleiche, statistische Power, Richter-Bias und Reproduzierbarkeit aus deinen Rohdaten.


 Du bekommst eine von zwei ehrlichen Antworten: Es besteht die Korrektur, hier ist die korrigierte Statistik, die du zitieren kannst, oder es liegt im Rauschen, hier ist warum und die eine Zeile Fix.


 Was das ausmacht, ist Beweis, nicht Versprechen. Ich habe das Buch über dieses Versagensmuster geschrieben (Measured, Not Believed), das Open-Source-Tool entwickelt, das die Checks durchführt (evalgate), und öffentlich drei echte Übertreibungen reproduziert: MT-Bench, RewardBench und ein veröffentlichtes Skalierungsgesetz. Jedes Urteil, das ich gebe, ist aus deinen Daten reproduzierbar; ich zeige die Arbeit. Und wenn dein Wert echt ist, zertifiziere ich ihn – ein Auditor, der nur Fehler findet, ist ein Zyniker, kein Auditor.