NotTrack AI Chat öffnen

Was ein Score misst und was nicht

2026-08-19

Benchmarks testen feste Aufgaben mit festen Prompts, automatisch bewertet. Deine Arbeit ist eine andere Aufgabe mit deinem Wortlaut, von dir bewertet. Vier Lücken trennen die Welten.

Scores sind das meistzitierte, aber am wenigsten vorhersagbare Kriterium. Das ist kein Vorwurf der Unehrlichkeit, sondern folgt aus der Natur eines Benchmarks.

Die Aufgaben sind nicht deine Aufgaben

Benchmarks bevorzugen Probleme mit überprüfbaren Antworten: Prüfungen, Rätsel, Code, der läuft. Die meisten echten Arbeiten werden bewertet, nicht geprüft. Kein Benchmark kann Urteile automatisch messen. Die messbare Teilmenge ist keine Stichprobe deines Tages.

Der Prompt ist nicht dein Prompt

Scores entstehen mit sorgfältig geschriebenen Prompts, oft für den Test optimiert. Du schreibst deine Frage in einer Zeile, während du an etwas anderes denkst. Die Lücke zwischen optimiertem Prompt und echter Frage ist größer als die zwischen zwei Top-Modellen.

Die Verpackung wird nicht gemessen

Benchmarks bewerten das Modell, du nutzt ein Produkt: Anweisungen, Filter, Oberfläche, Limits. Ein hochbewertetes Modell in einem vorsichtigen Produkt liefert eine schlechtere Erfahrung als ein niedriger bewertetes Modell in einer gut gebauten Umgebung.

Kontamination ist ein reales Problem

Beliebte Testdatensätze sickern in die Trainingsdaten ein, was Scores erhöht, ohne die Fähigkeit zu steigern. Das ist von außen schwer zu erkennen und betrifft die meistzitierten Benchmarks am stärksten, weil Popularität die Ursache ist.

Was Menschen vor dem Wechsel fragen

Sind Benchmarks dann nutzlos?

Sie sind nützlich, um die Entwicklung über Jahre zu verfolgen und große Lücken zu erkennen. Sie eignen sich schlecht, um enge Konkurrenten zu ranken, genau das, wofür sie genutzt werden.

Was ist mit blinden menschlichen Präferenztests?

Näher am Nützlichen, sie messen die durchschnittliche Präferenz bei durchschnittlichen Fragen. Deine Fragen sind nicht durchschnittlich und deine Präferenz ist die einzige, die für dich zählt.

Sollte ich Scores komplett ignorieren?

Nutze sie, um eine Shortlist zu erstellen, aber nicht, um die Wahl zu treffen. Zwanzig Minuten mit deinen eigenen Fragen entscheiden besser als jede Tabelle.

Überspringe die Tabelle und teste hier deine 3 eigenen Fragen.

Chat öffnen

KI-Chats vergleichen