Unser Testset war zu ordentlich
Wir haben den Namen eines Feldes in einem Kundenschema geändert, und ein Schritt, der monatelang grün war, scheiterte plötzlich an einem Fünftel unserer Fälle. An der Aufgabe hatte sich nichts geändert — und genau das sollte jeden beunruhigen, der ein Bewertungsset pflegt.
Die Änderung, die nichts hätte ausmachen dürfen
Ein Kunde benannte in seinem Export ein Feld von Lieferdatum in Lieferdatum_IST um. Unser Extraktionsschritt arbeitet gegen ein Schema, das Schema wurde aktualisiert, und rund ein Fünftel unserer markierten Fälle begann zu scheitern — auf Weisen, die mit diesem Feld nichts zu tun hatten.
Werte, die monatelang korrekt extrahiert worden waren, kamen falsch zurück. Die Aufgabe war identisch, unser Prompt war identisch, und die einzige Variable war ein Oberflächendetail, das eine korrekte Umsetzung ignorieren würde. Unsere ignorierte es nicht — und unser Vertrauen in den Schritt offenbar ebenso wenig.
Was das Set tatsächlich gemessen hat
Achtzig echte Fälle aus echten Dokumenten, von einem Experten geprüft. Alle in denselben zwei Wochen gesammelt, von vier Kunden, aus Dokumenten zweier Systeme. Formulierung, Feldreihenfolge und Wortschatz waren weit einheitlicher als der Verkehr im Betrieb.
Das Set maß also, ob der Schritt diese bestimmte Ausprägung der Aufgabe beherrscht. Es bestand monatelang, und das Bestehen sagte weniger, als wir dachten — denn ein Schritt kann sich der Oberfläche eines Sets eng genug anpassen, um zu bestehen, ohne die Aufgabe darunter zu beherrschen.
Die Forschung, die den Punkt scharf gemacht hat
Mirzadeh und Kollegen veröffentlichten in jenem Oktober eine Arbeit, die Varianten etablierter Denkaufgaben erzeugt, indem sie Namen und Zahlenwerte ändert und das zugrunde liegende Problem gleich lässt, und berichten, dass die Leistung auf den Varianten sinkt.
Ihr Feld ist mathematisches Schließen und unseres Feldextraktion, und der übertragbare Befund betrifft die Messung, nicht die Modelle: Bewegt sich die Leistung, wenn sich nur die Oberfläche bewegt, dann berichtet ein festes Set mit fester Oberfläche etwas Engeres, als die Zahl nahelegt.
| Was wir heute variieren | Was konstant bleibt |
|---|---|
| Feldnamen und Beschriftungen | Die korrekten extrahierten Werte |
| Reihenfolge der Felder auf der Seite | Die Bedeutung des Dokuments |
| Zahlen, Daten und Kennungen | Die Beziehungen zwischen ihnen |
| Sprache der Beschriftungen | Alles Übrige |
Was wir gebaut haben
Einen Variantengenerator. Jeder markierte Fall erzeugt mehrere Fassungen mit regelbasiert geänderten Namen, Zahlen und Reihenfolgen, und die erwarteten Werte wandeln sich mit — weil die Umformung mechanisch ist und nicht modellerzeugt.
Genau dieses Detail macht es unbedenklich. Wir haben an anderer Stelle geschrieben, dass wir keine erwarteten Antworten erzeugen, und das verletzt es nicht: Die Erwartung wird deterministisch aus einem von Menschen geprüften Original abgeleitet, kein Modell entscheidet, was richtig heißt.
Was es sofort gefunden hat
Drei echte Defekte im ersten Lauf. Der Schritt traf eine Beschriftung über die Position, wenn die Beschriftung fehlte, deutete ein Datum anhand einer Überschrift statt anhand des Wertes als europäisches Format, und las von zwei Summen die letzte statt der verlangten.
Alle drei waren die ganze Zeit vorhanden und alle drei unsichtbar, weil unsere achtzig Fälle die Bedingungen nie herstellten. Die Ordentlichkeit des Sets war keine kleine Einschränkung, sie war der Grund, warum wir den Schritt für funktionierend hielten.
Wie wir heute berichten
Zwei Zahlen statt einer. Genauigkeit auf den Originalfällen, was wir Kunden zusagen, und Genauigkeit über Varianten hinweg, was uns sagt, ob der Schritt robust ist. Liegt die zweite deutlich unter der ersten, ist der Schritt an eine Oberfläche angepasst.
Der Abstand ist das nützliche Signal. Er lag anfangs bei rund achtzehn Punkten und liegt heute unter fünf, und ihn zu beobachten ist, wie wir merken, dass ein Schritt zu unserer Formulierung driftet statt zur Aufgabe.
Die Kosten und die Falle
Billig im Betrieb und leicht zu missbrauchen. Der Generator erzeugt viele Fälle, und eine große grüne Zahl beruhigt auf eine Weise, die nicht immer verdient ist — deshalb begrenzen wir, was sie behaupten darf: Ein gescheiterter Variantenfall ist ein zu untersuchender Defekt, ein bestandener für sich kein Beleg.
Die von Menschen geprüften Originalfälle bleiben das Gate. Varianten stehen daneben als Robustheitsmaß — dieselbe Trennung, die wir bei erzeugten Eingaben in unserer Bewertungsarbeit überall anwenden.
Was wir nicht behaupten
Wir behaupten nicht, Varianten deckten die echte Verteilung ab. Sie variieren, woran wir gedacht haben, und die nächste Überraschung wird ziemlich sicher eine Dimension sein, die zu ändern uns nicht eingefallen ist — eine Grenze, die keine Menge an Erzeugung beseitigt.
Wir behaupten auch nicht, ein kleiner Abstand bedeute, ein Schritt sei robust. Er bedeutet, der Schritt ist robust gegen die Umformungen, die wir anwenden. Das ist enger — und es eng zu sagen ist die einzige Art, wie die Zahl ihren Wert behält.
