Wenn der Nutzer mittendrin seine Meinung ändert
Eine Nutzerin startete eine Sammeländerung, merkte nach neunzig Sekunden, dass der Filter falsch war, und sagte es. Der Agent beendete den ursprünglichen Auftrag, korrekt und vollständig, und meldete anschließend Erfolg.
Die neunzig Sekunden
Die Aufgabe war, eine Lieferadresse über eine Reihe offener Aufträge zu ändern. Der Agent las den Filter, holte einundvierzig Aufträge und arbeitete sie ab. Nach neunzig Sekunden schrieb die Nutzerin, der Filter hätte stornierte Aufträge ausschließen müssen.
Der Agent sah diese Nachricht erst nach dem Ende, denn unser Entwurf sammelte Nutzereingaben zwischen Aufgaben statt während einer. Achtunddreißig Aufträge waren geändert, sechs davon zu Unrecht, und die Meldung lautete, die Aufgabe sei erfolgreich abgeschlossen.
Warum unser Entwurf keinen Platz dafür hatte
Wir hatten eine Agentenaufgabe als Anfrage und Antwort modelliert. Dieses Modell stimmt für einen Schritt von zwei Sekunden und ist falsch für einen von drei Minuten — und die Grenze zwischen beiden Fällen hatte sich verschoben, ohne dass es jemandem auffiel, als die Aufgaben größer wurden.
Zou und Kollegen veröffentlichten 2026 eine Arbeit zur Bewertung unterbrechbarer Agenten bei langen Aufgaben und behandeln den Meinungswechsel des Nutzers mitten in der Aufgabe als normales Ereignis statt als Randfall.
Was wir gebaut haben
Haltepunkte zwischen Schritten. Der Agent prüft nach jedem Element auf neue Nutzereingaben statt erst am Ende, und eine neue Nachricht pausiert den Lauf und zeigt, was bisher getan wurde und was noch aussteht.
Das ist billig, weil die Schleife ohnehin existierte; die Änderung war, am Anfang jeder Runde eine Warteschlange zu lesen. Es ist keine Verdrängung, ein laufendes Element wird zu Ende gebracht — bei unseren Aufgaben heißt das, dass nach dem Einwurf höchstens ein weiterer Datensatz betroffen ist.
| Dauer der Aufgabe | Was wir tun |
|---|---|
| Unter wenigen Sekunden | Nichts. Unterbrechung lohnt nicht |
| Sekunden bis Minuten | Zwischen Elementen auf Eingaben prüfen |
| Minuten mit Seiteneffekten | Prüfen und laufend Fortschritt melden |
| Alles mit unumkehrbaren Schritten | Vorher bestätigen, nicht mittendrin |
Was eine Unterbrechung wirklich kostet
Die Prüfung selbst ist kostenlos. Teuer ist, dass der Agent nun seinen eigenen Fortschritt in einer Form beschreiben können muss, mit der eine Nutzerin etwas anfangen kann: achtunddreißig von einundvierzig erledigt, diese sechs entsprechen dem genannten Stornofilter, abbrechen oder fortfahren?
Diese Berichterstattung war der größte Teil der Arbeit. Ein Agent, der pausieren kann und nicht sagen kann, was er getan hat, stellt eine Nutzerin vor eine Wahl, für die sie keine Grundlage hat — und das ist schlimmer als gar nicht zu pausieren.
Rückgängigmachen ist ein anderes Problem
Wir haben es nicht gelöst. Die sechs falsch geänderten Aufträge mussten von Hand korrigiert werden, denn die Werkzeuge des Agenten schreiben in ein System, das um einen Stapel von einundvierzig Datensätzen keine Transaktionsgrenze kennt.
Ergänzt haben wir stattdessen eine Aufzeichnung des Geänderten, je Element, mit dem vorherigen Wert. Damit wird die Korrektur ein skriptbarer Vorgang statt einer Untersuchung — und das ist die ehrliche Grenze dessen, was wir anbieten können, wenn das darunterliegende System kein Zurückrollen kennt.
Die Regel zu unumkehrbaren Schritten
Alles Unumkehrbare wird vor dem Lauf bestätigt, ausdrücklich aufgelistet, und niemals in eine Schleife gelegt, die auf halbem Weg unterbrochen werden kann. Ein Agent, der Mails an eine Liste versendet, ist keine unterbrechbare Aufgabe; er ist eine Aufgabe, die bestätigt wird und dann durchläuft.
Diese Unterscheidung gehört heute zur Einordnung von Agentenarbeit im Entwurf. Umkehrbare Sammelvorgänge bekommen Haltepunkte. Unumkehrbare bekommen eine Bestätigung und keine Abbruchmöglichkeit — denn ein halb versendeter Verteiler ist schlimmer als beide Ausgänge.
Was wir Nutzern sagen
Dass sie unterbrechen können — in der Oberfläche, im Moment des Aufgabenstarts. Eine Fähigkeit, von der niemand weiß, ist keine Fähigkeit, und unsere erste Fassung hatte die Haltepunkte und keinen Hinweis darauf, dass Sprechen etwas bewirkt.
Die Unterbrechung wird bei etwa jedem neunten Lauf genutzt, weit häufiger als erwartet — was nahelegt, dass Menschen zuvor zusahen, wie Aufgaben falsch liefen, und auf deren Ende warteten.
Was wir nicht behaupten
Wir behaupten nicht, Haltepunkte machten lange Aufgaben sicher. Sie verkürzen das Fenster, in dem eine falsche Anweisung weiter ausgeführt wird; das eigentliche Risiko ist, dass ein Sammelvorgang auf einem falschen Filter gestartet wurde — ein Bestätigungsproblem am Anfang, kein Unterbrechungsproblem in der Mitte.
Wir behaupten auch nicht, unsere Quote von einem Neuntel sei ein gutes Zeichen. Sie kann heißen, dass die Oberfläche wirkt, und sie kann heißen, dass unser Einrichtungsschritt schlecht genug ist, dass Menschen häufig den falschen Auftrag starten. Wir haben das nicht getrennt und sollten es tun.
