Start KI-Lösungen Fertige Lösungen Peers & Simulation RAG & Retrieval Use Cases Frameworks Blog English Kontakt

Technische Analysen

Belegt. Praxisnah. Klar abgegrenzt.

Seit 2023 analysieren wir, was in KI-Systemen belastbar funktioniert — anhand von Zahlen, Quellen und klar benannten technischen Grenzen.

Was ein lange laufender Agent behält und was er verwirft

Sechzig Werkzeugaufrufe erzeugen einen Verlauf, der in kein Fenster passt. Das Älteste zusammenzufassen verwirft die Entscheidungen und die gescheiterten Versuche — genau das, was einen Agenten davon abhält, sich zu wiederholen. Kang und Kollegen optimieren, was bei langen Aufgaben verdichtet wird. Unsere Regel: Beobachtungen verdichten, Entscheidungen und Fehler bleiben wörtlich.

Produktivitätszahlen stammen aus dem Neubau, unsere Arbeit nicht

Ein Kunde fragte, warum unsere Schätzung einen veröffentlichten Produktivitätsgewinn nicht abbildet. Die Studie maß neuen Code ohne bestehende Randbedingungen; unsere Arbeit ist ein fünfzehn Jahre altes System mit undokumentierten Konventionen. Sharma benennt Brownfield als eigene Kategorie. Was sich dort tatsächlich beschleunigt, was nicht, und welche Zahl wir stattdessen nennen.

Mehr zeigen ist nicht dasselbe wie helfen

Wir haben Quellen, Konfidenz, Abfrage und Begründung auf einen Prüfbildschirm gelegt, und die Prüfgenauigkeit sank. Margondai und Mouloua entwickeln eine Theorie dazu, wann Erklärungen Entscheidungen durch kognitive Last verschlechtern. Was wir entfernt haben, was standardmäßig bleibt, und warum unser eigenes Prinzip eine Grenze brauchte.

Wir verkaufen keinen Halluzinations-Detektor

Ausschreibungen fragen ihn namentlich nach, mit Zielquote. Sinha leitet Grenzen dessen her, was Ähnlichkeit zwischen Antwort und Quelle belegen kann — deckungsgleich mit unserer Messung: Der Ähnlichkeitstest fängt die abgedriftete Wiedergabe und lässt die nicht folgende Schlussfolgerung durch. Was wir stattdessen bauen und welche drei Prüfungen je einen benennbaren Fehler fangen.

Der Stapellauf, der den Assistenten auffraß

Ein nächtlicher Aufnahmelauf überlappte mit dem Morgen, und der Assistent brauchte neun Sekunden statt zwei. Park untersucht, wie Infrastrukturfehler Autoscaler zu Fehlzuteilungen bringen. Unserer war nicht fehlerhaft, er war auf Durchschnittslast konfiguriert von einem Team, das nicht wusste, dass sich zwei Lasten einen Pool teilen.

Wem gehört der Assistent, wenn wir gehen

Wir sollten prüfen, warum ein Assistent schlechter geworden war, und fanden elf in der Organisation, mit benanntem Verantwortlichen für zwei. Acharya schlägt ein Reifegradmodell gegen Agenten-Wildwuchs vor. Die vier Fragen, die wir heute zu jedem betriebenen System stellen, das Übergabedokument, auf dem wir bestehen, und warum ein Assistent ohne Eigentümer schlechter ist als keiner.

Der Index weiß mehr, als der Nutzer wissen darf

Ein Bestand, drei Abteilungen, Filterung nach Rechten nach dem Abruf. Ein Kollege zeigte an einem Vormittag, dass sich um den Filter herum schließen lässt: Was zurückkommt, wenn ein gesperrtes Dokument der beste Treffer wäre, verrät etwas, auch wenn das Dokument es nicht tut. Tang und Kollegen arbeiten an Datenschutzgarantien für Retrieval.

Der Chunker hätte vor drei Jahren einen eigenen Artikel verdient

Wir haben Chunking in einem Dutzend Beiträgen den größten Hebel genannt und nie darüber geschrieben. Was wir tun: Struktur zuerst, ein Gedanke je Chunk, Überschriften in den Text übernommen, Tabellen nie geteilt. Koutsiaris segmentiert nach vorhergesagtem Informationsbedarf — die Richtung, in der wir zufällig gelandet sind. Zwei Fehler und die Einstellung, die niemand kopieren sollte.

Ein Assistent vor der Warteschlange verändert die Rechnung

Der Assistent löste vierzig Prozent der Anfragen und leitete sechs falsch weiter, und der Durchsatz verbesserte sich nicht. Dada und Kollegen modellieren den Gatekeeper, der löst oder weiterreicht. Eine Fehlleitung kostet eine volle Bearbeitung plus die ursprüngliche — der Break-even liegt nicht dort, wo die Intuition ihn vermutet.

Wenn der Nutzer mittendrin seine Meinung ändert

Eine Nutzerin merkte nach neunzig Sekunden, dass der Filter falsch war, und sagte es. Der Agent beendete den Auftrag korrekt und meldete Erfolg, weil der Entwurf keine Unterbrechung vorsah. Zou und Kollegen bewerten unterbrechbare Agenten bei langen Aufgaben. Haltepunkte zwischen Schritten, was eine Unterbrechung kostet, und warum Rückgängigmachen ein anderes Problem ist.

Der Assistent, der zu leicht nachgab

Auf den Vorwurf, falsch zu liegen, entschuldigte sich unser Assistent und lieferte eine andere Antwort. Wir haben fünfzig solcher Wechsel geprüft: Die erste Antwort war in etwa vier von fünf Fällen richtig. Zhang und Kollegen untersuchen, ob Agenten bei Widerspruch reparieren oder nur antworten. Was wir geändert haben und warum die höfliche Fassung die gefährliche war.

Korrekt abgerufen, treu zitiert, trotzdem falsch

Die Zahl in der Antwort passte zum Dokument, und das Dokument war seit 2019 falsch. Jede Prüfung fragt, ob die Antwort zur Quelle passt; keine, ob die Quelle stimmt. Patil arbeitet an der Erkennung manipulierter Zahlenangaben in Retrieval-Systemen. Was sich dokumentübergreifend prüfen lässt, warum Zahlen anders zu behandeln sind als Prosa, und was ein Datenqualitätsproblem bleibt.