Start KI-Lösungen Fertige Lösungen Peers & Simulation RAG & Retrieval Use Cases Frameworks Blog English Kontakt

Engineering-Notizen

KI verstehen. Entscheidungen belegen.

Jeder Beitrag beginnt mit einer praktischen Frage, erklärt die nötigen Fachbegriffe und verlinkt Primärquellen. Wir trennen externe Evidenz, eigene Projekterfahrung und Schlussfolgerungen — und benennen, was sich daraus nicht ableiten lässt.

Quelle
Externe Zahlen, Rechtsstände und Produktdaten führen zur Primärquelle.
Praxisbeobachtung
Eigene Messungen gelten für den beschriebenen Fall — nicht automatisch allgemein.
Grenze
Wir sagen, welche Schlussfolgerung die Daten tragen und welche nicht.

Agent Governance: Identitäten für die nicht-menschliche Belegschaft

Handelnde Agenten brauchen verwaltete Identitäten. Dieser Artikel definiert Agenten-Identität, betrachtet Microsoft Entra Agent ID und das MCP-Autorisierungsmodell und beschreibt Least Privilege an der Tool-Grenze, delegationsbewusste Audit-Trails und die Entdeckung von Schatten-Agenten — einschließlich der Grenzen jeder Kontrolle und der Control Planes, die wir als Nächstes erwarten.

Der Filter, der die Arbeit blockierte

Ein Techniker fragte, was beim Mischen zweier Reinigungsmittel passiert, und der Sicherheitsfilter lehnte ab — genau die Frage, für die es das Sicherheitsdatenblatt gibt. Kumar und Kollegen zeigen, dass Guardrails Falsch-Positive gegen Falsch-Negative tauschen, ohne kostenlose Option. Was wir auf beiden Seiten messen, warum eine Ablehnung ein Defekt mit Ticket ist, und wo wir Überblockung bewusst hinnehmen.

Wir bauen weniger Agenten, die miteinander sprechen

Planer, Rechercheur, Schreiber, Kritiker und Aufseher erzeugten plausible Pläne und falsche Ergebnisse, die niemand einer Komponente zuordnen konnte. Cemri und Kollegen erstellen eine Taxonomie, warum Multi-Agenten-Systeme scheitern — die meisten Kategorien betreffen Koordination, nicht Fähigkeit. Was wir durch gewöhnlichen Code ersetzt haben und wo ein zweiter Agent seinen Platz behält.

GPT-5: Das Modell wird zum Portfolio

GPT-5 macht aus der Modellauswahl einen Echtzeit-Router, der pro Anfrage zwischen schnellem Pfad und Reasoning-Pfad wählt. Wir zeigen, wie der Router entscheidet, warum die API explizite Kontrollen behält, was die Startwoche über Vorhersagbarkeit gelehrt hat und wie sich die Evaluationspraxis ändern muss, wenn das Produkt ein Portfolio hinter einem Namen ist.

Deklarative Agenten für Microsoft 365 Copilot

Über ein JSON-Manifest spezialisieren deklarative Agenten Microsoft 365 Copilot: Instruktionen, Wissensquellen und OpenAPI-Aktionen laufen vollständig auf Microsofts Orchestrator, ohne eigenes Hosting. Wir betrachten den Schema-Stand vom August 2025, die Governance im Microsoft 365 Admin Center, die Abrechnungsmodelle mit konkreten Preisen sowie die Fälle, in denen Custom Engine Agents mit eigenem Code die bessere Wahl bleiben.

Ein Modell schätzt sich genau dort am schlechtesten ein, wo Ihr Geschäft liegt

Modelle wissen besser, was sie nicht wissen, wenn das Thema breit dokumentiert ist. Ni und Kollegen verknüpfen diese Selbsteinschätzung mit der Verbreitung des Wissens — mit einer unangenehmen Folge für Spezialisten: Der Assistent kann seine Unsicherheit genau dort am schlechtesten anzeigen, wo die Expertise des Kunden liegt. Was daraus für die Architektur folgt.

Hybrides Retrieval und Reranker: Die Baseline 2025

Der Retrieval-Standard 2025 kombiniert BM25 und dichte Vektoren per Reciprocal Rank Fusion und ordnet sie mit einem Cross-Encoder-Reranker neu. Wir behandeln die gemessenen Verbesserungen von Anthropic und Cohere, ein realistisches Latenzbudget, drei Reranker für die Produktion und die Frageklassen, die diese Baseline weiterhin nicht beantwortet.

Die Testsuite ist die Migration

Ein Kunde wollte eine fünfzehn Jahre alte Codebasis modernisieren, und wir haben die ersten sechs Wochen Tests geschrieben. Code zu übersetzen können Modelle gut; zu wissen, ob die Übersetzung das Verhalten erhält, entscheidet, ob das Projekt ankommt. Was wir zuerst testen, warum wir Blätter vor Stämmen migrieren, und welche Änderung wir keinem Assistenten erlaubt haben.

Einen Assistenten die Datenbank abfragen lassen

Auf Deutsch fragen, eine Zahl aus dem ERP bekommen: Die Vorführung ist unwiderstehlich, die Betriebsfassung sieht ihr nicht ähnlich. Wir geben kuratierte Sichten frei statt Tabellen, denn eine korrekte Abfrage über die falsche Tabelle ist der Fehler ohne Fehlermeldung. Was wir verbieten, warum jede Antwort die Abfrage zeigt, und die Zahl, die stimmte und trotzdem falsch war.

A2A wechselt zur Linux Foundation

Google übergab das Agent2Agent-Protokoll (A2A) an die Linux Foundation. AWS, Cisco, Google, Microsoft, Salesforce, SAP und ServiceNow sind Gründungsmitglieder. Wir ordnen ein, was das Protokoll spezifiziert, was es bewusst offenlässt und warum neutrale Governance die Voraussetzung für Agenten-Interoperabilität über Organisationsgrenzen hinweg ist.

Service-Virtualisierung für Agenten

Agenten-Journeys führen letztlich zu Systemen, die Sie nicht in großem Umfang testen können: Zahlungsdienstleister, ERP-Backends, Partner-APIs. Wir übertragen Service-Virtualisierung auf Agenten — simulierte Gegenstellen hinter echten Verträgen, mit Zustand und Fehlerinjektion — und begründen, warum jedes simulierte Ergebnis ein explizites Label tragen muss. Mit geprüften Daten aus τ-bench, τ²-bench und Microcks 1.12.0.

Die Multi-Agenten-Debatte: Warum beide Seiten recht haben

Am 12. und 13. Juni 2025 gaben Cognition und Anthropic scheinbar widersprüchliche Empfehlungen zu Multi-Agenten-Systemen. Wir vergleichen 'Don't Build Multi-Agents' mit Anthropics Research-System-Post — 90,2 Prozent Verbesserung bei rund 15-fachen Token-Kosten — und leiten eine Entscheidungsregel ab: zerlegbare Breite parallelisieren, Arbeit mit geteiltem Kontext einsträngig halten.