Start KI-Lösungen Fertige Lösungen Peers & Simulation RAG & Retrieval Use Cases Frameworks Blog English Kontakt

Engineering-Notizen

Präzise. Faktenbasiert. Aus der Produktion.

Seit 2023 dokumentieren wir hier, was in KI-Systemen wirklich funktioniert — mit Zahlen, Quellen und ehrlichen Grenzen.

MCP und A2A — die Protokollschicht des Agenten-Ökosystems

Die MCP-Revision 2026-07-28 macht das Protokoll zustandslos und härtet OAuth; A2A 1.0 bringt signierte Agent Cards, Multi-Tenancy und drei Protokoll-Bindings. Der Artikel prüft den aktuellen Stand beider Standards, erklärt das Zusammenspiel der Schichten Agent-zu-Werkzeug und Agent-zu-Agent, skizziert Gateway-Muster für Unternehmen und benennt präzise, was die Protokolle nicht lösen: Semantik und Vertrauen in Inhalte.

Subagenten vs. Peer-Agenten — zwei Arbeitsmodi von Multi-Agenten-Systemen

Subagenten und Peer-Agenten heißen beide Multi-Agenten-Systeme, unterscheiden sich aber in Zustand, Lebenszyklus, Kosten und Vertrauensmodell. Dieser Artikel trennt die beiden Arbeitsmodi mit verifizierten Zahlen von Anthropic und Cognition, erklärt, was A2A 1.0 standardisiert — Agent Cards, Tasks, contextId —, zeigt, warum Unabhängigkeit die Simulation von Gegenübersystemen ermöglicht, und liefert sechs Entscheidungsregeln für die Wahl des richtigen Modus.

Simulation-First-Engineering für Agenten

End-to-End-Journeys von Agenten enden in Zustandsänderungen bei Behörden, ERP-Systemen und Partner-APIs — Systemen, gegen die sich nicht frei testen lässt. Dieser Artikel definiert das Simulation-First-Muster: Das reale Gegensystem wird hinter demselben Kontrakt gegen ein zustandsbehaftetes simuliertes getauscht. Wir ordnen das Muster gegenüber Service-Virtualisierung und Digital Twins ein und behandeln ehrliche Kennzeichnung, Last- und Angriffstests, die Fidelity-Lücke und den Weg zu Ökosystemen simulierter Gegensysteme.

Eval-getriebene Entwicklung für LLM-Systeme

Demos beweisen, dass ein LLM-System einmal funktionieren kann; Evals beweisen, dass es zuverlässig funktioniert. Der Artikel definiert goldene Testsets, die vier RAGAS-Standardmetriken für RAG-Pipelines, LLM-as-Judge mit dokumentierten Verzerrungen und verifizierten Gegenmaßnahmen, Offline- versus Online-Evaluation und Regressions-Gates in der CI — dazu Trajektorien- und Tool-Call-Evaluation für Agenten, mit Zahlen aus MT-Bench, τ-bench und dem Berkeley Function-Calling Leaderboard.

GraphRAG — wann sich Wissensgraphen lohnen

GraphRAG verwandelt einen Dokumentenkorpus in einen LLM-extrahierten Wissensgraphen mit Leiden-Communities und vorberechneten Zusammenfassungen — korpusweite Fragen werden damit beantwortbar. Wir prüfen die belegten Zahlen: 70–80 % Gewinnrate bei Vollständigkeit, 0,1 % Indexierungskosten und 700-fach günstigere globale Abfragen mit LazyGraphRAG. Und wir benennen die Fälle, in denen hybrides RAG günstiger, schneller und genauer bleibt — mit fünf Entscheidungsregeln für die Praxis.

Hybrid Retrieval ist die Produktions-Baseline

Reine Vektorsuche verfehlt exakte Identifier, Fehlercodes und seltene Begriffe. Dieser Artikel definiert die Produktions-Baseline für RAG-Retrieval: BM25 plus Dense Embeddings, fusioniert per Reciprocal Rank Fusion, gefolgt von Cross-Encoder-Reranking. Wir belegen gemessene Genauigkeitsgewinne und Latenzkosten, verfolgen die Herkunft der 70-Prozent-Behauptung zurück und benennen klar, wann hybrides Retrieval nicht ausreicht.

MCP im Unternehmenseinsatz: Registry und Gateways

Die offizielle MCP-Registry macht Server auffindbar, Streamable HTTP mit OAuth 2.1 macht sie remote. Daraus entstand ein Markt für Gateways mit zentraler Authentifizierung, Autorisierung je Werkzeug und Audit. Der Artikel zeigt, was die Registry garantiert, warum das Protokoll ein Gateway nahelegt, welche Risiken bleiben und wie ein minimaler Rollout im Unternehmen aussieht.

Vector-Store-Konsolidierung: Das Betriebsmodell entscheidet

Die Wahl des Vektorspeichers entscheidet 2026 kein ANN-Benchmark mehr, sondern das Betriebsmodell. pgvector 0.8.2, wo Postgres bereits die Datenplattform ist. Qdrant 1.17 für gefilterte Suche und Speichereffizienz im großen Maßstab. Azure AI Search für verwaltete Azure-Landschaften mit hybrider Suche und Semantic Ranker. Mit Speicherrechnung, Datenresidenz und dem Fall ohne Vektordatenbank.

EU AI Act Artikel 50 — Transparenz ab 2. August 2026

Die Hochrisiko-Pflichten der KI-Verordnung werden auf Dezember 2027 verschoben. Artikel 50 nicht. Ab 2. August 2026 müssen Anbieter erzeugte Inhalte maschinenlesbar kennzeichnen und die KI-Interaktion offenlegen, Betreiber müssen Deepfakes kennzeichnen. Wir zeigen, was jetzt zu bauen ist — Kennzeichnung, Offenlegung in der Oberfläche, Protokollierung — und was die Verordnung nicht verlangt.

Work IQ: Agenten im Organisationskontext verankern

Microsoft Work IQ verankert Copilot und Agenten in der realen Arbeitsweise einer Organisation: Projekte, Mitwirkende, Dokumente, Muster. Der Beitrag erklärt den Unterschied zwischen Kontextschicht und Data Lake, warum Berechtigungen zur Abfragezeit aufgelöst werden müssen, was CVE-2025-32711 offengelegt hat und welche sechs Punkte Teams vor der Einführung prüfen sollten.

Dual-State-Architekturen für Agenten

Chatverläufe sind Logs von Äußerungen, keine Datenbanken. Dieser Artikel beschreibt eine Dual-State-Architektur für KI-Agenten: ein autoritativer, schemavalidierter Prozesszustand pro Instanz, aus dem jede nutzerseitige Sicht als Projektion einer konkreten Revision berechnet wird. Wir behandeln die Wurzeln des Musters in Event Sourcing und CQRS, seine Audit- und Nebenläufigkeitsvorteile und seine ehrlichen Grenzen.

Agent-Evals in der CI: Regressions-Gates für Trajektorien und Tool-Calls

Agenten scheitern an deterministischen Tests, weil derselbe Input unterschiedliche Trajektorien erzeugt. Dieser Artikel zeigt, wie Sie Regressionen 2026 in der CI abfangen: Assertions auf Tool-Calls und Trajektorien, Offline-Datensätze mit Referenzausgaben, Online-LLM-Judges auf Produktions-Traces, Kostenverfolgung pro Lauf und eval-getriebene Entwicklung als Arbeitsweise für Agenten in Produktion.