Start KI-Lösungen Fertige Lösungen Peers & Simulation RAG & Retrieval Use Cases Frameworks Blog English Kontakt

Engineering-Notizen

Präzise. Faktenbasiert. Aus der Produktion.

Seit 2023 dokumentieren wir hier, was in KI-Systemen wirklich funktioniert — mit Zahlen, Quellen und ehrlichen Grenzen.

OpenAI o1: Test-Time Compute und der Preis des Denkens

OpenAIs o1-preview und o1-mini, veröffentlicht am 12. September 2024, tauschen Latenz und Kosten gegen Genauigkeit: Rechenzeit fließt zur Inferenz in verborgene Reasoning-Tokens. Wir untersuchen, wo trainiertes Schlussfolgern hilft — Mathematik, Code, Planung —, was es kostet, warum die Gedankenkette verborgen bleibt und was Test-Time Compute für die Praxis bedeutet.

Agentengedächtnis jenseits des Kontextfensters

Kontextfenster sind Arbeitsgedächtnis, kein Gedächtnis. Dieser Artikel trennt beide Begriffe und beschreibt die drei Mechanismen, die 2024 produktiv im Einsatz sind — Gesprächszusammenfassungen, Vektorgedächtnis und strukturierter Zustand — samt ihrer Fehlermodi. Dazu: warum gezieltes Vergessen die Korrektheit verbessert und welche Grenzen die DSGVO persistentem Agentengedächtnis setzt.

Die Ökonomie des Prompt Caching

Anthropics Prompt-Caching-Beta verändert die Kostenrechnung langer Prompts: Cache-Schreibvorgänge kosten 25 Prozent mehr als Basis-Input-Tokens, Cache-Lesevorgänge 90 Prozent weniger. Wir rechnen Preise und Break-even durch, benennen die Grenzen der fünfminütigen TTL und zeigen, was die Zahlen für RAG-Pipelines und Agenten-Loops bedeuten.

ColPali: Visuelles Dokument-Retrieval ohne OCR

ColPali (Juni 2024) ersetzt die OCR-Parsing-Pipeline durch direktes Einbetten von Seitenbildern. Wir erklären den Late-Interaction-Mechanismus aus ColBERT, die ViDoRe-Ergebnisse — 81,3 gegenüber 66,1 nDCG@5 — sowie die Speicher- und Skalierungskompromisse und ordnen ein, wo visuelles Retrieval in produktiven RAG-Systemen im Juli 2024 steht.

Strukturierte Dokumentenextraktion mit Vision-LLMs

Wie Rechnungen und Verträge 2024 mit Vision-LLMs zu schema-validiertem JSON werden: was GPT-4o, Claude 3.5 Sonnet und Gemini 1.5 Pro auf Dokumenten leisten, welche Genauigkeitsspannen in der Produktion realistisch sind, warum der Validator vor dem Prompt entsteht und wo menschliche Prüfung strukturell notwendig bleibt.

GraphRAG: Globale Fragen mit Wissensgraphen beantworten

Microsoft hat GraphRAG veröffentlicht: eine Indexierungs-Pipeline, die per LLM einen Entitätsgraphen aus Text extrahiert, ihn mit dem Leiden-Algorithmus partitioniert und jede Community vorab zusammenfasst. Wir erklären, wie das globale Fragen beantwortet, an denen Vektor-RAG scheitert, was das Paper tatsächlich misst und warum die Indexierungskosten der eigentliche Trade-off sind.

Claude 3.5 Sonnet: Wenn die Mittelklasse das Flaggschiff schlägt

Claude 3.5 Sonnet, veröffentlicht am 20. Juni 2024, schlägt Anthropics Flaggschiff Claude 3 Opus zu einem Fünftel des Preises bei doppelter Geschwindigkeit. Wir analysieren die Benchmark-Daten, die fallende Kosten-pro-Qualität-Kurve seit GPT-4 und warum Artifacts den Wandel zu Arbeitsergebnissen statt Chat-Transkripten markiert — inklusive der Grenzen.

Golden Test Sets: Ground Truth für LLM-Produkte

Wie Sie 2024 Golden Test Sets für LLM-Produkte aufbauen und pflegen: echte Produktionsanfragen sampeln, mit Fachexperten trotz Criteria Drift labeln, bekannte Fehlermodi abdecken und automatische Richter gegen Expertenlabels kalibrieren. Und warum die Pflege des Datensatzes — nicht das Tooling — der eigentliche Engpass der Evaluation ist. Mit konkreten Zahlen und datierten Quellen.

GPT-4o: Echtzeit-Multimodalität für Assistenten

GPT-4o, vorgestellt am 13. Mai 2024, verarbeitet Text, Bild und Audio in einem einzigen Ende-zu-Ende-Netz. Wir prüfen die belegten Zahlen — 320 ms mittlere Sprachlatenz, halber Preis gegenüber GPT-4 Turbo, fünffache Rate-Limits — und trennen, was die API heute liefert, von dem, was die Launch-Demos versprechen.

LoRA und PEFT in der Praxis

Ein Praxisleitfaden zu parameter-effizientem Fine-Tuning mit Stand April 2024. Wir erklären die Funktionsweise von LoRA, die 4-Bit-Quantisierung von QLoRA und die aktuelle Open-Source-Toolchain. Dazu ein Entscheidungsrahmen für Tuning versus Retrieval versus Prompting — inklusive der Grenzen von Adaptern und dem Serving tausender Adapter auf einer GPU.

Llama 3: Offene Gewichte werden zur ernsthaften Option

Metas Llama 3 (18. April 2024) verkleinert den Abstand zwischen offenen Gewichten und geschlossenen APIs. Wir betrachten die Benchmarks der 8B- und 70B-Modelle, die Wirkung von 4-Bit-Quantisierung auf die Hardwareanforderungen, die Auslastungsrechnung des Self-Hosting gegenüber API-Preisen und die datenschutzgebundenen Workloads, in denen nur ein offenes Modell in Frage kommt.

RAG-getunte Modelle: Command R und Grounded Generation

Cohere hat am 11. März 2024 Command R veröffentlicht: ein Modell, das Grounded Generation als trainierte Fähigkeit statt als Prompt-Trick behandelt — mit Zitaten auf Span-Ebene, nativem Tool Use, 128k Kontext und offenen Forschungsgewichten. Wir analysieren, was ein RAG-getuntes Modell für Produktionssysteme ändert, was es nicht löst und wohin sich die Kategorie entwickelt.