Start KI-Lösungen Fertige Lösungen Peers & Simulation RAG & Retrieval Use Cases Frameworks Blog English Kontakt

Engineering-Notizen

Präzise. Faktenbasiert. Aus der Produktion.

Seit 2023 dokumentieren wir hier, was in KI-Systemen wirklich funktioniert — mit Zahlen, Quellen und ehrlichen Grenzen.

Prompt Injection bleibt ungelöst

Ein Jahr nach der Benennung durch Simon Willison ist Prompt Injection ungelöst. Wir definieren direkte und indirekte Injection, erklären, warum Retrieval-Augmented Generation und Tool-Nutzung die Angriffsfläche vergrößern, prüfen die im September 2023 verfügbaren Mitigationen und benennen offen, was jede einzelne nicht leistet. Eine vollständige Lösung existiert nicht.

Chunking-Strategien für Document QA

Chunking bestimmt, was ein Document-QA-System überhaupt finden kann. Wir vergleichen Fixed-Size- und rekursives Splitting, quantifizieren die Trade-offs von Chunk-Größe und Overlap gegen die Kontextfenster von 2023 und erklären, warum Metadaten Pflicht sind. Mit verifizierten Zahlen von Pinecone, OpenAI und dem Lost-in-the-Middle-Paper — und einem Ausblick vom September 2023.

Vektordatenbanken: Wann Sie wirklich eine brauchen

Allein im Frühjahr 2023 flossen über 160 Millionen Dollar in Vektordatenbanken. Wir erklären, was Approximate-Nearest-Neighbor-Suche tatsächlich leistet, wie der HNSW-Index funktioniert und warum Postgres mit dem heute erschienenen pgvector 0.5.0 oft ausreicht — samt konkreter Kriterien, wann sich ein dediziertes System wirklich lohnt.

Llama 2: Was offene Gewichte für Unternehmen bedeuten

Meta hat Llama 2 am 18. Juli 2023 unter einer Lizenz veröffentlicht, die kommerzielle Nutzung erlaubt. Wir untersuchen, was offene Gewichte für Unternehmensarchitekturen ändern: Datenresidenz ohne Drittlandtransfer, fixe Inferenzkosten statt Token-Abrechnung, die gemessene Qualitätslücke zu GPT-4 und der heutige Einsatzbereich der Modelle mit 7B, 13B und 70B Parametern.

RAG oder Fine-Tuning für Unternehmenswissen

Retrieval-Augmented Generation oder Fine-Tuning: Wie kommt Unternehmenswissen in ein Sprachmodell? Eine Engineering-Sicht aus dem Sommer 2023. Wir erklären, was Fine-Tuning tatsächlich ändert, wie Embeddings und Vektorsuche funktionieren, warum Retrieval bei Fakten der Standard sein sollte und wo sich Fine-Tuning lohnt — gestützt auf Lewis et al. (2020) und aktuelles Tooling.

Function Calling: Von freiem Text zu strukturierten Werkzeugaufrufen

OpenAI hat GPT-4 und GPT-3.5 am 13. Juni 2023 um Function Calling erweitert. Wir erklären, was der neue functions-Parameter ermöglicht — Werkzeuge, strukturierte Extraktion, erste Agenten-Schleifen —, wie der Aufrufzyklus funktioniert und wo er scheitert: halluzinierte Argumente, nicht erzwungene Schemata, Prompt Injection. Mit Validierungsmustern für den Produktionsbetrieb.