LlamaIndex Extract v2.5 steigert Genauigkeit durch strukturelles Schlussfolgern
LlamaIndex hat Extract v2.5 veröffentlicht, was die Genauigkeit der Dokumentenextraktion über alle Leistungsebenen hinweg verbessert und erweiterte Zitierfunktionen für eine bessere Datenverankerung hinzufügt.
Automatisch aus dem englischen Original übersetzt.
LlamaIndex hat Extract v2.5 auf den Markt gebracht, ein bedeutendes Update für seine schemabasierten Dokumentenextraktions-Agenten, das eine höhere Genauigkeit und eine verbesserte Datenverankerung bietet. Die am 1. Oktober 2026 veröffentlichte Version führt architektonische Änderungen ein, die von Coding-Agenten inspiriert sind, um komplexe Dokumentenlayouts effektiver zu verarbeiten, ohne die Kosten pro Seite zu erhöhen.
Was passiert ist
Der Kern dieses Releases ist ein messbarer Leistungssprung über alle drei Serviceebenen hinweg: Cost Effective, Agentic und Agentic Plus. Laut internen Benchmarks auf ExtractBench erreicht die Cost-Effective-Ebene nun einen gesamten Value-F1-Score von 93,9, gegenüber 87,1 zuvor, und übertrifft damit die bisherige Leistung der Agentic-Ebene. Die Agentic-Ebene verbesserte sich von 89,8 auf 95,8, während die Top-Ebene Agentic Plus von 95,1 auf 96,4 anstieg. Diese Gewinne gehen mit keiner Preisänderung einher und bieten bestehenden Nutzern eine bessere Leistung pro Dollar.
Neben den reinen Genauigkeitswerten adressiert das Update spezifische Fehlermodi, die bei der Verarbeitung realer Dokumente häufig auftreten. Lange Listen, die oft dazu führen, dass Vision-Language-Modelle Ausgaben kürzen oder den Überblick über wiederholte Datensätze verlieren, werden nun mit Zwischenrepräsentationen behandelt, die gegen das Schema des Benutzers validiert werden. In einem Test mit einer 17-seitigen Fondsunterlage extrahierte die Cost-Effective-Ebene zuvor nur 87 von 238 Positionen; mit v2.5 wurden alle 238 erfasst, wodurch der Dokumentenextraktions-Score von 52,8 auf 98,7 stieg.
Das Release verbessert auch die Handhabung von Datensätzen, die sich über mehrere Seiten erstrecken, sowie gescannter Formulare, die gemischten Drucktext, Handschrift und Annotationen enthalten. Zuvor könnten Agenten Prüferkommentare mit Feldwerten vermischt haben oder ihre Lesetätigkeit an Seitenumbrüchen abgebrochen haben. Die neue Version bewahrt Beziehungen zwischen Feldern über Seiten hinweg besser und unterscheidet Originalwerte von manuellen Korrekturen, was den Bedarf an Nachbearbeitung nach der Extraktion reduziert.
Wie es funktioniert
Im Hintergrund hat LlamaIndex ein neues Agent-Harness eingeführt, das speziell für die Dokumentenextraktion entwickelt wurde. Diese Architektur zieht Inspiration aus jüngsten Fortschritten bei Coding-Agenten und optimiert die Modellinteraktionen hypergenau, um Schritte zur visuellen Analyse, zum Schlussfolgern und zur Verifizierung effizienter zu verwalten. Ein Schlüsselfeature ist das Structural Reasoning (strukturelle Schlussfolgerung), das es dem Agenten ermöglicht, seinen Aufwand basierend auf der Dokumentenkomplexität anzupassen. Bei einfachen Dokumenten verarbeitet er diese schnell mit geringerer Latenz, während komplexe Layouts tiefere Analysen auslösen, um maximale Genauigkeit sicherzustellen.
Eine weitere wesentliche Ergänzung sind Advanced Citations (erweiterte Zitierungen), die nun sowohl für die Agentic- als auch für die Agentic-Plus-Ebenen verfügbar sind. Dieses Feature lokalisiert Begrenzungsrahmen (Bounding Boxes) für unterstützende Beweismittel extrahierter Werte, selbst wenn der exakte Text nicht wortwörtlich in der Quelle erscheint. Die Grounding-Scores auf ExtractBench sprangen erheblich, von 46,8 auf 80,6 für Agentic und von 46,4 auf 82,2 für Agentic Plus. Diese Zitierungen ermöglichen es menschlichen Prüfern, extrahierte Daten gegen das Originaldokument zu verifizieren, und erleichtern so zuverlässige Human-in-the-Loop-Workflows.
Das System erhielt zudem native Fähigkeiten zur Tabellenkalkulations-Extraktion. Anstatt Arbeitsmappen in unstrukturierten Text zu zerlegen, arbeiten Agenten nun direkt mit den Zellen der Arbeitsmappe und bewahren dabei die strukturierte Natur der Daten. Dieser Ansatz hilft, die Integrität von Tabellen und Rastern zu erhalten, die für Standard-Pipelines zur optischen Zeichenerkennung (OCR) oft eine Herausforderung darstellen.
Wichtige Details
- Leistungssteigerungen: Der F1-Score für Cost Effective stieg auf 93,9, für Agentic auf 95,8 und für Agentic Plus auf 96,4 auf ExtractBench.
- Keine Preiserhöhung: Die Preise pro Seite bleiben trotz der Genauigkeitsverbesserungen über alle Ebenen hinweg unverändert.
- Advanced Citations: Die Grounding-Scores verbesserten sich für die Top-Ebenen auf über 80 und liefern Begrenzungsrahmen zur Beweisverifizierung.
- Structural Reasoning: Der Agent passt seinen Verarbeitungsaufwand basierend auf Dokumentenlayout und Informationsdichte an.
- Native Tabellenkalkulationsunterstützung: Agenten interagieren nun direkt mit Arbeitsmappenzellen anstelle von flachgestellten Textrepräsentationen.
- Verbesserte Handhabung langer Listen: Zwischenrepräsentationen verhindern Kürzungen in Dokumenten mit Hunderten von wiederholten Datensätzen.
Warum es wichtig ist
Für Ingenieure, die Pipelines zur Dokumentenautomatisierung entwickeln, ist Zuverlässigkeit oft der größte Engpass. Frühere Generationen von Extraktionstools erforderten häufig umfangreiche manuelle Prüfungen, da sie Einträge in langen Listen übersahen oder Annotationen mit Daten verwechselten. Durch die Verbesserung der Datenverankerung und des strukturellen Schlussfolgens reduziert Extract v2.5 das Volumen der Ausnahmen, die menschliche Operatoren bearbeiten müssen. Diese Verschiebung macht es machbar, risikoreiche Workflows wie Finanzcompliance oder juristische Entdeckungsverfahren (Legal Discovery) zu automatisieren, wo das Übersehen eines einzelnen Postens schwerwiegende Konsequenzen haben kann.
Die Einführung von Konfidenzwerten gepaart mit Zitierungen verändert auch, wie Teams ihre Prüfschnittstellen gestalten. Anstatt blindlings dem Output zu vertrauen oder jedes Feld manuell zu überprüfen, können Entwickler nur Extraktionen mit geringer Konfidenz an menschliche Prüfer weiterleiten. Die Zitierungen liefern sofortigen Kontext, sodass Prüfer direkt zum relevanten Teil des Quelldokuments springen können. Dieser gezielte Ansatz spart Zeit und reduziert die kognitive Belastung, was hybride Mensch-KI-Workflows im großen Maßstab nachhaltiger macht.
Was Sie tun können
- Testen Sie v2.5 auf Ihren schwierigsten Dokumenten, insbesondere solchen mit langen Listen oder mehrseitigen Tabellen, unter Verwendung Ihrer vorhandenen Schemas.
- Aktivieren Sie Advanced Citations in Ihrer Konfiguration, um Begrenzungsrahmen zur Verifizierung extrahierter Werte zu generieren.
- Nutzen Sie Konfidenzwerte, um die automatische Verarbeitung zu filtern und nur unsichere Felder an menschliche Prüfer weiterzuleiten.
- Probieren Sie die native Tabellenkalkulations-Extraktion für Excel-lastige Workflows aus, um die Zellstruktur zu erhalten.
