LlamaIndex Extract v2.5 améliore la précision grâce au raisonnement structurel
LlamaIndex a lancé Extract v2.5, améliorant la précision de l'extraction de documents sur tous les niveaux et ajoutant des citations avancées pour un meilleur ancrage.
Traduit automatiquement depuis l'original anglais.
LlamaIndex a lancé Extract v2.5, une mise à jour majeure de ses agents d'extraction de documents basés sur schéma, offrant une précision accrue et un meilleur ancrage des données. Publiée le 1er octobre 2026, cette version introduit des changements architecturaux inspirés des agents de codage pour gérer plus efficacement les mises en page complexes sans augmenter les coûts par page.
Ce qui s'est passé
Le cœur de cette sortie est une augmentation mesurable des performances sur les trois niveaux de service : Cost Effective, Agentic et Agentic Plus. Selon les benchmarks internes sur ExtractBench, le niveau Cost Effective atteint désormais un score F1 global de 93,9, contre 87,1 auparavant, surpassant les performances précédentes du niveau Agentic. Le niveau Agentic est passé de 89,8 à 95,8, tandis que le niveau supérieur Agentic Plus a progressé de 95,1 à 96,4. Ces gains sont réalisés sans changement de prix, offrant ainsi un meilleur rapport performance/prix aux utilisateurs existants.
Au-delà des scores bruts de précision, la mise à jour traite des modes de défaillance spécifiques courants dans le traitement réel de documents. Les longues listes, qui provoquent souvent une troncature de la sortie ou une perte de suivi des enregistrements répétés par les modèles vision-langage, sont désormais gérées avec des représentations intermédiaires validées par rapport au schéma de l'utilisateur. Dans un test impliquant un dépôt de fonds de 17 pages, le niveau Cost Effective n'extrayait auparavant que 87 des 238 participations ; avec v2.5, il a capturé les 238, faisant passer le score d'extraction du document de 52,8 à 98,7.
La sortie améliore également la manière dont le système gère les enregistrements s'étendant sur plusieurs pages et les formulaires scannés contenant un mélange de texte imprimé, d'écriture manuscrite et d'annotations. Auparavant, les agents pouvaient fusionner les notes des réviseurs avec les valeurs des champs ou arrêter la lecture aux sauts de page. La nouvelle version préserve mieux les relations entre les champs à travers les pages et distingue les valeurs originales des corrections manuelles, réduisant ainsi le besoin de nettoyage post-extraction.
Comment cela fonctionne
En interne, LlamaIndex a introduit un nouveau harnais d'agent conçu spécifiquement pour l'extraction de documents. Cette architecture s'inspire des récentes avancées dans les agents de codage, hyper-optimisant les interactions avec le modèle pour gérer plus efficacement les étapes de vision, de raisonnement et de vérification. Une fonctionnalité clé est le Raisonnement Structurel (Structural Reasoning), qui permet à l'agent d'adapter son effort en fonction de la complexité du document. Pour les documents simples, il traite rapidement avec une latence réduite, tandis que les mises en page complexes déclenchent une analyse plus approfondie pour garantir une précision maximale.
Une autre addition majeure est les Citations Avancées (Advanced Citations), désormais disponibles pour les niveaux Agentic et Agentic Plus. Cette fonctionnalité localise les boîtes englobantes (bounding boxes) des preuves justificatives pour les valeurs extraites, même lorsque le texte exact n'apparaît pas mot pour mot dans la source. Les scores d'ancrage sur ExtractBench ont augmenté significativement, passant de 46,8 à 80,6 pour Agentic et de 46,4 à 82,2 pour Agentic Plus. Ces citations permettent aux réviseurs humains de vérifier les données extraites par rapport au document original, facilitant des workflows fiables intégrant l'humain dans la boucle (human-in-the-loop).
Le système a également acquis des capacités natives d'extraction de feuilles de calcul. Au lieu d'aplatir les classeurs en texte non structuré, les agents travaillent désormais directement avec les cellules des classeurs, préservant la nature structurée des données. Cette approche aide à maintenir l'intégrité des tableaux et des grilles, qui sont souvent difficiles pour les pipelines standards de reconnaissance optique de caractères (OCR).
Détails clés
- Gains de performance : Le score F1 de Cost Effective est monté à 93,9, celui d'Agentic à 95,8 et celui d'Agentic Plus à 96,4 sur ExtractBench.
- Pas d'augmentation de prix : Le tarif par page reste inchangé malgré les améliorations de précision sur tous les niveaux.
- Citations Avancées : Les scores d'ancrage ont dépassé 80 pour les niveaux supérieurs, fournissant des boîtes englobantes pour la vérification des preuves.
- Raisonnement Structurel : L'agent adapte son effort de traitement en fonction de la mise en page du document et de la densité d'information.
- Support natif des feuilles de calcul : Les agents interagissent désormais directement avec les cellules des classeurs plutôt qu'avec des représentations textuelles aplaties.
- Meilleure gestion des longues listes : Les représentations intermédiaires empêchent la troncature dans les documents contenant des centaines d'enregistrements répétés.
Pourquoi c'est important
Pour les ingénieurs construisant des pipelines d'automatisation documentaire, la fiabilité est souvent le principal goulot d'étranglement. Les générations précédentes d'outils d'extraction nécessitaient fréquemment une revue manuelle extensive car elles omettaient des éléments dans les longues listes ou confondaient les annotations avec les données. En améliorant l'ancrage et le raisonnement structurel, Extract v2.5 réduit le volume d'exceptions que les opérateurs humains doivent traiter. Ce changement rend possible l'automatisation de workflows critiques, tels que la conformité financière ou la découverte légale, où l'omission d'une seule ligne peut avoir des conséquences graves.
L'introduction de scores de confiance associés aux citations change également la façon dont les équipes conçoivent leurs interfaces de revue. Au lieu de faire aveuglément confiance à la sortie ou de vérifier manuellement chaque champ, les développeurs peuvent router uniquement les extractions à faible confiance vers des réviseurs humains. Les citations fournissent un contexte immédiat, permettant aux réviseurs de sauter directement à la partie pertinente du document source. Cette approche ciblée fait gagner du temps et réduit la charge cognitive, rendant les workflows hybrides humain-IA plus durables à grande échelle.
Ce que vous pouvez faire
- Testez v2.5 sur vos documents les plus difficiles, en particulier ceux avec de longues listes ou des tableaux multi-pages, en utilisant vos schémas existants.
- Activez les Citations Avancées dans votre configuration pour générer des boîtes englobantes afin de vérifier les valeurs extraites.
- Utilisez les scores de confiance pour filtrer le traitement automatique et router uniquement les champs incertains vers des réviseurs humains.
- Essayez l'extraction native de feuilles de calcul pour les workflows lourds en Excel afin de préserver la structure et les relations des cellules.
- Mettez à jour vers la dernière version SDK et utilisez les nouvelles fonctionnalités d'ancrage.
