データと文書

LlamaIndex Extract v2.5、構造的推論により精度を向上

LlamaIndexはExtract v2.5をリリースし、すべてのティアでドキュメント抽出の精度を向上させるとともに、より正確な根拠付けを実現する高度な引用機能を追加しました。

英語の原文から自動翻訳されました。

LlamaIndexは、スキーマベースのドキュメント抽出エージェントに対する重要なアップデートであるExtract v2.5を発表しました。このバージョンでは、精度の向上とデータ根拠付け(グラウンディング)の改善が実現されています。2026年10月1日にリリースされた本バージョンは、ページあたりのコストを増加させることなく、複雑なドキュメントレイアウトをより効果的に処理するために、コーディングエージェントから着想を得たアーキテクチャ変更を導入しています。

何が起きたか

今回のリリースの中核は、Cost Effective、Agentic、Agentic Plusという3つのサービスティアすべてにおいて、性能が測定可能なレベルで向上した点にあります。内部ベンチマーク「ExtractBench」によると、Cost Effectiveティアの総合値F1スコアは87.1から93.9に上昇し、従来のAgenticティアの性能を上回りました。Agenticティアは89.8から95.8へ、最上位のAgentic Plusは95.1から96.4へとそれぞれ改善されました。これらの性能向上に伴う価格変更はなく、既存ユーザーにとってコストパフォーマンスが向上しています。

単純な精度スコアの向上に加え、今回のアップデートでは、実際のドキュメント処理でよく見られる特定の失敗モードへの対応も強化されています。視覚言語モデルが出力を切り詰めたり、繰り返されるレコードを追跡できなくなったりしがちな長いリストについては、ユーザーのスキーマに対して検証を行う中間表現を用いて処理されるようになりました。あるテストケースでは、17ページのファンド届出書類において、従来はCost Effectiveティアが238件の保有資産のうち87件しか抽出できませんでしたが、v2.5では全238件を捕捉し、ドキュメント抽出スコアが52.8から98.7へと大幅に向上しました。

また、複数ページにわたるレコードや、印刷文字、手書き、注釈が混在するスキャンフォームの処理方法も改善されました。従来は、エージェントがレビューヤーのメモとフィールド値を統合してしまったり、ページ区切りで読み取りを停止したりすることがありましたが、新バージョンではページ間でのフィールド間の関係性をより適切に保持し、元の値と手動による修正を区別できるようになりました。これにより、抽出後のクリーンアップ作業の必要性が軽減されます。

仕組み

内部的には、LlamaIndexはドキュメント抽出専用に設計された新しいエージェントハーネスを導入しました。このアーキテクチャは、最近のコーディングエージェントにおける進歩からヒントを得ており、視覚、推論、検証ステップをより効率的に管理するためにモデルインタラクションをハイパーチューニングしています。主要な機能の一つである「Structural Reasoning(構造的推論)」により、エージェントはドキュメントの複雑さに応じて処理負荷を適応的に調整できます。シンプルなドキュメントでは低遅延で迅速に処理を行い、複雑なレイアウトでは最大の精度を確保するために深い分析を実行します。

もう一つの大きな追加機能として、「Advanced Citations(高度な引用)」があり、これはAgenticおよびAgentic Plusティアの両方で利用可能になりました。この機能は、抽出された値の根拠となる証拠のバウンディングボックス(囲み枠)を特定します。ソーステキストに完全一致する文言が存在しない場合でも対応可能です。ExtractBenchにおけるグラウンディングスコアは大幅に向上し、Agenticティアでは46.8から80.6へ、Agentic Plusティアでは46.4から82.2へと上昇しました。これらの引用機能により、人間のレビューヤーは抽出データを元のドキュメントと照合して検証できるため、信頼性の高い人間介入型ワークフローの実現が可能になります。

さらに、システムはネイティブのスプレッドシート抽出機能も獲得しました。ワークブックを非構造化テキストにフラット化する代わりに、エージェントはワークブックのセルを直接操作し、データの構造化された性質を保持します。このアプローチにより、標準的な光学文字認識(OCR)パイプラインでは扱いにくいテーブルやグリッドの整合性を維持するのに役立ちます。

主な詳細

  • 性能向上: ExtractBenchにおいて、Cost EffectiveティアのF1スコアは93.9、Agenticは95.8、Agentic Plusは96.4に上昇しました。
  • 価格据え置き: すべてのティアで精度が向上しましたが、ページあたりの価格は変更されていません。
  • Advanced Citations: 上位ティアではグラウンディングスコアが80以上まで改善し、証拠検証用のバウンディングボックスを提供します。
  • Structural Reasoning: エージェントは、ドキュメントのレイアウトと情報密度に応じて処理負荷を適応的に調整します。
  • ネイティブスプレッドシートサポート: エージェントはフラット化されたテキスト表現ではなく、ワークブックのセルと直接やり取りを行います。
  • 長いリストの処理改善: 中間表現により、数百件の繰り返しレコードを含むドキュメントでの出力切り詰めを防ぎます。

なぜ重要なのか

ドキュメント自動化パイプラインを構築するエンジニアにとって、信頼性はしばしば最大のボトルネックとなります。従来の抽出ツールは、長いリスト内の項目を見逃したり、注釈とデータを混同したりするため、広範な手動レビューが必要になることが頻繁にありました。グラウンディングと構造的推論の改善により、Extract v2.5は人間オペレーターが対処すべき例外事項の数を削減します。これにより、単一行の漏れが深刻な結果を招く可能性のある金融コンプライアンスや法的ディスカバリなどの高リスクワークフローの自動化が現実的になります。

引用と組み合わせた信頼度スコアの導入は、チームがレビューインターフェースを設計する方法も変えます。出力を無条件に信頼したり、すべてのフィールドを手動でチェックしたりする代わりに、開発者は信頼度の低い抽出結果のみを人間のレビューヤーにルーティングできます。引用機能は即座にコンテキストを提供するため、レビューヤーはソースドキュメントの関連部分へ直接ジャンプできます。このターゲットを絞ったアプローチは時間を節約し、認知負荷を軽減するため、大規模な環境でのハイブリッドな人間-AIワークフローを持続可能にします。

実施可能なこと

  • 既存のスキーマを使用し、特に長いリストや複数ページのテーブルを含む最も難しいドキュメントでv2.5をテストしてください。
  • 設定でAdvanced Citationsを有効にし、抽出値の検証用バウンディングボックスを生成してください。
  • 信頼度スコアを使用して自動処理をフィルタリングし、不確実なフィールドのみを人間のレビューヤーにルーティングしてください。
  • Excelを多用するワークフローでは、セル構造と関係性を保持するためにネイティブスプレッドシート抽出を試してください。
  • Python SDKを最新バージョンに更新し、抽出ジョブで cite_sources および confidence_scores フラグを使用してください。
  • より大きなアプリケーションに統合する前に、CLIツール llp を使用してターミナルベースの迅速な抽出テストを行ってください。

Bytechapストアのツール

続きを読む

すべての記事