Dữ liệu & tài liệu

LlamaIndex Extract v2.5 nâng cao độ chính xác nhờ suy luận cấu trúc

LlamaIndex đã ra mắt Extract v2.5, cải thiện độ chính xác khi trích xuất tài liệu ở tất cả các cấp dịch vụ và bổ sung tính năng trích dẫn nâng cao để tăng cường cơ sở dữ liệu.

Được dịch tự động từ bản gốc tiếng Anh.

LlamaIndex vừa ra mắt Extract v2.5, một bản cập nhật đáng kể cho các tác nhân trích xuất tài liệu dựa trên schema (cấu trúc dữ liệu), mang lại độ chính xác cao hơn và cải thiện việc neo giữ dữ liệu (data grounding). Phiên bản này được phát hành vào ngày 1 tháng 10 năm 2026, giới thiệu những thay đổi kiến trúc lấy cảm hứng từ các tác nhân lập trình (coding agents) nhằm xử lý hiệu quả hơn các bố cục tài liệu phức tạp mà không làm tăng chi phí trên mỗi trang.

Chuyện gì đã xảy ra

Trọng tâm của bản phát hành này là sự gia tăng hiệu suất đo lường được trên cả ba cấp dịch vụ: Cost Effective (Hiệu quả về chi phí), Agentic (Tác nhân) và Agentic Plus (Tác nhân Plus). Theo các bài kiểm tra nội bộ trên ExtractBench, cấp Cost Effective hiện đạt điểm F1 tổng thể cho giá trị là 93,9, tăng từ 87,1, vượt qua hiệu suất trước đây của cấp Agentic. Cấp Agentic cải thiện từ 89,8 lên 95,8, trong khi cấp cao nhất Agentic Plus tăng từ 95,1 lên 96,4. Những cải tiến này đi kèm với mức giá không đổi, mang lại hiệu suất tốt hơn trên mỗi đồng tiền cho người dùng hiện tại.

Ngoài các điểm số độ chính xác thô, bản cập nhật còn giải quyết các chế độ lỗi cụ thể thường gặp trong quá trình xử lý tài liệu thực tế. Các danh sách dài, vốn thường khiến các mô hình ngôn ngữ thị giác (vision-language models) cắt ngắn đầu ra hoặc mất dấu các bản ghi lặp lại, giờ đây được xử lý bằng các biểu diễn trung gian để đối chiếu với schema của người dùng. Trong một bài kiểm tra liên quan đến hồ sơ quỹ gồm 17 trang, cấp Cost Effective trước đây chỉ trích xuất được 87 trong số 238 khoản nắm giữ; với v2.5, nó đã thu thập đủ 238 khoản, nâng điểm trích xuất tài liệu từ 52,8 lên 98,7.

Bản phát hành cũng cải thiện cách hệ thống xử lý các bản ghi trải dài trên nhiều trang và các mẫu đơn quét chứa hỗn hợp văn bản in, chữ viết tay và chú thích. Trước đây, các tác nhân có thể gộp nhầm ghi chú của người xem xét với giá trị trường hoặc dừng đọc tại các ngắt trang. Phiên bản mới bảo toàn tốt hơn các mối quan hệ giữa các trường xuyên suốt các trang và phân biệt rõ ràng giữa giá trị gốc và các chỉnh sửa thủ công, giảm nhu cầu dọn dẹp sau khi trích xuất.

Cách thức hoạt động

Bên dưới giao diện, LlamaIndex đã giới thiệu một khung tác nhân (agent harness) mới được thiết kế riêng cho việc trích xuất tài liệu. Kiến trúc này lấy cảm hứng từ những tiến bộ gần đây trong lĩnh vực tác nhân lập trình, tinh chỉnh kỹ lưỡng các tương tác của mô hình để quản lý các bước thị giác, suy luận và xác minh hiệu quả hơn. Một tính năng chính là Suy luận Cấu trúc (Structural Reasoning), cho phép tác nhân điều chỉnh nỗ lực xử lý dựa trên độ phức tạp của tài liệu. Đối với các tài liệu đơn giản, nó xử lý nhanh chóng với độ trễ thấp, trong khi các bố cục phức tạp sẽ kích hoạt phân tích sâu hơn để đảm bảo độ chính xác tối đa.

Một bổ sung lớn khác là Trích dẫn Nâng cao (Advanced Citations), hiện có sẵn cho cả hai cấp Agentic và Agentic Plus. Tính năng này xác định các hộp bao quanh (bounding boxes) của bằng chứng hỗ trợ cho các giá trị được trích xuất, ngay cả khi văn bản chính xác không xuất hiện nguyên văn trong nguồn. Điểm neo giữ (grounding scores) trên ExtractBench đã tăng đáng kể, từ 46,8 lên 80,6 cho cấp Agentic và từ 46,4 lên 82,2 cho cấp Agentic Plus. Những trích dẫn này cho phép người xem xét con người xác minh dữ liệu được trích xuất so với tài liệu gốc, tạo điều kiện thuận lợi cho các quy trình làm việc kết hợp người-AI (human-in-the-loop) đáng tin cậy.

Hệ thống cũng có thêm khả năng trích xuất bảng tính gốc. Thay vì làm phẳng các workbook thành văn bản không cấu trúc, các tác nhân giờ đây làm việc trực tiếp với các ô trong workbook, bảo toàn tính chất có cấu trúc của dữ liệu. Cách tiếp cận này giúp duy trì tính toàn vẹn của các bảng và lưới, vốn thường gây khó khăn cho các pipeline nhận dạng ký tự quang học (OCR) tiêu chuẩn.

Chi tiết chính

  • Cải thiện hiệu suất: Điểm F1 của Cost Effective tăng lên 93,9, Agentic lên 95,8 và Agentic Plus lên 96,4 trên ExtractBench.
  • Không tăng giá: Giá theo từng trang vẫn không đổi bất chấp những cải tiến về độ chính xác trên tất cả các cấp.
  • Trích dẫn Nâng cao: Điểm neo giữ cải thiện lên hơn 80 cho các cấp cao nhất, cung cấp các hộp bao quanh để xác minh bằng chứng.
  • Suy luận Cấu trúc: Tác nhân điều chỉnh nỗ lực xử lý dựa trên bố cục tài liệu và mật độ thông tin.
  • Hỗ trợ bảng tính gốc: Các tác nhân giờ đây tương tác trực tiếp với các ô trong workbook thay vì các biểu diễn văn bản đã bị làm phẳng.
  • Xử lý danh sách dài tốt hơn: Các biểu diễn trung gian ngăn chặn tình trạng cắt ngắn trong các tài liệu có hàng trăm bản ghi lặp lại.

Tại sao điều này quan trọng

Đối với các kỹ sư xây dựng pipeline tự động hóa tài liệu, độ tin cậy thường là nút thắt cổ chai lớn nhất. Các thế hệ công cụ trích xuất trước đây thường yêu cầu xem xét thủ công mở rộng vì chúng hay bỏ sót các mục trong danh sách dài hoặc nhầm lẫn chú thích với dữ liệu. Bằng cách cải thiện việc neo giữ và suy luận cấu trúc, Extract v2.5 giảm khối lượng các ngoại lệ mà người vận hành phải xử lý. Sự thay đổi này giúp khả thi hóa việc tự động hóa các quy trình làm việc rủi ro cao, chẳng hạn như tuân thủ tài chính hoặc khám phá pháp lý, nơi mà việc bỏ sót một dòng dữ liệu duy nhất có thể gây ra hậu quả nghiêm trọng.

Việc giới thiệu điểm tin cậy (confidence scores) đi kèm với trích dẫn cũng thay đổi cách các nhóm thiết kế giao diện xem xét của họ. Thay vì mù quáng tin tưởng vào đầu ra hoặc kiểm tra thủ công mọi trường, các nhà phát triển có thể chuyển hướng chỉ những phần trích xuất có độ tin cậy thấp đến người xem xét. Các trích dẫn cung cấp bối cảnh ngay lập tức, cho phép người xem xét nhảy trực tiếp đến phần liên quan của tài liệu nguồn. Cách tiếp cận có mục tiêu này tiết kiệm thời gian và giảm tải nhận thức, làm cho các quy trình làm việc lai ghép người-AI bền vững hơn ở quy mô lớn.

Bạn có thể làm gì

  • Thử nghiệm v2.5 trên các tài liệu khó nhất của bạn, đặc biệt là những tài liệu có danh sách dài hoặc bảng nhiều trang, sử dụng các schema hiện có của bạn.
  • Bật Trích dẫn Nâng cao trong cấu hình của bạn để tạo các hộp bao quanh nhằm xác minh các giá trị được trích xuất.
  • Sử dụng điểm tin cậy để lọc quá trình tự động và chỉ chuyển hướng các trường không chắc chắn đến người xem xét.
  • Thử nghiệm trích xuất bảng tính gốc cho các quy trình làm việc nặng về Excel để bảo toàn cấu trúc ô.

Công cụ từ cửa hàng Bytechap

Đọc tiếp

Tất cả bài viết