Tinh chỉnh mô hình NVIDIA Nemotron ASR cho các phương ngữ Ả Rập Saudi
Quy trình kỹ thuật sử dụng NVIDIA NeMo giúp giảm tỷ lệ lỗi từ (word error rate) đối với giọng nói Najdi và Hijazi bằng cách kết hợp trộn dữ liệu hồi quy có trọng số và mở khóa một phần bộ mã hóa.
Được dịch tự động từ bản gốc tiếng Anh.
Các kỹ sư của NVIDIA đã chi tiết hóa một quy trình tinh chỉnh cụ thể cho mô hình Nhận dạng Giọng nói Tự động (ASR) Nemotron 3.5, nhắm mục tiêu vào các phương ngữ Ả Rập Saudi chưa được đại diện đầy đủ. Được công bố vào tháng 10 năm 2026, hướng dẫn này minh họa cách thích ứng một mô hình đa ngôn ngữ trực tuyến để xử lý giọng nói Najdi và Hijazi mà không làm suy giảm hiệu suất trong tiếng Anh hoặc các biến thể Ả Rập khác. Phương pháp tiếp cận dựa trên khung NVIDIA NeMo và nhấn mạnh việc chọn lọc dữ liệu cẩn thận hơn là huấn luyện lại thô bạo.
Điều gì đã xảy ra
Các mô hình ASR đa ngôn ngữ thường gặp khó khăn với các phương ngữ khu vực và điều kiện ghi âm địa phương khác biệt so với dữ liệu tiền huấn luyện của chúng. Mặc dù Nemotron 3.5 hỗ trợ phiên âm qua 40 cặp ngôn ngữ-địa phương, nó vẫn cho thấy những khoảng trống đáng kể khi xử lý các phương ngữ Saudi như Najdi và Hijazi. Để giải quyết vấn đề này, NVIDIA đã phát triển một quy trình thích ứng có mục tiêu sử dụng 133,7 giờ dữ liệu giọng nói từ bộ dữ liệu SADA 2022. Mục tiêu là hạ thấp tỷ lệ lỗi từ (WER) cho các phương ngữ cụ thể này trong khi duy trì các khả năng hiện có của mô hình đối với Tiếng Ả Rập Chuẩn Hiện đại và tiếng Anh.
Nhóm nghiên cứu bắt đầu với một thí nghiệm cơ sở chỉ tinh chỉnh mô hình trên dữ liệu phương ngữ mục tiêu. Nỗ lực ban đầu này mang lại những cải thiện khiêm tốn, với WER kiểm chứng đạt trạng thái bão hòa sau 45 epoch. Kết quả cho thấy việc huấn luyện độc quyền trên phương ngữ mới khiến mô hình quên đi các mẫu đã học trước đó, một hiện tượng được gọi là sự lãng quên thảm khốc (catastrophic forgetting). WER cơ bản cho tập thử nghiệm Najdi và Hijazi mục tiêu vẫn ở mức cao là 55,05%, gợi ý rằng việc tinh chỉnh toàn bộ đơn giản là không đủ cho việc thích ứng phương ngữ tài nguyên thấp.
Để vượt qua những hạn chế này, các kỹ sư đã giới thiệu ba thay đổi chính: chọn lọc dữ liệu tối thiểu nhưng nghiêm ngặt, trộn dữ liệu hồi quy có trọng số và phân nhóm theo thời lượng. Họ cũng thử nghiệm mở khóa một phần bộ mã hóa để cân bằng giữa chi phí tính toán và độ chính xác. Quy trình cuối cùng đã giảm WER cho giọng nói Najdi và Hijazi xuống còn 29,96%, một cải thiện đáng kể hơn 25 điểm phần trăm. Đáng ngạc nhiên, hiệu suất của mô hình trên tiếng Anh cũng cải thiện nhẹ, giảm từ 11,04% xuống 10,42% WER, chứng minh rằng chuyên môn hóa có mục tiêu có thể tăng cường độ vững chắc tổng thể nếu được quản lý đúng cách.
Cách thức hoạt động
Cốt lõi của giải pháp là chiến lược trộn dữ liệu hồi quy có trọng số nhằm ngăn chặn mô hình ghi đè kiến thức chung của nó. Thay vì chỉ huấn luyện trên dữ liệu phương ngữ Saudi, quy trình trộn thêm 10% dữ liệu từ bộ FLEURS, chia thành 7% tiếng Anh và 3% tiếng Ả Rập. Điều này đảm bảo mô hình tiếp tục thực hành các ngôn ngữ gốc trong khi học phương ngữ mới. Việc trộn được khai báo thông qua các trọng số cấu hình thay vì ghép nối tệp đơn giản, đảm bảo dữ liệu hồi quy được phân phối đều khắp các batch huấn luyện thông qua xáo trộn cửa sổ trượt.
Việc chọn lọc dữ liệu đóng vai trò quan trọng trong việc loại bỏ nhiễu mà không vứt bỏ các đoạn thoại khó nhưng hợp lệ. Nhóm đã lọc bỏ các clip có dấu hiệu không nghe rõ, chẳng hạn như chú thích "không rõ ràng" trong tiếng Ả Rập, và loại bỏ các câu nói có tỷ lệ ký tự-thời lượng không thực tế. Họ sử dụng các giai đoạn Curator của NVIDIA NeMo để chấm điểm chất lượng âm thanh, đặt các ngưỡng tùy chỉnh cho các chỉ số UTMOS và SIGMOS dựa trên phân phối cụ thể của bộ dữ liệu SADA. Cách này giữ lại 82,5% các câu nói ban đầu, bao gồm cả những giọng điệu khó mà các bộ lọc chung có thể đã loại bỏ.
Hiệu quả huấn luyện đạt được thông qua phân nhóm theo thời lượng, gom các câu nói có độ dài tương tự vào cùng một batch. Điều này giảm bớt việc đệm (padding) và mức sử dụng bộ nhớ, cho phép kích thước batch hiệu dụng lớn hơn. Nhóm cũng điều chỉnh ngữ cảnh chú ý thành 13 khung nhìn trước (lookahead frames) và sử dụng giải mã MALSD beam-8 cho đánh giá ngoại tuyến, giúp giảm WER thêm 2,71 điểm tuyệt đối mà không cần huấn luyện lại. Đối với phiên âm có gán nhãn người nói, quy trình tích hợp NVIDIA Nemotron 3 Diarization để căn chỉnh ranh giới người nói với mốc thời gian ASR cho tối đa tám người nói.
Chi tiết chính
- Bộ dữ liệu: 133,7 giờ giọng nói Najdi và Hijazi từ SADA 2022, trộn với 10% dữ liệu FLEURS để hồi quy.
- Lợi ích hiệu suất: WER cho các phương ngữ mục tiêu giảm từ 55,05% xuống 29,96%; WER tiếng Anh cải thiện từ 11,04% lên 10,42%.
- Phần cứng: Các thí nghiệm chạy trên hai GPU NVIDIA RTX PRO 6000 Blackwell Workstation Edition trong khoảng 4,5 giờ.
- Kiến trúc mô hình: Cache-Aware FastConformer-RNNT với khả năng trực tuyến đa ngôn ngữ được nhắc (prompted).
- Hiệu quả tham số: Cập nhật tất cả 24 lớp bộ mã hóa liên quan đến 230,4 triệu tham số có thể huấn luyện; mở khóa một phần cung cấp một lựa chọn thay thế rẻ hơn.
- Tối ưu hóa giải mã: Chuyển sang giải mã MALSD beam-8 và ngữ cảnh chú ý lớn hơn đã giảm WER 2,71 điểm mà không cần huấn luyện lại.
Tại sao điều này quan trọng
Đối với các kỹ sư phần mềm xây dựng giao diện giọng nói ở các khu vực ngôn ngữ đa dạng, quy trình này cung cấp một công thức tái lập để xử lý các phương ngữ tài nguyên thấp. Nó chứng minh rằng bạn không cần các bộ dữ liệu khổng lồ để chuyên môn hóa một mô hình đa ngôn ngữ lớn. Bằng cách sử dụng trộn hồi quy và chọn lọc cẩn thận, các nhóm có thể triển khai ASR chính xác cho các biến thể khu vực cụ thể mà không hy sinh sự hỗ trợ ngôn ngữ rộng rãi vốn làm cho các mô hình tiền huấn luyện trở nên hấp dẫn. Điều này đặc biệt liên quan đến các ứng dụng trong dịch vụ khách hàng, y tế và giáo dục, nơi độ chính xác phương ngữ địa phương là yếu tố then chốt cho niềm tin của người dùng.
Những hiểu biết kỹ thuật cũng nhấn mạnh tầm quan trọng của kỹ thuật dữ liệu hơn là thay đổi kiến trúc mô hình. Những lợi ích hiệu suất đáng kể đến từ cách dữ liệu được trộn, lọc và phân batch, chứ không phải từ việc thay đổi cấu trúc mạng nơ-ron cơ bản. Điều này chuyển trọng tâm cho các nhà thực hành AI sang việc xây dựng các đường ống dữ liệu vững chắc có thể xử lý âm thanh thực tế nhiều nhiễu. Khả năng cải thiện hiệu suất tiếng Anh trong khi chuyên môn hóa tiếng Ả Rập gợi ý rằng việc tinh chỉnh được quản lý tốt có thể hoạt động như một dạng chính quy hóa (regularization), củng cố các đặc trưng chung của mô hình.
Bạn có thể làm gì
- Tái lập quy trình: Sử dụng notebook tinh chỉnh NVIDIA NeMo ASR được cung cấp để chạy công thức thích ứng Ả Rập Saudi trên phần cứng của riêng bạn.
- Chọn lọc cẩn thận: Kiểm tra phân phối điểm chất lượng âm thanh trong bộ dữ liệu của bạn trước khi áp dụng các bộ lọc chung để tránh vứt bỏ các đoạn thoại phương ngữ hợp lệ.
- Triển khai trộn hồi quy: Khi tinh chỉnh trên một miền hẹp, hãy trộn một tỷ lệ nhỏ dữ liệu đa mục đích để ngăn ngừa sự lãng quên thảm khốc.
- Kích hoạt phân nhóm: Đảm bảo
use_bucketingđược đặt thành true trong cấu hình NeMo của bạn để giảm đệm và cải thiện hiệu quả huấn luyện. - Thử nghiệm mở khóa một phần: Nếu tài nguyên tính toán bị hạn chế, hãy thử chỉ mở khóa các lớp bộ mã hóa trên cùng và bộ giải mã thay vì toàn bộ mô hình.
- Đánh giá độc lập: Luôn đo lường hiệu suất trên một tập thử nghiệm giữ lại bao gồm cả các phương ngữ mục tiêu và các ngôn ngữ chung để giám sát sự suy giảm.

