Développer avec l’IA

Ajustement fin du modèle ASR NVIDIA Nemotron pour les dialectes arabes saoudiens

Un flux de travail technique utilisant NVIDIA NeMo réduit les taux d'erreur de mots pour la parole najdi et hijazi en combinant le mélange pondéré par relecture et le dégel partiel de l'encodeur.

Traduit automatiquement depuis l'original anglais.

Les ingénieurs de NVIDIA ont détaillé un flux de travail spécifique d'ajustement fin pour le modèle de reconnaissance automatique de la parole (ASR) Nemotron 3.5, ciblant les dialectes arabes saoudiens sous-représentés. Publié en octobre 2026, ce guide démontre comment adapter un modèle multilingue en streaming pour traiter la parole najdi et hijazi sans dégrader les performances en anglais ou dans d'autres variantes arabes. L'approche repose sur le framework NVIDIA NeMo et met l'accent sur une curation soignée des données plutôt que sur un réentraînement par force brute.

Ce qui s'est passé

Les modèles ASR multilingues rencontrent souvent des difficultés avec les dialectes régionaux et les conditions d'enregistrement locales qui diffèrent de leurs données de pré-entraînement. Bien que Nemotron 3.5 prenne en charge la transcription à travers 40 combinaisons langue-région, il a montré des lacunes significatives lors du traitement de dialectes saoudiens comme le najdi et le hijazi. Pour remédier à cela, NVIDIA a développé un pipeline d'adaptation ciblé utilisant 133,7 heures de données vocales issues du jeu de données SADA 2022. L'objectif était de réduire le taux d'erreur de mots (WER) pour ces dialectes spécifiques tout en maintenant les capacités existantes du modèle en arabe standard moderne et en anglais.

L'équipe a commencé par une expérience de référence qui ajustait le modèle uniquement sur les données du dialecte cible. Cette première tentative a produit des améliorations modestes, le WER de validation atteignant un plateau après 45 époques. Les résultats ont indiqué que l'entraînement exclusif sur le nouveau dialecte faisait oublier au modèle les motifs appris précédemment, un phénomène connu sous le nom d'oubli catastrophique. Le WER de référence pour la partition de test Najdi et Hijazi est resté élevé à 55,05 %, suggérant qu'un simple ajustement complet était insuffisant pour l'adaptation aux dialectes à faibles ressources.

Pour surmonter ces limitations, les ingénieurs ont introduit trois changements clés : une curation des données minimale mais stricte, un mélange pondéré par relecture et un regroupement basé sur la durée. Ils ont également expérimenté le dégel partiel de l'encodeur pour équilibrer le coût computationnel et la précision. Le flux de travail final a réduit le WER pour la parole Najdi et Hijazi à 29,96 %, soit une amélioration substantielle de plus de 25 points de pourcentage. Fait surprenant, les performances du modèle en anglais se sont également légèrement améliorées, passant de 11,04 % à 10,42 % de WER, prouvant qu'une spécialisation ciblée peut renforcer la robustesse globale si elle est bien gérée.

Comment cela fonctionne

Le cœur de la solution est une stratégie de mélange pondéré par relecture qui empêche le modèle d'écraser ses connaissances générales. Au lieu de s'entraîner uniquement sur les données des dialectes saoudiens, le pipeline intègre 10 % de données du jeu FLEURS, réparties entre 7 % d'anglais et 3 % d'arabe. Cela garantit que le modèle continue de pratiquer ses langues originales tout en apprenant le nouveau dialecte. Le mélange est déclaré via des poids de configuration plutôt que par une simple concaténation de fichiers, assurant que les données de relecture sont uniformément distribuées dans les lots d'entraînement grâce à un mélange par fenêtre glissante.

La curation des données joue un rôle critique dans l'élimination du bruit sans rejeter des paroles difficiles mais valides. L'équipe a filtré les extraits contenant des marqueurs inaudibles, tels que l'annotation arabe pour « peu clair », et supprimé les énoncés présentant des ratios caractères/durée irréalistes. Ils ont utilisé les étapes de NVIDIA NeMo Curator pour évaluer la qualité audio, définissant des seuils personnalisés pour les métriques UTMOS et SIGMOS basés sur la distribution spécifique du jeu de données SADA. Cela a permis de conserver 82,5 % des énoncés originaux, préservant ainsi les accents difficiles que des filtres génériques auraient pu rejeter.

L'efficacité de l'entraînement est obtenue grâce au regroupement basé sur la durée, qui regroupe les énoncés de longueurs similaires dans le même lot. Cela réduit le remplissage (padding) et l'utilisation de la mémoire, permettant des tailles de lot effectives plus grandes. L'équipe a également ajusté le contexte d'attention à 13 images de lookahead et a utilisé le décodage MALSD beam-8 pour l'évaluation hors ligne, ce qui a réduit le WER de 2,71 points absolus supplémentaires sans nécessiter de réentraînement. Pour la transcription attribuée au locuteur, le flux de travail intègre NVIDIA Nemotron 3 Diarization pour aligner les limites des locuteurs avec les horodatages ASR pour jusqu'à huit locuteurs.

Détails clés

  • Jeu de données : 133,7 heures de parole Najdi et Hijazi provenant de SADA 2022, mélangées avec 10 % de données FLEURS pour la relecture.
  • Gain de performance : Le WER pour les dialectes cibles est passé de 55,05 % à 29,96 % ; le WER en anglais s'est amélioré de 11,04 % à 10,42 %.
  • Matériel : Les expériences ont été réalisées sur deux GPU NVIDIA RTX PRO 6000 Blackwell Workstation Edition pendant environ 4,5 heures.
  • Architecture du modèle : Cache-Aware FastConformer-RNNT avec capacités de streaming multilingue incitées (prompted).
  • Efficacité des paramètres : La mise à jour des 24 couches de l'encodeur impliquait 230,4 millions de paramètres entraînables ; le dégel partiel offre une alternative moins coûteuse.
  • Optimisation du décodage : Le passage au décodage MALSD beam-8 et à un contexte d'attention plus large a réduit le WER de 2,71 points sans réentraînement.

Pourquoi c'est important

Pour les ingénieurs logiciels développant des interfaces vocales dans des régions linguistiquement diverses, ce flux de travail fournit une recette reproductible pour gérer les dialectes à faibles ressources. Il démontre qu'il n'est pas nécessaire de disposer d'énormes jeux de données pour spécialiser un grand modèle multilingue. En utilisant le mélange par relecture et une curation soignée, les équipes peuvent déployer un ASR précis pour des variantes régionales spécifiques sans sacrifier le large soutien linguistique qui rend les modèles pré-entraînés attractifs. Ceci est particulièrement pertinent pour les applications dans le service client, la santé et l'éducation où la précision des dialectes locaux est cruciale pour la confiance des utilisateurs.

Les informations techniques soulignent également l'importance de l'ingénierie des données par rapport aux modifications de l'architecture du modèle. Les gains de performance significatifs provenaient de la manière dont les données étaient mélangées, filtrées et regroupées, plutôt que de l'altération de la structure du réseau neuronal sous-jacent. Cela déplace l'attention des praticiens de l'IA vers la construction de pipelines de données robustes capables de gérer des audio bruyants du monde réel. La capacité d'améliorer les performances en anglais tout en se spécialisant dans l'arabe suggère qu'un ajustement fin bien géré peut agir comme une forme de régularisation, renforçant les fonctionnalités générales du modèle.

Ce que vous pouvez faire

  • Reproduire le flux de travail : Utilisez le notebook d'ajustement fin ASR NVIDIA NeMo fourni pour exécuter la recette d'adaptation arabe saoudienne sur votre propre matériel.
  • Curater avec soin : Inspectez la distribution des scores de qualité audio dans votre jeu de données avant d'appliquer des filtres génériques afin d'éviter de rejeter des paroles dialectales valides.
  • Implémenter le mélange par relecture : Lors de l'ajustement fin sur un domaine étroit, mélangez un petit pourcentage de données à usage général pour prévenir l'oubli catastrophique.
  • Activer le regroupement : Assurez-vous que use_bucketing est défini sur true dans votre configuration NeMo pour réduire le padding et améliorer l'efficacité de l'entraînement.
  • Tester le dégel partiel : Si les ressources de calcul sont limitées, essayez de dégeler uniquement les couches supérieures de l'encodeur et le décodeur au lieu de l'ensemble du modèle.
  • Évaluer indépendamment : Mesurez toujours les performances sur un ensemble de test retenu incluant à la fois les dialectes cibles et les langues générales pour surveiller toute dégradation.

Outils de la Boutique Bytechap

$89

DocBento

Gestion documentaire auto-hébergée qui analyse chaque scan et répond avec des citations de pages.

Démo en ligne

Continuer la lecture

Tous les articles