Quand les interviews changent de langue
· Zeyu Si
Sur cette page
La recherche transfrontalière produit beaucoup d'enregistrements de ce genre : la personne interviewée parle espagnol, celle qui pose les questions parle chinois, et un interprète se tient entre les deux. La conversation fait des allers-retours entre deux langues.
Nous pensions que ce serait simple. Nous avons lu la documentation de chaque moteur, mené une série de tests en laboratoire et abouti à un ensemble de conclusions. Puis nous avons testé un vrai enregistrement et les conclusions se sont inversées.
Deux types de mélange, des résultats très différents
D'abord, il faut distinguer deux situations :
- L'aparté occasionnel : une langue principale, avec de temps en temps un mot ou une phrase dans une autre, moins d'un dixième de l'enregistrement.
- L'alternance : par exemple l'interprétation consécutive, où les deux langues alternent et occupent chacune à peu près la moitié.
Les moteurs se comportent très différemment dans ces deux cas. Il ne faut pas les confondre.
Une bonne nouvelle d'abord : le mélange avec l'anglais se passe généralement bien. La prise en charge multilingue de presque tous les moteurs est construite autour de « langue X plus anglais ». Notre moteur principal écrit une phrase anglaise complète telle qu'elle a été prononcée, même au milieu de l'espagnol.
Les ennuis commencent quand aucune des deux langues n'est l'anglais, comme l'espagnol mélangé au chinois.
Le même réglage « langue » veut dire quatre choses différentes
La plupart des moteurs ont un paramètre de langue. On pourrait supposer qu'il fait à peu près la même chose partout. Nous avons parcouru la documentation de chaque éditeur, puis testé chacun. Ce sont quatre choses différentes :
- ElevenLabs : lui indique dans quelle langue l'enregistrement est principalement.
- Soniox : une indication vers laquelle il penchera, sans l'empêcher de reconnaître d'autres langues.
- Doubao : choisit quel modèle de langue faire tourner. Curieusement, le laisser vide est la pire option : il écoute alors le chinois et l'anglais, et force l'espagnol en anglais.
- AssemblyAI : décide dans quelle langue est tout le fichier, puis confie le fichier entier au modèle de cette seule langue. Des deux langues qu'il sait traiter ensemble, l'une doit être l'anglais.
Ce dernier point a une conséquence brutale. Dans un enregistrement à 45 % en chinois, AssemblyAI a quand même décidé qu'il était en espagnol (confiance 0,84). Nous avons essayé quatre configurations. Pas un seul caractère chinois n'est sorti.
Il y a eu aussi une surprise dans l'autre sens. À lire la documentation de Doubao, régler la langue sur l'espagnol devrait verrouiller tout le fichier en espagnol. En pratique, ce n'a pas été le cas. Il a quand même transcrit le chinois au milieu.
Le pire résultat, c'est la traduction
Avec l'aparté occasionnel, notre moteur principal échoue de l'une de deux façons, selon la configuration. (Ceci a été testé sur des enregistrements montés. La section suivante traite du problème du montage, mais si le moteur se trompe alors que le changement de langue est aussi évident, un vrai enregistrement ne sera pas plus facile.)
- Indiquez-lui que la langue principale est l'espagnol, et les phrases en chinois disparaissent tout simplement. La ligne de temps les saute sans laisser de trace.
- Ne le lui indiquez pas, et les phrases en chinois sont traduites en un espagnol fluide. "你是谁?" est devenu "¿Quién eres?". Pas un seul caractère chinois dans toute la transcription.
Le premier cas laisse un trou. Le second ajoute de l'espagnol que personne n'a prononcé. Le second est pire, car la transcription se lit sans défaut et un chercheur supposerait que la personne interviewée a réellement dit cela en espagnol.
Un autre moteur, qui utilise un grand modèle de langage pour transcrire, s'est bloqué sur un changement de langue et a répété le même mot environ 370 fois.
L'audio réel a renversé les résultats du labo
Pour tester le cas de l'alternance, nous avons commencé par de l'audio monté : des extraits espagnols et des extraits chinois existants, coupés et assemblés. Les transcriptions de référence étaient fournies d'office et cela ne coûtait presque rien.
Les tests sur audio monté disaient :
- Indiquez au moteur principal que la langue principale est l'espagnol, et tout casse : le chinois est traduit, du contenu inventé apparaît, et la ligne de temps se désagrège.
- Laissez-le déterminer la langue lui-même, et il a tout juste.
Puis nous avons obtenu une vraie interview avec interprète : 66 minutes, en espagnol et en chinois, avec un chercheur, un interprète et une personne interviewée. Les résultats ont été exactement inverses :
- Lui indiquer que la langue principale est l'espagnol a donné une transcription quasi parfaite. Les deux langues ont été correctement basculées, et les trois interlocuteurs ont été bien distingués. Même l'interprète, qui passait d'une langue à l'autre, a été correctement reconnu comme une seule personne.
- Laissé libre de décider, il a conclu que tout était en chinois (confiance 0,86), a transcrit avec le chinois comme fil principal, et a perdu des passages entiers d'espagnol.
Pourquoi ? L'audio monté présente une couture évidente entre les langues : la pièce, le volume et le bruit de fond changent tous en même temps, il est donc facile pour un moteur de remarquer un changement. Un vrai enregistrement, c'est une seule pièce et un seul micro. Il n'y a pas de couture.
Le rythme différait aussi de nos montages. Le chinois représentait 29 %, en alternant « de longues réponses en espagnol d'une à quatre minutes, de courtes interventions en chinois de quinze secondes à une minute environ », ce qui tombait pile dans la plage que nos montages n'avaient pas couverte.
Ce que nous en retenons
La qualité de transcription d'une interview multilingue dépend de trois choses : quelles deux langues, s'il s'agit d'un aparté occasionnel ou d'une alternance, et comment le moteur est configuré. La documentation des éditeurs ne peut pas répondre à ces questions, et l'audio de test monté non plus.
Seuls les vrais enregistrements le peuvent.
Par : Zeyu Si