Le WER ment. Voici comment nous mesurons la précision sur de vraies interviews
· Zeyu Si
Sur cette page
Nous avons un jour testé une interview de critique littéraire tirée d'une matinale de la télévision suédoise. Quatre moteurs de reconnaissance vocale l'ont transcrite. Selon le WER, l'indicateur que presque tout le monde utilise, leurs taux d'erreur se situaient entre 194 % et 216 %. Plus d'erreurs que de mots.
Puis nous avons lu les quatre transcriptions ligne par ligne. C'étaient les plus complètes de tout le lot. Titres de livres, noms, éléments d'intrigue, tout était juste. Elles avaient même saisi des choses que la transcription de référence avait omises.
Le problème, c'était la référence.
Cet article traite de deux choses : pourquoi le WER ne tient pas sur les interviews, et ce que nous utilisons à la place. C'est la méthode avec laquelle nous avons choisi les moteurs pour chacune de nos 27 langues.
Cinq façons dont le WER vous trompe sur l'audio d'interview
Nous avons rencontré les mêmes quelques problèmes dans plus de 20 langues. Chacun produit un chiffre qui a l'air précis et qui dit quelque chose de faux.
1. La référence a déjà été raccourcie. La plupart de nos références proviennent des sous-titres pour sourds et malentendants de films et d'émissions de télévision. Les sous-titres doivent pouvoir se lire vite, ils condensent donc régulièrement ce que les gens disent réellement. Plus un moteur transcrit fidèlement, plus il s'écarte des sous-titres, et plus il est pénalisé. C'était le cas de l'interview suédoise. Dans une scène de film espagnol où tout le monde crie par-dessus tout le monde, chaque moteur a obtenu entre 63 % et 80 % de WER. À la lecture ligne par ligne, tous avaient restitué le sens.
2. La langue écrite et la langue parlée ne sont pas la même chose. L'arabe écrit et l'arabe que les gens parlent au quotidien peuvent être très éloignés. Nous avons noté le même moteur par rapport à une référence rédigée en arabe standard moderne et obtenu 49 %. Par rapport à une référence qui transcrivait fidèlement le dialecte, 16 %. Le moteur n'avait pas changé. La référence, si.
Le tamoul est plus extrême. Par convention, les sous-titres sont rédigés dans le registre littéraire, alors que les gens parlent le registre familier. Prenez les sous-titres comme référence et le gagnant est le moteur qui « réécrit » la parole en tamoul littéraire. Le moteur qui transcrit fidèlement arrive dernier. Le classement s'inverse.
3. Le chinois et le japonais ne mettent pas d'espaces entre les mots. Découpez selon les espaces et une phrase chinoise entière devient un seul « mot ». Le taux d'erreur peut dépasser 1000 %. Ce chiffre ne veut rien dire.
4. L'orthographe diffère, le sens non. Le grec et l'arabe obtiennent souvent des scores élevés. En y regardant de près, une bonne partie des « erreurs » tient aux flexions et aux conventions orthographiques, comme le fait d'écrire ou non un petit signe arabe appelé hamza. Aucun lecteur ne se méprendrait sur la phrase. L'indicateur la compte quand même.
5. Le WER n'est donc qu'un test de fumée, rien de plus. Il vous dit si un moteur s'est complètement effondré : des passages entiers manquants, des écrans de charabia. Pour décider lequel de deux moteurs qui fonctionnent est le plus précis, nous ne le regardons plus.
Les références doivent être de vraies conversations
Les vraies interviews comportent des pauses, des mots de remplissage, des interruptions et des gens qui parlent en même temps. Testez sur des présentateurs de journal ou de l'audio lu à voix haute, et tous les moteurs ont l'air excellents. Les interviews, c'est une autre histoire.
Nos extraits de test sont donc uniquement de la parole spontanée. Les scènes de films passent en premier : elles ont des sous-titres pour sourds et malentendants qui suivent de près les dialogues, et elles sont disponibles. Quand nous ne trouvons pas de film adapté, nous nous rabattons, dans l'ordre, sur les séries télévisées et les documentaires, les enregistrements parlementaires ou judiciaires, puis les podcasts avec transcription verbatim.
Il y a trois niveaux de difficulté, chacun construit sur le précédent :
- Base : une ou deux personnes, rythme régulier, pas de bruit de fond, accent standard, mais toujours une vraie conversation. Ce niveau suffit à éliminer quelques moteurs faibles.
- Plus difficile : le niveau de base plus une ou deux complications, comme un débit plus rapide, un petit groupe, des tours de parole plus rapides, un peu de bruit de fond ou un accent.
- Extrême : paroles qui se chevauchent, bruit fort ou musique, dialecte marqué, mauvais son, tout à la fois.
Quand une langue présente de fortes variations régionales, chaque région a ses propres extraits. L'espagnol d'Espagne, du Mexique et d'Argentine. L'arabe du Golfe, d'Égypte et du Levant.
Vérifier la référence avant de vérifier le moteur
C'est l'étape que les gens sautent. Nous l'avons ajoutée après qu'elle nous a coûté cher. Avant qu'une référence serve à noter quoi que ce soit, nous confirmons que la référence elle-même est juste.
Lors d'un audit, nous avons écarté beaucoup d'extraits qui avaient eu l'air corrects :
- Une émission étiquetée en tagalog était en réalité en cebuano, une autre langue des Philippines.
- Un extrait thaï avait des sous-titres décalés d'environ 30 secondes par rapport à l'audio.
- Une interview en cantonais s'est révélée être en coréen. L'invité était coréen et les sous-titres cantonais étaient une traduction. Tous les moteurs y ont obtenu près de 100 % d'erreur.
Chacun de ces cas aurait produit un score d'apparence précise et dénué de sens. Pire, certaines conclusions antérieures avaient été bâties sur des extraits de ce genre.
Il reste trois langues pour lesquelles nous ne trouvons toujours pas de référence utilisable : le tamoul, le bengali et le filipino. Nous ne les prenons pas encore en charge. Nous préférons ne pas proposer une langue plutôt que d'avancer un chiffre que nous ne pouvons pas assumer.
Compter les erreurs qui changent le sens
Les chercheurs lisent les transcriptions d'interview pour leur sens. Écrire « euh » au lieu de « heu » n'a pas d'importance. Écrire « n'a pas fait » au lieu de « a fait », si. Pour chaque moteur, nous comptons donc les erreurs de ligne rouge, en six catégories :
- Phrases inventées : une phrase apparaît alors que personne ne l'a dite. Un moteur au taux d'erreur tout à fait honorable a produit, dans un extrait avec un fort accent, une phrase complète se terminant par « acheter des bananes ». Personne n'avait rien dit de tel. Nous n'avons pas retenu ce moteur.
- Négation inversée : « non » devient « oui » ou l'inverse. La phrase se lit parfaitement et veut dire le contraire. Notre prochain article porte sur ce point.
- Boucles : le même mot répété des dizaines ou des centaines de fois.
- Contenu inséré : des éléments ajoutés qui n'étaient pas dans l'audio.
- Passages perdus : un segment de parole qui manque entièrement. Dans une scène de film au dialecte marqué et à la foule bruyante, un moteur a perdu les 54 premières secondes.
- Dérive de langue : un changement de langue en cours de route. Un moteur a transformé de longs passages d'espagnol en portugais. "Soy abogado" est devenu "Sou advogado".
Chaque moteur est mesuré avec la même règle. Les différences d'orthographe des noms, ou le fait qu'un nombre soit écrit "6" ou « six », ne comptent pas comme des lignes rouges.
Les personnes qui lisent les transcriptions laissent aussi passer des choses, nous faisons donc également deux vérifications automatiques :
- Ratio de sortie : le nombre de mots produits par un moteur divisé par le nombre de mots de la référence. Nettement en dessous de 1, cela signifie généralement que de grands passages ont été perdus ; nous avons vu 0,1. Nettement au-dessus de 1 avec beaucoup de mots répétés, cela signifie généralement une boucle ; nous avons vu 1,8.
- Répétitions : la fréquence à laquelle le même mot revient sur un court intervalle.
Aucun des deux ne dépend du format audio ni de la difficulté de l'extrait, on peut donc les comparer d'une langue à l'autre. Le WER, non.
Des règles pour ne pas nous tromper nous-mêmes
Chacune est née d'une erreur.
Quand plusieurs moteurs sont d'accord et que seule la référence diverge, soupçonnez d'abord la référence. Nous nous sommes trompés deux fois en turc. Nous avions consigné de vraies paroles comme « hallucination » alors que les sous-titres avaient simplement omis cette réplique.
Quand plusieurs moteurs font la même erreur au même endroit, ne l'imputez pas à l'un d'eux. En général, l'audio y est réellement confus et n'importe qui se tromperait. La compter contre un seul moteur est injuste envers lui, et vous conduit à choisir le mauvais.
On ne peut pas se fier aux extraits courts. Faites toujours tourner l'enregistrement complet. Une approche que nous avons examinée a obtenu 99,8 % en identification des interlocuteurs sur un extrait de 10 minutes. Sur l'enregistrement complet, elle est tombée à 63,9 %.
Faites tourner chaque réglage au moins deux fois. La même entrée ne donne pas toujours la même sortie. Une fois, un moteur a répété un seul « euh » 99 fois et avalé les trois phrases suivantes. Avec un seul passage, impossible de savoir si c'est typique ou accidentel.
Les limites de cette méthode
La plupart de nos extraits de test viennent du cinéma et de la télévision, pas d'interviews de recherche. Les dialogues de films sont écrits et enregistrés avec soin. Un simple enregistreur posé sur une table de salle de réunion, c'est autre chose. Ce que ces résultats vous disent, c'est donc comment les moteurs échouent sur une vraie conversation, pas quelle sera la précision de votre interview en particulier.
C'est aussi pourquoi nous ne publions pas un chiffre unique de précision pour la transcription. Ce que nous pouvons partager, c'est comment nous testons, ce que nous avons trouvé, et ce que nous ne savons toujours pas.
Prochain article : la plus dangereuse des six lignes rouges, celle où le sens s'inverse et où la phrase se lit toujours parfaitement.
Par : Zeyu Si