Aller au contenu principal

Les erreurs de transcription les plus dangereuses se lisent parfaitement

· Zeyu Si

Sur cette page

Une interview en norvégien, un son propre. La personne interrogée explique qu'elle n'a pas trompé son partenaire. Dans la transcription d'un des moteurs, elle dit qu'elle a choisi de le tromper.

La phrase est grammaticale. Aucune faute de frappe. Elle ne détonne même pas dans le contexte. Le lecteur n'a aucune raison de s'arrêter.

Une négation inversée est la pire erreur qu'une transcription d'interview puisse contenir

Quand un mot est mal orthographié, le lecteur le remarque en général. Quand le sens est inversé, il ne le remarque pas.

Le cas norvégien n'était pas isolé. Nous avons ensuite passé cinq autres extraits norvégiens dans Gemini et Qwen. Les deux ont produit le même type d'erreur sur des passages parfaitement audibles.

Cela arrive aussi en anglais. « You're still not a cop » est devenu « still a cop » dans les deux modèles vocaux de Qwen. Le « not » avait tout simplement disparu.

Nous avons essayé de donner une consigne directe au modèle : conserver chaque négation exactement telle qu'elle est prononcée, signaler tout ce qu'il n'entend pas, ne rien compléter. Cela n'a rien changé. Le « not » disparaissait toujours.

Un vote à la majorité ne vous sauvera pas

La solution évidente consiste à faire tourner plusieurs moteurs et à suivre la majorité.

Dans cinq langues (russe, coréen, ukrainien, norvégien et espagnol), nous avons trouvé des passages où plusieurs moteurs faisaient exactement la même erreur, la bonne version étant minoritaire. Dans quatre d'entre elles, l'erreur portait sur une négation ou un sens inversé. Dans le cas norvégien, cinq moteurs ont inversé le sens et un seul a eu juste. Passez au vote et c'est la mauvaise réponse qui l'emporte.

La raison : un même passage audio peu clair peut amener plusieurs moteurs à « entendre » la même chose fausse. Leurs erreurs ne sont pas indépendantes.

Notre règle est donc la suivante : dès qu'une négation ou un sens inversé est en jeu, l'accord entre moteurs ne compte pour rien. Il nous faut une preuve solide, comme la logique des phrases voisines ou le fait que l'intervenant reformule son propos un peu plus tard. Sans elle, le passage est signalé pour qu'une personne l'écoute. Nous ne tranchons pas à la place du lecteur.

Les erreurs fluides sont plus difficiles à repérer que les erreurs évidentes

Les négations inversées en sont un type. Il en existe un plus subtil.

Nous avons construit un enregistrement de test : une conversation en espagnol avec, au milieu, une ligne de chinois insérée, « 你是谁? » (« Qui es-tu ? »). Un moteur n'a pas transcrit le chinois. Il l'a traduit, en écrivant « ¿Quién eres? ». La transcription entière ne contenait pas un seul mot de chinois et se lisait parfaitement. Si vous ne parlez pas chinois et n'avez pas écouté l'audio, vous ne sauriez jamais qu'une autre langue avait été parlée à cet endroit.

Ce que ces erreurs ont en commun, c'est que la transcription a l'air parfaitement correcte. Impossible de les trouver en lisant. Il faut que quelqu'un vous dise quelle seconde aller écouter.

Un outil de transcription devrait vous dire où il n'est pas sûr

Alors, les outils de transcription que les gens utilisent vraiment vous disent-ils « je ne suis pas sûr de ce passage » ? En septembre 2026, nous en avons passé en revue 15 parmi les plus courants : centres d'aide, documentation produit, documentation d'API et journaux des modifications.

Trois l'affichent dans l'éditeur :

  • Sonix propose une carte de chaleur activable, qui colore chaque mot selon la confiance du moteur. Plus c'est clair, moins le moteur est confiant. Sonix précise lui-même qu'un mot clair n'est « pas forcément une erreur ».
  • Rev a une option dans l'éditeur qui surligne en gris les mots que son moteur a signalés comme possiblement faux.
  • Happy Scribe affiche en rouge les mots à faible confiance. Notre source est un article d'aide de 2023 ; nous n'avons pas vérifié l'interface actuelle.

Seulement dans l'API ou les exports : Amberscript peut inclure un score de confiance par mot dans ses fichiers d'export ; pour la mise en évidence dans l'éditeur, nous n'avons trouvé que des affirmations de tiers. Pour TurboScribe, seuls des articles de tiers affirment qu'il surligne en jaune les mots à faible confiance, et nous n'avons pas pu charger son propre site pour vérifier.

Nous n'avons trouvé aucune fonction de ce type dans 10 d'entre eux : Transkriptor, Otter.ai, Fireflies.ai, Notta, Noota, Trint, Descript, Riverside, Dovetail et transcribe.com.

Ne pas l'avoir trouvée ne veut pas dire qu'elle n'existe pas. Une partie de la documentation d'API est derrière une connexion ou se charge par script, et nous n'avons pas pu tout lire. Si vous utilisez l'un de ces outils et qu'il a bien cette fonction, dites-le-nous et nous corrigerons.

Un moteur qui se note lui-même, ce n'est pas la même chose que des moteurs en désaccord

Les trois outils qui ont cette fonction signalent tous la même chose : le score qu'un moteur attribue à sa propre confiance.

C'est réellement utile, avec un angle mort. Si un moteur entend mal quelque chose avec assurance, son propre score ne déclenchera aucune alerte.

Notre approche consiste à faire transcrire le même audio par plusieurs moteurs et à signaler les endroits où ils ne sont pas d'accord, ainsi que les noms, les entreprises et les termes techniques, là où les erreurs se concentrent. Chaque signalement porte un horodatage, et un clic fait écouter la seconde concernée. Ce n'est que lorsque chaque signalement a été traité que le produit indique que la transcription est prête à être exportée.

Cela ne rattrape toujours pas tout. Quand plusieurs moteurs se trompent tous au même endroit exactement de la même façon, ils « sont d'accord », et rien n'est signalé. C'est pourquoi nous vérifions la négation et le sens inversé même lorsque tous les moteurs disent la même chose.

Ce que nous pouvons promettre, c'est que vous n'avez pas à réécouter tout l'enregistrement. Seulement les passages qui méritent un doute.

Par : Zeyu Si