Qui a dit ça ? L'attribution des interlocuteurs quand beaucoup de gens parlent
· Zeyu Si
Sur cette page
- Avec plus de personnes, les étiquettes intégrées dérivent
- Les extraits courts flattent les résultats
- La méthode de notation peut aussi tromper
- Quelques constats contre-intuitifs
- Notre approche : apprendre chaque voix d'abord, puis attribuer phrase par phrase
- Résultats : au-dessus de 99 % sur des données de réunion publiques, sans dérive
- La limite : les gens qui parlent en même temps
Une discussion à sept personnes, d'une durée de 37 minutes. Nous avons confié l'enregistrement complet à ElevenLabs en lui demandant d'indiquer qui avait dit chaque phrase.
Il a trouvé neuf personnes.
Le problème le plus grave, c'est que les étiquettes des gens changeaient sans cesse. Un interlocuteur était étiqueté A de la minute 8 à la minute 18, est devenu B juste après 18:30, est revenu à A vers la minute 30, puis est redevenu B à 32:47. Sur les sept interlocuteurs, les identités ont basculé 16 fois. Mesuré en mots, seuls 68,6 % de la transcription étaient attribués à la bonne personne.
Pour la recherche par interview, c'est pire que quelques mots mal entendus. On ne peut plus se fier à qui a dit quoi que ce soit.
Avec plus de personnes, les étiquettes intégrées dérivent
Cet enregistrement provient d'AISHELL-4, un jeu de données public d'enregistrements de réunions en chinois, chacune réunissant cinq à sept personnes autour d'une table. Nous y avons testé à plusieurs reprises l'étiquetage des interlocuteurs intégré à ElevenLabs :
- Sur des extraits de 10 à 15 minutes, selon les réglages, entre 67,5 % et 97,8 % du contenu était correctement attribué, et l'identité d'une personne basculait jusqu'à 12 fois.
- Plus il y avait de monde, pire c'était. Sur des extraits à sept personnes, même en lui indiquant qu'il y avait sept interlocuteurs, il n'atteignait que 77 % à 82 %.
- Il ne savait pas compter les personnes de façon fiable. Laissé libre de le déterminer, il a trouvé le bon nombre 4 fois sur 12, et à chaque échec il manquait une personne : les un ou deux interlocuteurs les plus discrets étaient fusionnés avec quelqu'un d'autre.
Lancer deux fois les mêmes réglages pouvait donner des résultats très différents. Un extrait a obtenu 81,9 % lors d'un passage et 93,8 % lors du suivant.
Les extraits courts flattent les résultats
Ces chiffres cachent un piège qui leur est propre : plus l'extrait est court, meilleur il paraît.
Dans la même salle de réunion, les extraits de 15 minutes obtenaient de 78 % à 93 %. L'enregistrement complet de 37 minutes est tombé à 68,6 %, soit 10 à 25 points de moins, et la défaillance est passée de « une personne en moins » à « des personnes en trop et des identités qui s'échangent sans arrêt ».
Nous avons vu la même chose ailleurs. Une approche open source a obtenu 99,8 % en identification des interlocuteurs sur un extrait de 10 minutes. Sur l'enregistrement complet, elle est tombée à 63,9 %.
Nous ne jugeons donc désormais que sur des enregistrements complets.
La méthode de notation peut aussi tromper
Il y a un autre piège dans la règle de mesure elle-même.
Les transcriptions de référence humaines sont généralement horodatées à la seconde près, et par convention plusieurs lignes peuvent partager la même seconde (une personne termine et une autre enchaîne aussitôt). Dans une référence que nous avons utilisée, 55 % des lignes partageaient leur horodatage avec une ligne voisine.
Notez selon la ligne de temps et un décalage d'une seconde compte comme une phrase entière attribuée à la mauvaise personne. La même sortie a obtenu 81 % selon la ligne de temps et 99,7 % par alignement du texte.
Quelques constats contre-intuitifs
- Prévoir plus d'interlocuteurs ne permet pas d'en trouver davantage. Nous l'avons essayé avec un système open source : laissez-lui de la place pour une personne de plus et, au lieu de trouver un troisième interlocuteur, il coupe en deux la personne la plus bavarde.
- Un autre modèle n'est pas forcément différent. Cinq modèles de voix du même développeur ont produit une sortie identique mot pour mot. Seul un modèle d'un autre développeur a changé quelque chose.
- Les réglages par défaut effacent les « mm » et les « ah oui ». Les acquiescements de moins d'une demi-seconde étaient jetés comme du bruit. Une fois ce filtre supprimé, davantage de changements d'interlocuteur ont été repérés, et avec plus de précision.
Notre approche : apprendre chaque voix d'abord, puis attribuer phrase par phrase
Ce à quoi nous avons abouti tient en trois étapes :
- Une « carte vocale » pour chaque personne : 10 à 30 secondes de parole claire de cette personne, comme un tour de présentations au début. En dessous de 10 secondes, les résultats se dégradent nettement ; au-delà de 30 secondes, ils ne s'améliorent plus.
- Attribuer chaque phrase : ElevenLabs se contente de transcrire et de découper les phrases. Qui a dit chacune est décidé en comparant la voix de cette phrase à chaque carte, et non par les étiquettes d'interlocuteur d'ElevenLabs. Ces étiquettes ne sont pas cohérentes dans le temps : attribuer d'après elles n'a donné que 71,5 %.
- Trier par degré de confiance : les attributions sûres sont faites directement ; les incertaines sont signalées pour qu'une personne les confirme. Sur deux réunions de test, le groupe des attributions sûres couvrait 564 segments sans une seule erreur.
Les « ouais » et « mm » très courts ne contiennent pas assez de voix pour être identifiés seuls : ils prennent donc l'identité des phrases plus longues de la même personne qui les entourent.
Résultats : au-dessus de 99 % sur des données de réunion publiques, sans dérive
Deux réunions AISHELL-4 complètes :
| ElevenLabs intégré | Notre approche | |
|---|---|---|
| 5 personnes, 36 minutes | 97,28 % | 99,76 % |
| 7 personnes, 37 minutes | 68,6 % (16 basculements d'identité) | 99,32 % |
Les deux ont trouvé le bon nombre de personnes et n'ont eu aucun basculement d'identité.
Nous avons aussi testé six extraits de 10 à 15 minutes et une table ronde publique à cinq personnes (99,75 %). Les neuf étaient au-dessus de 97 %.
Presque toutes les erreurs restantes sont des « ouais », « d'accord » ou « ok » de moins d'une seconde.
La limite : les gens qui parlent en même temps
Cela, ce sont des données publiques. Les vrais groupes de discussion se sont révélés plus difficiles.
- Une discussion ouverte à cinq personnes : l'animatrice lance un sujet et quatre participantes interviennent librement. Toutes les cinq sont des femmes, et environ un cinquième du temps de parole comporte des personnes qui parlent en même temps. Les attributions sûres étaient justes à environ 97 %, mais 30 à 40 % des segments ne pouvaient être que signalés comme incertains.
- Un groupe de discussion à huit personnes enregistré en qualité téléphonique : une fois que chaque participant avait une vraie carte vocale, les attributions sûres étaient justes à 98,1 %, mais le contenu incertain représentait encore 17,5 % du texte. Notre propre seuil est « attributions sûres au-dessus de 99 %, contenu incertain à 5 % au plus ». Celui-ci n'est pas passé.
Réécouter les erreurs a mis une chose en évidence : quand plusieurs personnes parlent à la fois, l'oreille humaine ne parvient pas non plus à les séparer. Les preneurs de notes professionnels présents dans la salle s'appuient sur la vidéo.
Notre engagement sur l'attribution des interlocuteurs couvre donc les discussions à plusieurs où chacun parle à son tour : une personne parle, les autres écoutent. Dans ce cadre, nous gardons l'identité de chaque personne cohérente du début à la fin. Les gens qui parlent en même temps en sont exclus.
Par : Zeyu Si