Vai al contenuto principale

Chi l'ha detto? Attribuire i parlanti quando parlano in tanti

· Zeyu Si

In questa pagina

Una discussione a sette, lunga 37 minuti. Abbiamo dato l'intera registrazione a ElevenLabs chiedendogli di indicare chi aveva detto ogni frase.

Ha trovato nove persone.

Il problema più grosso era che le etichette delle persone continuavano a cambiare. Un parlante è stato etichettato A dal minuto 8 al minuto 18, è diventato B subito dopo le 18:30, è tornato A intorno al minuto 30, e di nuovo B alle 32:47. Nei sette parlanti le identità si sono scambiate 16 volte. Misurato sulle parole, solo il 68,6% della trascrizione era attribuito alla persona giusta.

Per la ricerca basata su interviste è peggio di qualche parola fraintesa. Non ci si può fidare di chi abbia detto qualunque cosa.

Con più persone, le etichette integrate slittano

Quella registrazione viene da AISHELL-4, un dataset pubblico di registrazioni di riunioni in cinese, ciascuna con da cinque a sette persone attorno a un tavolo. Vi abbiamo testato ripetutamente l'etichettatura dei parlanti integrata di ElevenLabs:

  • Su clip da 10 a 15 minuti, a seconda delle impostazioni, tra il 67,5% e il 97,8% del contenuto era attribuito correttamente, e l'identità di una persona si è scambiata fino a 12 volte.
  • Più persone peggioravano le cose. Sulle clip a sette, anche quando gli si diceva che i parlanti erano sette, arrivava solo dal 77% all'82%.
  • Non riusciva a contare le persone in modo affidabile. Lasciato fare da solo, ha azzeccato il numero 4 volte su 12, e ogni errore era una persona in meno: i parlanti più silenziosi, uno o due, venivano fusi con qualcun altro.

Eseguire due volte le stesse impostazioni poteva dare risultati molto diversi. Una clip ha ottenuto l'81,9% in un'esecuzione e il 93,8% in quella successiva.

Le clip brevi abbelliscono i risultati

Quei numeri nascondono una trappola a sé: più la clip è corta, migliore sembra il risultato.

Nella stessa sala riunioni, le clip da 15 minuti hanno ottenuto dal 78% al 93%. La registrazione completa di 37 minuti è scesa al 68,6%, da 10 a 25 punti in meno, e l'errore è passato da "una persona in meno" a "persone in più e identità che si scambiano avanti e indietro".

Abbiamo visto la stessa cosa altrove. Un approccio open source ha ottenuto il 99,8% nell'identificazione dei parlanti su una clip di 10 minuti. Eseguito sulla registrazione completa, è sceso al 63,9%.

Per questo ora giudichiamo solo su registrazioni complete.

Anche il metodo di valutazione può ingannare

C'è un'altra trappola nel metro stesso.

Le trascrizioni di riferimento umane di solito mettono i timestamp al secondo, e per convenzione più righe possono condividere lo stesso secondo (una persona finisce e un'altra si inserisce subito). In un riferimento che abbiamo usato, il 55% delle righe condivideva il timestamp con una riga vicina.

Valutando sulla linea temporale, uno scarto di un secondo conta come un'intera frase attribuita alla persona sbagliata. Lo stesso output ha ottenuto l'81% sulla linea temporale e il 99,7% con l'allineamento del testo.

Alcuni risultati controintuitivi

  • Prevedere più parlanti non fa trovare più parlanti. L'abbiamo provato con un sistema open source: dategli spazio per una persona in più e, invece di trovare un terzo parlante, divide in due la persona che parla di più.
  • Un modello diverso non è necessariamente diverso. Cinque modelli vocali dello stesso sviluppatore hanno prodotto un output identico parola per parola. Solo un modello di un altro sviluppatore ha cambiato qualcosa.
  • Le impostazioni predefinite cancellano "mm" e "ah ah". Gli assensi più brevi di mezzo secondo venivano scartati come rumore. Una volta evitato questo, sono stati colti più cambi di parlante, e con più precisione.

Il nostro approccio: imparare prima ogni voce, poi attribuire frase per frase

Quello a cui siamo arrivati ha tre passaggi:

  1. Una "scheda vocale" per ogni persona: da 10 a 30 secondi di parlato pulito di quella persona, come un giro di presentazioni all'inizio. Sotto i 10 secondi peggiora sensibilmente; oltre i 30 secondi smette di migliorare.
  2. Attribuire ogni frase: ElevenLabs si limita a trascrivere e dividere le frasi. Chi ha detto ciascuna viene deciso confrontando la voce di quella frase con ogni scheda, non con le etichette dei parlanti di ElevenLabs. Quelle etichette non sono coerenti nel tempo: attribuendo in base all'etichetta si arrivava solo al 71,5%.
  3. Ordinare per affidabilità: le attribuzioni sicure vengono fatte direttamente; quelle incerte vengono segnalate perché una persona le confermi. In due riunioni di prova, il gruppo delle attribuzioni sicure ha coperto 564 segmenti senza un solo errore.

I "sì" e i "mm" brevissimi non contengono abbastanza voce per essere identificati da soli, quindi prendono l'identità delle frasi più lunghe della stessa persona che li circondano.

Risultati: oltre il 99% su dati pubblici di riunioni, senza slittamenti

Due riunioni complete di AISHELL-4:

Integrato di ElevenLabs Il nostro approccio
5 persone, 36 minuti 97,28% 99,76%
7 persone, 37 minuti 68,6% (16 scambi di identità) 99,32%

Entrambe hanno azzeccato il numero di persone e hanno avuto zero scambi di identità.

Abbiamo anche testato sei clip da 10 a 15 minuti e una tavola rotonda pubblica a cinque (99,75%). Tutte e nove erano sopra il 97%.

Quasi tutti gli errori rimasti sono un "sì", un "giusto" o un "ok" più brevi di un secondo.

Il limite: persone che si parlano sopra

Questi sono dati pubblici. I veri focus group sono stati più difficili.

  • Una discussione aperta a cinque: la moderatrice propone un tema e quattro partecipanti intervengono liberamente. Sono tutte e cinque donne, e per circa un quinto del tempo di parola più persone parlano insieme. Le attribuzioni sicure erano giuste per circa il 97%, ma dal 30 al 40% dei segmenti poteva solo essere segnalato come incerto.
  • Un focus group a otto registrato con qualità telefonica: una volta che ogni partecipante aveva una scheda vocale adeguata, le attribuzioni sicure erano giuste al 98,1%, ma il materiale incerto costituiva ancora il 17,5% del testo. La nostra soglia è "attribuzioni sicure sopra il 99%, materiale incerto al massimo il 5%". Questo non l'ha superata.

Riascoltare gli errori ha chiarito una cosa: quando più persone parlano insieme, nemmeno l'orecchio umano riesce a separarle. I verbalizzatori professionisti presenti in sala si affidano al video.

Per questo il nostro impegno sull'attribuzione dei parlanti riguarda le discussioni a più persone in cui si parla a turno: una persona parla, gli altri ascoltano. In questo ambito manteniamo coerente l'identità di ogni persona dall'inizio alla fine. Le persone che si parlano sopra ne restano fuori.

Di Zeyu Si