Il WER mente. Ecco come misuriamo la precisione sulle interviste reali
· Zeyu Si
In questa pagina
Una volta abbiamo testato un'intervista su un libro trasmessa dalla televisione del mattino svedese. Quattro motori di riconoscimento vocale l'hanno trascritta. Secondo il WER, la metrica che usano quasi tutti, i loro tassi di errore sono risultati tra il 194% e il 216%. Più errori che parole.
Poi abbiamo letto le quattro trascrizioni riga per riga. Erano le più complete dell'intero lotto. Titoli di libri, nomi, snodi della trama, tutto corretto. Avevano persino colto cose che la trascrizione di riferimento aveva tralasciato.
Il problema era il riferimento.
Questo articolo tratta due cose: perché il WER non funziona sulle interviste, e cosa usiamo al suo posto. È il metodo con cui abbiamo scelto i motori per tutte le nostre 27 lingue.
Cinque modi in cui il WER vi inganna sull'audio delle interviste
Abbiamo incontrato gli stessi pochi problemi in più di 20 lingue. Ognuno produce un numero che sembra preciso e dice la cosa sbagliata.
1. Il riferimento è già stato sfoltito. La maggior parte dei nostri riferimenti viene dai sottotitoli per sordi e ipoudenti di film e TV. I sottotitoli devono potersi leggere in fretta, quindi comprimono abitualmente ciò che le persone dicono davvero. Più un motore trascrive fedelmente, più si discosta dal sottotitolo, e più viene penalizzato. È quello che è successo con l'intervista svedese. In una scena di un film spagnolo in cui tutti urlano sopra tutti, ogni motore ha ottenuto un WER tra il 63% e l'80%. Letti riga per riga, tutti avevano reso il significato.
2. La lingua scritta e la lingua parlata non sono la stessa cosa. L'arabo scritto e l'arabo che le persone parlano ogni giorno possono essere molto distanti. Abbiamo valutato lo stesso motore rispetto a un riferimento scritto in arabo standard moderno e abbiamo ottenuto il 49%. Rispetto a un riferimento che registrava fedelmente il dialetto, il 16%. Il motore non era cambiato. Il riferimento sì.
Il tamil è un caso ancora più estremo. I sottotitoli si scrivono per convenzione nel registro letterario, mentre le persone parlano quello colloquiale. Usate i sottotitoli come riferimento e vince il motore che "riscrive" il parlato in tamil letterario. Il motore che trascrive fedelmente arriva ultimo. La classifica si ribalta.
3. Il cinese e il giapponese non mettono spazi tra le parole. Se si divide per spazi, un'intera frase cinese diventa una sola "parola". Il tasso di errore può superare il 1000%. Quel numero non significa nulla.
4. L'ortografia cambia, il significato no. Il greco e l'arabo ottengono spesso punteggi alti. A guardare da vicino, molti degli "errori" sono flessioni e convenzioni ortografiche, come se sia stato scritto o no un piccolo segno arabo chiamato hamza. Nessun lettore fraintenderebbe la frase. La metrica lo conta comunque.
5. Quindi il WER è un test di fumo, niente di più. Vi dice se un motore è crollato del tutto: interi passaggi mancanti, schermate di testo senza senso. Per decidere quale di due motori funzionanti sia più preciso, non lo guardiamo più.
I riferimenti devono essere conversazione reale
Le interviste reali hanno pause, intercalari, interruzioni e persone che si parlano sopra. Testate su speaker di notiziari o su audio letto ad alta voce e ogni motore sembra ottimo. Con le interviste è un'altra storia.
Per questo le nostre clip di prova sono solo parlato spontaneo. Vengono prima le scene di film: hanno sottotitoli per sordi e ipoudenti che seguono da vicino i dialoghi, e sono reperibili. Dove non troviamo un film adatto, ripieghiamo nell'ordine su serie TV e documentari, registrazioni parlamentari o giudiziarie, poi podcast con trascrizioni alla lettera.
Ci sono tre livelli di difficoltà, ciascuno costruito sul precedente:
- Base: una o due persone, ritmo costante, nessun rumore di fondo, accento standard, ma comunque conversazione reale. Già questo livello elimina alcuni motori deboli.
- Più difficile: il livello base più una o due complicazioni, come parlato più veloce, un piccolo gruppo, cambi di turno più rapidi, un po' di rumore di fondo o un accento.
- Estremo: parlato sovrapposto, rumore o musica forti, dialetto marcato, audio scadente, tutto insieme.
Quando una lingua ha forti variazioni regionali, ogni regione ha le sue clip. Spagnolo di Spagna, Messico e Argentina. Arabo del Golfo, dell'Egitto e del Levante.
Controllate il riferimento prima di controllare il motore
È il passaggio che si salta. L'abbiamo aggiunto dopo che ci è costato caro. Prima di usare un riferimento per valutare qualsiasi cosa, verifichiamo che il riferimento stesso sia corretto.
In una verifica abbiamo scartato molte clip che sembravano a posto:
- Un programma etichettato come tagalog era in realtà in cebuano, un'altra lingua delle Filippine.
- Una clip thailandese aveva i sottotitoli sfasati di circa 30 secondi rispetto all'audio.
- Un'intervista in cantonese si è rivelata in coreano. L'ospite era coreano e i sottotitoli cantonesi erano una traduzione. Tutti i motori hanno ottenuto un errore vicino al 100%.
Ognuno di questi casi avrebbe prodotto un punteggio dall'aria precisa e privo di significato. Peggio ancora, alcune conclusioni precedenti erano state costruite su clip come queste.
Ci sono tre lingue per cui non riusciamo ancora a trovare un riferimento utilizzabile: tamil, bengalese e filippino. Per ora non le supportiamo. Preferiamo non offrire una lingua piuttosto che pubblicare un numero che non possiamo sostenere.
Contare gli errori che cambiano il significato
I ricercatori leggono le trascrizioni delle interviste per il loro significato. Scrivere "ehm" come "eh" non conta. Scrivere "non l'ha fatto" come "l'ha fatto" sì. Per questo per ogni motore contiamo gli errori da linea rossa, in sei categorie:
- Frasi inventate: compare una frase che nessuno ha detto. Un motore con un tasso di errore del tutto rispettabile ha prodotto, in una clip con un accento marcato, una frase completa che finiva con "compra delle banane". Nessuno aveva detto niente del genere. Non abbiamo usato quel motore.
- Negazione capovolta: il "no" diventa "sì" o viceversa. Si legge perfettamente e significa il contrario. Il nostro prossimo articolo parla di questo.
- Loop: la stessa parola ripetuta decine o centinaia di volte.
- Contenuto inserito: materiale aggiunto che non c'era nell'audio.
- Passaggi persi: un tratto di parlato che manca del tutto. In una scena di film con dialetto marcato e una folla rumorosa, un motore ha perso i primi 54 secondi.
- Deriva linguistica: cambiare lingua a metà. Un motore ha trasformato lunghi passaggi in spagnolo in portoghese. "Soy abogado" è diventato "Sou advogado".
Ogni motore viene misurato con lo stesso metro. Le differenze nel modo di scrivere i nomi, o se un numero è scritto "6" o "sei", non contano come linee rosse.
Anche chi legge le trascrizioni si lascia sfuggire delle cose, quindi eseguiamo anche due controlli automatici:
- Rapporto di output: il numero di parole prodotte da un motore diviso per quello del riferimento. Molto sotto 1 di solito significa che sono stati persi ampi passaggi; abbiamo visto 0,1. Molto sopra 1 con tante parole ripetute di solito significa un loop; abbiamo visto 1,8.
- Ripetizioni: quanto spesso la stessa parola ricorre in un breve intervallo.
Nessuno dei due dipende dal formato audio o dalla difficoltà della clip, quindi si possono confrontare tra lingue diverse. Il WER no.
Regole per non ingannare noi stessi
Ognuna è nata da un errore.
Quando più motori sono d'accordo e solo il riferimento non lo è, sospettate prima del riferimento. In turco abbiamo sbagliato due volte. Abbiamo registrato parlato reale come "allucinazione" quando i sottotitoli avevano semplicemente tralasciato quella battuta.
Quando più motori fanno lo stesso errore nello stesso punto, non attribuitelo a uno solo. Di solito lì l'audio è davvero poco chiaro e chiunque sbaglierebbe. Imputarlo a un solo motore è ingiusto verso quel motore, e porta a scegliere quello sbagliato.
Delle clip brevi non ci si può fidare. Eseguite sempre la registrazione completa. Un approccio che abbiamo esaminato ha ottenuto il 99,8% nell'identificazione dei parlanti su una clip di 10 minuti. Eseguito sulla registrazione completa, è sceso al 63,9%.
Eseguite ogni impostazione almeno due volte. Lo stesso input non dà sempre lo stesso output. Una volta un motore ha ripetuto un singolo "ehm" 99 volte e si è mangiato le tre frasi successive. Eseguendolo una sola volta non si può capire se sia la norma o un caso.
Dove questo metodo non basta
La maggior parte delle nostre clip di prova viene da cinema e televisione, non da interviste di ricerca. I dialoghi dei film sono scritti e registrati con cura. Un unico registratore sul tavolo di una sala riunioni è un'altra cosa. Quindi quello che questi risultati vi dicono è come i motori sbagliano sulla conversazione reale, non quanto sarà precisa la vostra specifica intervista.
È anche per questo che non pubblichiamo un unico dato di precisione della trascrizione da mettere in vetrina. Quello che possiamo condividere è come testiamo, cosa abbiamo trovato e cosa ancora non sappiamo.
Prossimamente: la più pericolosa delle sei linee rosse, quella in cui il significato si capovolge e la frase si legge ancora perfettamente.
Di Zeyu Si