Ir para o conteúdo principal

O WER mente. Veja como medimos a precisão em entrevistas reais

· Zeyu Si

Nesta página

Certa vez testamos uma entrevista sobre livros de um programa matinal da televisão sueca. Quatro motores de fala a transcreveram. Pelo WER, a métrica que quase todo mundo usa, as taxas de erro ficaram entre 194% e 216%. Mais erros do que palavras.

Depois lemos as quatro transcrições linha a linha. Eram as mais completas de todo o lote. Títulos de livros, nomes, pontos da trama, tudo correto. Elas captaram até coisas que a transcrição de referência tinha deixado de fora.

O problema era a referência.

Este post trata de duas coisas: por que o WER falha em entrevistas e o que passamos a usar. É o método que usamos para escolher os motores dos nossos 27 idiomas.

Cinco formas de o WER enganar você em áudio de entrevistas

Esbarramos nos mesmos poucos problemas em mais de 20 idiomas. Cada um produz um número que parece preciso e diz a coisa errada.

1. A referência já foi cortada. A maioria das nossas referências vem de legendas para surdos e ensurdecidos de filmes e TV. Legendas precisam ser lidas depressa, então rotineiramente comprimem o que as pessoas realmente dizem. Quanto mais fielmente um motor transcreve, mais ele discorda da legenda e mais é penalizado. Foi o caso da entrevista sueca. Numa cena de filme espanhol em que todo mundo grita por cima de todo mundo, todos os motores marcaram entre 63% e 80% de WER. Lidos linha a linha, todos tinham transmitido o sentido.

2. A língua escrita e a língua falada não são a mesma coisa. O árabe escrito e o árabe que as pessoas falam no dia a dia podem estar muito distantes. Pontuamos o mesmo motor contra uma referência escrita em árabe padrão moderno e obtivemos 49%. Contra uma referência que registrava fielmente o dialeto, 16%. O motor não tinha mudado. A referência, sim.

O tâmil é ainda mais extremo. As legendas são escritas, por convenção, no registro literário, enquanto as pessoas falam o coloquial. Use as legendas como referência e o vencedor será o motor que "reescrever" a fala em tâmil literário. O motor que transcreve fielmente fica em último. A classificação se inverte.

3. Chinês e japonês não põem espaços entre as palavras. Divida por espaços e uma frase inteira em chinês vira uma só "palavra". A taxa de erro pode passar de 1000%. Esse número não significa nada.

4. A grafia difere, o sentido não. Grego e árabe costumam ter pontuações altas. Olhando de perto, muitos dos "erros" são flexões e convenções de grafia, como se um pequeno sinal árabe chamado hamza foi escrito ou não. Nenhum leitor entenderia mal a frase. A métrica conta mesmo assim.

5. Por isso o WER é um teste de fumaça, nada mais. Ele diz se um motor desabou por completo: trechos inteiros faltando, telas de algaravia. Para decidir qual de dois motores que funcionam é mais preciso, não olhamos mais para ele.

As referências devem ser conversa real

Entrevistas reais têm pausas, palavras de preenchimento, interrupções e pessoas falando umas por cima das outras. Teste com apresentadores de telejornal ou áudio lido em voz alta e todos os motores parecem ótimos. Entrevistas são outra história.

Por isso, nossos trechos de teste são apenas de fala espontânea. Cenas de filmes vêm primeiro: têm legendas para surdos e ensurdecidos que acompanham o diálogo de perto, e estão disponíveis. Quando não encontramos um filme adequado, recorremos, nesta ordem, a séries de TV e documentários, gravações de parlamentos ou tribunais e, por fim, podcasts com transcrições literais.

Há três níveis de dificuldade, cada um construído sobre o anterior:

  • Básico: uma ou duas pessoas, ritmo constante, sem ruído de fundo, sotaque padrão, mas ainda assim conversa real. Só este nível já derruba alguns motores fracos.
  • Mais difícil: o básico mais uma ou duas complicações, como fala mais rápida, um grupo pequeno, trocas de turno mais rápidas, algum ruído de fundo ou um sotaque.
  • Extremo: fala sobreposta, ruído forte ou música, dialeto acentuado, áudio ruim, tudo ao mesmo tempo.

Quando um idioma tem forte variação regional, cada região ganha seus próprios trechos. Espanhol da Espanha, do México e da Argentina. Árabe do Golfo, do Egito e do Levante.

Confira a referência antes de conferir o motor

Esta é a etapa que as pessoas pulam. Nós a acrescentamos depois de pagar caro por isso. Antes de uma referência ser usada para pontuar qualquer coisa, confirmamos que a própria referência está certa.

Numa auditoria, descartamos muitos trechos que pareciam bons:

  • Um programa rotulado como tagalo estava, na verdade, em cebuano, outro idioma das Filipinas.
  • Um trecho em tailandês tinha as legendas cerca de 30 segundos fora de sincronia com o áudio.
  • Uma entrevista em cantonês acabou se revelando em coreano. O convidado era coreano e as legendas em cantonês eram uma tradução. Todos os motores marcaram perto de 100% de erro nela.

Cada um desses teria produzido uma pontuação com aparência precisa e sem sentido. Pior: algumas conclusões anteriores tinham sido construídas sobre trechos assim.

Há três idiomas para os quais ainda não conseguimos encontrar uma referência utilizável: tâmil, bengali e filipino. Ainda não os suportamos. Preferimos não oferecer um idioma a publicar um número que não conseguimos sustentar.

Conte os erros que mudam o sentido

Pesquisadores leem transcrições de entrevistas pelo sentido. Escrever "hum" como "éh" não importa. Escrever "não fez" como "fez" importa. Por isso, para cada motor, contamos os erros de linha vermelha, em seis categorias:

  1. Frases inventadas: aparece uma frase que ninguém disse. Um motor com uma taxa de erro perfeitamente respeitável produziu, num trecho com sotaque forte, uma frase completa terminando em "comprar umas bananas". Ninguém disse nada parecido. Não usamos esse motor.
  2. Negação invertida: "não" vira "sim" ou o contrário. Lê-se perfeitamente e significa o oposto. Nosso próximo post é sobre isso.
  3. Loops: a mesma palavra repetida dezenas ou centenas de vezes.
  4. Conteúdo inserido: material acrescentado que não estava no áudio.
  5. Trechos perdidos: um pedaço de fala que falta por inteiro. Numa cena de filme com dialeto forte e uma multidão barulhenta, um motor perdeu os primeiros 54 segundos.
  6. Deriva de idioma: trocar de idioma no meio do caminho. Um motor transformou longos trechos de espanhol em português. "Soy abogado" virou "Sou advogado".

Todos os motores são medidos com a mesma régua. Diferenças na grafia de nomes, ou se um número é escrito "6" ou "seis", não contam como linhas vermelhas.

Pessoas lendo transcrições também deixam passar coisas, por isso também rodamos duas verificações automáticas:

  • Razão de saída: o número de palavras que um motor produziu dividido pelo número da referência. Bem abaixo de 1 geralmente significa que grandes trechos foram perdidos; já vimos 0,1. Bem acima de 1 com muitas palavras repetidas geralmente significa loop; já vimos 1,8.
  • Repetições: com que frequência a mesma palavra volta num intervalo curto.

Nenhuma das duas depende do formato do áudio ou da dificuldade do trecho, então dá para compará-las entre idiomas. O WER, não.

Regras para não nos enganarmos

Cada uma delas nasceu de um erro.

Quando vários motores concordam e só a referência discorda, desconfie primeiro da referência. Erramos nisso duas vezes em turco. Registramos fala real como "alucinação" quando as legendas simplesmente tinham deixado aquela fala de fora.

Quando vários motores cometem o mesmo erro no mesmo lugar, não culpe um só deles. Normalmente o áudio ali é realmente pouco claro e qualquer um erraria. Contar isso contra um motor é injusto com ele e leva você a escolher o motor errado.

Trechos curtos não são confiáveis. Rode sempre a gravação completa. Uma abordagem que avaliamos marcou 99,8% na identificação de falantes num trecho de 10 minutos. Rodada na gravação completa, caiu para 63,9%.

Rode cada configuração pelo menos duas vezes. A mesma entrada nem sempre dá a mesma saída. Certa vez, um motor repetiu um único "hum" 99 vezes e engoliu as três frases seguintes. Rodando uma só vez, não dá para saber se isso é típico ou um acaso.

Onde este método fica devendo

A maioria dos nossos trechos de teste vem de cinema e televisão, não de entrevistas de pesquisa. O diálogo de filme é roteirizado e gravado com cuidado. Um único gravador sobre a mesa de uma sala de reunião é outra coisa. Então o que esses resultados dizem é como os motores falham em conversa real, não quão precisa será a sua entrevista em particular.

É também por isso que não publicamos um número único de precisão de transcrição como manchete. O que podemos compartilhar é como testamos, o que encontramos e o que ainda não sabemos.

A seguir: a mais perigosa das seis linhas vermelhas, em que o sentido se inverte e a frase continua perfeitamente legível.

Por Zeyu Si