Ir para o conteúdo principal

Quem disse isso? Atribuição de falantes quando muita gente fala

· Zeyu Si

Nesta página

Uma discussão com sete pessoas, de 37 minutos. Demos a gravação inteira ao ElevenLabs e pedimos que rotulasse quem disse cada frase.

Ele encontrou nove pessoas.

O problema maior era que os rótulos das pessoas não paravam de mudar. Um falante foi rotulado como A do minuto 8 ao minuto 18, virou B logo depois de 18:30, voltou a ser A por volta do minuto 30 e virou B de novo em 32:47. Entre os sete falantes, as identidades trocaram 16 vezes. Medido em palavras, só 68,6% da transcrição foi atribuída à pessoa certa.

Para pesquisa com entrevistas, isso é pior do que algumas palavras mal ouvidas. Não dá para confiar em quem disse o quê.

Com mais pessoas, os rótulos de falante nativos se desviam

Essa gravação vem do AISHELL-4, um conjunto de dados público de gravações de reuniões em chinês, cada uma com cinco a sete pessoas em volta de uma mesa. Testamos repetidamente a rotulagem de falantes nativa do ElevenLabs nele:

  • Em trechos de 10 a 15 minutos, dependendo das configurações, entre 67,5% e 97,8% do conteúdo foi atribuído corretamente, e a identidade de uma pessoa trocou até 12 vezes.
  • Mais pessoas pioravam o resultado. Em trechos com sete pessoas, mesmo informado de que havia sete falantes, ele só chegou a 77% a 82%.
  • Ele não conseguia contar as pessoas com confiabilidade. Deixado para descobrir sozinho, acertou o número 4 vezes em 12, e em todos os erros faltou uma pessoa: os um ou dois falantes mais calados foram fundidos com outra pessoa.

Rodar as mesmas configurações duas vezes podia dar resultados muito diferentes. Um trecho marcou 81,9% numa rodada e 93,8% na seguinte.

Trechos curtos embelezam os resultados

Esses números escondem uma armadilha própria: quanto mais curto o trecho, melhor ele parece.

Na mesma sala de reunião, trechos de 15 minutos marcaram de 78% a 93%. A gravação completa de 37 minutos caiu para 68,6%, de 10 a 25 pontos a menos, e a falha mudou de "falta uma pessoa" para "pessoas a mais e identidades trocando de um lado para o outro".

Já vimos o mesmo em outros lugares. Uma abordagem de código aberto marcou 99,8% na identificação de falantes num trecho de 10 minutos. Rodada na gravação completa, caiu para 63,9%.

Por isso, agora só julgamos com gravações completas.

O método de pontuação também pode enganar

Há outra armadilha na própria régua.

Transcrições de referência humanas costumam marcar o tempo com precisão de um segundo, e, por convenção, várias linhas podem compartilhar o mesmo segundo (uma pessoa termina e outra entra direto). Numa referência que usamos, 55% das linhas compartilhavam o timestamp com uma linha vizinha.

Pontue pela linha do tempo e um desvio de um segundo conta como uma frase inteira atribuída à pessoa errada. A mesma saída marcou 81% pela linha do tempo e 99,7% pelo alinhamento de texto.

Algumas descobertas contraintuitivas

  • Admitir mais falantes não faz encontrar mais falantes. Testamos isso com um sistema de código aberto: dê a ele espaço para uma pessoa a mais e, em vez de encontrar um terceiro falante, ele divide em dois a pessoa que mais fala.
  • Um modelo diferente não é necessariamente diferente. Cinco modelos de voz do mesmo desenvolvedor produziram uma saída idêntica palavra por palavra. Só um modelo de outro desenvolvedor mudou alguma coisa.
  • As configurações padrão apagam "hum" e "aham". Confirmações com menos de meio segundo estavam sendo descartadas como ruído. Quando paramos com isso, mais trocas de falante foram captadas, e com mais precisão.

Nossa abordagem: aprender cada voz antes e depois atribuir frase a frase

O que acabamos adotando tem três etapas:

  1. Um "cartão de voz" para cada pessoa: de 10 a 30 segundos de fala limpa daquela pessoa, como uma rodada de apresentações no início. Abaixo de 10 segundos piora visivelmente; acima de 30 segundos para de melhorar.
  2. Atribuir cada frase: o ElevenLabs só transcreve e divide as frases. Quem disse cada uma é decidido comparando a voz daquela frase com cada cartão, e não pelos rótulos de falante do próprio ElevenLabs. Esses rótulos não são consistentes ao longo do tempo: atribuir pelo rótulo chegou a apenas 71,5%.
  3. Ordenar por confiança: as atribuições seguras são feitas diretamente; as incertas são marcadas para uma pessoa confirmar. Em duas reuniões de teste, o grupo seguro cobriu 564 segmentos sem um único erro.

"Sim" e "hum" muito curtos não carregam voz suficiente para serem identificados sozinhos, então assumem a identidade das frases mais longas da mesma pessoa ao redor deles.

Resultados: acima de 99% em dados públicos de reuniões, sem desvio

Duas reuniões completas do AISHELL-4:

ElevenLabs nativo Nossa abordagem
5 pessoas, 36 minutos 97,28% 99,76%
7 pessoas, 37 minutos 68,6% (16 trocas de identidade) 99,32%

As duas acertaram o número de pessoas e tiveram zero trocas de identidade.

Também testamos seis trechos de 10 a 15 minutos e um painel público de discussão com cinco pessoas (99,75%). Os nove ficaram acima de 97%.

Quase todos os erros restantes são um "sim", "certo" ou "tá" com menos de um segundo.

O limite: pessoas falando umas por cima das outras

Isso são dados públicos. Grupos focais reais têm sido mais difíceis.

  • Uma discussão aberta com cinco pessoas: a moderadora levanta um tema e quatro participantes entram livremente. As cinco são mulheres, e cerca de um quinto do tempo de fala tem pessoas falando ao mesmo tempo. As atribuições seguras acertaram cerca de 97%, mas de 30 a 40% dos segmentos só puderam ser marcados como incertos.
  • Um grupo focal com oito pessoas gravado com qualidade de telefone: quando cada participante passou a ter um cartão de voz adequado, as atribuições seguras acertaram 98,1%, mas o material incerto ainda representava 17,5% do texto. Nosso próprio padrão é "atribuições seguras acima de 99%, material incerto de no máximo 5%". Este não passou.

Ouvir os erros de novo deixou uma coisa clara: quando várias pessoas falam ao mesmo tempo, ouvidos humanos também não conseguem separá-las. Profissionais que tomam notas na sala se apoiam em vídeo.

Por isso, nosso compromisso com a atribuição de falantes cobre discussões com várias pessoas em que se fala por turnos: uma pessoa fala, as outras escutam. Dentro disso, mantemos a identidade de cada pessoa consistente do início ao fim. Pessoas falando umas por cima das outras ficam fora disso.

Por Zeyu Si