Quem disse isso? Atribuição de falantes quando muita gente fala
· Zeyu Si
Nesta página
- Com mais pessoas, os rótulos de falante nativos se desviam
- Trechos curtos embelezam os resultados
- O método de pontuação também pode enganar
- Algumas descobertas contraintuitivas
- Nossa abordagem: aprender cada voz antes e depois atribuir frase a frase
- Resultados: acima de 99% em dados públicos de reuniões, sem desvio
- O limite: pessoas falando umas por cima das outras
Uma discussão com sete pessoas, de 37 minutos. Demos a gravação inteira ao ElevenLabs e pedimos que rotulasse quem disse cada frase.
Ele encontrou nove pessoas.
O problema maior era que os rótulos das pessoas não paravam de mudar. Um falante foi rotulado como A do minuto 8 ao minuto 18, virou B logo depois de 18:30, voltou a ser A por volta do minuto 30 e virou B de novo em 32:47. Entre os sete falantes, as identidades trocaram 16 vezes. Medido em palavras, só 68,6% da transcrição foi atribuída à pessoa certa.
Para pesquisa com entrevistas, isso é pior do que algumas palavras mal ouvidas. Não dá para confiar em quem disse o quê.
Com mais pessoas, os rótulos de falante nativos se desviam
Essa gravação vem do AISHELL-4, um conjunto de dados público de gravações de reuniões em chinês, cada uma com cinco a sete pessoas em volta de uma mesa. Testamos repetidamente a rotulagem de falantes nativa do ElevenLabs nele:
- Em trechos de 10 a 15 minutos, dependendo das configurações, entre 67,5% e 97,8% do conteúdo foi atribuído corretamente, e a identidade de uma pessoa trocou até 12 vezes.
- Mais pessoas pioravam o resultado. Em trechos com sete pessoas, mesmo informado de que havia sete falantes, ele só chegou a 77% a 82%.
- Ele não conseguia contar as pessoas com confiabilidade. Deixado para descobrir sozinho, acertou o número 4 vezes em 12, e em todos os erros faltou uma pessoa: os um ou dois falantes mais calados foram fundidos com outra pessoa.
Rodar as mesmas configurações duas vezes podia dar resultados muito diferentes. Um trecho marcou 81,9% numa rodada e 93,8% na seguinte.
Trechos curtos embelezam os resultados
Esses números escondem uma armadilha própria: quanto mais curto o trecho, melhor ele parece.
Na mesma sala de reunião, trechos de 15 minutos marcaram de 78% a 93%. A gravação completa de 37 minutos caiu para 68,6%, de 10 a 25 pontos a menos, e a falha mudou de "falta uma pessoa" para "pessoas a mais e identidades trocando de um lado para o outro".
Já vimos o mesmo em outros lugares. Uma abordagem de código aberto marcou 99,8% na identificação de falantes num trecho de 10 minutos. Rodada na gravação completa, caiu para 63,9%.
Por isso, agora só julgamos com gravações completas.
O método de pontuação também pode enganar
Há outra armadilha na própria régua.
Transcrições de referência humanas costumam marcar o tempo com precisão de um segundo, e, por convenção, várias linhas podem compartilhar o mesmo segundo (uma pessoa termina e outra entra direto). Numa referência que usamos, 55% das linhas compartilhavam o timestamp com uma linha vizinha.
Pontue pela linha do tempo e um desvio de um segundo conta como uma frase inteira atribuída à pessoa errada. A mesma saída marcou 81% pela linha do tempo e 99,7% pelo alinhamento de texto.
Algumas descobertas contraintuitivas
- Admitir mais falantes não faz encontrar mais falantes. Testamos isso com um sistema de código aberto: dê a ele espaço para uma pessoa a mais e, em vez de encontrar um terceiro falante, ele divide em dois a pessoa que mais fala.
- Um modelo diferente não é necessariamente diferente. Cinco modelos de voz do mesmo desenvolvedor produziram uma saída idêntica palavra por palavra. Só um modelo de outro desenvolvedor mudou alguma coisa.
- As configurações padrão apagam "hum" e "aham". Confirmações com menos de meio segundo estavam sendo descartadas como ruído. Quando paramos com isso, mais trocas de falante foram captadas, e com mais precisão.
Nossa abordagem: aprender cada voz antes e depois atribuir frase a frase
O que acabamos adotando tem três etapas:
- Um "cartão de voz" para cada pessoa: de 10 a 30 segundos de fala limpa daquela pessoa, como uma rodada de apresentações no início. Abaixo de 10 segundos piora visivelmente; acima de 30 segundos para de melhorar.
- Atribuir cada frase: o ElevenLabs só transcreve e divide as frases. Quem disse cada uma é decidido comparando a voz daquela frase com cada cartão, e não pelos rótulos de falante do próprio ElevenLabs. Esses rótulos não são consistentes ao longo do tempo: atribuir pelo rótulo chegou a apenas 71,5%.
- Ordenar por confiança: as atribuições seguras são feitas diretamente; as incertas são marcadas para uma pessoa confirmar. Em duas reuniões de teste, o grupo seguro cobriu 564 segmentos sem um único erro.
"Sim" e "hum" muito curtos não carregam voz suficiente para serem identificados sozinhos, então assumem a identidade das frases mais longas da mesma pessoa ao redor deles.
Resultados: acima de 99% em dados públicos de reuniões, sem desvio
Duas reuniões completas do AISHELL-4:
| ElevenLabs nativo | Nossa abordagem | |
|---|---|---|
| 5 pessoas, 36 minutos | 97,28% | 99,76% |
| 7 pessoas, 37 minutos | 68,6% (16 trocas de identidade) | 99,32% |
As duas acertaram o número de pessoas e tiveram zero trocas de identidade.
Também testamos seis trechos de 10 a 15 minutos e um painel público de discussão com cinco pessoas (99,75%). Os nove ficaram acima de 97%.
Quase todos os erros restantes são um "sim", "certo" ou "tá" com menos de um segundo.
O limite: pessoas falando umas por cima das outras
Isso são dados públicos. Grupos focais reais têm sido mais difíceis.
- Uma discussão aberta com cinco pessoas: a moderadora levanta um tema e quatro participantes entram livremente. As cinco são mulheres, e cerca de um quinto do tempo de fala tem pessoas falando ao mesmo tempo. As atribuições seguras acertaram cerca de 97%, mas de 30 a 40% dos segmentos só puderam ser marcados como incertos.
- Um grupo focal com oito pessoas gravado com qualidade de telefone: quando cada participante passou a ter um cartão de voz adequado, as atribuições seguras acertaram 98,1%, mas o material incerto ainda representava 17,5% do texto. Nosso próprio padrão é "atribuições seguras acima de 99%, material incerto de no máximo 5%". Este não passou.
Ouvir os erros de novo deixou uma coisa clara: quando várias pessoas falam ao mesmo tempo, ouvidos humanos também não conseguem separá-las. Profissionais que tomam notas na sala se apoiam em vídeo.
Por isso, nosso compromisso com a atribuição de falantes cobre discussões com várias pessoas em que se fala por turnos: uma pessoa fala, as outras escutam. Dentro disso, mantemos a identidade de cada pessoa consistente do início ao fim. Pessoas falando umas por cima das outras ficam fora disso.
Por Zeyu Si