Quando as entrevistas trocam de idioma
· Zeyu Si
Nesta página
Pesquisas internacionais produzem muitas gravações assim: o entrevistado fala espanhol, quem faz as perguntas fala chinês e um intérprete fica entre os dois. A conversa vai e volta entre dois idiomas.
Achamos que isso seria simples. Lemos a documentação de todos os motores, fizemos uma rodada de testes de laboratório e chegamos a um conjunto de conclusões. Depois testamos uma gravação real, e as conclusões se inverteram.
Dois tipos de mistura, resultados muito diferentes
Primeiro, é preciso separar duas situações:
- O aparte ocasional: um idioma principal, com uma ou outra palavra ou frase em outro, menos de um décimo da gravação.
- Revezamento: por exemplo, interpretação consecutiva, em que os dois idiomas se alternam e cada um ocupa mais ou menos metade.
Os motores se comportam de forma muito diferente nesses dois casos. Eles não devem ser tratados como uma coisa só.
Primeiro uma boa notícia: misturar inglês costuma funcionar bem. O suporte multilíngue de quase todos os motores é construído em torno de "idioma X mais inglês". Nosso motor principal escreve uma frase inteira em inglês do jeito que foi dita, mesmo no meio do espanhol.
O problema começa quando nenhum dos idiomas é o inglês, como espanhol misturado com chinês.
A mesma configuração de "idioma" significa quatro coisas diferentes
A maioria dos motores tem um parâmetro de idioma. Você poderia supor que ele faz mais ou menos a mesma coisa em todos. Percorremos a documentação de cada fornecedor e depois testamos cada um. São quatro coisas diferentes:
- ElevenLabs: diz em qual idioma a gravação está principalmente.
- Soniox: uma dica para a qual ele vai pender, sem impedi-lo de reconhecer outros idiomas.
- Doubao: escolhe qual modelo de idioma rodar. Curiosamente, deixar em branco é a pior opção: ele passa a ouvir chinês e inglês e força o espanhol para o inglês.
- AssemblyAI: decide em que idioma o arquivo inteiro está e então entrega o arquivo todo ao modelo desse único idioma. Dos dois idiomas que ele consegue tratar juntos, um tem de ser o inglês.
Esse último tem uma consequência direta. Numa gravação que era 45% em chinês, o AssemblyAI ainda assim decidiu que era espanhol (confiança de 0,84). Tentamos quatro configurações. Não saiu um único caractere chinês.
Houve também uma surpresa na direção contrária. Pela documentação do Doubao, definir o idioma como espanhol deveria travar o arquivo inteiro em espanhol. Na prática, não travou. Ele continuou transcrevendo o chinês no meio.
O pior resultado é a tradução
No aparte ocasional, nosso motor principal falha de uma de duas formas, dependendo de como é configurado. (Isso foi testado em gravações montadas. A próxima seção trata do problema das montagens, mas, se o motor erra quando a troca de idioma é tão óbvia, uma gravação real não vai ser mais fácil.)
- Diga a ele que o idioma principal é o espanhol, e as frases em chinês simplesmente somem. A linha do tempo passa por cima delas e não deixa rastro.
- Não diga, e as frases em chinês são traduzidas para um espanhol fluente. "你是谁?" virou "¿Quién eres?". Nenhum caractere chinês na transcrição inteira.
A primeira deixa um buraco. A segunda acrescenta espanhol que ninguém disse. A segunda é pior, porque a transcrição se lê sem falhas e um pesquisador suporia que o entrevistado realmente disse aquilo em espanhol.
Outro motor, que usa um modelo de linguagem grande para transcrever, travou numa troca de idioma e repetiu a mesma palavra cerca de 370 vezes.
O áudio real derrubou os resultados de laboratório
Para testar o caso do revezamento, começamos com áudio montado: trechos existentes em espanhol e trechos em chinês colados. As transcrições de referência vinham de graça e quase não custou nada.
Os testes com montagens diziam:
- Diga ao motor principal que o idioma principal é o espanhol, e tudo quebra: o chinês é traduzido, surge conteúdo inventado e a linha do tempo desmorona.
- Deixe que ele descubra o idioma sozinho, e ele acerta tudo.
Depois conseguimos uma entrevista real com interpretação: 66 minutos, espanhol e chinês, com um pesquisador, um intérprete e um entrevistado. Os resultados foram exatamente o contrário:
- Dizer que o idioma principal é o espanhol deu uma transcrição quase perfeita. Os dois idiomas trocaram corretamente, e os três falantes foram mantidos separados. Até o intérprete, indo e voltando entre os idiomas, foi corretamente reconhecido como uma só pessoa.
- Deixando que ele decidisse, concluiu que tudo era chinês (confiança de 0,86), transcreveu com o chinês como fio principal e descartou trechos inteiros em espanhol.
Por quê? O áudio montado tem uma emenda óbvia entre os idiomas: a sala, o volume e o ruído de fundo mudam todos de uma vez, então é fácil para um motor perceber uma troca. Uma gravação real é uma sala e um microfone. Não há emenda.
O ritmo também era diferente das nossas montagens. O chinês representava 29%, alternando como "respostas longas em espanhol, de um a quatro minutos, e intervenções curtas em chinês, de quinze segundos a mais ou menos um minuto", o que caiu bem na faixa que nossas montagens não tinham coberto.
O que aprendemos
A qualidade da transcrição de uma entrevista com idiomas misturados depende de três coisas: quais são os dois idiomas, se é um aparte ocasional ou um revezamento, e como o motor está configurado. A documentação dos fornecedores não responde a essas perguntas, e o áudio de teste montado também não.
Só gravações reais respondem.
Por Zeyu Si