Parte da série: 27 idiomas, um a um
Malaio: o entrevistado mudou para o inglês, e o motor traduziu de volta
· Zeyu Si
Nesta página
Numa entrevista sobre atualidades na Malásia, o convidado muda para o inglês no meio da fala: "enforcing the letter of the law, without looking at … mood music around you."
O ElevenLabs registrou esse inglês palavra por palavra. O AssemblyAI, em vez disso, produziu cerca de quinze palavras em malaio. Mais ou menos o mesmo sentido, perfeitamente fluente, e não foi o que o convidado disse.
Para pesquisadores, este é o erro mais perigoso em malaio. O motor fez uma tradução em nome do entrevistado, e nada na página denuncia isso.
Os trechos de teste: três, escolhidos pela alternância de idiomas
- Uma cena de uma novela malaia: mãe e filho conversando, depois uma prisão feita pela divisão de narcóticos, com gritos e algumas falas em inglês ("under arrest" e afins).
- Duas entrevistas de talk shows políticos da Malásia: comentaristas alternando entre malaio e inglês frase a frase, orações inteiras em inglês e muitos nomes de pessoas e partidos.
Havia um quarto trecho, uma palestra TEDx, mas as legendas voluntárias eram um resumo, 170 palavras para três minutos, então não serviam como referência e o descartamos. Material em malaio livre, conversacional e literal é escasso, e paramos em três. Os trechos foram escolhidos pela quantidade de alternância de idiomas, não para corresponder aos nossos três níveis de dificuldade. Não testamos especificamente ruído forte com pessoas falando umas por cima das outras.
Motores que testamos
Onze: ElevenLabs Scribe v2, Soniox, Doubao (ms-MY), AssemblyAI, FunASR, Qwen, Speechmatics (enhanced e Melia-1), Gladia e Deepgram, além do Gemini, adicionado em agosto de 2026.
Linhas vermelhas, motor a motor
Reescrever inglês como malaio: o AssemblyAI e o Gladia fizeram isso no trecho jurídico acima. Na outra entrevista, o AssemblyAI também transformou "asking for the removal" no termo malaio para "restauração", o sentido oposto. O Gladia transformou "we'll look at the comments" em "we'll suppress the comments".
Sentido invertido:
- O Deepgram transformou "está sendo investigado" em "fugiu".
- O FunASR transformou a fala da novela "você pegou a pessoa errada" em "você pegou a pessoa certa".
- O Speechmatics transformou o inglês "I don't know what that means" em "I know What I means".
Trechos perdidos: o Deepgram cortou a novela depois de 2:11, perdendo cerca de 30% dela. O FunASR pulou uns 20 segundos de uma das entrevistas.
Palavras inseridas: o Speechmatics enfiou "menipu" ("enganar") numa frase.
Loops: a versão Melia-1 do Speechmatics repetiu "eh" cerca de cinquenta vezes no fim da novela e produziu uma sequência de "ada ada ada" numa entrevista. Essa sequência foi atribuída primeiro ao Qwen; a revisão descobriu que tínhamos posto a culpa no motor errado.
O que escolhemos, e por quê
Principal: ElevenLabs Scribe v2. O mais limpo na alternância de idiomas nos três trechos, com as orações em inglês mantidas palavra por palavra, e o mais preciso em nomes.
Referência 1: Soniox. Nenhuma alucinação ou inversão em nenhum trecho, e a menor taxa de erro nos três (apenas 0,4 ponto à frente do AssemblyAI na novela). Seu único deslize pequeno foi escrever "latter" em vez de "letter".
Referência 2: Doubao. Também nenhuma alucinação ou inversão, e o único motor que nunca "traduziu" nada nos três trechos. Manteve as falas em inglês da novela, "You got the wrong person" e "under arrest", como foram ditas. Seus erros foram nomes e palavras de som parecido, como "gelap" (escuro) em vez de "gelak" (risada).
Referência 3: Gemini. Na rodada de agosto, teve no máximo uma expressão borrada no primeiro talk show, com todos os nomes de partidos e instituições corretos. Na palestra TEDx, produziu 304 palavras coerentes, sem alucinações.
Evidências contra a nossa escolha
- O Soniox também "malaiza". Na novela, escreveu a fala em inglês "You are under arrest" como o malaio "awak ditangkap". O sentido está certo e nada foi invertido, mas é o mesmo tipo de comportamento pelo qual penalizamos o AssemblyAI, e o relatório original não apontou isso. A revisão recomenda conferir por amostragem os trechos com alternância de idiomas logo no início da produção.
- O Doubao não é um segundo lugar claro. Nos talk shows, sua taxa de erro alterna posições com o FunASR e o Qwen. Um dos motivos para escolhê-lo foi que o FunASR perdeu grandes blocos e o Qwen entrou em loop, enquanto o Doubao não fez nenhuma das duas coisas. A segunda metade disso acabou sendo atribuída ao motor errado (veja o último ponto).
- O AssemblyAI é, na verdade, muito bom na novela: 17,4%, empatado com o Soniox no topo. Ele só desanda na alternância densa de idiomas das entrevistas. Hoje é um reserva.
- O Qwen foi condenado com base em duas provas que caíram por terra: o loop era do Melia-1, e a "frase inventada" era o falante realmente começando uma frase e se corrigindo. Hoje é um reserva utilizável, mas não uma trilha fixa, porque seus timestamps são uma grade de intervalos iguais, e não tempos reais.
Ainda em aberto
- Três trechos é uma amostra pequena.
- Nenhum teste dedicado de ruído forte com pessoas falando umas por cima das outras.
- A alternância densa de idiomas só foi testada num contexto: talk shows políticos.
Nossa página de transcrição em malaio
Por Zeyu Si