Parte da série: 27 idiomas, um a um
Japonês: o motor que parecia o melhor estava apagando as hesitações
· Zeyu Si
Nesta página
Em dois trechos de entrevistas atuais em japonês, o AssemblyAI pareceu de início o mais preciso dos quatro motores que testamos, com uma taxa de erro de caracteres de apenas 8.4% num deles. Então descobrimos de onde vinha a vantagem. As legendas contra as quais pontuamos omitem as hesitações faladas e os sons de pausa. O AssemblyAI também os omite. O Soniox os escreve, e cada um que escreveu contou como erro. Tirando as hesitações dos dois lados, o Soniox vence os quatro trechos, chegando a 2.0% no último, abaixo do nosso motor principal.
Essa descoberta mudou quem ocupa as faixas de referência do japonês.
Os trechos de teste
Quatro trechos em dois pares:
- Seven Samurai (1954): dialeto de Tohoku, gritaria densa, chiado de filme antigo.
- Rashomon (1950): japonês padrão, mas com chuva forte e três pessoas interrompendo umas às outras.
- Uma entrevista a dois do YouTube: troca frequente de turnos, som de estúdio limpo.
- Um episódio de um programa do YouTube em japonês: dois apresentadores dando retorno o tempo todo (そうだね, うん e afins), com troca de falante a cada poucas palavras.
Na nossa escala de dificuldade de três níveis, os filmes são do nível mais alto e os trechos atuais do intermediário. Não testamos um trecho fácil em japonês à parte (uma ou duas pessoas, ritmo constante, sem ruído).
Para os trechos atuais, pontuamos contra as legendas feitas à mão por quem subiu o vídeo, nunca contra legendas automáticas. A primeira entrevista que escolhemos se revelou, numa checagem linha por linha, falada em inglês com legendas de tradução em japonês. Pontuar uma transcrição contra uma tradução não faria sentido, então a trocamos.
Motores que experimentamos
ElevenLabs Scribe v2, AssemblyAI, Doubao e Speechmatics na primeira rodada. Soniox, Gladia, Deepgram, FunASR e Qwen em rodadas posteriores. O Gemini foi testado à parte.
Onde os motores cruzaram linhas vermelhas
Loops de repetição. Na gritaria de Seven Samurai, o AssemblyAI repetiu um som 95 vezes. No mesmo trecho, o Gladia repetiu 447 vezes. Quando uma transcrição se enche de uma única sílaba, tudo o que vinha depois se perde.
Frases inventadas. Também em Seven Samurai, o AssemblyAI inventou frases inteiras, e em Rashomon grudou palavras não ditas no fim de uma fala.
Conteúdo inserido. Nos filmes antigos, o Doubao certa vez escreveu uma ordem violenta que ninguém deu. Seu histórico limpo só vale para os trechos atuais.
Sentido invertido. O Soniox inverteu o sentido de duas falas no trecho de dialeto e gritaria de Seven Samurai. Nesse mesmo trecho, o AssemblyAI estava em loop e inventando frases. Descartar o Soniox por esses dois erros e manter o AssemblyAI seria julgá-los por regras diferentes, então tratamos isso como um problema daquela cena.
Desvio de idioma. Quando testamos o Gemini como substituto do motor principal, seu japonês saiu com alguns kanji nas formas do chinês simplificado: 绍介, 连络, 结婚 em vez de 紹介, 連絡, 結婚. Caracteres certos, escrita errada.
Substituições (não são linhas vermelhas, mas enganam): o Speechmatics ouviu 人前式, um casamento celebrado diante da família e dos amigos, como 人権意識, "consciência de direitos humanos". O Doubao e o AssemblyAI escreveram 酌み交わす ("compartilhar uma bebida") como seu homófono 組み交わす.
O que escolhemos
Principal: ElevenLabs Scribe v2. O único motor que nunca colapsou em nenhum dos quatro trechos, e 5.1% no programa do YouTube.
Referências, em ordem: Soniox, Doubao, Gemini. Os três rodam em todos os arquivos em japonês.
- Soniox: vence os quatro trechos quando as hesitações são tiradas. Atribuímos suas duas inversões no filme antigo à cena.
- Doubao: primeiro achamos que ele não fazia japonês porque devolvia lixo. Só não tínhamos enviado o código de idioma certo. Com ja-JP, foi limpo nos trechos atuais, terceiro em Rashomon e meio de tabela, mas íntegro, em Seven Samurai. Ele vem de uma linhagem muito diferente da do Soniox, então os dois raramente falham no mesmo ponto.
- Gemini: nenhum erro de linha vermelha nos dois trechos atuais.
O AssemblyAI passou a reserva.
Evidências contra a nossa escolha
- O AssemblyAI é de fato preciso em entrevistas atuais, e em conversa real e limpa seus problemas quase desaparecem. Nós o substituímos sobretudo por causa dos loops e das frases inventadas nos filmes antigos, e porque ele deixa de ser o primeiro quando as hesitações são tiradas.
- Uma rodada anterior chegou à conclusão oposta. Naquele momento, o Soniox não parecia melhor que os dois titulares em material de entrevista, e a regra era "não trocar em caso de empate". A descoberta das hesitações inverteu isso. Então a decisão se apoia numa única escolha de pontuação: se as hesitações contam ou não.
- O Gemini cometeu muitos erros nos dois filmes antigos. Em Seven Samurai, transformou 米 ("arroz") no sobrenome 亀岡. Em Rashomon, escreveu o título policial da era Heian 検非違使 como 蛇石 ("pedra de cobra"), transformou "chega de sermão" em "chega de tosse" e deixou cair a frase final. Rashomon tem diálogo claro, então o problema acompanha mais a qualidade da gravação do que o ruído. Se a gravação de um cliente for ruim, esta faixa pode escorregar junto.
Problemas em aberto
- Temos só duas entrevistas reais, e as duas são limpas. Não temos nenhum exemplo pontuado de uma entrevista atual em japonês numa sala barulhenta.
- Se um cliente quiser uma transcrição estritamente literal, com cada えーと mantido, o hábito do Soniox de escrever as hesitações é um ponto forte. Se quiser uma transcrição limpa, a base do ranking precisa ser revista.
- O problema dos kanji simplificados apareceu quando o Gemini substituiu o motor principal. Não temos dados separados sobre se isso acontece quando o Gemini roda como faixa de referência.
Nossa página de transcrição em japonês
Por Zeyu Si