Ir para o conteúdo principal

Notas de campo de 27 idiomas: como escolhemos os motores de cada um

· Zeyu Si

Nesta página

Oferecemos suporte a 27 idiomas. Os motores por trás de cada um foram testados separadamente. Não existe uma configuração única aplicada a todos.

Esta série abre os testes de cada idioma: quais trechos usamos, quais motores experimentamos, que erros cada um cometeu, o que escolhemos e por quê, e o que ainda está em aberto.

A versão curta

Não existe "o melhor motor". Um motor que lidera em espanhol pode ficar em último no japonês. Um que não erra nada em áudio limpo pode perder trechos inteiros quando aparece um sotaque regional ou pessoas falando umas por cima das outras.

Para cada idioma, procuramos a combinação que comete menos erros naquele idioma e falha em lugares diferentes dos outros. A segunda metade importa tanto quanto a primeira: motores que erram sempre nas mesmas palavras não conseguem corrigir uns aos outros. Explicamos o porquê em Por que um motor só não basta.

O método de teste em si está em O WER mente: conversa real como referência, conferir a referência primeiro e depois contar os erros que mudam o sentido.

A formação atual

Cada idioma tem um motor principal, que produz a transcrição e distingue os falantes, mais dois ou três motores de apoio que fazem a checagem cruzada.

Hoje o motor principal é o ElevenLabs Scribe v2 para todos os idiomas. Os motores de apoio se dividem em oito combinações:

Motores de apoio Idiomas
AssemblyAI + Doubao Inglês, alemão, espanhol, francês, italiano, holandês, português, russo, turco, ucraniano
Soniox + Doubao Indonésio, japonês, malaio, polonês, romeno, tailandês
Soniox + Speechmatics Árabe, tcheco, norueguês
Speechmatics + Soniox Dinamarquês, grego
AssemblyAI + Soniox Húngaro, sueco
Doubao + Soniox Coreano, vietnamita
Speechmatics + AssemblyAI Finlandês
Doubao + FunASR + iFlytek Chinês (o único idioma com três)

Desde agosto de 2026, o Gemini também roda como motor de apoio adicional em todos os 27 idiomas.

Notas de cada idioma

Idiomas que ainda não oferecemos

Testamos tâmil, bengali e filipino, mas não encontramos uma referência utilizável para nenhum deles. As legendas em tâmil costumam ser escritas no registro literário, enquanto as pessoas falam no coloquial. Para o bengali, não encontramos legendas humanas literais. E alguns programas rotulados como filipino estavam, na verdade, em outro idioma.

Se não conseguimos medir, não oferecemos. Quando tivermos uma referência confiável, por exemplo uma transcrição literal feita por um falante nativo, vamos testar de novo.

Por Zeyu Si