Parte da série: 27 idiomas, um a um
Tailandês: parte da pontuação do nosso motor principal era um bug nosso
· Zeyu Si
Nesta página
Nos nossos testes em tailandês, parte da boa pontuação do motor principal veio de um bug no nosso próprio código.
Uma função do nosso pipeline remove a pontuação das extremidades das palavras. Os sinais de vogal e de tom do tailandês são caracteres combinantes que ficam acima ou abaixo das letras, e essa função os tratou como pontuação e os apagou. Assim, as transcrições armazenadas do ElevenLabs tinham perdido todos os sinais de vogal e de tom, e sua taxa de erro foi calculada como se esses sinais não existissem. O bug foi corrigido, mas a precisão real do ElevenLabs nos diacríticos tailandeses ainda precisa ser conferida por amostragem.
Tenha essa ressalva em mente para todos os números abaixo.
Os trechos de teste
Três trechos, avaliados contra legendas em tailandês feitas à mão, da mesma fonte:
- Uma entrevista de culinária: uma ou duas pessoas falando em ritmo moderado, com pouco ruído de fundo. É o nosso trecho de base, próximo de fácil na nossa escala de dificuldade de três níveis.
- Um reality show: vários convidados falando uns por cima dos outros e rindo, com música de fundo e efeitos sonoros. Classificamos como nível intermediário.
- Um debate no estilo "lobisomem": pessoas se acusando, falando rápido, interrompendo umas às outras, misturando palavras em inglês como Seer e defend. Nível máximo.
Tínhamos um quarto trecho, mas a verificação mostrou que áudio e legendas estavam uns 30 segundos defasados, o que significaria avaliar contra as respostas erradas, então o descartamos. Legendas em tailandês gratuitas, conversacionais e literais são raras, e três trechos é o máximo que conseguimos encontrar.
Motores que experimentamos
Dez: ElevenLabs Scribe v2, AssemblyAI, Speechmatics (duas versões), Doubao, Soniox, Deepgram, Gladia, FunASR e Qwen. O Gemini foi testado separadamente.
Onde os motores cruzaram linhas vermelhas
Loops de repetição. O debate começa com uma explosão de risadas que as legendas registram como uma risada curta. Depois da risada ฮ่า, o Gladia escreveu o sinal de repetição tailandês ๆ mais de 400 vezes seguidas, ao longo de duas linhas, e depois repetiu as mesmas duas frases quatro vezes. Foi isso que o levou a 83,9%. Ele nunca entrou num loop assim nos outros dois trechos. O AssemblyAI também entra em loop: na revisão, descobrimos que ele repetiu uma palavra por umas 22 linhas no reality show e repetiu outra expressão umas 25 vezes.
Trechos perdidos. No debate, o AssemblyAI pulou grandes trechos, em alguns pontos perto de dez segundos sem saída nenhuma. Ficou em último nos dois primeiros trechos, e no debate só o colapso do Gladia o impediu de ficar na lanterna.
Conteúdo inserido (retirado). Em certo momento, achamos que o Qwen tinha inventado um trecho no início do debate. Na revisão, as legendas se mostraram cerca de 10 segundos fora de sincronia no início, e o Soniox, o Doubao e o FunASR tinham transcrito o mesmo conteúdo no mesmo lugar. Alguém realmente disse aquilo. Retiramos essa constatação.
O que escolhemos
Principal: ElevenLabs Scribe v2. Nenhum colapso e nenhuma repetição descontrolada em nenhum trecho; 12,6% na entrevista de culinária e a menor pontuação no reality show. Com a ressalva acima.
Referências, em ordem: Soniox, Doubao, Gemini. As três rodam em todos os arquivos em tailandês.
- Soniox: o mais estável nos três trechos, com a segmentação mais limpa, acompanhando as legendas linha a linha, sem loops e sem deixar nada grande de fora.
- Doubao: produz tailandês de verdade, fica no mesmo nível do Soniox e do principal no debate e mantém o empréstimo defend como está. O relatório dizia inicialmente que o Doubao não tinha sido rodado na entrevista de culinária. Tinha sim, e em alguns pontos foi mais preciso que o Soniox ali; o resultado só nunca entrou na tabela. Ele também vem de uma linhagem técnica diferente dos dois primeiros.
- Gemini: no debate, errou um nome no resultado da votação, e os quatro motores terminaram a menos de 1,9 ponto uns dos outros.
O que deixamos de fora: o Qwen teve a melhor pontuação no debate (18,3%), mas devolveu os três minutos inteiros como uma única linha, sem timestamps por palavra, o que a nossa etapa de alinhamento não consegue usar. A pontuação do FunASR também foi razoável, mas sua saída é um único bloco contínuo de caracteres, sem quebras de frase. O Gladia está fora pelos loops, e o AssemblyAI pelo que ele perde.
Evidências contra a nossa escolha
- A maior está no topo: a pontuação do principal em tailandês está inflada, e sua precisão real nos diacríticos ainda não foi conferida por amostragem.
- Nossos revisores não leem tailandês. O relatório só julgou o que dá para ver sem saber o idioma: repetições descontroladas, saltos repentinos de tamanho, blocos faltando, tudo devolvido num só bloco. Se algum motor inverteu ou embaralhou o sentido de uma fala, não conferimos frase a frase.
- O Gemini tem apenas um trecho de teste em tailandês em estilo de conversa, o que não basta. Numa rodada anterior, ele também produziu coisas como marcações de risada e rótulos que não eram tailandeses; nenhum dos dois reapareceu neste trecho. O tailandês também já atingiu uma vez o seu limite de tamanho de saída.
- O próprio Soniox é um transcritor no estilo de modelo de linguagem grande. Em geral, nos preocupa que motores assim alisem as partes que não conseguem ouvir. Não vimos isso em tailandês, mas também não conferimos linha a linha.
Problemas em aberto
- O tailandês não marca os limites das palavras com espaços e ainda não temos um segmentador de palavras para tailandês, então nossa etapa de alinhamento funciona no nível da frase e é bastante grosseira.
- Nenhum dos três trechos é uma entrevista de pesquisa real.
- A precisão do motor principal nos diacríticos ainda precisa ser conferida.
Nossa página de transcrição em tailandês
Por Zeyu Si