Ir para o conteúdo principal

Os erros de transcrição mais perigosos são os que se leem perfeitamente

· Zeyu Si

Nesta página

Uma entrevista em norueguês, áudio limpo. O entrevistado está dizendo que não traiu o parceiro. Na transcrição de um dos motores, ele diz que decidiu trair.

A frase é gramatical. Nenhum erro de digitação. Nem soa estranha no contexto. O leitor não tem motivo para parar.

Uma negação invertida é o pior erro que uma transcrição de entrevista pode ter

Quando uma palavra está escrita errado, o leitor costuma perceber. Quando o sentido está invertido, não percebe.

O caso norueguês não foi isolado. Depois passamos mais cinco trechos em norueguês pelo Gemini e pelo Qwen. Os dois cometeram o mesmo tipo de erro em passagens claras.

Acontece em inglês também. "You're still not a cop" virou "still a cop" nos dois modelos de fala do Qwen. O "not" simplesmente sumiu.

Tentamos instruir o modelo diretamente: mantenha cada negação exatamente como foi dita, marque tudo o que não conseguir ouvir, não preencha nada. Não fez diferença. O "not" continuou desaparecendo.

Uma votação por maioria não vai salvar você

A solução óbvia é rodar vários motores e ficar com a maioria.

Em cinco idiomas (russo, coreano, ucraniano, norueguês e espanhol) encontramos pontos em que vários motores cometeram exatamente o mesmo erro e a versão correta ficou em minoria. Em quatro deles, o erro era uma negação ou um sentido invertido. No caso norueguês, cinco motores inverteram o sentido e só um acertou. Coloque em votação e a resposta errada vence.

O motivo é que um trecho de áudio pouco claro pode levar vários motores a "ouvir" a mesma coisa errada. Os erros deles não são independentes.

Por isso nossa regra é: sempre que houver negação ou sentido invertido, a concordância entre motores não vale nada. Precisamos de evidência concreta, como a lógica das frases ao redor ou o falante repetindo a ideia logo depois. Sem isso, o ponto é sinalizado para uma pessoa ouvir. Não tomamos essa decisão pelo leitor.

Erros fluentes são mais difíceis de pegar do que os óbvios

As negações invertidas são um tipo. Existe outro, mais sutil.

Montamos uma gravação de teste: uma conversa em espanhol com uma frase em chinês inserida no meio, "你是谁?" ("Quem é você?"). Um dos motores não transcreveu o chinês. Traduziu, escrevendo "¿Quién eres?". A transcrição inteira não tinha nenhum chinês e se lia perfeitamente. Se você não fala chinês e não ouviu o áudio, jamais saberia que ali se falou outro idioma.

O que esses erros têm em comum é que a transcrição parece completamente normal. Não dá para encontrá-los lendo. Alguém precisa dizer a você qual segundo ir ouvir.

Uma ferramenta de transcrição deveria dizer onde tem dúvida

Então, as ferramentas de transcrição que as pessoas de fato usam dizem "não tenho certeza sobre este trecho"? Em setembro de 2026 analisamos 15 das mais comuns: centrais de ajuda, documentação do produto, documentação de API e registros de alterações.

Três mostram isso no editor:

  • O Sonix tem um mapa de calor que você pode ativar, que sombreia cada palavra de acordo com a confiança do motor. Mais claro significa menos confiança. O próprio Sonix observa que uma palavra clara "não é necessariamente um erro".
  • O Rev tem uma opção no editor que destaca em cinza as palavras que o motor marcou como possivelmente erradas.
  • O Happy Scribe mostra em vermelho as palavras de baixa confiança. Nossa fonte é um artigo de ajuda de 2023; não confirmamos a interface atual.

Só na API ou nas exportações: o Amberscript pode incluir uma pontuação de confiança por palavra nos arquivos exportados; sobre destaque no editor, só encontramos afirmações de terceiros. Quanto ao TurboScribe, só artigos de terceiros dizem que ele destaca em amarelo as palavras de baixa confiança, e não conseguimos carregar o site dele para verificar.

Não encontramos esse recurso em 10: Transkriptor, Otter.ai, Fireflies.ai, Notta, Noota, Trint, Descript, Riverside, Dovetail e transcribe.com.

Não encontrar não é o mesmo que não existir. Parte da documentação de API fica atrás de login ou carrega via scripts, e não conseguimos ler tudo. Se você usa uma dessas ferramentas e ela tem o recurso, avise-nos e vamos corrigir.

Um motor avaliando a si mesmo não é o mesmo que motores discordando

As três ferramentas que têm esse recurso sinalizam a mesma coisa: a nota que um único motor dá para a própria confiança.

Isso é realmente útil, com um ponto cego. Se um motor ouve algo errado com convicção, a nota dele não dispara nenhum alarme.

Nossa abordagem é fazer vários motores transcreverem o mesmo áudio e sinalizar os pontos em que eles não concordam, além de nomes, empresas e termos técnicos, que é onde os erros se concentram. Cada sinalização traz um código de tempo, e um clique toca aquele segundo. Só quando todas as sinalizações foram resolvidas o produto diz que a transcrição está pronta para exportar.

Mesmo assim, não pegamos tudo. Quando vários motores erram o mesmo ponto exatamente do mesmo jeito, eles "concordam", e nada é sinalizado. É por isso que verificamos negação e sentido invertido mesmo quando todos os motores dizem a mesma coisa.

O que podemos prometer é que você não precisa reouvir a gravação inteira. Só os pontos que merecem dúvida.

Por Zeyu Si