Ir al contenido principal

Los errores de transcripción más peligrosos se leen perfectamente

· Zeyu Si

En esta página

Una entrevista en noruego, con audio limpio. La persona entrevistada dice que no engañó a su pareja. En la transcripción de un motor, dice que decidió engañarla.

La frase es gramatical. No tiene erratas. Ni siquiera desentona en el contexto. El lector no tiene ningún motivo para detenerse.

Una negación invertida es el peor error que puede tener la transcripción de una entrevista

Cuando una palabra está mal escrita, el lector suele darse cuenta. Cuando el significado se invierte, no.

El caso noruego no fue aislado. Más tarde pasamos cinco fragmentos más en noruego por Gemini y Qwen. Ambos produjeron el mismo tipo de error en pasajes claros.

También ocurre en inglés. "You're still not a cop" se convirtió en "still a cop" en los dos modelos de voz de Qwen. El "not" simplemente desapareció.

Probamos a darle instrucciones directas al modelo: conserva cada negación tal como se dijo, marca todo lo que no puedas oír, no rellenes nada. No sirvió de nada. El "not" siguió desapareciendo.

Una votación por mayoría no te salvará

La solución obvia es usar varios motores y quedarse con lo que diga la mayoría.

En cinco idiomas (ruso, coreano, ucraniano, noruego y español) encontramos puntos en los que varios motores cometieron exactamente el mismo error y la versión correcta quedó en minoría. En cuatro de ellos, el error era una negación o un significado invertido. En el caso noruego, cinco motores lo invirtieron y solo uno acertó. Si se somete a votación, gana la respuesta equivocada.

La razón es que un mismo tramo de audio poco claro puede llevar a varios motores a "oír" lo mismo equivocado. Sus errores no son independientes.

Así que nuestra regla es: siempre que haya una negación o un significado invertido de por medio, el acuerdo entre motores no cuenta para nada. Necesitamos pruebas sólidas, como la lógica de las frases de alrededor o que el hablante repita la idea un momento después. Sin ellas, el punto se marca para que una persona lo escuche. No tomamos esa decisión por el lector.

Los errores fluidos son más difíciles de detectar que los evidentes

Las negaciones invertidas son un tipo. Hay otro más sutil.

Creamos una grabación de prueba: una conversación en español con una frase en chino insertada en medio, "你是谁?" ("¿Quién eres?"). Un motor no transcribió el chino. Lo tradujo y escribió "¿Quién eres?". La transcripción completa no contenía nada de chino y se leía perfectamente. Si no hablas chino y no escuchaste el audio, nunca sabrías que ahí se había hablado otro idioma.

Lo que tienen en común estos errores es que la transcripción parece estar completamente bien. No se pueden encontrar leyendo. Alguien tiene que decirte qué segundo ir a escuchar.

Una herramienta de transcripción debería decirte dónde tiene dudas

Entonces, ¿las herramientas de transcripción que la gente usa de verdad te dicen "no estoy seguro de esta parte"? En septiembre de 2026 revisamos 15 de las más comunes: centros de ayuda, documentación de producto, documentación de API y registros de cambios.

Tres lo muestran en el editor:

  • Sonix tiene un mapa de calor que se puede activar y que sombrea cada palabra según la confianza del motor. Más claro significa menos confianza. La propia Sonix advierte que una palabra clara "no es necesariamente un error".
  • Rev tiene un interruptor en el editor que resalta en gris las palabras que su motor marcó como posiblemente erróneas.
  • Happy Scribe muestra en rojo las palabras de baja confianza. Nuestra fuente es un artículo de ayuda de 2023; no hemos confirmado la interfaz actual.

Solo en la API o en las exportaciones: Amberscript puede incluir una puntuación de confianza por palabra en sus archivos exportados; sobre el resaltado en el editor solo encontramos afirmaciones de terceros. En el caso de TurboScribe, solo artículos de terceros dicen que resalta en amarillo las palabras de baja confianza, y no pudimos cargar su propio sitio para comprobarlo.

No encontramos esta función en 10: Transkriptor, Otter.ai, Fireflies.ai, Notta, Noota, Trint, Descript, Riverside, Dovetail y transcribe.com.

No encontrarla no es lo mismo que que no exista. Parte de la documentación de API está detrás de un inicio de sesión o se carga con scripts, y no pudimos leerla toda. Si usas una de estas herramientas y sí tiene la función, avísanos y lo corregiremos.

Que un motor se califique a sí mismo no es lo mismo que motores en desacuerdo

Las tres herramientas que tienen esta función marcan lo mismo: la puntuación que un motor da a su propia confianza.

Es realmente útil, con un punto ciego. Si un motor oye mal algo con total seguridad, su propia puntuación no dará la alarma.

Nuestro enfoque es que varios motores transcriban el mismo audio y marcar los puntos en los que no coinciden, además de nombres, empresas y términos técnicos, que es donde se concentran los errores. Cada señal lleva una marca de tiempo, y con un clic se reproduce ese segundo. Solo cuando se han atendido todas las marcas, el producto indica que la transcripción está lista para exportar.

Aun así, no lo detectará todo. Cuando varios motores fallan en el mismo punto exactamente de la misma manera, "coinciden" y no se marca nada. Por eso revisamos la negación y el significado invertido aunque todos los motores digan lo mismo.

Lo que sí podemos prometer es que no tendrás que volver a escuchar toda la grabación. Solo los puntos de los que vale la pena dudar.

Escrito por Zeyu Si