Parte de la serie: 27 idiomas, uno a uno
Japonés: el motor que parecía el mejor estaba borrando las muletillas
· Zeyu Si
En esta página
En dos fragmentos de entrevistas modernas en japonés, AssemblyAI pareció al principio el más preciso de los cuatro motores que probamos, con una tasa de error por carácter de solo un 8.4% en uno de ellos. Luego averiguamos de dónde venía esa ventaja. Los subtítulos contra los que puntuamos omiten las muletillas y los sonidos de duda. AssemblyAI también los omite. Soniox los escribe, y cada uno que escribía contaba como error. Si se quitan las muletillas de ambos lados, Soniox gana en los cuatro fragmentos y llega a un 2.0% en el último, por debajo de nuestro motor principal.
Ese hallazgo cambió quién ocupa las pistas de referencia en japonés.
Los fragmentos de prueba
Cuatro fragmentos en dos parejas:
- Seven Samurai (1954): dialecto de Tohoku, gritos constantes, siseo de película antigua.
- Rashomon (1950): japonés estándar, pero con lluvia intensa y tres personas interrumpiéndose.
- Una entrevista a dos de YouTube: turnos frecuentes, sonido de estudio limpio.
- Un episodio de un programa de YouTube en japonés: dos presentadores que no paran de dar señales de escucha (そうだね, うん y similares), con cambios de hablante cada pocas palabras.
En nuestra escala de dificultad de tres niveles, las películas son de nivel superior y los fragmentos modernos de nivel intermedio. No probamos aparte un fragmento fácil en japonés (una o dos personas, ritmo constante, sin ruido).
Para los fragmentos modernos puntuamos contra los subtítulos hechos a mano por quien subió el vídeo, nunca contra subtítulos automáticos. La primera entrevista que elegimos resultó ser, al revisarla línea por línea, inglés hablado con subtítulos de traducción al japonés. Puntuar una transcripción contra una traducción no habría tenido sentido, así que la cambiamos.
Motores que probamos
ElevenLabs Scribe v2, AssemblyAI, Doubao y Speechmatics en la primera ronda. Soniox, Gladia, Deepgram, FunASR y Qwen en pasadas posteriores. Gemini se probó por separado.
Dónde cruzaron los motores las líneas rojas
Bucles de repetición. En los gritos de Seven Samurai, AssemblyAI repitió un sonido 95 veces. En el mismo fragmento, Gladia lo repitió 447 veces. En cuanto una transcripción se llena de una sola sílaba, todo lo que venía después se pierde.
Frases inventadas. También en Seven Samurai, AssemblyAI se inventó frases enteras, y en Rashomon añadió al final de una línea palabras que nadie dijo.
Contenido insertado. En las películas antiguas, Doubao escribió una vez una orden violenta que nadie dio. Su historial limpio solo vale para los fragmentos modernos.
Significado invertido. Soniox invirtió el sentido de dos líneas en el tramo de dialecto y gritos de Seven Samurai. En ese mismo fragmento, AssemblyAI entraba en bucle e inventaba frases. Descartar Soniox por esos dos errores y mantener AssemblyAI sería juzgarlos con reglas distintas, así que lo tratamos como un problema de esa escena.
Deriva de idioma. Cuando probamos Gemini como sustituto del motor principal, su japonés salió con algunos kanji en formas del chino simplificado: 绍介, 连络, 结婚 en lugar de 紹介, 連絡, 結婚. Los caracteres correctos, en la escritura equivocada.
Sustituciones (no son líneas rojas, pero inducen a error): Speechmatics oyó 人前式, una boda celebrada ante familiares y amigos, como 人権意識, «conciencia de los derechos humanos». Doubao y AssemblyAI escribieron los dos 酌み交わす («compartir una copa») como su homófono 組み交わす.
Qué elegimos
Principal: ElevenLabs Scribe v2. El único motor que nunca se desplomó en ninguno de los cuatro fragmentos, y un 5.1% en el programa de YouTube.
Referencias, por orden: Soniox, Doubao, Gemini. Los tres se ejecutan en cada archivo en japonés.
- Soniox: gana en los cuatro fragmentos una vez quitadas las muletillas. Atribuimos sus dos inversiones en la película antigua a la escena.
- Doubao: al principio creímos que no podía con el japonés porque devolvía basura. Simplemente no le habíamos enviado el código de idioma correcto. Con ja-JP estuvo limpio en los fragmentos modernos, tercero en Rashomon y a media tabla pero entero en Seven Samurai. Procede de un linaje muy distinto al de Soniox, así que los dos rara vez fallan en el mismo sitio.
- Gemini: ningún error de línea roja en los dos fragmentos modernos.
AssemblyAI pasó a respaldo.
Pruebas en contra de nuestra elección
- AssemblyAI es de verdad preciso con entrevistas modernas, y con conversación real y limpia sus problemas desaparecen casi por completo. Lo sustituimos sobre todo por los bucles y las frases inventadas en las películas antiguas, y porque deja de ser el primero una vez quitadas las muletillas.
- Una ronda anterior llegó a la conclusión opuesta. En ese momento Soniox no parecía mejor que los dos titulares con material de entrevista, y la regla era «sin cambios en caso de empate». El descubrimiento de las muletillas le dio la vuelta. Así que la decisión se apoya en una sola elección de puntuación: si las muletillas cuentan o no.
- Gemini cometió muchos errores en las dos películas antiguas. En Seven Samurai convirtió 米 («arroz») en el apellido 亀岡. En Rashomon escribió el título policial de la era Heian 検非違使 como 蛇石 («piedra de serpiente»), convirtió «basta de sermones» en «basta de toses» y se dejó la última frase. Rashomon tiene un diálogo claro, así que el problema va más ligado a la calidad de la grabación que al ruido. Si la grabación de un cliente es mala, esta pista puede resbalar con ella.
Problemas pendientes
- Solo tenemos dos entrevistas reales, y las dos son limpias. No tenemos ningún ejemplo puntuado de una entrevista moderna en japonés en una sala ruidosa.
- Si un cliente quiere una transcripción literal estricta con cada えーと incluido, la costumbre de Soniox de escribir las muletillas es una ventaja. Si quiere una transcripción limpia, hay que revisar de nuevo en qué se basa la clasificación.
- El problema de los kanji simplificados apareció cuando Gemini sustituyó al motor principal. No tenemos datos aparte sobre si ocurre cuando Gemini funciona como pista de referencia.
Nuestra página de transcripción en japonés
Escrito por Zeyu Si