跳到主内容

本文属于27 门语言实测档案

日语:看起来最准的那家,赢在删掉了语气词

· Zeyu Si

本页目录

日语两段现代访谈片上,AssemblyAI 一开始看起来是四家里最准的,其中一段字错误率只有 8.4%。后来我们发现,它的优势来自删语气词:字幕会把口头的语气词、填充词删掉,AssemblyAI 也删,Soniox 照实写下来,结果被当成错字扣了分。两边都剥掉填充词再算,Soniox 四段全赢,最后一段降到 2.0%,比主轨还低。

这件事让日语的参考轨换了人。

测试片

四段,分成两组:

  • 《七武士》(1954):东北方言、密集叫喊,加上老胶片的底噪。
  • 《罗生门》(1950):标准音,但有大雨声,三个人互相打断。
  • 一段 YouTube 上的双人访谈:两人频繁换着说,录音棚里录的,很干净。
  • 一集 YouTube 上的日语节目:两个人不停地附和、接话(そうだね、うん 这类),换人极其频繁。

前两段在我们的三档难度里属于高档,后两段属于中档。低档(一两个人、语速平稳、无噪音)的日语片我们没有单独测。

现代两段的标准答案用的是节目方上传的人工字幕,不用自动字幕。我们一开始选过另一段访谈,逐句核对后发现那是英语口播配日语翻译字幕,拿它当标准答案等于拿译文考听写,当场换掉了。

测了哪些引擎

ElevenLabs Scribe v2、AssemblyAI、豆包、Speechmatics 是第一批,Soniox、Gladia、Deepgram、FunASR、Qwen 在后来的补测里也跑过。Gemini 单独补测。

各家的红线

循环复读。 《七武士》的叫喊段,AssemblyAI 把同一个音重复了 95 次,同一片 Gladia 重复了 447 次。一段转写被一个音节占满,后面的内容就没了。

整句幻觉。 同样在《七武士》,AssemblyAI 还凭空造了整句;《罗生门》里它在句尾加了没说过的内容。

凭空插入。 豆包在老片里有一处凭空写出一句带暴力意味的命令。它的「零幻觉」只在现代两段上成立。

否定反转。 Soniox 在《七武士》方言加叫喊的那一段有 2 处把意思说反。同一片 AssemblyAI 已经复读崩溃、还在造句,如果因为这 2 处就淘汰 Soniox,却留下 AssemblyAI,就是两把尺子。我们判它是场景性的问题。

语言漂移。 Gemini 在作主轨备用时测过一次,写出来的日文里混了简体中文字形,比如「绍介」「连络」「结婚」。换句话说,字是对的,字形却成了中文。

替换(不算红线,但会误导):Speechmatics 把「人前式」(在亲友面前办的婚礼)听成「人権意識」(人权意识);豆包和 AssemblyAI 都把「酌み交わす」(对饮)写成同音的「組み交わす」。

选了谁,为什么

主轨 ElevenLabs Scribe v2。 四段里只有它从头到尾没崩,最后那段节目上字错误率 5.1%。

参考轨,按顺序:Soniox、豆包、Gemini。 生产里三条都跑。

  • Soniox:剥掉填充词后四段全赢,老片上的 2 处反转判为场景性。
  • 豆包:最早以为它不支持日语,出来全是乱码,其实是我们没传对语言代码。补上 ja-JP 后,现代两段干净,《罗生门》排第三,《七武士》中游但没崩。它和 Soniox 出自完全不同的技术路线,犯错的地方不容易重合。
  • Gemini:现代两段零红线。

AssemblyAI 退为备用。

不利于我们的证据

  • AssemblyAI 在现代访谈上确实很准。在干净的真实对话里,它的毛病基本不出现。我们换掉它,理由主要落在老片上的复读和造句,以及剥掉填充词以后它已经不是第一。
  • 早一轮的结论正好相反:当时认为 Soniox 在访谈场景并不比在位的两家强,按「打平不换」维持原样。是后来发现了填充词问题才翻过来的。结论依赖「填充词该不该算分」这个口径。
  • Gemini 在两段老片上错得很多:《七武士》里「米」写成人名「亀岡」,《罗生门》里官职「検非違使」写成「蛇石」、「说教够了」写成「咳嗽够了」,最后一整句还漏了。《罗生门》是清晰对话,所以它的问题出在录音音质,跟吵不吵关系不大。客户如果录音条件差,这条轨可能会跟着变差。

还没解决的问题

  • 真正的访谈只有两段,而且都很干净。「现代但嘈杂」的日语访谈,我们没有带标准答案的样本。
  • 如果客户要逐字稿、连「えーと」都要保留,Soniox 这种照实写的习惯是优点;如果要的是清理过的稿子,排名的依据就要重新想。
  • Gemini 混入简体字形的问题,是在它顶替主轨时发现的。作参考轨时会不会出现,我们还没有单独的数据。

日语转录页

作者Zeyu Si