跳到主内容

本文属于27 门语言实测档案

韩语:三家引擎错成了同一个否定句

· Zeyu Si

本页目录

韩语测试里有一句,三家引擎错得一字不差。原话里没有否定,豆包、AssemblyAI、Soniox 却都写成了 쓰지 않았어,一个带「没」的否定句。

三家同时错,说明这里的声音本身就容易听岔,算不到哪一家头上。如果因为这一处淘汰 Soniox,那在位的两家也得一起淘汰。这句话也提醒我们:三家投票,在否定句上靠不住。

测试片

四段韩语电影对白,标准答案是韩语听障字幕:

  • 《杀人回忆》审讯戏:三个人,夹着笑声、呻吟和叠音。
  • 《杀人回忆》最后一场审问:四五个人,情绪激动,大声吼叫、骂人。
  • 《极限职业》给炸鸡起名那场:好几个人快速抢话,还有欢呼。
  • 《侦探:回归》委托追踪那场:四个人快问快答,中间有一段演示黑客操作。

前两段在三档难度里算高档,后两段算中档。没有低档片。前两段用的是片方官方放出的场景片段。

测了哪些引擎

第一轮是 ElevenLabs Scribe v2、AssemblyAI、豆包、Speechmatics。Soniox、Gladia 等在后来的补测里也跑过。Gemini 单独补测。

各家的红线

否定反转。 除了开头那句三家同错,Speechmatics 在侦探那场还单独有一处反转,出入在「오빠 넣으면」和带否定的「안 오면」(要是不来)之间。

凭空插入。 Speechmatics 在炸鸡那场凭空造了一个人名「박동규야」。豆包的毛病在数字上:凭空写出「5 존맛」,还把一段哭声写成了「6 6」。

循环复读。 豆包在《杀人回忆》的笑声段里,把笑声写成一串 ㅎ,重复了 40 次。同样的坍缩在两段中档片里一次都没出现,只发生在极端的笑声、吼叫段。Gladia 在韩语上也有复读。Soniox 是唯一在两段高档片上都没坍缩的引擎。

整段丢失。 AssemblyAI 最大的毛病是漏:整块整块地跳过,字数经常四家最少。它不怎么编,但信息丢得多。

选了谁,为什么

主轨 ElevenLabs Scribe v2。 四段都是第一,平均 11.6%,第二名是 17.0%。它也是唯一常能把人名写对的一家。

参考轨,按顺序:豆包、Soniox、Gemini。 生产里三条都跑。

  • 豆包:平均分第二,两段中档片都稳在第二。它的坍缩只出现在极端笑声段,真实访谈里很少碰到。
  • Soniox:顶替了 AssemblyAI。理由不在分数上:我们发现 AssemblyAI 最严重的那类错,Soniox 基本也会犯,两家常常错在同一处;AssemblyAI 独有的,又恰恰是最严重的整块漏。留着它,参考轨之间的错误重合度更高。换成 Soniox,它和豆包的错误重合得少一些。
  • Gemini:挂在第三条。

不利于我们的证据

  • 第一份韩语四片报告的建议跟现在不一样:当时推荐豆包加 AssemblyAI,理由是 AssemblyAI「只漏不编,最安全」。后来复核发现 AssemblyAI 也参与了那句三家同错的否定,「最安全」的说法站不住,才换成 Soniox。
  • Gemini 在韩语上的记录并不好。补测它的时候,韩语放在「不纳入」一档:炸鸡那场有四五处改意,「肉汁还在」写成「赦免肉身」,还漏了内容;侦探那场有 3 处改意,「以为是尸体」写成「以为睡着了」,还丢了一个「5%」。这些错大多是改意替换,不在六类红线之内,但对访谈稿同样危险。它目前在配置里,这是一个需要盯着的地方。
  • 豆包那些凭空冒出的数字,放到访谈稿里很容易被当成受访者说的数据。

还没解决的问题

  • 两段高档片当时只看了字错误率和有没有崩,没有逐句核对意思。
  • 四段都是电影,没有真实访谈。配置里至今留着一条提醒:正式投产前,应当用一段真实访谈把整条流程跑一遍。
  • 开头那种三家同错,靠投票解决不了。所以遇到否定和肯定分歧的地方,我们的合并环节不按票数定;找不到硬证据,就标出来让人核。

韩语转录页

作者Zeyu Si