本文属于:27 门语言实测档案
土耳其语:一次模型升级,让零反转的记录破了
· Zeyu Si
在土耳其语上,AssemblyAI 原本有一条干净的记录:四段片子,没有一处把意思说反。后来它的厂商推出新一代模型,我们短暂换了上去。结果土耳其语四段全部退步,有的片子错误率差不多翻了一倍,还把一句命令 indirin(放下来)写成了 indirmez(他不会放下),零反转的记录就这么破了。我们退回了旧模型。
同一家引擎,版本一换,结论就可能不成立。这门语言的配置就是这么定下来的。
测试片
四段土耳其语电影,标准答案来自土耳其语听障字幕,每段一分半左右:
- 《Vizontele》(2001):村长带人迎接来客,好几个人快速对答、打断、喊叫。
- 《Düğün Dernek》(2013):骆驼把新娘弄丢了,四个以上的人七嘴八舌,咕哝、叠音、骂人。
- 《G.O.R.A.》(2004):科幻喜剧里登上飞船的一场,指令一句叠一句,音效和配乐很密。
- 《Bergen》(2022):生母上门对质,你来我往、情绪激动,说的是阿达纳方言,也有脏话。
前两段属于三档难度里的高档,后两段属于中档。没有低档片。
测了哪些引擎
第一轮四家:ElevenLabs Scribe v2、AssemblyAI、Speechmatics、豆包。Soniox 后来在复核中补评。Gemini 单独补测。
各家的红线
整句幻觉。 Speechmatics 在《Vizontele》那段有两三处。原话 Hiç lüzüm yok(没这个必要),它写成 İç sesim yok(我没有内心的声音);又在一句话后面凭空接上 gazeteye getirip(拿到报社去)。
凭空加否定。 还是 Speechmatics、还是这一段:Fikri benim adım(我叫 Fikri),它在后面加了个 yok(没有)。
尾部整段丢失。 Gemini 在两段难片上,稿子前面都正常,结尾却各漏了二十多个词,其中一段漏了四句。那两段它的 WER 都排第二,光看分数发现不了。
语言漂移。 豆包最早跑出来的土耳其语是英文乱码,比如「I'm shaking these diseases」。原因是我们没传土耳其语的语言代码,补上 tr-TR 后四段都是连贯的土耳其语。
AssemblyAI(旧模型)和豆包四段零幻觉、零反转。
选了谁,为什么
主轨 ElevenLabs Scribe v2。 除了音效最密的《G.O.R.A.》,其余三段都是第一。
参考轨,按顺序:AssemblyAI、豆包、Gemini。 生产里三条都跑。
- AssemblyAI:主轨以外最准的一家,四段没有凭空造句,也没有把话说反。它会把 Belgin 这样的人名听成 belli(明显),但这类错能靠其他轨核回来。
- 豆包:四家里 WER 恒定垫底,方言片掉到 28.6%。它的错几乎全是拼写上的:方言口音被照音拼出来,pabuç 写成 pafuç。可它从头到尾没编过、没反过。把参考轨定下来时,我们更在意它会不会自信地写错,分数高低排在后面。
- Gemini:挂在第三条。
Soniox 在复核中表现不差:六类红线零,质量排非主轨第二。我们没有换它上来,因为在位的 AssemblyAI 已经是最强的非主轨,换了看不到好处。它排在备用的第一位,豆包一旦在生产里拖后腿,就由它顶上。
不利于我们的证据
- 开头那次升级说明,AssemblyAI 的「零反转」是某一个版本的记录,版本变了就要重测。
- 豆包是四家里最弱的。方言重、语速快的时候,它能贡献的信息有限。
- Gemini 在土耳其语上只有一段对话类的测试片,样本不够下定论。它的尾部漏句,在《G.O.R.A.》上还伴着改意:「摘下眼镜」变成「挖掉眼睛」,还凭空多出 Ölmüş(死了)这样的词。
- 报告里记了主轨在前两段各有一处轻微的凭空造词。但复核也发现,这批字幕省略得很多,曾经两次把真实的话误判成幻觉。这两处到底算不算主轨的错,我们不能完全确定。
还没解决的问题
- 四段都是电影,没有真实访谈,也没有低档的平常对话。
- 字幕省略太多,多家引擎一致写出、字幕却没有的内容,要回头核对字幕,不能直接判幻觉。
- Gemini 的尾部漏句,光看分数检测不出来,只能靠逐句读。
作者:Zeyu Si