本文属于:27 门语言实测档案
泰语:主轨的好成绩里,有一部分是我们的 bug
· Zeyu Si
泰语测试里,主轨 ElevenLabs 的分数有一部分水分,来源是我们自己的代码。
我们的处理流程里有一个函数,负责去掉词尾的标点。泰文的元音符号和声调符号是附着在字母上的组合符号,这个函数把它们当成标点一起删了。结果,存档里 ElevenLabs 的泰语稿元音、声调全都没了,它的错误率是在「不看这些符号」的情况下算出来的。bug 已经修好,但它在泰语变音符上到底准不准,还要重新抽查。
所以下面的分数,读的时候请带着这个保留。
测试片
三段,标准答案是同源的人工泰语字幕:
- 一段烹饪访谈:一到两个人说话,语速中等,底噪低。这是基准分,接近三档难度里的低档。
- 一段多人真人秀:嘉宾抢话、笑闹,还有背景音乐和音效。我们归为中档。
- 一段狼人杀式的辩论:互相指认,语速快,多人打断,还夹着 Seer、defend 这样的英文词。这段是高档。
本来找了第四段,检查时发现音频和字幕错开了约 30 秒,拿它打分等于对着错的答案判卷,就剔掉了。泰语里「免费、会话、逐字」三样都满足的字幕很少,三段是我们目前能找到的上限。
测了哪些引擎
十家:ElevenLabs Scribe v2、AssemblyAI、Speechmatics(两个版本)、豆包、Soniox、Deepgram、Gladia、FunASR、Qwen。Gemini 单独补测。
各家的红线
循环复读。 辩论开头有一阵哄笑,字幕只记了一声短笑。Gladia 把笑声「ฮ่า」后面的泰文重复符号 ๆ 一口气写了四百多个,连出两行;后面又把两句话来回循环了四遍。它的错误率因此冲到 83.9%。同样的循环在另外两段里一次也没有。AssemblyAI 也有:复核时发现它在真人秀里把一个词连刷了约 22 行,另一串词循环了约 25 遍。
整段丢失。 AssemblyAI 在辩论那段大段跳过,有的地方近十秒不出字。前两段它都垫底,辩论那段也只比崩掉的 Gladia 好。
凭空插入(后来撤回)。 我们一度认为 Qwen 在辩论开头凭空多写了一段。复核发现是字幕开头有约 10 秒的时间偏移,Soniox、豆包、FunASR 三家都在同一处转出了同样的内容,那是真实的话。这条指控撤回了。
选了谁,为什么
主轨 ElevenLabs Scribe v2。 三段都没崩,没有叠字循环,烹饪访谈 12.6%、真人秀全场最低。带着前面说的保留。
参考轨,按顺序:Soniox、豆包、Gemini。 生产里三条都跑。
- Soniox:三段最稳,切分最规整,逐句贴着字幕,没有循环也没有整段漏。
- 豆包:输出的是真泰文,辩论那段和 Soniox、主轨同一档,英文借词 defend 照原样保留。报告最初写它「第一段没测」,其实测过,而且那段局部比 Soniox 还准,只是结果没进表。它和前两家技术来源不同。
- Gemini:辩论那段只错了一处投票结果里的人名,四家分数挤在 1.9 个百分点之内。
没选的:Qwen 辩论那段分数全场最低(18.3%),但它把整整 3 分钟吐成一行,没有逐词的时间戳,我们的对齐步骤没法用。FunASR 分数也不差,可它的输出是一整坨没有分句的字符。Gladia 因为循环、AssemblyAI 因为漏,都不入选。
不利于我们的证据
- 最大的一条就在开头:主轨的泰语分数有水分,真实的变音符精度还没抽查。
- 评测的人不通泰语。报告只判了能用肉眼看出来的问题:叠字、字数暴涨、整段漏、单块输出。有没有把意思听反、听错,我们没有逐句判断。
- Gemini 在泰语上只有一段对话类测试片,样本不够。更早一轮它还出过笑声标记、非泰文标签之类的问题,这一段里没再出现。泰语还让它撞过一次输出长度上限。
- Soniox 也属于大模型一类的转写引擎。我们一向担心这类引擎把听不清的地方「补通顺」,在泰语上没看到,但也没有逐句核过。
还没解决的问题
- 泰文不用空格分词,我们暂时没有泰语分词器,对齐只能按句段来做,精度偏粗。
- 三段都不是真实的研究访谈。
- 主轨变音符精度待抽查。
作者:Zeyu Si