本文属于:27 门语言实测档案
阿拉伯语:说的是方言,写的是书面语,我们怎么挑引擎
· Zeyu Si
同一个引擎,同一种水平,在一段阿拉伯语上错误率 49.2%,在另一段上 18.2%。
引擎还是那个引擎。变的是拿来对照的标准答案:前一份写成了书面阿拉伯语,后一份照着说话人的方言一字一字记。
测试片:两段,两种方言
- Talhouk:一位黎巴嫩讲者的公开演讲,谈母语和阿拉伯语教育。他说的是黎巴嫩口语,字幕却写成了规范的现代标准阿拉伯语(MSA)。
- Fenjan(روقي):一段海湾口音(沙特)的时政访谈。字幕逐字记下了方言口语。
只有两段,因为「方言原声 + 人工字幕 + 逐字忠实」的免费素材太难找,我们找到这两段后就停了。这两段是按方言挑的,不是按难度挑的。多人抢话、强底噪这种最难的场景,这门语言没有覆盖。
而且第一段只能用来观察,不能拿来排名,原因在下面。
候选引擎
十家:ElevenLabs Scribe v2、AssemblyAI、Speechmatics(enhanced 和 Melia-1 两档)、豆包(ar-SA)、Soniox、Deepgram、Gladia、FunASR(fun-asr-mtl)、Qwen(qwen3.5-omni)。2026 年 8 月又补测了 Gemini。
红线:阿拉伯语是一门「安全」的语言
在 Fenjan 这段上,ElevenLabs、Soniox、Speechmatics、Qwen、豆包、Gladia、Deepgram、FunASR 八家的稿子逐句读下来,意思都对得上,没有整句幻觉,没有否定反转,也没有凭空造出一整段。
出问题的是这几处:
- AssemblyAI:在 Talhouk 那段里成段复读,还编出了录音里没有的内容,而且那些内容挂在时长为零的时间戳上。这是整个阿拉伯语面板里唯一一次真正的幻觉。
- FunASR:一句阿拉伯语中间混进了一个英文词 "Also"(轻微的语言漂移),还把年份 1990 写成了 2990。
- 豆包和 FunASR 的高错误率:在 Fenjan 上分别是 41.4% 和 37.7%,比领先的几家高一倍。逐句看,大部分「错」来自两件事:hamza 这个符号没写,年份用了方言口语的写法(比如把 2011 写成 الفين واحدعش)。读的人不会误解。我们最初据此判「豆包阿语弱」,后来改掉了这个结论。
同一段上,Speechmatics 15.7%、Qwen 17.9%、Soniox 18.2%、ElevenLabs 20.1%,差距只有几个点。
选了谁、为什么
主轨:ElevenLabs Scribe v2。 它在 Fenjan 上排在领先那一组的末尾,阿拉伯语算不上它的强项。但它两段都忠实,黎巴嫩那段几乎原样保留了 بدي、هيدا、وين 这些方言词;海湾那段把 وش(什么)写成了更通用的 أيش,意思没丢。它在所有语言里当主轨,理由主要来自说话人区分和长录音的稳定性,不是这一门的分数。
参考轨一:Soniox。 两段零幻觉,海湾方言那段读下来最忠实。有意思的是,它在黎巴嫩那段上恰好相反,把方言写成了书面语,WER 反而最低。它和主轨的错法方向相反:一个偏方言,一个偏书面。对照着看,比两家都往同一个方向错有用。
参考轨二:Speechmatics。 Fenjan 上错误率最低,稿子干净,不崩。它是传统声学模型,和 Soniox 路线不同。它的稿子没有标点,那是接口设置,不影响内容。
参考轨三:Gemini。 8 月的补测里,阿拉伯语被列进「可以加」一档:至少两段对话或演讲类素材上没有红线。
没选的:Qwen 准确度不输前两家,但它和 Gemini 同属大模型路线,又没有词级时间戳,放在备选。豆包路线和其他家都不同,留作备用,目前没挂。
反方证据
- 我们曾把「Soniox 把黎巴嫩方言转得最忠实」写成它入选的理由。复核时逐词对照,发现这句话记反了:保留方言词的是 ElevenLabs、FunASR、Qwen 和豆包,Soniox 恰恰是书面化最重的那一家。这条理由已经作废,Soniox 留下的理由换成了上面那几条。
- 真正可信的排名只压在一段录音上。Speechmatics、Qwen、Soniox 之间差两三个点,一段之内说明不了谁更好。
- 这门语言最初的评估主要看 WER 和输出结构,逐句读意思是后来补的。那次补读推翻了「豆包、FunASR 阿语弱」的判断。
还没解决的
- 只测了黎凡特和海湾两种方言,埃及等其他方言没有覆盖。
- 拿到第三、第四段方言忠实的素材后,排序要重新比一次。
- 两段是公开演讲和媒体访谈,不是研究访谈。
作者:Zeyu Si