Teil der Reihe: 27 Sprachen, eine nach der anderen
Arabisch: Gesprochen wird Dialekt, die Untertitel schreiben MSA. Wie wir trotzdem Engines ausgewählt haben
· Zeyu Si
Auf dieser Seite
Eine Engine, ein Leistungsniveau. Bei einer arabischen Aufnahme lag ihre Fehlerrate bei 49.2%. Bei einer anderen bei 18.2%.
Die Engine hat sich nicht verändert. Das Referenztranskript schon. Das erste war in formellem Arabisch geschrieben. Das zweite hielt Wort für Wort den Dialekt fest, den der Sprecher tatsächlich verwendete.
Die Testaufnahmen: zwei Aufnahmen, zwei Dialekte
- Talhouk: ein öffentlicher Vortrag eines libanesischen Sprechers über Muttersprache und arabischsprachige Bildung. Er spricht umgangssprachliches libanesisches Arabisch. Die Untertitel geben es in modernem Hocharabisch (MSA) wieder.
- Fenjan (روقي): ein Interview zum Zeitgeschehen in Golf-Arabisch (Saudi-Arabien). Die Untertitel transkribieren den gesprochenen Dialekt wortgetreu.
Mehr haben wir nicht. Freies Material, das Dialekt-Audio, von Menschen erstellte Untertitel und wortgetreue Wiedergabe vereint, ist sehr schwer zu finden, und nach diesen beiden haben wir aufgehört. Sie wurden nach Dialekt ausgewählt, nicht nach Schwierigkeit. Unsere schwierigste Stufe (Menschen, die durcheinanderreden, starke Hintergrundgeräusche) ist für Arabisch nicht abgedeckt.
Und nur die zweite Aufnahme taugt dazu, Engines zu ranken. Hier ist der Grund.
Getestete Engines
Zehn: ElevenLabs Scribe v2, AssemblyAI, Speechmatics (enhanced und Melia-1), Doubao (ar-SA), Soniox, Deepgram, Gladia, FunASR (fun-asr-mtl) und Qwen (qwen3.5-omni). Gemini kam in einer Folgerunde im August 2026 hinzu.
Rote Linien: Arabisch erwies sich als „sichere“ Sprache
Beim Fenjan-Interview haben wir acht Transkripte Zeile für Zeile gelesen: ElevenLabs, Soniox, Speechmatics, Qwen, Doubao, Gladia, Deepgram und FunASR. Alle haben die Bedeutung bewahrt. Keine erfundenen Sätze, keine umgekehrten Verneinungen, keine hinzugedichteten Passagen.
Die Probleme lagen woanders:
- AssemblyAI geriet bei einem Abschnitt des Talhouk-Vortrags in eine Schleife und produzierte Inhalte, die nicht im Audio vorkommen, versehen mit Zeitstempeln der Länge null. Es war die einzige echte Halluzination im gesamten arabischen Testfeld.
- FunASR schob ein englisches Wort, „Also“, in einen arabischen Satz ein (ein kleiner Sprachdrift) und machte aus dem Jahr 1990 das Jahr 2990.
- Doubao und FunASR kamen bei Fenjan auf 41.4% und 37.7%, ungefähr das Doppelte der Spitzengruppe. Bei genauem Lesen stammten die meisten dieser „Fehler“ aus zwei Dingen: dem weggelassenen Hamza-Zeichen und Jahreszahlen, die so ausgeschrieben wurden, wie man sie im Dialekt sagt (2011 als الفين واحدعش). Ein Leser würde nicht in die Irre geführt. Zuerst folgerten wir, Doubao sei im Arabischen schwach; später haben wir das zurückgenommen.
Bei derselben Aufnahme kam Speechmatics auf 15.7%, Qwen auf 17.9%, Soniox auf 18.2% und ElevenLabs auf 20.1%. Nur wenige Punkte auseinander.
Wofür wir uns entschieden haben und warum
Haupt-Engine: ElevenLabs Scribe v2. Bei Fenjan liegt sie am Ende der Spitzengruppe; Arabisch ist also nicht ihre stärkste Sprache. Aber sie war bei beiden Aufnahmen getreu. Beim libanesischen Vortrag ließ sie Dialektwörter wie بدي, هيدا und وين fast unberührt. Beim Golf-Interview schrieb sie das allgemeinere أيش, wo der Sprecher وش („was“) sagte, ohne die Bedeutung zu verlieren. Sie ist in jeder Sprache unsere Haupt-Engine, vor allem wegen der Sprechertrennung und der Stabilität bei langen Aufnahmen, nicht wegen dieses einen Wertes.
Referenz 1: Soniox. Keine Halluzinationen bei beiden Aufnahmen und die getreueste Wiedergabe des Golf-Dialekts. Beim libanesischen Vortrag tat sie das Gegenteil: Sie schrieb den Dialekt als formelles Arabisch, weshalb ihre WER dort am niedrigsten war. Sie irrt also in die entgegengesetzte Richtung wie unsere Haupt-Engine. Die eine neigt zum Dialekt, die andere zur Schriftform. Für die Gegenprüfung ist das nützlicher als zwei Engines, die auf dieselbe Weise danebenliegen.
Referenz 2: Speechmatics. Niedrigste Fehlerrate bei Fenjan, saubere Ausgabe, keine Aussetzer. Es ist ein konventionelles akustisches Modell, anders gebaut als Soniox. Seine Transkripte kommen ohne Satzzeichen, was eine API-Einstellung ist und die Wörter nicht beeinflusst.
Referenz 3: Gemini. In der August-Runde kam Arabisch in die Gruppe „kann hinzugefügt werden“: keine roten Linien bei mindestens zwei Gesprächs- oder Redeaufnahmen.
Nicht gewählt: Qwen war so genau wie die beiden besten, ist aber wie Gemini ein Transkribierer auf Basis eines großen Sprachmodells und liefert keine Zeitstempel auf Wortebene; es bleibt also auf der Ersatzbank. Doubao funktioniert anders als alles andere in der Aufstellung; es ist ein mögliches Backup, aber nicht eingebunden.
Belege gegen unsere Wahl
- Einmal führten wir „Soniox ist dem libanesischen Dialekt am treuesten“ als Grund für seine Wahl an. Eine Wort-für-Wort-Nachprüfung zeigte, dass wir es genau verkehrt herum hatten. Die Engines, die die Dialektwörter behielten, waren ElevenLabs, FunASR, Qwen und Doubao. Soniox war diejenige, die am stärksten formalisierte. Dieser Grund ist weggefallen; Soniox bleibt aus den oben genannten Gründen.
- Das einzige verlässliche Ranking beruht auf einer einzigen Aufnahme. Speechmatics, Qwen und Soniox liegen zwei oder drei Punkte auseinander, und eine Aufnahme kann sie nicht trennen.
- Unser erster Durchgang für Arabisch stützte sich hauptsächlich auf WER und die Struktur der Ausgabe. Das Lesen nach Bedeutung kam später, und es hat das Urteil „Doubao und FunASR sind im Arabischen schwach“ umgestoßen.
Noch offen
- Getestet wurden nur levantinisches und Golf-Arabisch. Ägyptisches Arabisch und andere Dialekte sind nicht abgedeckt.
- Sobald wir eine dritte und vierte dialekttreue Aufnahme finden, muss das Ranking neu durchgeführt werden.
- Bei beiden Aufnahmen handelt es sich um einen öffentlichen Vortrag und ein Medieninterview, nicht um Forschungsinterviews.
Unsere Seite zur Arabisch-Transkription
Von Zeyu Si