Zum Hauptinhalt springen

Teil der Reihe: 27 Sprachen, eine nach der anderen

Malaiisch: Der Sprecher wechselte ins Englische, und die Engine übersetzte es zurück

· Zeyu Si

Auf dieser Seite

In einem malaysischen Interview zum Zeitgeschehen wechselt der Gast mittendrin ins Englische: „enforcing the letter of the law, without looking at … mood music around you.“

ElevenLabs hat dieses Englisch Wort für Wort mitgeschrieben. AssemblyAI lieferte stattdessen etwa fünfzehn Wörter Malaiisch. Ungefähr dieselbe Bedeutung, völlig flüssig – und nicht das, was der Gast gesagt hat.

Für Forschende ist das der gefährlichste Fehler im Malaiischen. Die Engine hat im Namen der interviewten Person übersetzt, und nichts auf der Seite verrät es.

Die Testclips: drei, ausgewählt nach Code-Switching

  • Eine Szene aus einer malaiischen Fernsehserie: Mutter und Sohn im Gespräch, dann eine Festnahme durch die Drogenfahndung mit Geschrei und ein paar englischen Zeilen („under arrest“ und Ähnliches).
  • Zwei malaysische politische Talkshow-Interviews: Kommentatoren, die Satz für Satz zwischen Malaiisch und Englisch wechseln, ganze englische Nebensätze und sehr viele Namen von Personen und Parteien.

Es gab einen vierten Clip, einen TEDx-Vortrag, doch dessen ehrenamtliche Untertitel waren eine Zusammenfassung – 170 Wörter für drei Minuten –, also taugte er nicht als Referenz, und wir haben ihn gestrichen. Freies, gesprächsnahes, wortgetreu transkribiertes malaiisches Material ist rar, und wir haben bei drei aufgehört. Die Clips wurden danach ausgewählt, wie viel Code-Switching sie enthalten, nicht passend zu unseren drei Schwierigkeitsstufen. Starken Lärm mit durcheinanderredenden Personen haben wir nicht gezielt getestet.

Getestete Engines

Elf: ElevenLabs Scribe v2, Soniox, Doubao (ms-MY), AssemblyAI, FunASR, Qwen, Speechmatics (enhanced und Melia-1), Gladia und Deepgram, dazu Gemini, das im August 2026 hinzukam.

Rote Linien, Engine für Engine

Englisch als Malaiisch umgeschrieben: AssemblyAI und Gladia taten es beide bei der oben zitierten Passage über das Recht. Im anderen Interview machte AssemblyAI außerdem aus „asking for the removal“ das malaiische Wort für „Wiederherstellung“ – die gegenteilige Bedeutung. Gladia machte aus „wir sehen uns die Kommentare an“ ein „wir unterdrücken die Kommentare“.

Umgekehrte Bedeutung:

  • Deepgram machte aus „wird untersucht“ ein „ist geflohen“.
  • FunASR machte aus der Serienzeile „Sie haben den Falschen“ ein „Sie haben den Richtigen“.
  • Speechmatics machte aus dem englischen „I don't know what that means“ ein „I know What I means“.

Verlorene Passagen: Deepgram brach die Serienszene nach 2:11 ab und verlor damit rund 30 % davon. FunASR übersprang etwa 20 Sekunden eines Interviews.

Eingefügte Wörter: Speechmatics schob „menipu“ („betrügen“) in einen Satz ein.

Schleifen: Die Melia-1-Version von Speechmatics wiederholte am Ende der Serienszene etwa fünfzigmal „eh“ und produzierte in einem Interview eine Kette aus „ada ada ada“. Diese Kette wurde zunächst Qwen zugeschrieben; bei der Überprüfung stellte sich heraus, dass wir sie der falschen Engine angelastet hatten.

Was wir gewählt haben und warum

Primär: ElevenLabs Scribe v2. Am saubersten beim Code-Switching über alle drei Clips, englische Nebensätze Wort für Wort erhalten und am genauesten bei Namen.

Referenz 1: Soniox. Auf keinem Clip Halluzinationen oder Bedeutungsumkehrungen und auf allen drei die niedrigste Fehlerrate (in der Serienszene nur 0,4 Punkte vor AssemblyAI). Sein einziger kleiner Ausrutscher war „latter“ statt „letter“.

Referenz 2: Doubao. Ebenfalls keine Halluzinationen oder Umkehrungen und die einzige Engine, die über alle drei Clips hinweg nie etwas „übersetzt“ hat. Sie behielt die englischen Zeilen der Serie, „You got the wrong person“ und „under arrest“, so wie sie gesprochen wurden. Ihre Fehler betrafen Namen und ähnlich klingende Wörter, etwa „gelap“ (dunkel) statt „gelak“ (lachen).

Referenz 3: Gemini. In der August-Runde hatte es in der ersten Talkshow höchstens eine verschwommene Wendung, und alle Partei- und Institutionsnamen stimmten. Beim TEDx-Vortrag lieferte es 304 zusammenhängende Wörter ohne Halluzinationen.

Was gegen unsere Wahl spricht

  • Auch Soniox malaiisiert. In der Serienszene schrieb es die englische Zeile „You are under arrest“ als das malaiische „awak ditangkap“. Die Bedeutung stimmt und nichts ist umgekehrt, aber es ist dieselbe Art von Verhalten, für die wir AssemblyAI abgestraft haben, und der ursprüngliche Bericht hat es nicht markiert. Die Überprüfung empfiehlt, Passagen mit Code-Switching im Produktivbetrieb früh stichprobenartig zu prüfen.
  • Doubao ist kein klarer Zweiter. In den Talkshows wechselt seine Fehlerrate den Platz mit FunASR und Qwen. Ein Grund für die Wahl war, dass FunASR große Stücke verlor und Qwen in Schleifen geriet, während Doubao beides nicht tat. Die zweite Hälfte davon erwies sich als der falschen Engine angelastet (siehe letzter Punkt).
  • AssemblyAI ist in der Serienszene tatsächlich sehr gut: 17,4 %, gleichauf mit Soniox an der Spitze. Es bricht erst beim dichten Code-Switching in den Interviews ein. Es ist jetzt ein Backup.
  • Qwen wurde auf Grundlage zweier Beweisstücke verurteilt, die beide in sich zusammenfielen: Die Schleife stammte von Melia-1, und die „erfundene Wendung“ war ein Sprecher, der tatsächlich einen Satz begann und sich dann korrigierte. Es ist jetzt ein brauchbares Backup, aber keine feste Spur, weil seine Zeitstempel ein gleichmäßiges Raster statt echter Zeitangaben sind.

Noch offen

  • Drei Clips sind eine kleine Stichprobe.
  • Kein gezielter Test von starkem Lärm mit durcheinanderredenden Personen.
  • Dichtes Code-Switching wurde nur in einem Umfeld getestet: politischen Talkshows.

Unsere Seite zur Malaiisch-Transkription

Von Zeyu Si