Zum Hauptinhalt springen

Teil der Reihe: 27 Sprachen, eine nach der anderen

Russisch: die Zeile, bei der beide Referenz-Engines falsch lagen

· Zeyu Si

Auf dieser Seite

Beim Russischen haben wir zum ersten Mal zwei Referenz-Engines dabei ertappt, wie sie in derselben Zeile den identischen Fehler machten, während die primäre Engine richtig lag. Hätten wir diese Zeile per Mehrheitsentscheid geklärt, wäre das Transkript falsch gewesen.

So haben wir Russisch getestet, und das hat diese Episode verändert.

Die Testclips

Vier Szenen aus russischen Filmen, bewertet anhand der russischen Untertitel der Filme für Gehörlose und Schwerhörige. Alle vier haben wir nach Schwierigkeit ausgewählt, auf unserer dreistufigen Skala liegen sie also alle ganz oben:

  • Brother (1997): ein Mann, der durch eine Tür schreit, draußen fallen mehrere Leute ins Wort, darunter Marktlärm.
  • Brother 2 (2000): schnelles Telefonieren voller Namen, Orte und Zahlen, im Hintergrund läuft ein Radio.
  • Leviathan (2014): eine Handvoll Männer schmiedet an einem Tisch Pläne, die Zeilen überlappen sich.
  • Kokoko (2012): ein Raum voller Frauen, die arbeiten und plaudern und dabei durcheinanderreden.

Das Audio veröffentlichen wir nicht. Keine dieser Szenen ist ein gewöhnliches Zweiergespräch in normalem Tempo – darauf kommen wir später als Einschränkung zurück.

Ausprobierte Engines

Acht: ElevenLabs Scribe v2, AssemblyAI, Speechmatics, Doubao, Soniox und Deepgram, dazu FunASR und Qwen als Kontrollen. Gemini wurde anschließend separat getestet.

Wo jede Engine eine rote Linie überschritt

Wir beurteilen Engines vor allem nach sechs Arten von Fehlern: erfundene Sätze, umgekehrte Verneinungen, Wiederholungsschleifen, eingefügte Wörter, ausgelassene Passagen und das Abdriften in eine andere Sprache. Im Russischen sahen wir diese:

Eingefügte Wörter. In der Brother-Szene fügte Speechmatics eine Anrede ein, Доченька („Töchterchen“), wo niemand sie sagt, und machte aus dem Fluchverb охерел den Namen Кирилл. Bei der Überprüfung zählten wir mindestens acht solcher Erfindungen in seiner russischen Ausgabe, einige in jedem Clip. Auch Deepgram erfindet: In „an dem kämst du nicht mal mit einer Kanone (пушки) vorbei“ hörte es einen Ortsnamen, Пушкино.

Eine umgekehrte Verneinung. In Leviathan sagt jemand «сегодня не в нашу пользу всё решится» („heute wird es nicht zu unseren Gunsten entschieden“). AssemblyAI ließ das не weg und schrieb «сегодня они в нашу пользу все решатся», was das Gegenteil besagt. Dieselbe Passage enthält vier oder fünf weitere Verneinungen, und es hatte jede davon richtig, daher behandeln wir das als Einzelfall und nicht als Muster.

Ein ersetzter Satz. «Двух жён в могилу свёл» („er hat zwei Frauen ins Grab gebracht“) kam bei Soniox als «Да уже он в могилу свёл» heraus, mit einem anderen Subjekt. Zunächst wurde das allein Soniox angelastet. Bei der Überprüfung lagen fünf der acht Engines bei dieser Zeile falsch. Das Audio ist an dieser Stelle einfach schwer.

Sprachdrift. Doubaos erster russischer Durchlauf ergab ein Durcheinander aus Englisch, japanischen Ortsnamen und Chinesisch. Das war unser Fehler: Der Adapter schickte keinen russischen Sprachcode, also fiel die Engine still auf Chinesisch zurück. Mit gesetztem ru-RU kamen alle vier Clips als zusammenhängendes Russisch zurück.

Wiederholungsschleifen: AssemblyAI produzierte über die vier Clips keine.

Was wir gewählt haben

Primär: ElevenLabs Scribe v2. Niedrigste WER bei drei der vier Clips. Den ersten Platz bei Brother 2 verlor es vor allem, weil es das Hintergrundradio transkribierte – sowohl den Sprecher als auch die Liedtexte –, das die Untertitel weglassen, sodass all das als Fehler zählte. Seine russischen Fehler waren meist ausgelassene Wörter, etwa ein fehlendes отсюда („von hier weg“). Dass es einen Satz erfunden hätte, haben wir nicht gesehen.

Referenzen, in dieser Reihenfolge: AssemblyAI, Doubao, Gemini. Alle drei laufen bei jeder russischen Datei.

  • AssemblyAI: in vier Clips keine Schleifen und keine Ketten erfundenen Texts, und der niedrigste Wert bei Brother 2, dem Clip mit den meisten Namen.
  • Doubao: Sobald der Sprachcode stimmte, kein Datenmüll und keine eingefügten Wörter; wenn es falsch liegt, dann bei einem einzelnen Wort, etwa wenn es торге („Feilschen“) als твороге („Quark“) hört. Es stammt von ByteDance und aus einer technisch ganz anderen Linie als AssemblyAI, sodass die beiden meist an unterschiedlichen Stellen scheitern.
  • Gemini: Unsere russischen Filmclips bestehen nur aus Geschrei und Gruppenszenen, die wenig über normale Gespräche verraten. Also haben wir fünf Minuten eines echten Fernsehinterviews genommen (Wladimir Posner mit Edward Radsinski) und Gemini Zeile für Zeile mit der primären Engine verglichen. Kein erfundener Text, keine umgekehrte Bedeutung, keine Schleifen. Es erfasste alle vier direkten Zitate und jeden Eigennamen richtig, darunter Cambridge, Oxford und Nikolaus II., und übersprang drei Rückmeldesignale der Art „natürlich“.

Was gegen unsere Wahl spricht

  • AssemblyAI ist im Russischen nicht sauber. Bei der Überprüfung hatte es drei gefährliche Fehler, darunter die oben genannte Verneinung und einen vollständigen Austausch von «Кто? Зинка я, открывай» („Wer ist da? Ich bin's, Sinka, mach auf“) gegen «Куда ты отдаёшь, Зинка».
  • Der Fall „zwei Engines sind sich einig und liegen beide falsch“ ist genau der Grund, warum man einer Dreier-Abstimmung nicht trauen kann. Engine-Fehler sind nicht unabhängig voneinander, und bei Verneinung und Polarität hat die Seite mit mehr Stimmen nicht unbedingt recht.
  • Bei Brother 2 schrieb Gemini vier Sätze aus dem Hintergrundradio ins Transkript und machte aus „haben Sie einen Zehn-Tage-Pass?“ ein „ich habe einen Zehn-Tage-Pass“. Es schnitt bei diesem Clip von den vieren am schlechtesten ab, mit 43,6 %. Wie oben erwähnt, hat auch die primäre Engine in einem anderen Durchlauf das Radio mitgeschrieben. In einem echten Interview entspräche das dem Transkribieren des Fernsehers im Besprechungsraum, als hätte die befragte Person es gesagt.
  • Soniox kam bei Leviathan auf 12,3 %, weniger als die primäre Engine, und wir haben es trotzdem nicht genommen, weil die Überprüfung Ersetzungen ganzer Sätze ergab. Wer nur nach dem Wert geht, käme zur gegenteiligen Entscheidung.

Offene Probleme

  • Unsere Prüfer können Russisch nicht genau genug lesen, um jede Zeile zu beurteilen. Der erste Durchgang prüfte nur, was sich objektiv beurteilen lässt: zusammenhängendes Russisch oder nicht, Datenmüll-Zeichen, eingefügte Wörter, ausgetauschte Sätze. Die umgekehrte Verneinung tauchte erst später auf, als wir jedes Verneinungswort einzeln verglichen. Es kann Bedeutungsfehler geben, die wir noch nicht gefunden haben.
  • Alle vier Clips sind schwere Filmszenen. Wir haben keinen bewerteten Clip mit einer oder zwei Personen, die in normalem Tempo sprechen. Das Gemini-Interview hatte kein Referenztranskript und wurde daher nur mit der primären Engine abgeglichen.
  • Zum Zeitpunkt der Tests gab es keine eigene Schutzvorkehrung dagegen, dass Hintergrundton im Transkript landet.

Unsere Seite zur Russisch-Transkription

Von Zeyu Si