Zum Hauptinhalt springen

Wenn Interviews die Sprache wechseln

· Zeyu Si

Auf dieser Seite

Grenzüberschreitende Forschung erzeugt viele Aufnahmen dieser Art: Die interviewte Person spricht Spanisch, die fragende Person spricht Chinesisch, und dazwischen sitzt eine Dolmetscherin. Das Gespräch wechselt hin und her zwischen zwei Sprachen.

Wir dachten, das wäre unkompliziert. Wir haben die Dokumentation jeder Engine gelesen, eine Runde Labortests gefahren und eine Reihe von Schlussfolgerungen gezogen. Dann haben wir eine echte Aufnahme getestet, und die Schlussfolgerungen kehrten sich um.

Zwei Arten der Mischung, sehr unterschiedliche Ergebnisse

Zunächst müssen zwei Situationen auseinandergehalten werden:

  • Der gelegentliche Einschub: eine Hauptsprache, mit dem einen oder anderen Wort oder Satz in einer anderen, unter einem Zehntel der Aufnahme.
  • Abwechselnd: zum Beispiel Konsekutivdolmetschen, bei dem sich die beiden Sprachen abwechseln und jede ungefähr die Hälfte einnimmt.

Engines verhalten sich in diesen beiden Fällen sehr unterschiedlich. Man sollte sie nicht in einen Topf werfen.

Zuerst eine gute Nachricht: Eingestreutes Englisch ist meist unproblematisch. Die Mehrsprachigkeitsunterstützung fast jeder Engine ist um „Sprache X plus Englisch“ herum gebaut. Unsere Haupt-Engine schreibt einen vollständigen englischen Satz so aus, wie er gesprochen wurde, selbst mitten im Spanischen.

Schwierig wird es, wenn keine der beiden Sprachen Englisch ist, etwa bei Spanisch gemischt mit Chinesisch.

Dieselbe „Sprach“-Einstellung bedeutet vier verschiedene Dinge

Die meisten Engines haben einen Sprachparameter. Man könnte annehmen, dass er überall ungefähr dasselbe tut. Wir sind die Dokumentation jedes Anbieters durchgegangen und haben dann jede Engine getestet. Es sind vier verschiedene Dinge:

  • ElevenLabs: sagt ihr, in welcher Sprache die Aufnahme hauptsächlich ist.
  • Soniox: ein Hinweis, dem sie zuneigt, ohne dass sie deshalb aufhört, andere Sprachen zu erkennen.
  • Doubao: wählt, welches Sprachmodell läuft. Merkwürdigerweise ist es die schlechteste Option, das Feld leer zu lassen: Dann horcht es auf Chinesisch und Englisch und zwingt das Spanische ins Englische.
  • AssemblyAI: entscheidet, in welcher Sprache die ganze Datei ist, und übergibt dann die gesamte Datei dem Modell dieser einen Sprache. Von den zwei Sprachen, die es zusammen verarbeiten kann, muss eine Englisch sein.

Das Letzte hat eine unverblümte Folge. Bei einer Aufnahme, die zu 45 % Chinesisch war, entschied AssemblyAI trotzdem auf Spanisch (Konfidenz 0,84). Wir haben vier Konfigurationen ausprobiert. Kein einziges chinesisches Zeichen kam heraus.

Es gab auch eine Überraschung in die andere Richtung. Laut Doubaos Dokumentation sollte die Einstellung Spanisch die ganze Datei auf Spanisch festlegen. In der Praxis tat sie das nicht. Es transkribierte das Chinesische dazwischen trotzdem.

Das schlimmste Ergebnis ist Übersetzung

Beim gelegentlichen Einschub scheitert unsere Haupt-Engine auf eine von zwei Arten, je nachdem, wie man sie einstellt. (Getestet wurde das an zusammengeschnittenen Aufnahmen. Der nächste Abschnitt behandelt das Problem mit dem Zusammenschneiden, aber wenn die Engine schon danebenliegt, wo der Sprachwechsel so offensichtlich ist, wird eine echte Aufnahme nicht einfacher.)

  • Sagt man ihr, die Hauptsprache sei Spanisch, verschwinden die chinesischen Sätze einfach. Die Zeitleiste springt über sie hinweg und hinterlässt keine Spur.
  • Sagt man es ihr nicht, werden die chinesischen Sätze in flüssiges Spanisch übersetzt. Aus „你是谁?“ wurde „¿Quién eres?“. Kein einziges chinesisches Zeichen im ganzen Transkript.

Das Erste hinterlässt eine Lücke. Das Zweite fügt Spanisch hinzu, das niemand gesagt hat. Das Zweite ist schlimmer, denn das Transkript liest sich makellos, und eine Forscherin würde annehmen, dass die interviewte Person das tatsächlich auf Spanisch gesagt hat.

Eine andere Engine, die zum Transkribieren ein großes Sprachmodell nutzt, blieb an einem Sprachwechsel hängen und wiederholte dasselbe Wort etwa 370-mal.

Echtes Audio stieß die Laborergebnisse um

Um den Fall des Abwechselns zu testen, haben wir mit zusammengeschnittenem Audio begonnen: vorhandene spanische und chinesische Clips, aneinandergeschnitten. Die Referenztranskripte gab es gratis dazu, und es kostete fast nichts.

Die Tests mit zusammengeschnittenem Audio sagten:

  • Sagt man der Haupt-Engine, die Hauptsprache sei Spanisch, geht alles kaputt: Das Chinesische wird übersetzt, erfundene Inhalte tauchen auf, und die Zeitleiste zerfällt.
  • Überlässt man es ihr, die Sprache selbst herauszufinden, macht sie alles richtig.

Dann bekamen wir ein echtes gedolmetschtes Interview: 66 Minuten, Spanisch und Chinesisch, mit einer Forscherin, einer Dolmetscherin und einer interviewten Person. Die Ergebnisse waren das genaue Gegenteil:

  • Die Angabe, die Hauptsprache sei Spanisch, ergab ein nahezu perfektes Transkript. Beide Sprachen wechselten korrekt, und alle drei Sprechenden wurden auseinandergehalten. Selbst die Dolmetscherin, die zwischen den Sprachen hin und her wechselte, wurde korrekt als eine Person erkannt.
  • Überließ man ihr die Entscheidung, kam sie zu dem Schluss, das Ganze sei Chinesisch (Konfidenz 0,86), transkribierte mit Chinesisch als rotem Faden und ließ ganze Passagen auf Spanisch weg.

Warum? Zusammengeschnittenes Audio hat eine offensichtliche Naht zwischen den Sprachen: Raum, Lautstärke und Hintergrundgeräusch ändern sich alle gleichzeitig, sodass eine Engine einen Wechsel leicht bemerkt. Eine echte Aufnahme ist ein Raum und ein Mikrofon. Es gibt keine Naht.

Auch der Rhythmus war anders als bei unseren Zusammenschnitten. Chinesisch machte 29 % aus und wechselte sich ab nach dem Muster „lange spanische Antworten von einer bis vier Minuten, kurze chinesische Einwürfe von fünfzehn Sekunden bis etwa einer Minute“ – genau in dem Bereich, den unsere Zusammenschnitte nicht abgedeckt hatten.

Was wir mitgenommen haben

Wie gut ein gemischtsprachiges Interview transkribiert wird, hängt von drei Dingen ab: welche zwei Sprachen, ob es ein gelegentlicher Einschub ist oder ein Abwechseln, und wie die Engine konfiguriert ist. Die Dokumentation der Anbieter kann diese Fragen nicht beantworten, und zusammengeschnittenes Testaudio auch nicht.

Das können nur echte Aufnahmen.

Von Zeyu Si