WER lügt. So messen wir Genauigkeit bei echten Interviews
· Zeyu Si
Auf dieser Seite
Wir haben einmal ein Buchbesprechungsinterview aus dem schwedischen Frühstücksfernsehen getestet. Vier Spracherkennungs-Engines transkribierten es. Nach WER, der Metrik, die fast alle verwenden, lagen ihre Fehlerraten zwischen 194 % und 216 %. Mehr Fehler als Wörter.
Dann haben wir die vier Transkripte Zeile für Zeile gelesen. Sie waren die vollständigsten des ganzen Durchgangs. Buchtitel, Namen, Handlungsdetails, alles korrekt. Sie hatten sogar Dinge erfasst, die das Referenztranskript weggelassen hatte.
Das Problem war die Referenz.
Dieser Beitrag behandelt zwei Dinge: warum WER bei Interviews versagt und worauf wir umgestiegen sind. Es ist die Methode, mit der wir Engines für alle 27 unserer Sprachen ausgewählt haben.
Fünf Arten, wie WER Sie bei Interviewaudio in die Irre führt
Wir sind in mehr als 20 Sprachen auf dieselben paar Probleme gestoßen. Jedes erzeugt eine Zahl, die präzise aussieht und das Falsche sagt.
1. Die Referenz ist bereits gekürzt. Die meisten unserer Referenzen stammen aus Untertiteln für Gehörlose und Schwerhörige zu Filmen und Fernsehsendungen. Untertitel müssen sich schnell lesen lassen, daher verdichten sie routinemäßig, was Menschen tatsächlich sagen. Je getreuer eine Engine transkribiert, desto mehr weicht sie vom Untertitel ab und desto stärker wird sie bestraft. So war es beim schwedischen Interview. In einer spanischen Filmszene, in der alle durcheinanderschreien, kam jede Engine auf 63 % bis 80 % WER. Zeile für Zeile gelesen, hatte jede von ihnen die Bedeutung transportiert.
2. Die geschriebene und die gesprochene Sprache sind nicht dasselbe. Geschriebenes Arabisch und das Arabisch, das Menschen im Alltag sprechen, können weit auseinanderliegen. Wir haben dieselbe Engine gegen eine Referenz in modernem Hocharabisch bewertet und 49 % erhalten. Gegen eine Referenz, die den Dialekt getreu festhielt: 16 %. Die Engine hatte sich nicht verändert. Die Referenz schon.
Tamil ist noch extremer. Untertitel werden üblicherweise im literarischen Register geschrieben, während die Menschen das umgangssprachliche sprechen. Nimmt man Untertitel als Referenz, gewinnt die Engine, die Gesprochenes in literarisches Tamil „umschreibt“. Die Engine, die getreu transkribiert, landet auf dem letzten Platz. Die Rangfolge kehrt sich um.
3. Chinesisch und Japanisch setzen keine Leerzeichen zwischen Wörter. Trennt man nach Leerzeichen, wird ein ganzer chinesischer Satz zu einem „Wort“. Die Fehlerrate kann über 1000 % liegen. Diese Zahl bedeutet nichts.
4. Die Schreibweise unterscheidet sich, die Bedeutung nicht. Griechisch und Arabisch schneiden oft schlecht ab. Schaut man genauer hin, sind viele der „Fehler“ Flexions- und Schreibkonventionen, etwa ob ein kleines arabisches Zeichen namens Hamza geschrieben wurde. Kein Leser würde den Satz missverstehen. Die Metrik zählt es trotzdem.
5. WER ist also ein Rauchtest, mehr nicht. Sie sagt Ihnen, ob eine Engine komplett umgefallen ist: ganze Passagen fehlen, bildschirmweise Kauderwelsch. Um zu entscheiden, welche von zwei funktionierenden Engines genauer ist, schauen wir nicht mehr darauf.
Referenzen sollten echte Gespräche sein
Echte Interviews haben Pausen, Füllwörter, Unterbrechungen und Menschen, die durcheinanderreden. Testet man an Nachrichtensprechern oder vorgelesenem Audio, sieht jede Engine großartig aus. Interviews sind eine andere Geschichte.
Unsere Testclips sind deshalb ausschließlich spontane Sprache. Filmszenen kommen zuerst: Sie haben Untertitel für Gehörlose und Schwerhörige, die dem Dialog eng folgen, und sie sind verfügbar. Wo wir keinen passenden Film finden, weichen wir der Reihe nach auf Fernsehserien und Dokumentationen, Parlaments- oder Gerichtsaufnahmen und dann auf Podcasts mit wortgetreuen Transkripten aus.
Es gibt drei Schwierigkeitsstufen, jede baut auf der vorigen auf:
- Einfach: eine oder zwei Personen, gleichmäßiges Tempo, kein Hintergrundlärm, Standardakzent, aber trotzdem echtes Gespräch. Allein diese Stufe schaltet ein paar schwache Engines aus.
- Schwerer: einfach plus eine oder zwei Komplikationen, etwa schnelleres Sprechen, eine kleine Gruppe, schnellere Sprecherwechsel, etwas Hintergrundlärm oder ein Akzent.
- Extrem: überlappende Sprache, starker Lärm oder Musik, ausgeprägter Dialekt, schlechter Ton – alles auf einmal.
Wenn eine Sprache starke regionale Unterschiede hat, bekommt jede Region eigene Clips. Spanisch aus Spanien, Mexiko und Argentinien. Arabisch aus der Golfregion, Ägypten und der Levante.
Erst die Referenz prüfen, dann die Engine
Das ist der Schritt, den man gern überspringt. Wir haben ihn eingeführt, nachdem er uns etwas gekostet hatte. Bevor eine Referenz verwendet wird, um irgendetwas zu bewerten, bestätigen wir, dass die Referenz selbst stimmt.
Bei einer Prüfung haben wir viele Clips verworfen, die in Ordnung ausgesehen hatten:
- Eine als Tagalog gekennzeichnete Sendung war tatsächlich auf Cebuano, einer anderen philippinischen Sprache.
- Bei einem thailändischen Clip waren die Untertitel etwa 30 Sekunden gegenüber dem Audio versetzt.
- Ein kantonesisches Interview entpuppte sich als koreanisch. Der Gast war Koreaner, und die kantonesischen Untertitel waren eine Übersetzung. Jede Engine kam dabei auf fast 100 % Fehlerrate.
Jeder dieser Fälle hätte einen präzise aussehenden, bedeutungslosen Wert erzeugt. Schlimmer noch: Einige frühere Schlussfolgerungen beruhten auf Clips wie diesen.
Für drei Sprachen finden wir noch immer keine brauchbare Referenz: Tamil, Bengalisch und Filipino. Wir unterstützen sie noch nicht. Wir bieten lieber eine Sprache nicht an, als eine Zahl zu veröffentlichen, hinter der wir nicht stehen können.
Fehler zählen, die die Bedeutung verändern
Forschende lesen Interviewtranskripte wegen der Bedeutung. Ob „ähm“ als „äh“ geschrieben wird, spielt keine Rolle. Ob „nicht getan“ als „getan“ geschrieben wird, sehr wohl. Deshalb zählen wir für jede Engine Rote-Linien-Fehler, in sechs Kategorien:
- Erfundene Sätze: Ein Satz taucht auf, den niemand gesagt hat. Eine Engine mit einer durchaus respektablen Fehlerrate produzierte in einem Clip mit starkem Akzent einen vollständigen Satz, der mit „kauf ein paar Bananen“ endete. Niemand hat etwas Ähnliches gesagt. Diese Engine haben wir nicht verwendet.
- Umgekehrte Verneinung: Aus „nein“ wird „ja“ oder umgekehrt. Es liest sich einwandfrei und bedeutet das Gegenteil. Darum geht es in unserem nächsten Beitrag.
- Schleifen: dasselbe Wort dutzend- oder hundertfach wiederholt.
- Eingefügte Inhalte: Material, das hinzugefügt wurde und nicht im Audio war.
- Ausgelassene Passagen: Ein Stück Sprache fehlt vollständig. In einer Filmszene mit starkem Dialekt und lauter Menschenmenge ließ eine Engine die ersten 54 Sekunden weg.
- Sprachdrift: mittendrin die Sprache wechseln. Eine Engine machte aus langen spanischen Passagen Portugiesisch. Aus „Soy abogado“ wurde „Sou advogado“.
Jede Engine wird mit demselben Maßstab gemessen. Unterschiede in der Schreibung von Namen oder ob eine Zahl als „6“ oder „sechs“ geschrieben wird, zählen nicht als rote Linien.
Auch Menschen, die Transkripte lesen, übersehen Dinge, daher fahren wir zusätzlich zwei maschinelle Prüfungen:
- Ausgabeverhältnis: die Anzahl der Wörter, die eine Engine produziert hat, geteilt durch die Anzahl in der Referenz. Deutlich unter 1 bedeutet meist, dass große Passagen weggefallen sind; wir haben 0,1 gesehen. Deutlich über 1 mit vielen wiederholten Wörtern bedeutet meist eine Schleife; wir haben 1,8 gesehen.
- Wiederholungen: wie oft dasselbe Wort innerhalb einer kurzen Spanne wiederkehrt.
Keine der beiden hängt vom Audioformat oder von der Schwierigkeit des Clips ab, daher lassen sie sich sprachübergreifend vergleichen. WER nicht.
Regeln, um uns nicht selbst zu täuschen
Jede davon ist aus einem Fehler entstanden.
Wenn mehrere Engines übereinstimmen und nur die Referenz abweicht, zuerst die Referenz verdächtigen. Im Türkischen haben wir das zweimal falsch gemacht. Wir haben echte Sprache als „Halluzination“ verbucht, obwohl die Untertitel diese Zeile schlicht weggelassen hatten.
Wenn mehrere Engines an derselben Stelle denselben Fehler machen, nicht einer von ihnen anlasten. Meist ist das Audio dort wirklich undeutlich, und jeder würde danebenliegen. Es einer Engine anzurechnen, ist unfair gegenüber dieser Engine und führt dazu, die falsche auszuwählen.
Kurzen Clips kann man nicht trauen. Immer die vollständige Aufnahme laufen lassen. Ein Ansatz, den wir uns angesehen haben, erreichte bei der Sprechererkennung über einen 10-minütigen Clip 99,8 %. Auf der vollständigen Aufnahme fiel er auf 63,9 %.
Jede Einstellung mindestens zweimal laufen lassen. Dieselbe Eingabe liefert nicht immer dieselbe Ausgabe. Einmal wiederholte eine Engine ein einzelnes „ähm“ 99-mal und verschluckte die nächsten drei Sätze. Lässt man es nur einmal laufen, kann man nicht sagen, ob das typisch ist oder ein Ausreißer.
Wo diese Methode an Grenzen stößt
Die meisten unserer Testclips stammen aus Film und Fernsehen, nicht aus Forschungsinterviews. Filmdialog ist geschrieben und sorgfältig aufgenommen. Ein einzelnes Aufnahmegerät auf einem Besprechungstisch ist etwas anderes. Was diese Ergebnisse Ihnen sagen, ist also, wie Engines bei echten Gesprächen scheitern – nicht, wie genau Ihr konkretes Interview sein wird.
Deshalb veröffentlichen wir auch keine einzelne Schlagzeilenzahl zur Transkriptionsgenauigkeit. Was wir teilen können, ist, wie wir testen, was wir gefunden haben und was wir noch nicht wissen.
Als Nächstes: die gefährlichste der sechs roten Linien, bei der sich die Bedeutung umkehrt und der Satz sich trotzdem einwandfrei liest.
Von Zeyu Si