Zum Hauptinhalt springen

Teil der Reihe: 27 Sprachen, eine nach der anderen

Thailändisch: Ein Teil des Werts unserer primären Engine war unser eigener Bug

· Zeyu Si

Auf dieser Seite

In unseren thailändischen Tests stammte ein Teil des guten Werts der primären Engine von einem Bug in unserem eigenen Code.

Eine Funktion in unserer Pipeline entfernt Satzzeichen an Wortenden. Thailändische Vokal- und Tonzeichen sind kombinierende Zeichen, die über oder unter den Buchstaben sitzen, und diese Funktion behandelte sie als Satzzeichen und löschte sie. Den gespeicherten ElevenLabs-Transkripten fehlte also jedes Vokal- und Tonzeichen, und seine Fehlerrate wurde so berechnet, als gäbe es diese Zeichen nicht. Der Bug ist behoben, aber wie genau ElevenLabs bei thailändischen diakritischen Zeichen wirklich ist, muss noch stichprobenartig geprüft werden.

Behalten Sie diesen Vorbehalt bei jeder Zahl unten im Hinterkopf.

Die Testclips

Drei Clips, bewertet anhand handgemachter thailändischer Untertitel aus derselben Quelle:

  • Ein Kochinterview: eine oder zwei Personen, die in mäßigem Tempo mit wenig Hintergrundlärm sprechen. Das ist unser Basisclip, auf unserer dreistufigen Schwierigkeitsskala nahe an „einfach“.
  • Eine Reality-Show: mehrere Gäste, die durcheinanderreden und lachen, mit Hintergrundmusik und Soundeffekten. Wir stufen ihn als mittel ein.
  • Eine Debatte im Werwolf-Stil: Leute beschuldigen sich gegenseitig, sprechen schnell, fallen sich ins Wort und mischen englische Wörter wie Seer und defend ein. Höchste Stufe.

Wir hatten einen vierten Clip, doch die Prüfung ergab, dass Audio und Untertitel etwa 30 Sekunden auseinanderlagen, was bedeutet hätte, gegen die falschen Antworten zu bewerten, also haben wir ihn gestrichen. Thailändische Untertitel, die frei verfügbar, gesprächsnah und wortgetreu sind, sind selten, und drei Clips sind das Maximum, das wir finden konnten.

Ausprobierte Engines

Zehn: ElevenLabs Scribe v2, AssemblyAI, Speechmatics (zwei Versionen), Doubao, Soniox, Deepgram, Gladia, FunASR und Qwen. Gemini wurde separat getestet.

Wo die Engines rote Linien überschritten

Wiederholungsschleifen. Die Debatte beginnt mit einem Lachanfall, den die Untertitel als ein kurzes Lachen verzeichnen. Nach dem Lachen ฮ่า schrieb Gladia das thailändische Wiederholungszeichen ๆ mehr als 400-mal hintereinander, über zwei Zeilen, und durchlief dann viermal dieselben zwei Sätze. Das trieb es auf 83,9 %. Bei den anderen beiden Clips geriet es nie so in eine Schleife. Auch AssemblyAI gerät in Schleifen: Bei der Überprüfung stellten wir fest, dass es in der Reality-Show ein Wort über etwa 22 Zeilen wiederholt und eine andere Wendung etwa 25-mal durchlaufen hatte.

Ausgelassene Passagen. Bei der Debatte übersprang AssemblyAI große Abschnitte, stellenweise fast zehn Sekunden ohne Ausgabe. Bei den ersten beiden Clips kam es auf den letzten Platz, und bei der Debatte bewahrte es nur Gladias Zusammenbruch vor dem Schlussplatz.

Eingefügte Inhalte (zurückgezogen). Eine Zeit lang dachten wir, Qwen habe am Anfang der Debatte eine Passage erfunden. Bei der Überprüfung zeigte sich, dass die Untertitel am Anfang etwa 10 Sekunden versetzt waren und dass Soniox, Doubao und FunASR alle denselben Inhalt an derselben Stelle transkribiert hatten. Jemand hat es wirklich gesagt. Wir haben diesen Befund zurückgezogen.

Was wir gewählt haben

Primär: ElevenLabs Scribe v2. Bei keinem Clip ein Zusammenbruch und keine ausufernden Wiederholungen; 12,6 % beim Kochinterview und der niedrigste Wert bei der Reality-Show. Mit dem Vorbehalt von oben.

Referenzen, in dieser Reihenfolge: Soniox, Doubao, Gemini. Alle drei laufen bei jeder thailändischen Datei.

  • Soniox: über alle drei Clips die stabilste, mit der saubersten Segmentierung, folgt den Untertiteln Zeile für Zeile, ohne Schleifen und ohne dass Größeres fehlt.
  • Doubao: liefert echtes Thailändisch, liegt bei der Debatte gleichauf mit Soniox und der primären Engine und lässt das Lehnwort defend, wie es ist. Der Bericht sagte zunächst, Doubao sei beim Kochinterview nicht gelaufen. Das war es aber, und stellenweise war es dort genauer als Soniox; das Ergebnis hat es nur nie in die Tabelle geschafft. Außerdem stammt es aus einer anderen technischen Linie als die ersten beiden.
  • Gemini: Bei der Debatte hatte es im Abstimmungsergebnis einen Namen falsch, und alle vier Engines lagen innerhalb von 1,9 Punkten beieinander.

Was wir weggelassen haben: Qwen hatte bei der Debatte den besten Wert (18,3 %), gab aber die ganzen drei Minuten als eine einzige Zeile ohne Zeitstempel auf Wortebene zurück, was unser Ausrichtungsschritt nicht verwenden kann. Auch FunASRs Wert war ordentlich, aber seine Ausgabe ist ein ununterbrochener Zeichenblock ohne Satzgrenzen. Gladia ist wegen der Schleifen raus und AssemblyAI wegen dessen, was es auslässt.

Was gegen unsere Wahl spricht

  • Der größte Punkt steht ganz oben: Der thailändische Wert der primären Engine ist aufgebläht, und ihre tatsächliche Genauigkeit bei diakritischen Zeichen ist noch nicht stichprobenartig geprüft.
  • Unsere Prüfer lesen kein Thailändisch. Der Bericht beurteilte nur, was man ohne Sprachkenntnis sehen kann: ausufernde Wiederholungen, plötzliche Längensprünge, fehlende Stücke, alles als ein Block zurückgegeben. Ob eine Engine die Bedeutung einer Zeile umgekehrt oder verstümmelt hat, haben wir nicht Satz für Satz geprüft.
  • Gemini hat nur einen thailändischen Testclip im Gesprächsstil, was nicht reicht. In einer früheren Runde produzierte es außerdem Dinge wie Lach-Tags und nicht-thailändische Beschriftungen; beides tauchte bei diesem Clip nicht wieder auf. Beim Thailändischen stieß es zudem einmal an seine Grenze für die Ausgabelänge.
  • Soniox ist selbst ein Transkriptionssystem nach Art großer Sprachmodelle. Grundsätzlich befürchten wir, dass solche Engines die Stellen glätten, die sie nicht verstehen. Im Thailändischen haben wir das nicht gesehen, aber auch nicht Zeile für Zeile geprüft.

Offene Probleme

  • Thailändisch kennzeichnet Wortgrenzen nicht mit Leerzeichen, und wir haben noch keinen thailändischen Wortsegmentierer, daher arbeitet unser Ausrichtungsschritt auf Satzebene und ist recht grob.
  • Keiner der drei Clips ist ein echtes Forschungsinterview.
  • Die Genauigkeit der primären Engine bei diakritischen Zeichen muss noch geprüft werden.

Unsere Seite zur Thai-Transkription

Von Zeyu Si