Wer hat das gesagt? Sprecherzuordnung, wenn viele Menschen reden
· Zeyu Si
Auf dieser Seite
- Mit mehr Personen driften eingebaute Sprecherlabels
- Kurze Clips schönen die Ergebnisse
- Auch die Bewertungsmethode kann in die Irre führen
- Ein paar kontraintuitive Befunde
- Unser Ansatz: erst jede Stimme lernen, dann Satz für Satz zuordnen
- Ergebnisse: über 99 % bei öffentlichen Meetingdaten, ohne Drift
- Die Grenze: Menschen, die durcheinanderreden
Eine Diskussion mit sieben Personen, 37 Minuten lang. Wir haben ElevenLabs die ganze Aufnahme gegeben und darum gebeten, bei jedem Satz zu kennzeichnen, wer ihn gesagt hat.
Es fand neun Personen.
Das größere Problem war, dass sich die Kennzeichnungen der Personen ständig änderten. Ein Sprecher war von Minute 8 bis Minute 18 als A gekennzeichnet, wurde kurz nach 18:30 zu B, um Minute 30 wieder zu A und bei 32:47 erneut zu B. Über die sieben Sprechenden hinweg wechselten die Identitäten 16-mal. Nach Wörtern gemessen, waren nur 68,6 % des Transkripts der richtigen Person zugeordnet.
Für die Interviewforschung ist das schlimmer als ein paar verhörte Wörter. Man kann nicht darauf vertrauen, wer was gesagt hat.
Mit mehr Personen driften eingebaute Sprecherlabels
Diese Aufnahme stammt aus AISHELL-4, einem öffentlichen Datensatz chinesischer Meetingaufnahmen mit jeweils fünf bis sieben Personen an einem Tisch. Wir haben die eingebaute Sprecherkennzeichnung von ElevenLabs darauf wiederholt getestet:
- Bei 10- bis 15-minütigen Clips wurden je nach Einstellungen zwischen 67,5 % und 97,8 % des Inhalts korrekt zugeordnet, und die Identität einer Person wechselte bis zu 12-mal.
- Mehr Personen machten es schlimmer. Bei Clips mit sieben Personen kam es selbst dann nur auf 77 % bis 82 %, wenn man ihm sagte, dass es sieben Sprechende waren.
- Es konnte die Personen nicht zuverlässig zählen. Wenn es die Zahl selbst ermitteln sollte, lag es 4 von 12 Malen richtig, und jeder Fehltreffer war eine Person zu wenig: Die ein oder zwei leisesten Sprechenden wurden mit jemand anderem zusammengelegt.
Dieselben Einstellungen zweimal laufen zu lassen, konnte sehr unterschiedliche Ergebnisse liefern. Ein Clip kam in einem Durchlauf auf 81,9 % und im nächsten auf 93,8 %.
Kurze Clips schönen die Ergebnisse
Diese Zahlen verbergen eine eigene Falle: Je kürzer der Clip, desto besser sieht er aus.
Im selben Meetingraum kamen 15-minütige Clips auf 78 % bis 93 %. Die vollständige 37-minütige Aufnahme fiel auf 68,6 %, 10 bis 25 Punkte niedriger, und der Fehler änderte sich von „eine Person zu wenig“ zu „zusätzliche Personen und Identitäten, die hin und her tauschen“.
Dasselbe haben wir auch anderswo gesehen. Ein Open-Source-Ansatz erreichte bei der Sprechererkennung über einen 10-minütigen Clip 99,8 %. Auf der vollständigen Aufnahme fiel er auf 63,9 %.
Deshalb urteilen wir jetzt nur noch anhand vollständiger Aufnahmen.
Auch die Bewertungsmethode kann in die Irre führen
Im Maßstab selbst steckt eine weitere Falle.
Menschliche Referenztranskripte setzen Zeitstempel meist auf die nächste Sekunde, und per Konvention können sich mehrere Zeilen dieselbe Sekunde teilen (eine Person endet, und eine andere setzt sofort ein). In einer von uns verwendeten Referenz teilten sich 55 % der Zeilen einen Zeitstempel mit einer benachbarten Zeile.
Bewertet man nach der Zeitleiste, zählt eine Verschiebung um eine Sekunde als ein ganzer Satz, der der falschen Person zugeordnet ist. Dieselbe Ausgabe kam nach Zeitleiste auf 81 % und nach Textausrichtung auf 99,7 %.
Ein paar kontraintuitive Befunde
- Mehr Sprechende zuzulassen findet nicht mehr Sprechende. Wir haben das mit einem Open-Source-System ausprobiert: Gibt man ihm Raum für eine zusätzliche Person, findet es keine dritte, sondern teilt die gesprächigste Person in zwei.
- Ein anderes Modell ist nicht unbedingt anders. Fünf Stimmmodelle desselben Entwicklers lieferten Wort für Wort identische Ausgaben. Nur ein Modell eines anderen Entwicklers änderte etwas.
- Standardeinstellungen löschen „mhm“ und „aha“. Rückmeldungen, die kürzer als eine halbe Sekunde waren, wurden als Rauschen verworfen. Nachdem wir das abgestellt hatten, wurden mehr Sprecherwechsel erkannt, und zwar genauer.
Unser Ansatz: erst jede Stimme lernen, dann Satz für Satz zuordnen
Am Ende hatten wir drei Schritte:
- Eine „Stimmkarte“ für jede Person: 10 bis 30 Sekunden saubere Sprache dieser Person, wie bei einer Vorstellungsrunde am Anfang. Unter 10 Sekunden wird es spürbar schlechter; über 30 Sekunden verbessert es sich nicht mehr.
- Jeden Satz zuordnen: ElevenLabs transkribiert nur und teilt die Sätze auf. Wer jeden davon gesagt hat, wird entschieden, indem die Stimme dieses Satzes mit jeder Karte verglichen wird, nicht anhand der eigenen Sprecherlabels von ElevenLabs. Diese Labels sind über die Zeit nicht konsistent: Die Zuordnung nach Label erreichte nur 71,5 %.
- Nach Sicherheit sortieren: Sichere Zuordnungen werden direkt getroffen; unsichere werden markiert, damit ein Mensch sie bestätigt. In zwei Testmeetings umfasste die sichere Gruppe 564 Abschnitte ohne einen einzigen Fehler.
Sehr kurze „ja“s und „mhm“s tragen nicht genug Stimme, um sie für sich allein zu erkennen, daher übernehmen sie die Identität der längeren Sätze derselben Person um sie herum.
Ergebnisse: über 99 % bei öffentlichen Meetingdaten, ohne Drift
Zwei vollständige AISHELL-4-Meetings:
| ElevenLabs eingebaut | Unser Ansatz | |
|---|---|---|
| 5 Personen, 36 Minuten | 97,28 % | 99,76 % |
| 7 Personen, 37 Minuten | 68,6 % (16 Identitätswechsel) | 99,32 % |
Bei beiden stimmte die Anzahl der Personen, und es gab null Identitätswechsel.
Wir haben außerdem sechs 10- bis 15-minütige Clips und eine öffentliche Podiumsdiskussion mit fünf Personen (99,75 %) getestet. Alle neun lagen über 97 %.
Fast jeder verbleibende Fehler ist ein „ja“, „genau“ oder „okay“, das kürzer als eine Sekunde ist.
Die Grenze: Menschen, die durcheinanderreden
Das sind öffentliche Daten. Echte Fokusgruppen waren schwieriger.
- Eine offene Diskussion mit fünf Personen: Die Moderatorin bringt ein Thema auf, und vier Teilnehmende steigen frei ein. Alle fünf sind Frauen, und in etwa einem Fünftel der Redezeit sprechen mehrere gleichzeitig. Die sicheren Zuordnungen waren zu etwa 97 % richtig, aber 30 bis 40 % der Abschnitte konnten nur als unsicher markiert werden.
- Eine Fokusgruppe mit acht Personen, aufgenommen in Telefonqualität: Sobald jede teilnehmende Person eine ordentliche Stimmkarte hatte, waren die sicheren Zuordnungen zu 98,1 % richtig, aber unsicheres Material machte immer noch 17,5 % des Texts aus. Unsere eigene Messlatte lautet „sichere Zuordnungen über 99 %, unsicheres Material höchstens 5 %“. Diese Gruppe hat sie nicht erreicht.
Das Nachhören der Fehler machte eines klar: Wenn mehrere Menschen gleichzeitig sprechen, können auch menschliche Ohren sie nicht auseinanderhalten. Professionelle Protokollführer im Raum verlassen sich auf Video.
Unsere Zusage bei der Sprecherzuordnung gilt daher für Diskussionen mit mehreren Personen, bei denen man sich abwechselt: Eine Person spricht, die anderen hören zu. Innerhalb dieses Rahmens halten wir die Identität jeder Person von Anfang bis Ende konsistent. Menschen, die durcheinanderreden, liegen außerhalb davon.
Von Zeyu Si