Vai al contenuto principale

Parte della serie: 27 lingue, una per una

Arabo: si parla in dialetto, i sottotitoli scrivono in MSA. Come abbiamo scelto i motori comunque

· Zeyu Si

In questa pagina

Un motore, un solo livello di bravura. Su una registrazione in arabo il suo tasso di errore era del 49.2%. Su un'altra, del 18.2%.

Il motore non era cambiato. Era cambiata la trascrizione di riferimento. La prima era scritta in arabo formale. La seconda registrava, parola per parola, il dialetto che l'oratore usava davvero.

Gli spezzoni di test: due registrazioni, due dialetti

  • Talhouk: un intervento pubblico di un oratore libanese sulla lingua madre e sull'insegnamento dell'arabo. Parla arabo libanese colloquiale. I sottotitoli lo rendono in arabo standard moderno (MSA).
  • Fenjan (روقي): un'intervista di attualità in arabo del Golfo (saudita). I sottotitoli trascrivono il dialetto parlato verbatim.

È tutto quello che abbiamo. Materiale gratuito che unisca audio in dialetto, sottotitoli fatti da persone e fedeltà verbatim è molto difficile da trovare, e ci siamo fermati dopo questi due. Sono stati scelti per il dialetto, non per la difficoltà. Il nostro livello più difficile (persone che si parlano sopra, forte rumore di fondo) per l'arabo non è coperto.

E solo il secondo spezzone si può usare per stilare una classifica dei motori. Ecco perché.

I motori che abbiamo testato

Dieci: ElevenLabs Scribe v2, AssemblyAI, Speechmatics (enhanced e Melia-1), Doubao (ar-SA), Soniox, Deepgram, Gladia, FunASR (fun-asr-mtl) e Qwen (qwen3.5-omni). Gemini è stato aggiunto in un turno successivo ad agosto 2026.

Linee rosse: l'arabo si è rivelato una lingua "sicura"

Sull'intervista Fenjan abbiamo letto riga per riga otto trascrizioni: ElevenLabs, Soniox, Speechmatics, Qwen, Doubao, Gladia, Deepgram e FunASR. Tutte hanno mantenuto il significato. Nessuna frase inventata, nessuna negazione ribaltata, nessun passaggio fabbricato.

I problemi erano altrove:

  • AssemblyAI è entrato in loop su un tratto dell'intervento di Talhouk e ha prodotto contenuti che non sono nell'audio, attaccati a timestamp di durata zero. È stata l'unica vera allucinazione dell'intero gruppo arabo.
  • FunASR ha infilato una parola inglese, "Also", in una frase araba (una piccola deriva di lingua) e ha trasformato l'anno 1990 in 2990.
  • Doubao e FunASR hanno ottenuto il 41.4% e il 37.7% su Fenjan, circa il doppio dei primi. A una lettura attenta, la maggior parte di quegli "errori" veniva da due cose: la hamza omessa e gli anni scritti per esteso come li si pronuncia in dialetto (2011 come الفين واحدعش). Un lettore non ne sarebbe tratto in inganno. In un primo momento avevamo concluso che Doubao fosse debole in arabo; poi abbiamo ritirato quella conclusione.

Sullo stesso spezzone, Speechmatics ha ottenuto il 15.7%, Qwen il 17.9%, Soniox il 18.2% ed ElevenLabs il 20.1%. Pochi punti di distanza.

Cosa abbiamo scelto, e perché

Principale: ElevenLabs Scribe v2. Su Fenjan sta in coda al gruppo di testa, quindi l'arabo non è la sua lingua più forte. Ma è stato fedele su entrambi gli spezzoni. Sull'intervento libanese ha lasciato quasi intatte parole dialettali come بدي, هيدا e وين. Sull'intervista del Golfo ha scritto il più generico أيش dove l'oratore diceva وش ("cosa"), senza perdere il significato. È il nostro motore principale in ogni lingua soprattutto per la separazione dei parlanti e la stabilità sulle registrazioni lunghe, non per questo punteggio in particolare.

Riferimento 1: Soniox. Nessuna allucinazione su nessuno dei due spezzoni, e la lettura più fedele del dialetto del Golfo. Sull'intervento libanese ha fatto il contrario: ha scritto il dialetto come arabo formale, ed è per questo che lì il suo WER era il più basso. Quindi sbaglia nella direzione opposta rispetto al nostro motore principale. Uno tende al dialetto, l'altro alla forma scritta. Per il controllo incrociato è più utile di due motori che sbagliano nello stesso modo.

Riferimento 2: Speechmatics. Il tasso di errore più basso su Fenjan, output pulito, nessun cedimento. È un modello acustico convenzionale, costruito in modo diverso da Soniox. Le sue trascrizioni arrivano senza punteggiatura, ma è un'impostazione dell'API e non incide sulle parole.

Riferimento 3: Gemini. Nel turno di agosto l'arabo è finito nel gruppo "si può aggiungere": nessuna linea rossa su almeno due spezzoni di conversazione o discorso.

Non scelti: Qwen era accurato quanto i primi due, ma è un trascrittore basato su un modello linguistico di grandi dimensioni come Gemini e non fornisce timestamp a livello di parola, quindi resta in panchina. Doubao funziona in modo diverso da tutti gli altri della formazione; è un possibile motore di riserva ma non è collegato.

Prove contro la nostra scelta

  • A un certo punto avevamo indicato "Soniox è il più fedele al dialetto libanese" come motivo per sceglierlo. Un ricontrollo parola per parola ha mostrato che avevamo capito al contrario. I motori che hanno mantenuto le parole dialettali erano ElevenLabs, FunASR, Qwen e Doubao. Soniox era quello che formalizzava di più. Quel motivo non vale più; Soniox resta per i motivi indicati sopra.
  • L'unica classifica affidabile si regge su una sola registrazione. Speechmatics, Qwen e Soniox sono a due o tre punti di distanza, e un solo spezzone non basta a separarli.
  • Il nostro primo passaggio sull'arabo si basava soprattutto sul WER e sulla struttura dell'output. La lettura per significato è arrivata dopo, e ha ribaltato il verdetto "Doubao e FunASR sono deboli in arabo".

Ancora aperto

  • Sono stati testati solo l'arabo levantino e quello del Golfo. L'egiziano e gli altri dialetti non sono coperti.
  • Quando troveremo una terza e una quarta registrazione fedele al dialetto, la classifica andrà rifatta.
  • I due spezzoni sono un intervento pubblico e un'intervista mediatica, non interviste di ricerca.

La nostra pagina sulla trascrizione in arabo

Di Zeyu Si