Vai al contenuto principale

Gli errori di trascrizione più pericolosi si leggono benissimo

· Zeyu Si

In questa pagina

Un'intervista in norvegese, audio pulito. La persona intervistata sta dicendo di non aver tradito il proprio partner. Nella trascrizione di un motore dice invece di aver scelto di tradirlo.

La frase è grammaticalmente corretta. Nessun refuso. Nel contesto non stona nemmeno. Chi legge non ha alcun motivo per fermarsi.

Una negazione ribaltata è l'errore peggiore che possa avere la trascrizione di un'intervista

Quando una parola è scritta male, di solito chi legge se ne accorge. Quando il significato è ribaltato, no.

Il caso norvegese non è stato isolato. In seguito abbiamo fatto passare altri cinque spezzoni in norvegese attraverso Gemini e Qwen. Entrambi hanno prodotto lo stesso tipo di errore su passaggi chiari.

Succede anche in inglese. "You're still not a cop" è diventato "still a cop" in entrambi i modelli vocali di Qwen. Il "not" era semplicemente sparito.

Abbiamo provato a dare istruzioni dirette al modello: mantieni ogni negazione esattamente come è stata pronunciata, segnala tutto ciò che non riesci a sentire, non completare nulla. Non è cambiato niente. Il "not" spariva comunque.

Un voto a maggioranza non vi salverà

La soluzione ovvia è far girare più motori e scegliere la versione della maggioranza.

In cinque lingue (russo, coreano, ucraino, norvegese e spagnolo) abbiamo trovato punti in cui più motori hanno commesso lo stesso identico errore e la versione corretta era in minoranza. In quattro di questi casi l'errore era una negazione o un significato ribaltato. Nel caso norvegese cinque motori l'hanno ribaltata e solo uno l'ha trascritta giusta. Mettetela ai voti e vince la risposta sbagliata.

Il motivo è che un solo tratto di audio poco chiaro può portare più motori a "sentire" la stessa cosa sbagliata. I loro errori non sono indipendenti.

Per questo la nostra regola è: dove c'è di mezzo una negazione o un significato ribaltato, l'accordo tra i motori non conta nulla. Servono prove concrete, come la logica delle frasi circostanti o chi parla che ribadisce il concetto poco dopo. Se mancano, il punto viene segnalato perché una persona lo ascolti. Non prendiamo quella decisione al posto di chi legge.

Gli errori scorrevoli sono più difficili da scovare di quelli evidenti

Le negazioni ribaltate sono un tipo di errore. Ce n'è uno più sottile.

Abbiamo costruito una registrazione di prova: una conversazione in spagnolo con una riga in cinese inserita a metà, "你是谁?" ("Chi sei?"). Un motore non ha trascritto il cinese. L'ha tradotto, scrivendo "¿Quién eres?". L'intera trascrizione non conteneva una sola parola di cinese e si leggeva benissimo. Se non parlate cinese e non avete ascoltato l'audio, non sapreste mai che lì era stata parlata un'altra lingua.

Ciò che questi errori hanno in comune è che la trascrizione sembra del tutto a posto. Leggendo non li trovate. Qualcuno deve dirvi quale secondo andare ad ascoltare.

Uno strumento di trascrizione dovrebbe dirvi dove non è sicuro

Quindi gli strumenti di trascrizione che le persone usano davvero vi dicono "su questo pezzo non sono sicuro"? A settembre 2026 ne abbiamo esaminati 15 tra i più diffusi: centri assistenza, documentazione di prodotto, documentazione delle API e changelog.

Tre lo mostrano nell'editor:

  • Sonix ha una mappa di calore attivabile che colora ogni parola in base alla sicurezza del motore. Più chiara significa meno sicura. Sonix stessa precisa che una parola chiara "non è necessariamente un errore".
  • Rev ha un interruttore nell'editor che evidenzia in grigio le parole che il suo motore ha segnalato come possibilmente sbagliate.
  • Happy Scribe mostra in rosso le parole a bassa confidenza. La nostra fonte è un articolo di assistenza del 2023; non abbiamo verificato l'interfaccia attuale.

Solo nelle API o nelle esportazioni: Amberscript può includere un punteggio di confidenza per parola nei file esportati; per l'evidenziazione nell'editor abbiamo trovato solo affermazioni di terzi. Per TurboScribe, sono solo articoli di terzi a dire che evidenzia in giallo le parole a bassa confidenza, e non siamo riusciti a caricare il suo sito per verificarlo.

In 10 non abbiamo trovato nessuna funzione del genere: Transkriptor, Otter.ai, Fireflies.ai, Notta, Noota, Trint, Descript, Riverside, Dovetail e transcribe.com.

Non averla trovata non significa che non esista. Parte della documentazione delle API sta dietro un login o si carica tramite script, e non siamo riusciti a leggerla tutta. Se usate uno di questi strumenti e la funzione c'è, fatecelo sapere e correggeremo.

Un motore che si dà il voto da solo non equivale a motori in disaccordo

I tre strumenti che hanno questa funzione segnalano tutti la stessa cosa: il punteggio che un singolo motore assegna alla propria sicurezza.

È davvero utile, con un punto cieco. Se un motore sente male qualcosa con sicurezza, il suo stesso punteggio non farà scattare alcun allarme.

Il nostro approccio è far trascrivere lo stesso audio a più motori e segnalare i punti in cui non concordano, insieme a nomi, aziende e termini tecnici, che sono dove gli errori si concentrano. Ogni segnalazione ha un timestamp, e con un clic si riproduce quel secondo. Solo quando ogni segnalazione è stata gestita il prodotto dice che la trascrizione è pronta per l'esportazione.

Nemmeno così si scova tutto. Quando più motori sbagliano lo stesso punto esattamente nello stesso modo, "concordano", e non viene segnalato nulla. Per questo controlliamo negazioni e significati ribaltati anche quando tutti i motori dicono la stessa cosa.

Quello che possiamo promettere è che non dovrete riascoltare l'intera registrazione. Solo i punti su cui vale la pena dubitare.

Di Zeyu Si