OpenAI ha presentato il 29 luglio 2026 due nuovi modelli di trascrizione, GPT-Transcribe e GPT-Live-Transcribe, che segnano un salto netto rispetto allo storico Whisper. Il dato chiave: un tasso di errore per parola (WER) dell'8,98%, contro il 15,21% di Whisper-1 — un miglioramento del 41%. Per chi produce sottotitoli, verbali di riunione o trascrizioni di interviste, significa molte meno correzioni a mano.
Cosa cambia rispetto a Whisper
Il primo modello, GPT-Transcribe, è pensato per la trascrizione di file audio già registrati (modalità batch); il secondo, GPT-Live-Transcribe, è ottimizzato per lo streaming in tempo reale, utile per sottotitoli dal vivo e assistenti vocali. Oltre al minor numero di errori in generale, la differenza più utile è il prompting sensibile al contesto: si possono fornire al modello parole chiave, nomi propri e indicazioni di lingua, e questo migliora in modo misurabile l'accuratezza proprio sui punti dove Whisper falliva di più — nomi di persone e aziende, numeri, termini tecnici e sigle.
Quanto costano
I prezzi sono pensati per rendere sostenibile la trascrizione anche su grandi volumi: circa 0,27 dollari per ora di audio in modalità batch e 1,02 dollari per ora in streaming. Numeri che, per un archivio di podcast o per una redazione che trascrive ore di interviste ogni settimana, cambiano l'economia del lavoro.
Come usarli via API: esempio pronto
L'accesso avviene tramite le API di OpenAI, con un'interfaccia molto simile a quella di Whisper. Per trascrivere un file già registrato bastano poche righe di Python. Prima si installa la libreria e si imposta la chiave:
pip install openai
export OPENAI_API_KEY="la-tua-chiave"
Poi si invia il file al modello, sfruttando il prompt per suggerire i termini difficili:
from openai import OpenAI
client = OpenAI()
with open("intervista.mp3", "rb") as audio:
testo = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio,
language="it",
prompt="Nomi propri: Andrea Bertolotti, AI Notizie, Berto Production. Sigle: IA, GPAI, AI Act."
)
print(testo.text)
Il risultato atteso è la trascrizione completa dell'audio, con i nomi e le sigle indicati scritti correttamente invece che storpiati foneticamente. Per i sottotitoli dal vivo si usa invece gpt-live-transcribe in modalità streaming, ricevendo il testo a blocchi man mano che l'audio arriva.
Dove tornano utili: dal podcast all'accessibilità
I casi d'uso concreti sono molti. Per un podcaster, avere trascrizioni accurate significa generare in automatico note dell'episodio, capitoli e testi per il SEO. Per una redazione giornalistica, poter trascrivere interviste con nomi e sigle corretti taglia ore di lavoro di revisione. Sul fronte dell'accessibilità, i sottotitoli in tempo reale prodotti da GPT-Live-Transcribe aprono contenuti video e riunioni a chi ha difficoltà uditive, con una qualità che fino a poco fa richiedeva stenotipisti professionisti. E chi costruisce assistenti vocali o strumenti di dettatura trova nel modello in streaming la base per esperienze fluide, in cui il parlato diventa testo quasi istantaneamente.
Il vero salto, rispetto a Whisper, sta nella combinazione tra minor tasso di errore e prompting contestuale: indicare in anticipo il glossario del proprio dominio — nomi dei relatori, prodotti, termini tecnici del settore — evita gran parte degli errori più fastidiosi, quelli sui nomi propri, che nelle trascrizioni automatiche costano sempre la revisione più lunga.
Quando conviene e quando restare su Whisper locale
I nuovi modelli hanno senso quando l'accuratezza conta davvero — verbali ufficiali, sottotitoli professionali, trascrizioni mediche o legali — e quando serve il tempo reale. Restano però due casi in cui la vecchia strada ha ancora senso: chi ha vincoli stretti di privacy e non vuole inviare audio a un servizio esterno può continuare a usare Whisper in locale, gratuito e senza far uscire i dati dal proprio computer; e chi trascrive volumi enormi con budget minimo può trovare più conveniente l'open source. Per tutti gli altri, il rapporto tra qualità, prezzo e prompting mirato rende GPT-Transcribe la scelta più comoda oggi disponibile. Dati e prezzi provengono dalle comunicazioni di OpenAI e dal riepilogo di ThursdAI.




