ChatGPT accetta ormai ufficialmente i file audio nelle sue conversazioni. Riunioni, interviste o lezioni possono essere trascritti, riassunti o trasformati in appunti strutturati. È poi possibile porre domande sul contenuto come si farebbe con un documento. La funzione è per il momento riservata agli abbonamenti a pagamento e agli spazi di lavoro, Enterprise incluso. L’offerta gratuita, nisba. OpenAI avverte inoltre che la sua disponibilità può variare in base al Paese, del modello utilizzato, della versione dell’applicazione e delle impostazioni del workspace.
La trascrizione non è tuttavia una novità per OpenAI. Whisper e poi i modelli GPT-4o Transcribe permettevano già agli sviluppatori di effettuare questo lavoro tramite l’API. Ciò che cambia qui è soprattutto l’utilizzo: basta caricare il proprio file su ChatGPT.
ChatGPT ora trascrive i file audio
ChatGPT accetta in particolare i formati MP3, WAV, FLAC, AAC, M4A e OGG, fino a 512 MB per file. Ciò rappresenta circa nove ore in MP3 a 128 kbit/s, contro una cinquantina di minuti per un WAV stereo 16 bit/44,1 kHz non compresso. Ma 512 MB è un limite di invio, non una garanzia di trascrizione. OpenAI indica che le registrazioni lunghe possono essere suddivise in più sezioni quando Data Analysis è disponibile e precisa che i file particolarmente lunghi possono scadere prima della fine della loro elaborazione. La qualità può inoltre variare a seconda della lingua.
Le prime prove fatte da chi ha avuto accesso alla funzione suggeriscono però che il caricamento di un file audio non garantisca necessariamente una trascrizione immediata. Con una registrazione MP3 di circa un’ora e mezza, per esempio, ChatGPT può riconoscere correttamente il file e indicarne la durata senza riuscire poi a completare l’elaborazione. In alcuni casi può anche suggerire di affidarsi a un servizio esterno. Le cose sembrano andare meglio con file più brevi, anche se non sempre senza intoppi.
15 minuti di audio? ChatGPT può comunque perdere metà dell’intervista
Con un’intervista di 15 minuti e più interlocutori, ChatGPT ha chiesto di dividere la registrazione in due file. Dopo il nuovo caricamento, l’assistente ha generato una trascrizione indicata come completa, che però conteneva soltanto una delle due parti.
Per arrivare al risultato corretto è stato quindi necessario segnalare il problema, chiedere a ChatGPT di controllare il materiale elaborato e correggere una prima interpretazione errata. Solo dopo un ulteriore passaggio le due parti sono state riportate nell’ordine corretto, anche se senza indicazioni temporali precise sugli ultimi scambi.
Il risultato è quindi utilizzabile, ma il procedimento può richiedere più interventi del previsto. Chi decide di affidare a ChatGPT la trascrizione di una registrazione dovrebbe quindi mettere in conto qualche verifica, soprattutto con file lunghi o conversazioni con più interlocutori.
Pratico, ma certamente da non usare a occhi chiusi
OpenAI riconosce che le trascrizioni possono contenere errori e che l’identificazione degli interlocutori può anch’essa essere poco affidabile. Il fatto è che bisogna anche assicurarsi che l’intero contenuto della registrazione sia stato realmente elaborato.
Per quanto riguarda poi i contenuti sensibili, sugli account personali, le nuove conversazioni possono servire a migliorare i modelli se l’opzione “Migliora il modello per tutti” resta attivata. Può essere disattivata nei controlli dei dati. Per impostazione predefinita, OpenAI non addestra invece i propri modelli sui contenuti degli spazi Business, Enterprise ed Edu.
Poter caricare un MP3 e chiedere immediatamente una trascrizione, un riassunto o una ricerca nel suo contenuto è una funzione molto pratica e sicuramente migliorerà con il tempo.