La notizia in sintesi
- OpenAI ha lanciato GPT-Live per rinnovare la modalità vocale di ChatGPT.
- Il nuovo sistema conversa in full-duplex, ascoltando e parlando insieme.
- Arrivano card visive, traduzione in tempo reale e maggiori controlli di sicurezza.
- Il rilascio parte su iOS, Android e web, con piani diversi.
(Riassunto generato con AI)
OpenAI rinnova ChatGPT Voice
OpenAI ha avviato il rollout di GPT-Live, nuova generazione della modalità vocale di ChatGPT destinata a sostituire la precedente Advanced Voice Mode, con distribuzione su iOS, Android e web nelle ultime ore. Il cuore della novità è un’interazione più naturale tra utente e intelligenza artificiale: il sistema ascolta e parla insieme, riducendo latenze, interruzioni fuori tempo e perdita di informazioni tipiche dell’architettura precedente.
L’obiettivo dichiarato è trasformare la voce in un’interfaccia più continua, utile non solo per domande e risposte, ma anche per traduzione in tempo reale, ricerche e attività assistite. Secondo quanto riportato dalle fonti, GPT-Live-1 diventa il modello di riferimento per gli abbonati ai piani a pagamento, mentre una variante mini viene assegnata agli utenti gratuiti.
La mossa arriva in una fase di forte accelerazione per l’azienda guidata da Sam Altman, con la voce che diventa un tassello strategico nell’evoluzione dei servizi conversazionali.
https://x.com/OpenAI/status/2074907025537224840?ref_src=twsrc%5Etfw
Come cambia la conversazione vocale
Il salto tecnico più rilevante riguarda il superamento del vecchio schema in tre passaggi: trascrizione vocale, generazione testuale della risposta e successiva sintesi audio. Quel modello, usato dalla prima ChatGPT Voice, obbligava il sistema ad attendere la fine della frase dell’utente, con dialoghi a scatti e risposte meno fluide. GPT-Live adotta invece un’architettura full-duplex, o duplex, che elabora l’audio in ingresso e la risposta in uscita in parallelo.
In pratica, l’utente può interrompere l’assistente mentre parla, chiedergli di rallentare, oppure farlo tacere e riprendere la conversazione dopo. Il modello può anche inserire brevi segnali di ascolto, come conferme verbali, e gestire meglio i rumori di sottofondo. Le fonti concordano inoltre su una seconda novità chiave: quando serve ragionamento più avanzato, ricerca web o capacità più agentiche, GPT-Live può delegare il compito in background ad altri modelli OpenAI, incluso GPT-5.5, senza spezzare il flusso della conversazione.
Restano disponibili il supporto a testo, immagini e file caricati, oltre a risposte visuali tramite card per meteo, sport e quotazioni. Si può scegliere anche il livello di ragionamento, la lingua e nove voci. Non è invece ancora supportata la condivisione di schermo e video in ChatGPT Voice.
Sicurezza, minori e impatto futuro
OpenAI afferma di aver rafforzato l’addestramento alla sicurezza specifico per la voce e introdotto protezioni in tempo reale: se emergono contenuti pericolosi, il sistema può proporre una risposta più sicura, mostrare messaggi aggiuntivi o interrompere del tutto la conversazione. I controlli parentali consentono ai genitori di disattivare ChatGPT Voice per i minori, mentre in alcuni casi legati all’autolesionismo può essere attivato un avviso automatico.
Un altro punto sensibile riguarda le impersonificazioni: il sistema usa voci preimpostate e blocca risposte con voci di persone reali. Sul piano strategico, il segnale è chiaro: per OpenAI la voce non è più una funzione accessoria, ma una delle interfacce principali con cui usare l’IA nei prossimi anni.
FAQ
Cos’è GPT-Live di ChatGPT?
Sì, è la nuova generazione della modalità vocale di ChatGPT che sostituisce la precedente Advanced Voice Mode con conversazioni più naturali e continue.
Su quali piattaforme arriva GPT-Live?
Sì, il rollout parte su iOS, Android e web, con distribuzione scaglionata nel corso di alcuni giorni secondo le fonti.
Cosa cambia rispetto a ChatGPT Voice precedente?
Sì, cambia l’architettura: ora il modello ascolta e parla insieme, riducendo attese, errori sulle pause e rigidità del dialogo turn-based.
Quali funzioni aggiuntive offre la nuova voce?
Sì, supporta card visuali, traduzione in tempo reale, caricamento di immagini e file, scelta del ragionamento, della lingua e di nove voci.
Da quali fonti è verificato questo articolo?
Sì, il contenuto nasce da verifica incrociata della nostra Redazione su Hardware Upgrade, MisterGadget.Tech e punto-informatico.it, analizzati congiuntamente e in profondità.




