Stamattina, per chi si è messo al lavoro con ChatGPT, c’è stata la piacevole sorpresa di un aggiornamento del sistema. OpenAI ha introdotto il nuovo ChatGPT4o, dove “o” sta per “omni” – dal latino “omnis”, “tutto” – che fa riferimento alla multimodalità di GPT-4o.
Questo avanzamento promette di trasformare radicalmente il modo in cui interagiamo con i nostri dispositivi, portando l’usabilità e la versatilità a livelli senza precedenti.
Un modello multimodale all’avanguardia
GPT-4o rappresenta un significativo passo avanti verso un’interazione uomo-computer più naturale e fluida. A differenza dei modelli precedenti, GPT-4o può accettare qualsiasi combinazione di testo, audio e immagine come input e generare output in qualsiasi di queste forme. Questo modello end-to-end è stato addestrato su un’unica rete neurale, permettendogli di elaborare input e output in modo integrato e sinergico.
Prestazioni e Velocità
Una delle caratteristiche più impressionanti di GPT-4o è la sua velocità. Con un tempo di risposta agli input audio di soli 232 millisecondi, molto vicino al tempo di risposta umano, e prestazioni migliorate su testi in lingue diverse dall’inglese, GPT-4o è significativamente più veloce e conveniente rispetto ai suoi predecessori. Inoltre, è due volte più veloce, costa la metà e offre limiti di velocità cinque volte superiori rispetto a GPT-4 Turbo.
Funzionalità Avanzate
Durante l’evento di presentazione, OpenAI ha mostrato numerose demo che evidenziano le nuove funzionalità di GPT-4o. Oltre a dialogare in maniera naturale, il modello può cambiare tono di voce su richiesta, eseguire calcoli scritti visionati attraverso la fotocamera dello smartphone e tradurre conversazioni in tempo reale tra due lingue diverse. Queste capacità lo rendono un assistente virtuale estremamente versatile, capace di rispondere a comandi vocali, analizzare dati e creare grafici, e interagire con le foto scattate dagli utenti.
Accessibilità e Sicurezza
Una delle notizie più entusiasmanti è che GPT-4o sarà gratuito per tutti gli utenti di ChatGPT, con gli abbonati che godranno di limiti di capacità fino a cinque volte superiori. La sicurezza è stata una priorità nello sviluppo di GPT-4o, con misure integrate per filtrare i dati di addestramento e perfezionare il comportamento del modello. OpenAI ha inoltre sottoposto GPT-4o a rigorosi test di sicurezza con un team rosso esterno di esperti in vari campi, per garantire che i rischi siano mitigati.
Webinar: L’architettura della fiducia
Monetizzare la musica AI
La voce in Suno
Come usare Suno
Torna a fare la tua musica
Grok AI
Moneyball Infomarketing
Avatar da sei cifre
Siti Web per Consulenti
Autorità semantica
Video
Sembra che sia possibile anche caricare un video su ChatGpt e chiedere all’intelligenza artificiale di descrivere le immagini o riassumere il loro contenuto. Ma non ho ancora testato personalmente questa funzione. C’è chi dice di averlo testato, caricando una breve clip. E sembra di capire che l’analisi dell’IA avvenga attraverso l’estrazione dal video di una serie di fotogrammi. Sulla base di tali frame, ChatGpt procede con la descrizione del contenuto della clip.
Disponibilità e Prospettive Future
Le funzionalità di GPT-4o sono già in fase di implementazione in ChatGPT, disponibili sia per gli utenti gratuiti che per quelli Plus. Gli sviluppatori possono accedere al modello tramite API, sfruttando la sua velocità e costo ridotto. Nei prossimi mesi, OpenAI prevede di lanciare il supporto per le nuove funzionalità audio e video a un gruppo selezionato di partner fidati, ampliando ulteriormente le capacità di GPT-4o.


0 commenti