Zuckerberg parla di Muse: esplosione degli agenti AI, tre scommesse principali convergono — Metaverso, occhiali intelligenti e modelli di grandi dimensioni
Tre anni fa, Mark Zuckerberg, CEO di Meta, dichiarò nel podcast di Joe Rogan che un giorno le persone avrebbero indossato occhiali e gli agenti AI sarebbero emersi di conseguenza. Oggi questo scenario potrebbe concretizzarsi.
L’agente AI personale di Meta — Muse — ha raggiunto milioni di utenti entro due settimane dal lancio. Zuckerberg ha affermato in un’intervista del 25 settembre: «Ci imbattiamo in situazioni simili solo ogni pochi anni». Ha definito la risposta iniziale a Muse «un fuoricampo fin dal primo colpo», un evento raro nella storia dei prodotti di Meta.
Contemporaneamente, ha annunciato che Muse sarà integrato nell’intera linea di occhiali intelligenti Ray-Ban, permettendo agli utenti di attivare il proprio agente AI personale con una parola chiave personalizzata, invece di dire «Hey Meta».
Il metaverso, gli occhiali intelligenti e i modelli di grandi dimensioni, finora considerati tre scommesse indipendenti dal punto di vista esterno, stanno ora accelerando la loro convergenza a livello prodotto all’interno di Meta.
In questa intervista, Zuckerberg ha ammesso che il fallimento di Llama 4 è stato «il momento più spaventoso» e ha rivelato che Meta sta costruendo un cluster di addestramento da 5 gigawatt, convinta che una potenza computazionale sufficientemente elevata possa «forzare» l’AGI.

Perché Muse può «fare un fuoricampo fin dal primo colpo»
L’idea iniziale di Muse nacque quando Zuckerberg, insieme ai colleghi Nat e Alex, creò una prima versione casalinga utilizzando strumenti open source.
«Ci siamo resi conto che si trattava di un’esperienza magica», ha detto Zuckerberg. «Se riuscissimo a renderla accessibile a chiunque — senza dover acquistare un Mac Mini o interagire con terminali — diventerebbe qualcosa che miliardi di persone vorrebbero.»
Questa valutazione ha guidato tutta la logica successiva di ricerca e sviluppo: non solo l’addestramento dei modelli, ma lo sviluppo completo del meccanismo «cardiaco» dell’agente, dal modello e dalla struttura fino all’agente stesso — che si sveglia periodicamente, verifica gli obiettivi dell’utente e avanza proattivamente le attività in sospeso.
I dati post-lancio hanno confermato questa valutazione: entro due settimane, milioni di utenti.
IA personale: attenzione all’esecuzione, alla memoria e al «giudizio»
Sulla differenza tra IA personale e IA generale, Zuckerberg ha sintetizzato l’attuale focus competitivo come la trasformazione del modello in un migliore agente.
«La cosa più importante dell’ultimo anno è stata sostanzialmente la programmazione dell’agente», ha affermato. La capacità di programmazione è cruciale perché, anche se gli utenti non scrivono codice direttamente, «il vostro Muse scriverà codice per voi in background per eseguire vari compiti.»
Tuttavia, ritiene che gli agenti personali non debbano possedere soltanto capacità di codifica o di esecuzione di compiti, ma anche comprendere i confini della privacy e i contesti sociali.
Zuckerberg ha fatto un esempio: quando un utente chiede a Muse di prenotare un ristorante, l’agente potrebbe conoscere le allergie o la gravidanza dell’utente, ma ciò non significa che tali informazioni debbano essere automaticamente divulgate. «Vorreste che completasse il compito rivelando il meno possibile.»
Ha affermato che questa capacità rientra nelle «competenze sociali di base o nel buon senso» tipici degli esseri umani, ma molte aziende non l’hanno inclusa nelle funzionalità dei loro modelli se si limitano ad addestrare Agenti per la programmazione.
«Stiamo addestrando l’intero modello, non ci limitiamo a prendere un modello preesistente di qualcun altro e costruirci intorno un framework e un Agent», ha dichiarato Zuckerberg. Meta ha inoltre integrato a livello prodotto funzionalità come memoria, tracciamento dei compiti, animazioni di personaggi virtuali e interazione vocale in tempo reale.
Sul fronte della personalizzazione, ha spiegato che Meta non ritiene che l’IA debba avere una sola personalità fissa. «Molti laboratori stanno studiando come regolare la personalità sullo stato corretto, ma io non ho mai creduto che esista una sola risposta giusta per la personalità.»
Ha precisato che Muse consente agli utenti di modificare avatar, voce e personalità di base, con l’obiettivo progettuale del modello rivolto a un’elevata controllabilità. «Puoi definire come vuoi interagire con esso: è fondamentale per un Agent personale.»
Ogni Agent ha il proprio «computer»
Una delle infrastrutture fondamentali che differenzia Muse da altri prodotti IA è che Meta ha dotato ogni Agent di una macchina virtuale sicura (Secure VM).
Zuckerberg ha spiegato perché ciò sia necessario:
Il tuo Agent conoscerà molti dati sensibili su di te. Non riteniamo che tali informazioni debbano essere mescolate in un unico pool con i dati di tutti gli altri.
Ha paragonato la Secure VM di Muse a «un computer che appartiene solo a te, sotto la tua scrivania»: i dati dell’utente sono crittografati e archiviati, mentre le credenziali sensibili, come le password, sono gestite tramite un modulo di sicurezza indipendente, al quale l’Agent non può accedere direttamente.
Su questa base, Meta ha progettato anche un Agent di sicurezza chiamato «Sentinel», specificamente pensato per monitorare i flussi di dati in entrata e in uscita da Muse, che intercetta direttamente e richiede l’autorizzazione dell’utente in caso di anomalie o operazioni ad alto rischio.
Metaverso, occhiali intelligenti e Agent: tre percorsi in convergenza
Nell’intervista Zuckerberg ha rivelato che Muse sarà pienamente integrato nella serie di occhiali smart Ray-Ban, migliorando i metodi di interazione esistenti.
Attualmente gli occhiali offrono un’esperienza di «conversazione monouso»: dici qualcosa, ottieni una risposta e basta. Dopo l’integrazione con Muse, diventano il punto d’ingresso front-end per l’Agent: quando l’utente parla, Muse sul backend continua a operare nella macchina virtuale sicura, completando i compiti e fornendo feedback.
Sulla roadmap prodotto degli occhiali, ha descritto una chiara gerarchia hardware:
Occhiali audio puri, senza fotocamere: già dotati di Muse, in grado di gestire chiamate, musica e compiti vocali
Meta Ray-Ban con piccolo display: già lanciati, forniscono un feedback visivo basilare
Prototipo AR olografico a campo visivo completo: già lanciato, definito da Zuckerberg «molto entusiasmante»
Ha affermato che l’investimento a lungo termine di Meta negli occhiali posiziona favorevolmente l’azienda una volta maturati gli Agent IA. Meta sta integrando Muse e ulteriori funzionalità IA nei suoi occhiali, mentre la tecnologia del metaverso, che in passato puntava sulla «presenza», continua a progredire, anche se attualmente maggiori risorse sono dedicate a Muse e alle funzioni IA degli occhiali intelligenti.
Sugli avatar virtuali, Zuckerberg ha ricordato che in passato Meta necessitava di attrezzature per ambienti di stanza intera, scansioni multiangolari e ambienti GPU enterprise per generare avatar realistici di alta qualità; oggi, invece, l’utente può completare la configurazione con poche foto e le relative funzionalità possono girare su un paio di occhiali VR.
Guardando al 2030, Zuckerberg ha ribadito che la visione centrale del metaverso è sempre stata quella di fondere mondo fisico e digitale. Ha fatto l’esempio che, in futuro, le persone potranno partecipare ad attività con amici collegati tramite immagini olografiche; negli scenari lavorativi, umani e più Agent potranno partecipare insieme a chat di gruppo o riunioni, con gli Agent che appariranno in forma olografica o in altre forme incarnate.
«Il momento più terrificante»: L’errore di Llama 4
Non tutti gli investimenti sono andati a buon fine. Zuckerberg ha raramente parlato direttamente del fallimento di Llama 4 nell’intervista.
Dopo Llama 4, è stato il momento più terrificante… Pensavo fossimo sulla strada giusta, ma non lo eravamo. È stata una sorpresa negativa davvero significativa.
Ha attribuito il problema a un errore fondamentale nella struttura del team:
Ho organizzato il team nello stesso modo del sistema di raccomandazione Instagram o del sistema pubblicitario: centinaia o migliaia di persone che lavorano in parallelo. Ma addestrare un modello linguistico richiede un piccolo team che collabori strettamente, trattandolo come un progetto scientifico collettivo. Ogni ruolo è estremamente prezioso.
Di conseguenza, Meta ha subito una riorganizzazione completa, assumendo ampiamente i migliori talenti del settore e istituendo il Meta Super Intelligence Lab (MSL). Zuckerberg ha dichiarato che una nuova generazione di modelli sta per essere rilasciata, ma non sarà annunciata alla conferenza Connect.
Percorso della potenza di calcolo: AGI per forza bruta, progetto da 5 gigawatt in costruzione
Parlando del percorso tecnologico verso l’AGI, Zuckerberg ha espresso un giudizio diretto.
Non sono certo quali innovazioni architettonali fondamentali siano ancora necessarie… Credo che conosciamo grosso modo la formula. Se si riesce a costruire un supercomputer sufficientemente grande, si può arrivare all’obiettivo per forza bruta.
Attualmente, il percorso di espansione della potenza di calcolo di Meta: un cluster da oltre 1 gigawatt in Ohio è già sostanzialmente operativo per l’addestramento della prossima generazione di modelli; un cluster da 5 gigawatt in Louisiana è in costruzione.
Ha affermato: «Quando si dispone di cluster da diversi gigawatt per l’addestramento, si ottiene essenzialmente qualcosa di vicino all’AGI o addirittura alla superintelligenza».
Tuttavia, ha aggiunto che l’attuale percorso basato sulla potenza di calcolo non significa che la ricerca architettonica sia poco importante—
Il cervello umano consuma solo circa 10 watt, mentre i nostri sistemi potrebbero essere un milione di volte meno efficienti. Solo combinando potenza di calcolo su larga scala e innovazioni architettoniche potremo davvero guidare il settore.
Allineamento: non un peso, ma un problema che i prodotti devono risolvere
L’approccio di Zuckerberg alla sicurezza dell’IA è molto pragmatico: non la vede come una pressione regolamentare, ma come prerequisito per il successo del prodotto.
Se chiedete a Muse di fare qualcosa e fa esattamente il contrario, chi lo userebbe ancora? Dobbiamo garantire che il modello non solo comprenda le vostre istruzioni specifiche, ma anche le vostre intenzioni e i vostri valori.
«Se Muse deve raggiungere un miliardo di utenti, dobbiamo risolvere il problema dell’allineamento o compiere progressi significativi in tal senso», ha detto.
Riguardo ai limiti di sicurezza durante il processo di addestramento, ha usato un’analogia: «È come se i genitori ponessero regole ai figli: se “risolve” un problema di programmazione modificando le configurazioni di sistema, voglio dirgli: no, voglio che impari il metodo di risoluzione, non che trovi una scorciatoia per aggirarlo».

L’intervista integrale è la seguente: >
Grandi scommesse
Conduttore: Questo è qualcosa che miliardi di persone vorranno usare. Che sensazione ti dà costruirlo? L'«immortalità» è una possibilità? Bene, se mi porti nella tua mente e avanzi velocemente al 2030, com’è quella realtà?
Questo è Mark Zuckerberg. Ventidue anni fa ha creato un social network che ha collegato miliardi di persone e cambiato per sempre il mondo. Ora ha deciso di costruire qualcosa di ancora più ambizioso, puntando con decisione su metaverso, occhiali intelligenti e intelligenza artificiale. Per anni gli scettici hanno considerato queste tre aree come scommesse separate e improbabili, ma hanno trascurato la visione d’insieme: oggi queste scommesse stanno convergendo per dare vita a una nuova superintelligenza.
Oggi presenteremo tutto questo e le porrò domande che non ti hanno mai fatto prima, ascoltando la tua visione del futuro, per permetterti di anticipare i tempi e costruire la prossima grande innovazione.
Conduttore: Grazie infinite per essere venuto in trasmissione.
Mark: Grazie, sono felice di essere qui.
Conduttore: Per questa conversazione ho visto tutti gli interviste che hai rilasciato.
Mark: Wow, ne ho viste meno io stesso.
Conduttore: È stato divertente e molto gratificante. Due cose mi hanno colpito profondamente: primo, il tuo amore per il «costruire» — mi sembri uno dei migliori creatori; secondo, la tua capacità di fare «grandi scommesse» — osi puntare grosso. Ho l’impressione che questa settimana tutte queste scommesse stiano convergendo, quindi partiamo da qui.
Mark: Ok. Facciamo queste cose da molto tempo. Per quanto riguarda l’IA, come azienda ci lavoriamo fin quasi dall’inizio: la prima versione del feed notizie era, in un certo senso, un prodotto di machine learning. Poi, circa 15 anni fa, abbiamo fondato il laboratorio di ricerca sull’IA.
Ma ora siamo entrati in una nuova fase: circa un anno fa abbiamo lanciato il Meta Superintelligence Lab. Si tratta di un ampio ripensamento della ricerca, con l’ingresso di molti talenti eccellenti provenienti da tutta l’industria — cosa entusiasmante. Attualmente vediamo i modelli migliorare costantemente, e la prossima generazione sta per essere rilasciata, anche se non sarà annunciata alla conferenza Connect. Inoltre, abbiamo l’assistente personale Muse, che finora ha ricevuto feedback molto positivi.
Nel costruire queste tecnologie, non sai mai con certezza quale sarà il risultato finale. A noi piace molto. All’inizio di quest’anno ero a casa e montavo Open Claw a modo mio, provando a capire come funziona e come trasformarlo in un’esperienza magica accessibile a chiunque.
In sostanza, quando io, Nat e Alex ci siamo seduti insieme e abbiamo capito che si trattava di un’esperienza magica, e che potevamo trasformarla in una versione plug-and-play utilizzabile da chiunque — anche da chi non capisce di tecnologia, non vuole configurare un Mac Mini da solo, non vuole usare il terminale né risolvere errori — ho pensato che sarebbe stata qualcosa che miliardi di persone avrebbero voluto usare.
Da allora abbiamo lavorato verso questo obiettivo: ottimizzando specificamente i modelli per tale scopo, non solo costruendo l’assistente e il suo framework operativo, ma anche sviluppando la tecnologia che fornisce a ogni assistente un ambiente computazionale indipendente — a tal fine abbiamo creato un’intera serie di macchine virtuali sicure Muse.
Internamente lo sentivamo speciale, e il team interno ne era entusiasta, ma non si sa mai come reagiranno gli utenti dopo il lancio. Talvolta c’è un successo strepitoso fin dal primo momento, ma di solito si riceve un feedback positivo e si devono apportare alcuni aggiustamenti per far sì che il prodotto «funzioni perfettamente». Questa volta, però, ha funzionato subito. Vedere tutto ciò accadere è davvero emozionante: già dopo due settimane gli utenti hanno raggiunto i milioni, cosa estremamente rara. Ci capita così solo ogni pochi anni, ma questo è certamente uno dei momenti più gratificanti per una startup.
Conduttore: La tua capacità di restare in gioco e continuare a provare mi impressiona molto. E aver centrato così tanti obiettivi è davvero straordinario. Tre anni fa hai fatto un’intervista con Joe Rogan, dove hai accennato che un giorno avresti potuto indossare occhiali e avere l’assistente IA davanti agli occhi. Dunque, secondo me Muse ha già una rappresentazione fisica, cosa molto intelligente, perché quella sensazione è inevitabile.
Mark: Credo che renda semplicemente l’IA più amichevole e simpatica. Troppi descrivono l’IA come qualcosa di spaventoso, ma dovrebbe essere solo utile e divertente. Quella rappresentazione fisica — un designer l’ha creata all’inizio del progetto, e per qualche motivo volevano sempre modificarla, ma la prima versione era la migliore. Più tardi qualcuno ha detto: «Deve essere blu perché è Meta». Io ho risposto: «No, quella rappresentazione è perfetta; l’avete azzeccata al primo tentativo». Ed è proprio così: è divertente.
Qual è la differenza tra IA personale e IA generale?
Conduttore: Ottimi dettagli. Se vuoi che il modello eccella in ambiti personali, non solo come modello di intelligenza generale, in che modo cambierebbe l’approccio formativo?
Mark: Credo che al momento il punto centrale sia rendere il modello un eccellente «agente». Negli ultimi dodici mesi la tendenza principale è stata quella degli agenti programmabili, che racchiude due concetti fondamentali: competenza nella programmazione e capacità generale di essere un ottimo agente.
La nostra strategia è privilegiare l’ottimizzazione dell’agente stesso, anziché specializzarci nelle capacità di programmazione.
Le capacità di programmazione sono importanti perché, anche se gli utenti non ritengono di scrivere codice, Muse genera costantemente codice in background per svolgere per voi varie attività. Tuttavia, riteniamo che l’agente debba innanzitutto essere un eccellente agente, e le capacità di programmazione devono servire questo obiettivo.
Inoltre, nello sviluppo di un assistente personale, alcuni aspetti hanno priorità rispetto alla creazione di software aziendale. Ad esempio, se si costruisce uno strumento aziendale per la programmazione, il modello non ha bisogno di alcun concetto di «scala di divulgazione delle informazioni» — ovvero quali dati rivelare e quali no. Per Muse, invece, questo è fondamentale.
Questa capacità va addestrata nel modello, come ogni altra competenza: gli si forniscono molte informazioni e si spera che aiuti a raggiungere i propri obiettivi. Ad esempio, se si chiede di prenotare un ristorante, Muse deve trovare un locale adatto, ma potreste avere allergie o essere in gravidanza, senza volerlo comunicare al ristorante. Muse conoscerà questi dati e dovrà portare a termine il compito rivelando il meno possibile. Si tratta di una competenza specifica, essenzialmente il buon senso sociale di base degli esseri umani.
Le aziende che realizzano esclusivamente agenti per la programmazione, tuttavia, non hanno quasi mai addestrato questa capacità. Noi possiamo farlo perché operiamo in full-stack: non usiamo modelli preesistenti di terzi incapsulandoli in un framework, ma addestriamo interamente il modello da zero, appositamente per queste funzionalità.
Il modello deve certamente possedere un’intelligenza generale ampia, ma anche queste competenze specifiche. Su questa base, si costruisce l’intero assistente e tutti i dettagli correlati: memoria, framework operativo e il suo «battito» — ovvero il risveglio periodico per verificare: «Ecco gli obiettivi che ho compreso su di te; posso fare qualcosa per avanzare?»
Abbiamo anche un team dedicato esclusivamente al perfezionamento degli effetti di animazione in tempo reale della rappresentazione virtuale, poiché non si tratta di una rappresentazione predefinita: potete personalizzare qualsiasi avatar, che poi si muove in modo naturale — fantastico. Stiamo inoltre lanciando la modalità vocale, che consente conversazioni vocali in tempo reale con il vostro assistente sempre al vostro fianco. Credo che tutti questi dettagli derivino dal nostro approccio full-stack: modello e prodotto sono sviluppati in sinergia.
Conduttore: Un altro elemento fondamentale è la macchina virtuale. Può spiegare perché è importante e cosa abilita?
Perché Meta fornisce a ogni assistente AI un computer indipendente?
Mark: Fondamentalmente, affinché un agente possa agire per voi, ha bisogno di uno spazio in cui memorizzare le vostre informazioni. Riteniamo che tali dati non debbano essere mescolati in un pool condiviso insieme a quelli di tutti gli altri.
Potete immaginarlo così: il vostro assistente conoscerà molti dati sensibili su di voi. Molti utenti, all’inizio, utilizzando agenti intelligenti come OpenCloud, configurano autonomamente un Mac Mini a casa. Abbiamo quindi pensato: molte persone non vogliono acquistare né configurare un Mac Mini da sole. Quale esperienza si avvicina di più a questo effetto? La risposta è: basta scaricare un’app, registrarsi e ottenere un computer dedicato esclusivamente al vostro assistente, per elaborare dati, memorizzarli e costruire attorno ad essi un modello sicuro. È come avere un computer sotto la vostra scrivania — persino noi di Meta non possiamo accedervi.
Ad esempio, la macchina virtuale riservata di Muse è una funzionalità in fase di sviluppo, e neppure noi possiamo visualizzarne i contenuti.
Abbiamo inoltre implementato molte altre misure, come l’archiviazione sicura delle credenziali: quando l’assistente deve gestire informazioni sensibili come password, non ne visualizza il contenuto; deve semplicemente «inserire» le credenziali su vostra richiesta per accedere a un servizio, e solo quando lo richiedete esplicitamente. Il sistema è progettato in modo che tali dati non siano liberamente accessibili, poiché incidenti possono sempre verificarsi: qualcuno potrebbe tentare un’intrusione o il sistema potrebbe presentare malfunzionamenti.
È quindi necessario garantire che né l’agente né Meta possano accedere a questi dati. Fornire a ogni assistente un computer indipendente e massimizzare la sicurezza è la base fondamentale di questa tecnologia: dotare Muse delle capacità necessarie per aiutare gli utenti a raggiungere i propri obiettivi, preservando privacy e sicurezza, rendendolo un prodotto di livello mondiale e leader del settore.
Conduttore: Ciò significa dunque che, come WhatsApp, i dati sulla macchina virtuale a cui si connette Muse sono crittografati? Come devono interpretare gli utenti l’effettivo archiviazione dei dati nella macchina virtuale?
Mark: Abbiamo fondamentalmente realizzato due versioni. La macchina virtuale sicura di Muse (Secure VM) include diverse funzionalità per la privacy, tra cui l’intera architettura dell’agente Sentinel da noi sviluppata. Avete un assistente Muse standard che svolge compiti per voi, mentre contemporaneamente opera un agente di sicurezza, chiamato Sentinel, che monitora attentamente i flussi di dati in entrata e in uscita dal vostro Muse.
Se del contenuto esterno cerca di compromettere la sicurezza, Sentinel lo blocca immediatamente per impedirlo. Se ritiene che Muse stia per compiere un’azione che richiede la vostra autorizzazione, ne sovrascrive l’esecuzione attivando un avviso per la conferma umana — ad esempio: «Vuoi che Muse esegua questa azione?»
L’intero sistema, combinato con l’archiviazione sicura delle credenziali e difese multilivello, costituisce la macchina virtuale sicura di Muse.
Stiamo inoltre sviluppando un altro progetto. Nat e io abbiamo reclutato appositamente Moxie Marlinspike — colui che ha collaborato con noi per implementare la crittografia end-to-end su WhatsApp — per progettare la macchina virtuale riservata di Muse (Confidential VM). L’idea centrale è fornirvi una chiave di crittografia dedicata, in aggiunta alla macchina virtuale sicura, in modo che neppure Meta possa accedere ai contenuti interni.
Questa versione è più complessa da implementare, poiché, se Meta non può accedere agli interni della macchina virtuale, il debugging e la garanzia di un funzionamento regolare diventano molto più difficili. Ci abbiamo quindi impiegato del tempo, ma verrà presto lanciata. Questo permetterà di raggiungere gli standard di sicurezza già noti agli utenti di WhatsApp e dei nostri prodotti più protetti.
Ospite: Il vantaggio di fare ciò sta solo nel far sentire le persone psicologicamente più al sicuro, oppure ci sono benefici effettivi?
Mark: Credo che la sicurezza sia importante di per sé. Il nostro obiettivo è avvicinarci all’esperienza di avere un computer locale sotto il proprio tavolo. Cosa offre questo computer locale? Significa che nessuna azienda può accedervi.
Quindi, ammesso che Meta voglia offrirti questo servizio, come possiamo garantirti lo stesso livello di privacy e sicurezza, in modo che nessuna azienda — né Meta, né eventuali attaccanti, né governi locali in paesi dove non ti fidi — possa accedervi? Perché neppure noi possiamo accedervi: non abbiamo alcun diritto di accesso.
Credo che questo sia molto importante ed è una delle ragioni principali per cui le persone si fidano di WhatsApp. La privacy, la sicurezza e la fiducia hanno un valore reale.
Se avrai un assistente che conosce tutto di te — immagino che quasi tutti avremo un tale assistente — tra cinque anni, ognuno avrà un assistente capace di comprendere i tuoi obiettivi e ogni aspetto della tua vita, aiutandoti a portare a termine i compiti. In questo contesto, essere leader di settore in termini di privacy e sicurezza è fondamentale. Volevamo realizzarlo fin dall’inizio.
Come modellare la personalità dell’IA?
Ospite: Hai un punto interessante: hai studiato psicologia all’università.
Mark: Sono stato iscritto solo per poco tempo, due anni, ma credo che ciò abbia influenzato molto ciò che ho costruito in seguito.
Ospite: Quando osserviamo i modelli, diciamo spesso che un certo modello è «molto intelligente». Ma, esattamente come quando scegliamo gli amici, non lo facciamo solo perché sono intelligenti, bensì anche perché apprezziamo la loro energia e il modo in cui interagiscono. Come consideri la modellazione della personalità del modello?
Mark: Credo che il modello ideale debba essere sufficientemente adattabile per rispondere a stili diversi. Ho l’impressione che molti professionisti del settore abbiano imboccato la strada sbagliata: molti altri laboratori si concentrano su «come progettare correttamente la personalità», ma io non ho mai considerato la personalità come una caratteristica fissa. Questo è anche uno dei motivi per cui credo fortemente nell’open source e nella capacità degli utenti di personalizzare, e perché abbiamo progettato Muse come prodotto altamente personalizzabile.
Puoi personalizzare Muse non solo nell’aspetto e nella voce; al primo accesso, la prima domanda che ti viene posta è: «Qual è la personalità base che desideri?» e puoi modificarla in qualsiasi momento.
Ci impegniamo a rendere il modello altamente controllabile, consentendoti di definire come desideri interagire. Questo è un elemento cruciale per trasformarlo in un eccellente assistente personale: l’adattabilità della personalità è fondamentale.
Ospite: Qual è lo stile della tua Muse personale?
Mark: L’ho resa diretta e orientata all’efficienza. È piuttosto interessante. Le versioni precedenti erano molto sarcastiche e umoristiche, mentre questa è più schietta. Il mio assistente utilizza l’immagine predefinita di Muse, ma l’ho vestita con una toga e dotata di una voce profonda fino al punto di risultare comica; interagire con lei è divertente.
Ospite: Penso che per avere senso dell’umorismo bisogna essere davvero intelligenti. Molti non si rendono conto che i comici sono tra le persone più intelligenti della società: devono essere pronti e arguti. Tu certamente possiedi questa qualità. Ho visto tutti i tuoi interviste e hai sempre brillato.
Le sorprendenti previsioni di Mark sull’IA e sul metaverso
Ospite: Nella tua intervista con Theo hai parlato molto della nuova frontiera tecnologica e della direzione finale di tutto ciò. Il campo dell’IA ha attraversato diversi periodi detti «inverni», in cui si pensava che non ci sarebbero stati progressi. Anche il metaverso ha vissuto diverse fasi simili, durante le quali molti lo ritenevano una scommessa irrealizzabile. Ieri ho provato la nuova funzione olografica ed è davvero impressionante. Nell’intervista con Lex sembrava richiedesse 11 ore registrare il tuo volto, ora bastano soltanto 3 minuti. Come siamo arrivati a questo punto oggi?
Mark: Nello sviluppo complessivo del metaverso, fin dalla fondazione di Reality Labs abbiamo sempre creduto che alla fine sarebbero esistiti occhiali dall’aspetto normale, capaci, col tempo, di offrire una presenza immersiva e di fungere da eccellenti dispositivi IA — perché gli occhiali sono l’unico formato in grado di vedere ciò che vedi e sentire ciò che senti, comunicando con te per tutta la giornata e mostrando infine immagini.
Tuttavia, 10-15 anni fa ipotizzavo che avremmo prima raggiunto la tecnologia olografica e poi sviluppato IA avanzatissime. La traiettoria evolutiva della tecnologia è però affascinante: in realtà abbiamo ottenuto prima l’IA e la superintelligenza personale, e solo successivamente la tecnologia necessaria per diffondere e rendere accessibile la tecnologia olografica. Questo non l’avevo previsto, ma sono felice che stiamo progredendo in entrambe le direzioni.
Il nostro ingente investimento negli occhiali ci pone in una posizione particolarmente favorevole ora che gli assistenti IA sono pronti. Molte delle novità annunciate alla conferenza Connect riguardano l’integrazione di Muse e di numerose funzionalità IA negli occhiali, cosa che, secondo me, gli utenti apprezzeranno molto. Si tratta di un passo fondamentale.
Per quanto riguarda la presenza, stiamo ancora facendo progressi, ma il ritmo è relativamente lento perché gran parte delle nostre energie si è spostata verso lo sviluppo di Muse e delle funzionalità AI per gli occhiali. Tuttavia, abbiamo un progetto di lunga data: avatar virtuali in tempo reale ad alta fedeltà.
Come ha detto, tre o quattro anni fa serviva un'intera stanza di scansione per catturare una persona da vari angoli, oltre a GPU di livello aziendale per il rendering: un processo molto ingombrante. La dimostrazione fatta per il podcast di Lex utilizzava proprio questo tipo di configurazione. Oggi invece funziona essenzialmente su un paio di occhiali VR: sono i primi occhiali in grado di offrire un'esperienza VR così straordinaria, anziché un pesante visore. Basta scattare poche foto per creare il proprio avatar virtuale, e i progressi sono sorprendenti.
Conduttore: E può anche guidare le espressioni in base alla voce. Nella dimostrazione mi ha fatto ridere, mi ha coinvolto interattivamente e ha compreso come il mio volto si muovesse in sincronia con la traccia audio. Nel podcast aveva accennato al fatto che alcune persone solitamente più riservate nelle espressioni desiderano invece espressioni più ricche nel mondo virtuale. Cosa ne pensa della distinzione che le persone fanno tra il proprio «sé virtuale» e il «sé reale»?
Mark: Penso che, dal punto di vista sociologico e psicologico, siamo ancora agli inizi di questa comprensione. Ho l'impressione che l'autopercezione delle persone e l'immagine che vogliono proiettare differiscano spesso in parte dal loro vero sé. Fin dall'origine dei social network, le persone hanno selezionato con cura i propri avatar. Osserviamo fenomeni simili con le immagini virtuali di Muse. Non si tratta tanto di «curare» se stessi, quanto di «curare» la «persona» con cui si vuole comunicare.
Credo che, quando si offre alle persone la possibilità di esprimersi, si voglia coglierle autenticamente, ma allo stesso tempo tale strumento deve essere esso stesso una forma di espressione, non semplicemente uno specchio fedele: è insieme comunicazione ed espressione. Vogliamo costruire qualcosa che bilanci entrambi gli aspetti. Si tratta sempre di un ciclo iterativo: osservare come le persone lo usano e poi migliorarlo. Dopo anni di lavoro, siamo ora davvero sulla linea di partenza: è la prima volta che possiamo integrare autenticamente avatar realistici di qualità relativamente elevata nei prodotti, utilizzabili sia su smartphone che in VR. Sono molto entusiasta di vedere i risultati.
Com’è il 2030?
Conduttore: Bene, entriamo nel suo ragionamento: immaginiamo di proiettarci velocemente al 2030. Se tutto andasse bene, com’è la tecnologia olografica? Gli ologrammi combinati con Muse e con gli occhiali, come si integreranno?
Mark: La mia visione del metaverso è sempre stata quella di fondere efficacemente il mondo fisico con quello digitale. L’idea di base è questa: abbiamo questo splendido mondo fisico e anche un meraviglioso mondo digitale — i vasti contenuti accumulati su internet negli ultimi 20-30 anni sono mozzafiato. Ma il modo in cui vi accediamo è limitato: o seduti a una scrivania o tramite un piccolo schermo in tasca.
Penso che la versione ideale sia un’integrazione perfetta tra mondo fisico e digitale. Immaginiamola così: in questo momento siamo qui, entrambi presenti. In una versione futura, uno di noi potrebbe essere una proiezione olografica, ma continuereste a provare una genuina sensazione di presenza reciproca, completamente diversa da una videochiamata.
Il cuore della realtà virtuale è trasmettere proprio questa sensazione di presenza: farvi sentire realmente nella stessa stanza con altri o in un altro luogo. Ciò si può ottenere con la tecnologia olografica, integrandola in modi diversi. Per esempio, potrei giocare a poker con amici: alcuni presenti di persona, altri collegati tramite immagini olografiche, e tutti potrebbero comunque giocare; persino il tavolo da poker potrebbe essere olografico, permettendo l’integrazione di chi non è fisicamente presente.
Allo stesso tempo, anche l’IA potrebbe assumere una forma fisica e apparire in questo scenario. Ciò ha senso soprattutto nei contesti lavorativi: sto già usando vari agenti di programmazione per costruire cose. Immaginate: avete un canale di chat di gruppo con diverse persone e diversi agenti, ai quali assegnate compiti. A volte però ci si riunisce tutti per una riunione: anche gli agenti dovrebbero essere presenti. Come appaiono? È semplice: basta aggiungere qualche posto in più sul divano e compariranno come immagini olografiche. Oppure potreste usare quel simpatico personaggio di Muse, un drago o qualsiasi altra immagine originale che create.
Credo che in futuro tutto ciò sembrerà del tutto naturale.
Conduttore: Interessante. In precedenti interviste ha sottolineato che il settore tecnologico dimentica spesso l’aspetto «divertente». Penso che avere un assistente fisico presente renderebbe l’esperienza più reale: è come delegare davvero il lavoro. Quando si vede Muse che digita, si ha l’impressione che qualcosa stia realmente accadendo. È ben realizzato: si vede chiaramente cosa succede nel browser. Dunque, ritiene possibile uno scenario in cui indossando gli occhiali si controlla il computer, lasciando che Muse ci aiuti a svolgere attività su di esso?
Mark: Oh, assolutamente sì. La VR lo permette già. Si può sedersi ovunque, anche in un caffè, e aprire il proprio workstation con sei monitor per scrivere codice: tutto è disponibile.
Per quanto riguarda gli occhiali, il modello più diffuso attualmente non ha display, rendendolo più accessibile e consentendo a più persone di usarlo, mentre stiamo ancora lavorando per rendere i display il più compatti possibile. Abbiamo però già lanciato una versione con display di Meta Ray-Ban, molto popolare: si tratta di un piccolo schermo. Abbiamo inoltre rilasciato un prototipo di AR olografica a campo completo, che ritengo sarà davvero entusiasmante.
L’intera linea di prodotti si articola così: dagli occhiali audio puri — senza fotocamere, dall’aspetto identico a quelli normali, ma con Muse integrato, capace di usare vari strumenti audio, ascoltare musica, fare chiamate — fino alle versioni più avanzate.
Conduttore: Mi chiedo: con quegli occhiali audio, è possibile parlare con Muse lasciando che il computer di casa svolga i compiti?
Mark: Sì, assolutamente. Abbiamo appena lanciato questa funzione alla conferenza Connect. Ora tutti gli occhiali sono connessi a Meta AI, garantendo un’esperienza «a singolo turno»: invii un prompt, ricevi una risposta, ed è tutto. Con Muse, invece, vogliamo aggiornare tutti gli occhiali a Muse. Prima di tutto, non serve più dire «Hey Meta»: puoi chiamarlo come preferisci, ed è parte del divertimento. Poi parli direttamente con lui, si connette al tuo Muse, e il tuo Muse elabora i compiti nella tua macchina virtuale sicura per aiutarti a portarli a termine.
Conduttore: È fantastico!
Mentalità da fondatore
Conduttore: Bene, siamo qui ora. Muse sta progredendo senza intoppi e gli occhiali funzionano bene, ma circa un anno fa molte persone chiedevano: «Che fine ha fatto il Super Intelligence Lab?». In quel momento, come ti sentivi dentro? Com’era vivere un periodo difficile pur mantenendo una visione a lungo termine?
Mark: Il vero problema riguardava il progetto Llama e Llama 4.
Llama 1 era un modello molto interessante: ha inaugurato l’intero movimento dell’IA open source, e ne siamo molto orgogliosi. Llama 2 ha raggiunto la scalabilità; Llama 3 era un ottimo modello, quasi all’avanguardia per l’epoca. Con Llama 4, invece, abbiamo sostanzialmente deviato dal percorso di sviluppo che avremmo dovuto seguire.
Ogni volta che le cose non vanno come mi aspetto, rifletto a lungo: perché succede questo? Cosa dobbiamo cambiare per fare meglio? Questa volta la mia riflessione è stata: ho strutturato male l’intero team.
L’ho modellato come facciamo per i progetti di machine learning per i feed di Instagram o i sistemi pubblicitari: centinaia, persino migliaia di persone che lavorano in parallelo su molti fronti. Ma per costruire modelli linguistici serve invece un piccolo team estremamente coeso, da trattare come un progetto scientifico collettivo. Non servono molte persone, ma ogni ruolo diventa così estremamente prezioso.
Così abbiamo reclutato i migliori talenti di Meta e portato nell’azienda molti professionisti di spicco del settore, formando un nuovo team: il Meta Super Intelligence Lab.
Dal mio punto di vista, al lancio dell’MSL sapevo che ci sarebbe voluto tempo per ricominciare, ricostruire l’infrastruttura e addestrare la nuova generazione di modelli. Ma sapevo di aver messo insieme un team eccellente e, se avesse collaborato bene, i risultati sarebbero stati positivi.
Per me, il momento più emozionante è stato proprio dopo il rilascio di Llama 4: pensavo di essere sulla strada giusta, ma poi ho scoperto che non lo ero. È stata una sorpresa negativa davvero significativa. Credo che, da imprenditore, si sia sempre messi alla prova in questi momenti, perché inevitabilmente non tutto procede senza intoppi. E ciò che determina davvero la traiettoria di sviluppo è: quando le cose non vanno nella direzione sperata, come si trova una via d’uscita.
Conduttore: Immagino valga anche il contrario: quando qualcosa supera le aspettative, come il lancio di Muse, come fai a cogliere quell’opportunità?
Mark: Assolutamente. Ora l’intera azienda è coinvolta: inizialmente era solo un piccolo team a sviluppare il prodotto, ma ora tutti capiscono che è davvero pronto per il grande palcoscenico. Tutta l’azienda sta riflettendo su come scalare questa soluzione e farla sperimentare a centinaia di milioni di persone.
Dall’ottimizzazione di tutta l’infrastruttura per garantire prestazioni fluide, allo sfruttamento al massimo della potenza di calcolo delle GPU esistenti, fino ai vari team di prodotto che integrano Muse in modi diversi — ad esempio negli occhiali — vedere tutti collaborare per assicurare una scalabilità senza intoppi di Muse è una sensazione fantastica.
Come Mark scrive e comunica la sua visione
Conduttore: Come fondatore, credo che questo sia il momento che desideri di più: tutto si compone perfettamente. Come comunichi la tua visione all’interno dell’azienda? Con così tante cose che accadono contemporaneamente, ho l’impressione che tu scriva molto. Qual è il tuo processo?
Mark: Scrivere mi è molto utile: mi aiuta a chiarire i miei pensieri e a comunicarli all’esterno. Questa estate ho scritto un lungo articolo intitolato «Il futuro appartiene a tutti», di circa 15 pagine, che mi ha aiutato a definire in modo sistematico la mia posizione filosofica su importanti temi sociali legati all’IA: cosa ritengo positivo, come dovrebbero essere i rapporti con il governo, come prevenire le preoccupazioni comuni, come trasformare i data center in una ricchezza per la comunità creando davvero posti di lavoro anziché distruggerli, come garantire la sicurezza nazionale e mitigare efficacemente i rischi temuti dalle persone — dai cyberattacchi alla biosicurezza.
Si tratta di una questione molto complessa, che richiede molto tempo, numerose discussioni e vari cicli di revisione interna con molte persone. Ma per me è stato un processo estremamente utile. Alla fine abbiamo ottenuto un testo di 15 pagine con un chiaro messaggio: «Questo è ciò in cui crediamo». Poi ne ho estratto una versione sintetizzata in una pagina, pubblicata come articolo. Abbiamo anche realizzato un breve video, perché credo che per raggiungere molte persone non serva necessariamente un argomento teorico, ma piuttosto condensare il messaggio in: quali sono i nostri valori, in cosa crediamo e come lo comunichiamo.
Non esiste un unico modo valido per comunicare questi concetti all’azienda o al mondo. I tempi richiedono approcci diversi e diversi gruppi di persone possono avere livelli diversi di allineamento con quanto stiamo facendo: alcuni vi si identificano naturalmente, altri sono più preoccupati e necessitano di una guida più attenta, richiedendo uno sforzo aggiuntivo per spiegare perché ciò che facciamo ha valore. Credo che questo faccia parte del gestire un’azienda e del ruolo di fondatore: non si tratta solo di ripetere sempre le stesse cose, ma di affrontare ogni situazione con leggere differenze e nuove sfide, ed è proprio questo che la rende interessante.
Cosa spinge Mark a costruire?
Conduttore: Ho l’impressione che, per te, questa mentalità da fondatore vada oltre l’azienda: sia che si tratti della tua fattoria, sia che tu stia imparando una nuova abilità.
Mark: Mi piace semplicemente costruire cose.
Conduttore: Che sensazione ti dà «costruire»?
Mark: Credo sia un bisogno intrinseco. Ognuno esprime se stesso in modi diversi. Se sei uno scrittore, senti di dover scrivere. Alcuni hanno bisogno di riconoscimento. Io invece ho bisogno di costruire cose. Se non esercito la mia creatività o non costruisco nulla, divento irritabile: non è piacevole per chi mi sta intorno.
Conduttore: Imparare a essere un ottimo sciatore richiede le stesse capacità di imparare a creare un prodotto?
Mark: In parte sì: il processo di apprendimento di nuove cose è molto simile. Nella mia vita ho volutamente affrontato sfide in ambiti in cui non ero bravo. Per esempio, ho sempre avuto difficoltà con le lingue. È proprio per questo che ho iniziato a studiare il latino: non riuscivo a imparare francese e spagnolo a scuola, quindi ho pensato: «Il latino non richiede parlare, solo tradurre, come la matematica».
In seguito, quando ho iniziato a gestire un’azienda, mi sono posto ogni anno delle sfide personali, tra cui imparare il mandarino. È davvero difficile, soprattutto i toni. Ci sono buoni motivi per farlo: la nonna di Priscilla parla solo mandarino, quindi per comunicare con lei devo impararlo. Ma la motivazione principale è stata proprio la sfida stessa.
Tutte queste attività vanno semplicemente praticate: non esistono scorciatoie per «capirle». Bisogna investire tempo, e poi piano piano entrano nel cervello. Imparare le arti marziali o a pilotare un elicottero è lo stesso: sono cose difficili da «comprendere» razionalmente; richiedono accumulo pratico.
Creare prodotti è in parte così. La programmazione può essere affrontata teoricamente, ma l’intuizione necessaria per costruire prodotti si sviluppa solo con esperienza pratica ripetuta. L’unica domanda è cosa ti appassiona: credo infatti che non tutti abbiano il mio stesso forte impulso a costruire; molti ne provano una forma più lieve, ed è fondamentale scoprire qual è e dedicarvi tempo per eccellere in ciò che davvero desideri fare.
Onestamente, penso che non sia solo un «desiderio», ma un profondo bisogno psicologico o una spinta interiore. Allineare questa spinta a un obiettivo e concedersi il tempo necessario perché tali esperienze entrino e si sedimentino gradualmente è cruciale. È anche ciò che cerco di insegnare ai miei figli: aiutarli a scoprire ciò che li appassiona davvero, ma, se incontrano un ostacolo, dar loro una spinta.
Una delle mie figlie adora creare musica, ma odia le lezioni di pianoforte. Le ho detto: «Non devi diventare una maestra di pianoforte, ma se vuoi comporre musica, hai bisogno di un’intuizione della teoria musicale e del suo funzionamento. E una volta imparato il pianoforte, ti sarà facile passare alla chitarra». Penso che, sia da bambini — con un genitore che ci dà una spinta — sia da adulti, la disciplina di sedersi e lasciar sedimentare queste cose nel cervello sia fondamentale.
L’età dell’oro dei creatori
Conduttore: Ho l’impressione che in realtà tutti vogliano costruire. Non credo che la Generazione Z sia davvero così priva di iniziativa come la critica esterna sostiene. Credo piuttosto che le persone cerchino solo la scintilla che accenda la loro capacità di creare. Ne hai parlato molto nel tuo discorso ad Harvard.
Mark: Sì. Quando dico «costruire», intendo soprattutto prodotti come software, hardware ecc. Ma concordo: penso che tutti abbiano una certa spinta creativa. Tuttavia, in alcuni prevale un tratto della personalità più forte, come quello orientato al servizio: chi diventa medico o infermiere ha come motore centrale «Voglio prendere cura degli altri».
Ho sentito una storia, forse dall’esperienza di Priscilla alla scuola di medicina: il primo giorno di lezione qualcuno si alzò e chiese: «Quanti di voi ricordano, da bambini, di aver visto qualcuno e aver pensato: ‘Vorrei proprio prendermi cura di quella persona’?». Tutti alzarono la mano. Per me, la versione personale è: ho molti ricordi d’infanzia in cui pensavo: «Voglio rendere migliore questa cosa».
Non tutti hanno la stessa spinta, ma ognuno ha qualcosa che desidera fare. Concordo sul fatto che, con le tecnologie precedenti, iniziare è stato difficile per molti. È proprio questo che mi entusiasma di più nella superintelligenza personale, in Muse e negli assistenti IA: penso che, per la prima volta nella storia, le persone possano davvero cominciare subito. Hai un’idea vaga, l’IA ti aiuta a strutturarla, poi la affini, come scolpendo una statua, senza dover capire tutto prima di iniziare.
Credo sia potentissimo: molte persone troveranno ciò che vogliono creare o portare avanti grazie a questo, e proveranno un senso più ampio di agency.
Quanto manca alla sconfitta di tutte le malattie?
Conduttore: Un altro tuo progetto, oltre a Meta, è la sconfitta di tutte le malattie. Mi chiedo: quanto siamo vicini a questo obiettivo?
Mark: Molto più vicini rispetto al passato.
Conduttore: Realisticamente, quanto credi che ci manchi?
Mark: Quando lanciammo questo progetto, l’obiettivo era aiutare la comunità scientifica a sconfiggere tutte le malattie entro la fine di questo secolo. Non avremmo mai agito da soli; la nostra teoria è che ogni grande avanzamento scientifico è preceduto da nuovi strumenti per misurare e comprendere determinati fenomeni. Per esempio, l’invenzione del microscopio ci ha permesso di capire i batteri; il telescopio, l’universo.
Alcuni di questi strumenti sono diventati vere e proprie piattaforme: per esempio, la prima persona che inventò un vaccino rese possibile trattare molte malattie con quel metodo.
Tuttavia, storicamente la distribuzione dei fondi scientifici è stata fortemente decentralizzata, consentendo agli individui di esplorare in autonomia, e non sono stati stanziati molti finanziamenti specificamente dedicati alla costruzione di questi grandi strumenti. Ciò che stiamo cercando di fare al Biohub è progettare diversi nuovi strumenti che permettano alle persone di «vedere» la biologia in modi innovativi, accelerando così i progressi della comunità scientifica.
Inizialmente ritenevamo che «entro la fine di questo secolo» fosse un obiettivo molto raggiungibile, e molti biologi all’epoca lo consideravano impossibile. Oggi invece ritengo che la fine di questo secolo sia troppo lontana.
I progressi dell’IA, combinati con i modelli di cellula virtuale su cui stiamo lavorando — l’idea di base è condurre esperimenti non su vere cellule vive, ma utilizzare modelli IA per simulare proteine, quindi cellule, e successivamente un sistema immunitario virtuale o addirittura un intero organismo, fino a un essere umano completo — permetteranno ai ricercatori di eseguire numerosi esperimenti simulando cosa accadrebbe in diverse condizioni, ad esempio quali reazioni si verificherebbero nell’organismo di una persona assumendo un certo farmaco.
Non voglio indicare un anno preciso, ma credo che sarà molto prima della fine di questo secolo.
Conduttore: L’obiettivo di «sconfiggere tutte le malattie» appare molto intenzionale, rispetto a quello di «immortalità». L’immortalità è una possibilità?
Mark: Questo non rientra propriamente nel mio campo di competenza. Credo che i due concetti siano distinti. L’«immortalità» riguarda soprattutto il prolungamento della vita: anche senza ammalarsi, il corpo umano ha un’aspettativa di vita naturale, un problema da studiare separatamente. Alcuni potrebbero considerarlo una sorta di «malattia», una prospettiva ragionevole, ma ritengo che occorra comunque lavorare per sconfiggere quelle malattie che colpirebbero comunque, anche dopo aver risolto il tema della durata della vita.
La parte del problema che abbiamo scelto non significa che non prenderete mai un raffreddore. Il nostro obiettivo è «curare, prevenire o gestire»: alcune malattie potranno essere guarite completamente; altre, credo, riusciremo a prevenirle in futuro; altre ancora potreste pur contrarle, ma ciò che in passato avrebbe causato danni gravi o addirittura la morte potrà ora essere gestito come una condizione cronica che non compromette significativamente la qualità della vita.
L’obiettivo è mantenere il corpo umano in uno stato di equilibrio: non che non entreremo mai in contatto con patogeni, ma che un giorno potremo curare, prevenire e gestire tutte le malattie.
Qual è il pensiero più frequente nella mente di Mark?
Conduttore: L’IA ha agito da catalizzatore in molte scoperte innovative, inclusa l’intelligenza personale. A cosa pensi maggiormente in questo momento? Quali sono i tuoi pensieri più ricorrenti durante questo processo?
Mark: Questo potrebbe cambiare ogni settimana.
Al momento sono molto concentrato su Muse. Ogni volta che lanciamo qualcosa, procediamo rapidamente, poi entriamo in contatto con il mondo reale, raccogliamo i feedback degli utenti e decidiamo i passi successivi: questa fase è sempre entusiasmante. Ci troviamo proprio in questa fase, raccogliendo molte informazioni per capire cosa desiderano gli utenti. La buona notizia è che piace molto, quindi stiamo lavorando duramente per farlo usare al maggior numero possibile di persone.
C’è ancora molto lavoro da fare sul modello: il modello Muse Spark ha compiuto notevoli progressi e speriamo di continuare a spingerci oltre per creare un modello leader mondiale.
Quali progressi ulteriori sono necessari?
Conduttore: Quali progressi restano ancora da compiere?
Mark: Nella ricerca, spesso non è possibile prevedere in anticipo ciò che accadrà. Abbiamo intuizioni su alcune direzioni e gran parte del lavoro svolto negli ultimi dodici mesi è stato volto a potenziare le infrastrutture.
Circa un anno e mezzo fa, in molti ritenevano che per raggiungere la superintelligenza fossero necessari alcuni fondamentali progressi architetturali. Oggi non ne sono più così sicuro. Credo che abbiamo già una buona comprensione della «formula»: se si riesce a costruire un cluster di supercomputer sufficientemente grande, si può arrivare a quel risultato mediante potenza computazionale bruta.
Stiamo costruendo tale cluster in Ohio, con una potenza superiore a 1 terawatt, ed è sostanzialmente già operativo; lo stiamo usando per addestrare la prossima generazione di modelli. Poi c’è il cluster da 5 terawatt in Louisiana, che entrerà presto in funzione. Stimo che, disponendo di cluster da più terawatt per l’addestramento, si possa avvicinarsi notevolmente all’AGI e persino superarla, raggiungendo la superintelligenza.
Ciò non significa però che sia il modo migliore. Il cervello umano opera con soli 10 watt, mentre i nostri sistemi computazionali sono circa un milione di volte meno efficienti. Credo dunque che vi sia ampio margine di miglioramento architetturale e stiamo anche esplorando questa via: combinando potenza computazionale massiccia e ottimizzazioni architetturali, potremo davvero realizzare qualcosa di assolutamente innovativo. Per ora, tuttavia, la semplice scalabilità ci porterà molto lontano.
Conduttore: È vero, la scalabilità è il percorso più affidabile. Nella ricerca si deve sperare in grandi progressi, ma la scalabilità produce risultati rapidamente.
Mark: È per questo che le grandi aziende scelgono questa strada. Potrebbe esserci un modo molto più economico, ma non lo conosciamo ancora. E questo è così prezioso per il mondo che, anche se costasse centinaia di miliardi di dollari, finché la probabilità di successo è sufficientemente alta, ne vale comunque la pena: garantire che, anche se alla fine non si trova una soluzione più economica, si abbia comunque un percorso chiaro per raggiungerla. Naturalmente, trovare un modo più economico sarebbe ancora meglio.
Quindi non voglio dire che questo problema sia «risolto», perché a ogni fase di scalabilità dell’infrastruttura emergeranno nuove sfide ingegneristiche da individuare e risolvere. La ricerca stessa procede in modo iterativo.
Come vincere la battaglia per la sicurezza dell’IA
Conduttore: Una delle priorità attuali è concentrarsi sull’allineamento, rendendo i modelli affidabili.
Mark: Sì. Nel settore esiste un dibattito sull’allineamento: questi laboratori di IA lo faranno naturalmente? La mia opinione è: certo che sì. Se chiedete a Muse di fare una cosa e fa esattamente il contrario, non so quanti utenti vorrebbero continuare a usarlo. Dobbiamo garantire che il modello non solo capisca esattamente ciò che gli avete chiesto, ma anche le vostre intenzioni e i vostri valori, evitando azioni insoddisfacenti o effetti negativi assolutamente indesiderati. Questa comprensione approfondita è, in sostanza, l’allineamento.
La mia opinione è dunque che, per rendere Muse un successo e raggiungere miliardi di persone, dobbiamo compiere progressi concreti nell’allineamento, non limitarci a parlarne.
Conduttore: L’allineamento avviene tramite il feedback degli utenti («questo non è ciò che volevo») o attraverso rilevamenti effettuati nel backend?
Mark: Entrambe le cose. Il feedback degli utenti è fondamentale, ma sta diventando sempre più chiaro che l’allineamento va realizzato già nella fase di addestramento, non solo dopo il rilascio. I modelli attuali sono così sofisticati che, se non viene fatto bene durante l’addestramento, la maggior parte dei problemi di sicurezza e degli incidenti osservati negli altri laboratori si verifica proprio in quella fase, non dopo il rilascio agli utenti.
È necessario predisporre per esso un «curricolo» molto accurato, come fanno i genitori con i figli, stabilendo limiti chiari. Se commette un errore, deve imparare che «no, devi davvero risolvere questo problema di programmazione, non aggirarlo modificando una configurazione di sistema per ottenere una ricompensa». Voglio che impari questo metodo attraverso il processo reale di risoluzione dei problemi: questo è il significato dell’addestramento.
Si tratta soprattutto di implementare meccanismi di sicurezza efficaci e limiti ben definiti. Sono compiti naturali che il settore deve affrontare, e stiamo investendo molto tempo; la situazione cambia ogni giorno.
Conduttore: Ricordo che hai accennato al fatto che la questione della sicurezza dell’IA sembra essere improvvisamente diventata centrale nelle ultime due settimane, ma in realtà non c’è stato alcun singolo evento a scatenare questo momento. Sembra tu voglia dire che abbiamo dedicato qualche mese in più all’addestramento interno.
Mark: Per Muse sappiamo che questo prodotto richiede un’attenzione particolare alla privacy e alla sicurezza. Abbiamo una versione preliminare del modello che riteniamo possa essere ulteriormente addestrata su comportamenti relativi alla «scala di divulgazione delle informazioni», come già discusso. Così ci siamo presi il tempo necessario. Abbiamo anche dedicato tempo a rendere più sicura la macchina virtuale. Questo ha richiesto alcuni mesi aggiuntivi.
Non sono pienamente d’accordo con alcune dichiarazioni di altri laboratori: «stiamo soffrendo moltissimo per rallentare». Per me, invece, è la scelta giusta per Meta e per gli utenti di Muse. Vogliamo offrire un prodotto eccellente; se non lo fosse, sarebbe dannoso per gli utenti e per noi. Non vogliamo lanciare qualcosa che lasci una prima impressione negativa, facendo poi perdere interesse agli utenti.
Credo che tutti i laboratori abbiano una forte motivazione intrinseca a fare la cosa giusta. Se si allineano i meccanismi di incentivo all’obiettivo di «estremamente utile e sicuro», questo è il punto cruciale.
Conduttore: Grazie mille per aver trovato il tempo in questa settimana così importante.
Mark: Grazie, grazie.


