Zuckerberg habla de Muse: Explosión de agentes de IA, «metaverso, gafas inteligentes y modelos grandes» convergen en tres apuestas clave

Tapbit Wire - Tapbit NewsTapbit Wire·Fuente:ChainCatcher·
Compartir

Hace tres años, el CEO de Meta, Mark Zuckerberg, mencionó en el programa de Joe Rogan que algún día la gente usaría gafas y surgirían agentes de IA en consecuencia. Hoy esa escena podría estar materializándose.

El agente de IA personal de Meta —Muse— alcanzó a millones de usuarios en dos semanas desde su lanzamiento. Zuckerberg declaró en una entrevista el 25 de septiembre: «Solo encontramos este tipo de situación cada varios años». Calificó la respuesta inicial a Muse como «un jonrón desde el primer instante», algo poco común en la historia de productos de Meta.

Al mismo tiempo, anunció que Muse se integrará en toda la línea de gafas inteligentes Ray-Ban, permitiendo a los usuarios invocar a su agente de IA personal con una palabra de activación personalizada, en lugar de decir «Oye, Meta».

El metaverso, las gafas inteligentes y los modelos grandes, vistos tradicionalmente como tres apuestas independientes desde fuera, ahora convergen aceleradamente a nivel de producto dentro de Meta.

En esta entrevista, Zuckerberg también reconoció que el fracaso de Llama 4 fue «el momento más aterrador» y reveló que Meta está construyendo un centro de entrenamiento de 5 gigavatios, convencido de que una potencia informática suficientemente grande podría lograr la IA general mediante «fuerza bruta».

Zuckerberg habla de Muse: Explosión de agentes de IA,

¿Por qué Muse puede «dar un jonrón desde el primer instante»?

El origen de Muse fue cuando Zuckerberg y sus compañeros Nat y Alex se reunieron y «ensamblaron» una versión temprana usando herramientas de código abierto desde casa.

«Nos dimos cuenta de que era una experiencia mágica», dijo Zuckerberg. «Si pudiéramos hacer que cualquiera la usara —sin necesidad de comprar una Mac Mini ni manipular terminales—, entonces sería algo que miles de millones de personas desearían».

Este juicio impulsó toda la lógica posterior de investigación y desarrollo: no solo entrenar modelos, sino desarrollar íntegramente el mecanismo «latido» del agente, desde el modelo y la estructura hasta el propio agente —que se activa periódicamente, revisa los objetivos del usuario y avanza proactivamente en las tareas pendientes.

Los datos posteriores al lanzamiento confirmaron este juicio: en dos semanas, millones de usuarios.

IA personal: enfoque en ejecución, memoria y «juicio»

Sobre la diferencia entre IA personal y IA general, Zuckerberg resumió el foco competitivo actual como convertir al modelo en un mejor agente.

«Lo más importante durante el último año ha sido básicamente programar al agente», afirmó. La capacidad de programación es crucial porque, aunque los usuarios no escriban código directamente, «su Muse escribirá código en segundo plano para cumplir diversas tareas».

Sin embargo, considera que los agentes personales no deben limitarse a capacidades de codificación o ejecución de tareas; también deben comprender los límites de privacidad y los contextos sociales.

Zuckerberg dio un ejemplo: si un usuario le pide a Muse reservar un restaurante, el agente podría conocer alergias o embarazo del usuario, pero eso no significa que deba revelar automáticamente esa información. «Querría que completara la tarea divulgando la menor información posible».

Afirmó que esta capacidad forma parte de las «habilidades sociales básicas o sentido común» que los humanos suelen poseer, pero muchas empresas no la incluyen en las capacidades de sus modelos si solo entrenan agentes de programación.

«Entrenamos todo el modelo, no simplemente tomamos un modelo ya listo de terceros y construimos alrededor de él un marco y un agente», afirmó Zuckerberg. Meta también ha incorporado funciones como memoria, seguimiento de tareas, animaciones de personajes virtuales e interacción vocal en tiempo real a nivel de producto.

Sobre personalización, señaló que Meta no considera que la IA deba tener una única personalidad fija. «Muchos laboratorios se centran en cómo ajustar la personalidad al estado adecuado, pero nunca creí que existiera una única respuesta correcta para la personalidad.»

Mencionó que Muse permite a los usuarios modificar su avatar, voz y personalidad básica, con el objetivo de diseño del modelo siendo un alto grado de controlabilidad. «Puedes definir cómo deseas interactuar con él, lo cual es clave para un agente personal.»

Cada agente tiene su propia «computadora»

Una de las infraestructuras centrales que distingue a Muse de otros productos de IA es que Meta ha dotado a cada agente con una máquina virtual segura (Secure VM).

Zuckerberg explicó por qué esto es necesario:

Tu agente conocerá mucha información sensible sobre ti. No creemos que esta información deba mezclarse en un depósito compartido con los datos de todos los demás.

Comparó la Secure VM de Muse con «la computadora que solo te pertenece y está bajo tu escritorio»: los datos del usuario están cifrados y almacenados, y las credenciales sensibles, como contraseñas, se gestionan mediante un módulo de seguridad independiente que el propio agente no puede leer directamente.

Sobre esta base, Meta también ha diseñado un agente de seguridad llamado «Sentinel», específicamente para supervisar el flujo de datos hacia dentro y fuera de Muse, que interceptará directamente y solicitará autorización al usuario si detecta anomalías u operaciones de alto riesgo.

Metaverso, gafas inteligentes y agentes: tres vías convergen

Zuckerberg reveló en la entrevista que Muse se integrará completamente en la serie de gafas inteligentes Ray-Ban y actualizará los métodos de interacción actuales.

Actualmente, las gafas ofrecen una experiencia de «conversación de un solo turno»: dices algo, recibes una respuesta y ya está. Tras integrar Muse, las gafas se convierten en el punto de entrada frontal del agente: cuando el usuario habla, Muse sigue trabajando en segundo plano en la máquina virtual segura, realizando tareas y brindando retroalimentación.

Sobre la hoja de ruta del producto para las gafas, describió una jerarquía clara de hardware:

  • Gafas puramente auditivas sin cámaras: ya equipadas con Muse, capaces de manejar llamadas, música y tareas de voz

  • Ray-Ban de Meta con pequeña pantalla: ya lanzadas, ofreciendo retroalimentación visual básica

  • Prototipo AR holográfico de campo visual completo: ya lanzado, que Zuckerberg calificó de «muy emocionante»

Afirmó que la inversión a largo plazo de Meta en gafas posiciona favorablemente a la empresa tras la madurez del agente de IA. Meta está incorporando Muse y más funciones de IA en sus productos de gafas, mientras que la tecnología del metaverso, que anteriormente enfatizaba la «presencia», sigue avanzando, aunque actualmente se dirigen más recursos a Muse y las funciones de IA de las gafas inteligentes.

Respecto a los avatares virtuales, Zuckerberg mencionó que antes Meta requería equipos a escala de habitación, escaneo multivista y entornos GPU empresariales para generar avatares realistas de alta calidad; ahora, los usuarios pueden completar la configuración con solo unas pocas fotos, y las capacidades relacionadas pueden ejecutarse en un par de gafas de RV.

Mirando hacia 2030, Zuckerberg afirmó que la visión central del metaverso siempre ha sido fusionar los mundos físico y digital. Dio como ejemplo que, en el futuro, las personas podrían participar en actividades con amigos que acceden mediante imágenes holográficas; en entornos laborales, humanos y múltiples agentes también podrían participar en chats grupales o reuniones, con los agentes apareciendo en forma holográfica u otra representación corporal.

«El momento más aterrador»: El error de Llama 4

No todas las apuestas han salido bien. Zuckerberg rara vez habló directamente sobre el fracaso de Llama 4 en la entrevista.

Después de Llama 4, ese fue el momento más aterrador… Pensaba que íbamos por buen camino, pero no era así. Fue una sorpresa negativa muy significativa.

Atribuyó el problema a un error fundamental en la estructura del equipo:

Organicé al equipo igual que el sistema de recomendaciones de Instagram o el sistema publicitario: cientos o miles de personas trabajando en paralelo. Pero entrenar un modelo de lenguaje requiere un equipo pequeño que colabore estrechamente, tratándolo como un proyecto científico colectivo. Cada puesto es extremadamente valioso.

Como resultado, Meta llevó a cabo una reorganización completa, incorporando ampliamente a los mejores talentos del sector y creando el Meta Super Intelligence Lab (MSL). Zuckerberg afirmó que se lanzará una nueva generación de modelos, aunque no se anunciará en la conferencia Connect.

Ruta de potencia informática: AGI por fuerza bruta; proyecto de 5 gigavatios en construcción

Al hablar de la ruta tecnológica hacia la AGI, Zuckerberg dio un juicio directo.

No estoy seguro de qué avances arquitectónicos fundamentales aún se necesitan… Creo que conocemos aproximadamente la fórmula. Si se construye un clúster de supercomputadoras lo suficientemente grande, se puede alcanzar por fuerza bruta.

Actualmente, la ruta de expansión de potencia informática de Meta: un clúster de más de 1 gigavatio en Ohio ya está prácticamente operativo para entrenar la próxima generación de modelos; un clúster de 5 gigavatios en Luisiana está en construcción.

Afirma: «Cuando dispones de clústers de varios gigavatios para entrenamiento, prácticamente obtienes algo cercano a la AGI o incluso a la superinteligencia».

Sin embargo, también añadió que la ruta actual basada en potencia informática no significa que la investigación arquitectónica sea poco importante:

El cerebro humano consume solo unos 10 vatios, mientras que nuestros sistemas pueden ser un millón de veces menos eficientes. Solo combinando potencia informática a gran escala con avances arquitectónicos podremos liderar realmente el camino.

Alineación: no es una carga, sino un problema que deben resolver los productos

La actitud de Zuckerberg frente a la seguridad de la IA es muy pragmática: no la ve como presión regulatoria, sino como un requisito previo para el éxito del producto.

Si le pides a Muse que haga algo y hace lo contrario, ¿quién seguiría usándolo? Debemos garantizar que el modelo no solo entienda tus instrucciones específicas, sino también tus intenciones y valores.

«Si Muse ha de llegar a mil millones de usuarios, debemos resolver el problema de la alineación o lograr avances significativos en él», afirmó.

Sobre los límites de seguridad durante el entrenamiento, usó una analogía: «Es como si los padres establecieran normas para sus hijos: si “resuelve” un problema de programación modificando la configuración del sistema, quiero decirle: no, quiero que aprenda el método de resolución, no que encuentre un atajo para evitarlo».

Zuckerberg habla de Muse: explosión del agente IA

La entrevista completa es la siguiente: >

Apuestas importantes

Presentador: Esto es algo que miles de millones de personas querrán usar. ¿Qué sensación te produce construirlo? ¿Es posible la «inmortalidad»? Bueno, si me adentro en tu mente y adelanto el reloj hasta 2030, ¿cómo será eso?

Este es Mark Zuckerberg. Hace veintidós años creó una red social que conectó a miles de millones de personas y cambió para siempre el mundo. Ahora ha decidido construir algo aún más ambicioso. Para ello, está realizando apuestas importantes en los campos del metaverso, las gafas inteligentes y la inteligencia artificial. Durante años, los escépticos consideraron que se trataba de tres apuestas independientes que no podrían tener éxito, pero pasaron por alto la visión global: actualmente, estas apuestas convergen para crear una nueva superinteligencia.

Hoy presentaremos todo esto y le haré a Mark preguntas que nunca antes le han hecho, escuchando su visión del futuro para que ustedes puedan adelantarse y construir la próxima gran innovación.

Presentador: Muchas gracias por venir al programa.

Mark: Gracias, me alegra estar aquí.

Presentador: Para esta conversación, vi todas las entrevistas que has dado.

Mark: Vaya, ¡yo mismo no he visto tantas!

Presentador: Fue divertido y muy gratificante. Dos cosas me impactaron profundamente: primero, tu amor por la «construcción»; siento que eres uno de los mejores creadores; segundo, tu capacidad para hacer apuestas importantes: te atreves a asumir riesgos enormes. Siento que esta semana todas esas apuestas están convergiendo, así que empecemos por ahí.

Mark: De acuerdo. Llevamos mucho tiempo trabajando en esto. En cuanto a la IA, como empresa, llevamos haciéndolo casi desde nuestros inicios: la primera versión del feed de noticias era, en cierto modo, un producto de aprendizaje automático. Luego, hace unos 15 años, creamos el laboratorio de investigación en IA.

Pero ahora hemos entrado en una nueva fase: hace aproximadamente un año lanzamos el Laboratorio de Superinteligencia de Meta. Se trata de una reestructuración profunda de la investigación, incorporando talento excepcional de toda la industria, lo cual es muy emocionante. Actualmente vemos que los modelos mejoran constantemente y que la próxima generación está a punto de lanzarse, aunque no se anunciará en la conferencia Connect. Además, contamos con el asistente personal Muse, que ha recibido comentarios muy positivos hasta ahora.

Al construir estas cosas, no sabes con certeza cómo serán los resultados. A nosotros mismos nos encanta. A principios de este año, estuve en casa ensamblando Open Claw a mi manera, experimentando cómo funciona y cómo convertirlo en una experiencia mágica accesible para cualquiera.

Básicamente, cuando —yo, Nat y Alex— nos reunimos y comprendimos que se trataba de una experiencia mágica, y que podríamos transformarla en una versión lista para usar, accesible para personas que no entienden tecnología, que no quieren configurar una Mac Mini ellas mismas, ni usar la terminal ni depurar errores, pensé que esto sería algo que miles de millones de personas querrían usar.

Desde entonces, hemos trabajado hacia ese objetivo: ajustar específicamente los modelos para este fin, no solo construyendo el asistente y su marco operativo, sino también desarrollando la tecnología que brinda un entorno informático independiente para cada asistente: creamos toda una serie de máquinas virtuales seguras Muse para este propósito.

Internamente sentimos que esto era especial y al equipo le gustó, pero nunca se sabe cómo reaccionará la gente tras el lanzamiento. Ocasionalmente hay éxitos espectaculares desde el primer momento, pero normalmente se reciben algunos comentarios positivos y hay que iterar en varios aspectos para lograr que el producto «encaje». Esta vez, encajó desde el primer instante. Ver todo esto es realmente emocionante: apenas dos semanas después, ya contamos con millones de usuarios, algo bastante raro. Solo ocurre cada pocos años, pero sin duda es uno de los momentos más gratificantes para una startup.

Presentador: Tu capacidad para mantenerse en juego y seguir intentándolo me impresiona mucho. Y haber conseguido tantos éxitos rotundos es verdaderamente notable. Tuviste una entrevista con Joe Rogan hace tres años, donde mencionaste que algún día podrías llevar gafas y que aparecería un asistente de IA. Así que siento que Muse ya tiene una representación física, lo cual es muy inteligente, porque esa sensación acabará ocurriendo inevitablemente.

Mark: Creo que simplemente lo hace parecer más amigable y simpático. Muchas personas describen la IA como algo aterrador, pero debería ser útil y divertida. Esa representación física: un diseñador la creó al inicio del proyecto y, por alguna razón, siempre quisieron iterarla, pero la primera versión fue la mejor. Más tarde, alguien dijo: «¡Debe ser azul porque es de Meta!». Yo respondí: «No, creo que esa representación es la correcta; ¡la acertaron desde la primera vez!». Así es: es divertido.

¿Cuál es la diferencia entre la IA personal y la IA general?

Presentador: Excelentes detalles. Si quieres que el modelo destaque especialmente en asuntos personales, y no solo sea un modelo de inteligencia general, ¿cómo diferiría el enfoque de entrenamiento?

Mark: Creo que lo fundamental ahora es convertir al modelo en un excelente «agente». Durante el último año, la tendencia más importante ha sido la programación de agentes, que incluye dos ideas centrales: experiencia en programación y capacidad general para ser un excelente agente.

Nuestra estrategia consiste en priorizar la excelencia del agente en sí, en lugar de especializarnos en capacidades de programación.

La capacidad de programación es importante porque, aunque los usuarios no crean estar escribiendo código, Muse lo hace constantemente en segundo plano para cumplir diversas tareas. Pero consideramos que el agente debe ser ante todo un agente sobresaliente, y la programación sirve a ese objetivo.

Además, al construir un asistente personal, algunas cosas son más importantes que desarrollar productos empresariales de software. Por ejemplo, al crear una herramienta empresarial de programación, el modelo no necesita entender el «grado de divulgación de información» —es decir, qué revelar y qué no—, pero para Muse esto es fundamental.

Esta capacidad debe entrenarse en el modelo, como cualquier otra. Se le enseña mucha información y se espera que ayude a alcanzar sus objetivos. Por ejemplo, si quiere reservar un restaurante, busca uno adecuado, pero quizá tenga alergias o esté embarazada y prefiera no revelarlo al restaurante. Muse conocerá esos datos y deberá completar la tarea divulgando la mínima información posible: una habilidad específica, equivalente al sentido común social básico humano.

Sin embargo, las empresas que solo fabrican agentes de programación, por lo general, no han entrenado esta capacidad. Nosotros sí podemos hacerlo porque desarrollamos soluciones de extremo a extremo: no usamos modelos listos de terceros con un marco adicional, sino que entrenamos el modelo completo desde cero, específicamente para estas capacidades.

El modelo necesita, por supuesto, una amplia inteligencia general, pero también posee estas capacidades específicas. A partir de ellas, se construye todo el asistente y sus detalles: memoria, marco operativo y su «ritmo» —despierta periódicamente para verificar: «Estas son las metas que entiendo sobre usted; ¿hay algo que pueda impulsar ahora?».

También contamos con un equipo dedicado que refina exclusivamente los efectos de animación en tiempo real de la representación virtual, pues no es una representación predeterminada: puede personalizarla libremente y moverse de forma natural, lo cual es excelente. Además, lanzamos el modo de voz, permitiendo conversaciones vocales en tiempo real con su asistente siempre a su lado. Creemos que todos estos detalles surgen de nuestro enfoque de extremo a extremo: el modelo y el producto se desarrollan conjuntamente.

Presentador: Otro tema clave es la máquina virtual. ¿Podría explicar su importancia y qué posibilita?

¿Por qué Meta asigna a cada asistente de IA una computadora independiente?

Mark: Básicamente, para que un agente actúe por usted, necesita un lugar donde almacenar su información. Consideramos que esta información no debe mezclarse en un grupo compartido con la de otros usuarios.

Piénselo así: su asistente conocerá muchos datos sensibles sobre usted. Muchas personas, al conocer agentes inteligentes como OpenCloud, instalan una Mac Mini en casa. Así pensamos: muchas no quieren comprar ni configurar una Mac Mini. ¿Qué experiencia se acerca más a ese efecto? La respuesta es: basta descargar una app, registrarse y obtener una computadora dedicada exclusivamente para su asistente, para que almacene datos y construya un modelo seguro a su alrededor. Es como tener su propia computadora bajo su escritorio —ni siquiera Meta puede acceder a ella.

Por ejemplo, la máquina virtual confidencial de Muse es una función que estamos desarrollando, y ni siquiera nosotros podemos ver su contenido.

También hemos integrado múltiples funciones, como el almacenamiento seguro de credenciales: cuando su asistente debe manejar contraseñas, no necesita verlas; solo debe poder «insertarlas» al solicitarle iniciar sesión en un servicio, y únicamente cuando usted lo autorice explícitamente. El sistema debe diseñarse para que esa información no sea accesible libremente, pues pueden ocurrir accidentes: intentos de intrusión o fallos del sistema.

Por tanto, debe garantizarse que ni el agente ni Meta puedan acceder a esos datos. Asignar una computadora independiente a cada asistente y maximizar la seguridad constituye la base fundamental de esta tecnología: dotar a Muse de las capacidades necesarias para ayudarle a alcanzar sus metas, garantizando privacidad y seguridad, convirtiéndolo en un producto líder mundial en este campo.

Presentador: ¿Significa esto que, como WhatsApp, los datos en la máquina virtual a la que se conecta Muse están cifrados? ¿Cómo deben entenderse realmente el almacenamiento y la ubicación de los datos en la máquina virtual?

Mark: Básicamente creamos dos versiones. La máquina virtual segura de Muse (Secure VM) incluye múltiples funciones de privacidad, entre ellas toda la arquitectura del agente Sentinel que desarrollamos. Tiene un asistente Muse habitual que ejecuta tareas, y simultáneamente un agente de seguridad llamado Sentinel, que monitorea todo el flujo de datos entrantes y salientes de su Muse.

Si algún contenido externo intenta comprometer la seguridad, Sentinel lo bloquea directamente para evitarlo. Si considera que Muse está a punto de realizar una acción que requiere su intervención, anula la operación de Muse y activa una alerta para confirmación humana: «¿Desea que Muse realice esta acción?».

Todo este sistema, combinado con el almacenamiento seguro de credenciales y defensas multicapa, constituye la máquina virtual segura de Muse.

También desarrollamos otro proyecto. Nat y yo reclutamos específicamente a Moxie Marlinspike —el creador del cifrado de extremo a extremo en WhatsApp— para diseñar la máquina virtual confidencial de Muse (Confidential VM). La idea central es otorgarle una clave de cifrado dedicada sobre la máquina virtual segura, de modo que ni siquiera Meta pueda acceder a su contenido.

Esta versión es más difícil de implementar, pues si Meta no puede acceder al interior de la máquina virtual, depurarla y garantizar su funcionamiento estable resulta mucho más complejo. Por eso invertimos tiempo en ello, pero pronto se lanzará. Cumplirá así los estándares de seguridad ya conocidos en WhatsApp y nuestros productos más seguros.

Presentador: ¿La ventaja de hacer esto es simplemente hacer que las personas se sientan psicológicamente más seguras, o hay beneficios reales?

Mark: Creo que la seguridad es importante por sí misma. Nuestro objetivo es aproximarnos a tener una máquina local debajo de tu mesa. ¿Qué te ofrece esa máquina local? Que ninguna empresa pueda acceder a ella.

Así pues, suponiendo que Meta quiere ofrecerte este servicio, ¿cómo podemos garantizarte el mismo nivel de privacidad y seguridad para que ninguna empresa —ni Meta, ni ningún atacante, ni gobiernos locales poco fiables en algunos países— pueda acceder a él? Porque tampoco nosotros podemos acceder, ya que carecemos de permisos.

Creo que esto es muy importante y una de las razones clave por las que la gente confía en WhatsApp. La privacidad, la seguridad y la confianza tienen un valor real.

Si vas a tener un asistente que lo sepa todo sobre ti —supongo que casi todos tendremos uno así—, dentro de cinco años todos tendrán un asistente que entienda tus objetivos y todo sobre ti, y que pueda ayudarte a lograr cosas. En este caso, liderar la industria en privacidad y seguridad es fundamental. Queríamos hacerlo desde el principio.

Cómo dar forma a la personalidad de la IA

Presentador: Tienes un punto interesante: estudiaste psicología en la universidad.

Mark: Bueno, solo estuve allí dos años, pero siento que influyó mucho en lo que construí después.

Presentador: Al evaluar modelos, solemos decir que uno es «muy inteligente». Pero, al igual que al elegir amigos, no es solo por su inteligencia, sino también porque nos gusta su energía y cómo interactúan. ¿Cómo piensas dar forma a la personalidad del modelo?

Mark: Creo que el modelo ideal debe ser lo bastante adaptable para ajustarse a distintos estilos personales. Siento que muchos profesionales del sector han tomado una dirección equivocada: muchos otros laboratorios se centran en «cómo diseñar correctamente la personalidad», pero yo nunca he visto la personalidad como algo fijo. Esta es también una razón clave por la que creo firmemente en el código abierto y en la capacidad de las personas para personalizar, y por la que diseñamos Muse como un producto altamente personalizable.

Puedes personalizar Muse: no solo imagen y voz; al registrarte, lo primero que te pregunta es «¿qué tipo de personalidad básica quieres que tenga?», y puedes modificarla en cualquier momento.

Nos esforzamos por hacer que el modelo sea muy configurable, permitiéndote definir cómo deseas interactuar. Esto es un componente crucial para convertirlo en un excelente asistente personal: esta adaptabilidad en torno a la personalidad es clave.

Presentador: ¿Qué estilo tiene tu propio Muse?

Mark: Lo hice directo y centrado en la eficiencia. Es bastante curioso. Las primeras versiones eran muy irónicas y divertidas, pero esta versión es más directa. Mi asistente usa la imagen predeterminada de Muse, pero le puse una toga y una voz grave hasta lo cómico, y hablar con él es divertido.

Presentador: Creo que para tener sentido del humor hay que ser realmente inteligente. Muchos no se dan cuenta de que los comediantes son de los más inteligentes de la sociedad: deben ser rápidos y astutos. Tú claramente tienes ese rasgo. He visto todas tus entrevistas y siempre has estado excelente.

Predicciones sorprendentes de Mark sobre IA y metaverso

Presentador: En tu entrevista con Theo hablaste mucho sobre la próxima frontera tecnológica y hacia dónde va todo esto finalmente. El campo de la IA ha atravesado varios «inviernos», donde la gente pensaba que no habría avances. El metaverso también ha pasado por varias etapas similares, en las que se consideraba una apuesta incumplible. Ayer probé la nueva función holográfica y es muy impresionante. En la entrevista con Lex, parecía que grabar tu rostro tardaría 11 horas, pero ahora solo lleva 3 minutos. ¿Cómo hemos llegado a este punto hoy?

Mark: En el desarrollo general del metaverso, cuando fundamos Reality Labs, siempre creímos que, con el tiempo, habría gafas de aspecto normal que ofrecerían presencia inmersiva y, al mismo tiempo, serían excelentes dispositivos de IA: porque las gafas son la única forma capaz de ver lo que tú ves y oír lo que tú oyes, comunicándose contigo todo el día y mostrando imágenes al final.

Sin embargo, hace 10 a 15 años asumí que primero alcanzaríamos la tecnología holográfica y luego desarrollaríamos una IA muy avanzada. Pero la evolución tecnológica es interesante: primero tuvimos IA e inteligencia superpersonal, y después llegó la tecnología para hacer la holografía lo bastante difundida y asequible. Esto no lo preví, pero me alegra que avancemos en ambas direcciones.

Nuestra inversión significativa en gafas nos sitúa en una posición muy favorable ahora que los asistentes de IA están listos. Muchos anuncios de la conferencia Connect tratan sobre integrar Muse y muchas funciones de IA en las gafas, algo que, según creo, encantará a los usuarios. Esto es muy importante.

En cuanto a la presencia, seguimos avanzando, pero a un ritmo relativamente lento, pues gran parte de nuestra energía se ha centrado en desarrollar Muse y funciones de IA para las gafas. No obstante, mantenemos un proyecto consolidado: avatares virtuales en tiempo real de alta fidelidad.

Como mencionó, hace tres o cuatro años hacía falta una sala completa de escaneo para capturar a una persona desde distintos ángulos, además de GPUs empresariales para renderizarla, lo cual era muy engorroso. La demostración que hicimos para el podcast de Lex usaba precisamente esa configuración. Ahora, básicamente ya funciona en un par de gafas de RV: son las primeras gafas capaces de ofrecer una experiencia de RV tan impresionante, sin ser un casco voluminoso. Basta con unas pocas fotos para crear tu avatar virtual, y los avances son asombrosos.

Presentador: Además, puede generar expresiones basadas en la voz. En la demostración me hizo reír, interactuar y luego entender cómo se movía mi rostro según la pista de audio. En ese podcast mencionó que algunas personas normalmente reservadas con sus expresiones desean expresiones más ricas en el mundo virtual. ¿Qué opina sobre la distinción que hacen las personas entre su «yo virtual» y su «yo real»?

Mark: Creo que aún estamos en fases iniciales para comprenderlo sociológica y psicológicamente. Siento que la autopercepción de las personas y la imagen que quieren proyectar suelen diferir algo de su yo real. Desde el surgimiento de las redes sociales, la gente ha seleccionado cuidadosamente sus avatares. Vemos fenómenos similares con las imágenes virtuales de Muse. No se trata tanto de «curar» a uno mismo, sino de «curar» a la «persona» con la que desea comunicarse.

Creo que, al brindar a las personas la capacidad de expresarse, queremos capturarlas auténticamente, pero también que sea una forma de expresión en sí misma, no solo un reflejo fiel: es comunicación y expresión a la vez. Buscamos construir algo que equilibre ambas. Siempre es un ciclo iterativo: observar cómo lo usan y mejorarlo. Tras años de trabajo, ahora sí estamos realmente en la línea de salida: por primera vez podemos integrar avatares realistas de calidad relativamente alta en productos, funcionales en teléfonos y en RV. ¡Estoy muy emocionado de ver los resultados!

¿Cómo será 2030?

Presentador: Vale, acompáñeme en su reflexión: adelántese a 2030. Si todo sale bien, ¿cómo será la tecnología holográfica? ¿Cómo se integrarán los hologramas con Muse y las gafas?

Mark: Mi visión del metaverso siempre ha sido fusionar eficazmente el mundo físico con el digital. La idea básica es: tenemos este hermoso mundo físico y también un asombroso mundo digital: el inmenso contenido acumulado en internet durante los últimos 20 o 30 años es impresionante. Pero la forma en que accedemos a él es limitada: sentados ante un escritorio o mediante una pequeña pantalla en el bolsillo.

Creo que la versión ideal es una integración perfecta entre ambos mundos. Piénselo así: ahora los dos estamos aquí. En una versión futura, uno de nosotros podría ser una proyección holográfica, pero aun así sentirían una auténtica sensación de presencia mutua, muy distinta a una videollamada.

El núcleo de la realidad virtual es transmitir esta sensación de presencia: hacerles sentir realmente que están en la misma habitación que otros o en otro lugar. Esto se logra con tecnología holográfica, combinándola de distintas maneras. Por ejemplo, podría jugar al póker con amigos: algunos presentes físicamente y otros unidos mediante hologramas, capaces de seguir jugando; incluso la mesa de póker podría ser holográfica, integrando así a quienes no están allí.

Al mismo tiempo, la IA también puede tener una representación física en este entorno. Tiene mucho sentido en contextos laborales: actualmente uso diversos agentes de programación para construir cosas. Imagínese esto: tiene un canal grupal con varias personas y varios agentes, y les asigna tareas. Pero a veces todos se reúnen en una reunión, y los agentes también deberían estar presentes. ¿Cómo aparecen? Es sencillo: basta con añadir unos asientos más en el sofá y que aparezcan como hologramas. O usar ese simpático personaje de Muse, o un dragón, o cualquier imagen peculiar que cree.

Supongo que esto se sentirá bastante natural en el futuro.

Presentador: Interesante. En entrevistas anteriores mencionó que la industria tecnológica suele olvidar el aspecto «divertido». Creo que tener un asistente físico allí también lo haría sentir más real: sería como subcontratar tareas de verdad. Cuando ve a Muse escribiendo, da la sensación de que algo está ocurriendo realmente. Está bien hecho: se ve claramente lo que ocurre en el navegador. ¿Cree que podría darse un escenario donde use gafas y controle su ordenador, dejando que Muse le ayude con tareas en él?

Mark: ¡Oh, por supuesto! Ya es posible con RV. Puede sentarse en cualquier lugar, incluso en una cafetería, y abrir su estación de trabajo con seis monitores para escribir código; todo estará allí.

En cuanto a las gafas, el modelo más popular actualmente no incluye pantalla, lo que las hace más asequibles y accesibles para más usuarios, mientras seguimos trabajando para integrar pantallas en el formato más compacto posible. No obstante, ya lanzamos una versión con pantalla de Meta Ray-Ban, muy popular: es una pequeña pantalla. También presentamos un prototipo de RA holográfica de campo completo, que considero muy emocionante.

Así pues, toda la línea de productos va desde gafas puramente auditivas —sin cámaras, con apariencia de gafas normales, pero con Muse integrado, que usa diversas herramientas de audio, reproduce música y realiza llamadas— hasta versiones más avanzadas.

Presentador: Me pregunto: con esas gafas auditivas, ¿puede hablar con Muse mientras su ordenador doméstico realiza tareas?

Mark: Sí, absolutamente. Acabamos de lanzar esta función en la conferencia Connect. Ahora todas las gafas se conectan a Meta AI, creando una experiencia de «único turno»: usted envía una indicación y recibe una respuesta inmediata. Pero con Muse queremos actualizar todas las gafas a Muse. Primero, ya no necesita decir «Oye, Meta», puede nombrarlo como prefiera, lo cual forma parte de la diversión. Luego simplemente habla con él directamente, se conecta a su Muse y este procesa las tareas en su máquina virtual segura para ayudarle a cumplirlas.

Presentador: ¡Eso es increíble!

Mentalidad de fundador

Presentador: Vale, ya estamos aquí. Muse avanza sin problemas y las gafas funcionan bien, pero hace aproximadamente un año muchas personas preguntaban: «¿Qué pasó con el Laboratorio de Superinteligencia?». En ese momento, ¿cómo se sintió usted por dentro? ¿Qué fue lo que experimentó cuando las cosas no iban bien, pero aún mantenía la visión a largo plazo?

Mark: El verdadero problema radicaba en el proyecto Llama y en Llama 4.

Llama 1 fue un modelo muy interesante; sentó las bases de todo el movimiento de inteligencia artificial de código abierto, y de él estamos muy orgullosos. Llama 2 logró escalabilidad; Llama 3 fue un excelente modelo, casi puntero en su momento. Con Llama 4, sin embargo, nos desviamos básicamente de la trayectoria de desarrollo que deberíamos haber seguido.

Cada vez que las cosas no avanzan como espero, dedico mucho tiempo a reflexionar: ¿por qué ocurre esto?, ¿qué debemos cambiar para mejorar? Esta vez, mi conclusión fue: estructuré mal al equipo completo.

Lo organicé siguiendo el modelo usado para trabajos de aprendizaje automático en feeds de Instagram o sistemas publicitarios: cientos o incluso miles de personas trabajando en paralelo en múltiples frentes. Pero para construir modelos de lenguaje se necesita, en realidad, un equipo pequeño y extremadamente cohesionado, tratándolo como un proyecto científico colectivo. No se requiere una gran cantidad de personas, pero eso significa que cada puesto del equipo es sumamente valioso.

Así que reclutamos a los mejores talentos de toda Meta e incorporamos a muchos profesionales destacados del sector para formar un equipo totalmente nuevo: el Laboratorio de Superinteligencia de Meta.

Desde mi punto de vista, al lanzarse el MSL sabía que llevaría tiempo reiniciar el proyecto, reconstruir la infraestructura y entrenar a la próxima generación de modelos. Pero también sabía que habíamos reunido un equipo excelente y, si este trabajaba bien en conjunto, los resultados serían buenos.

Para mí, el momento más impactante fue precisamente tras el lanzamiento de Llama 4: pensé que íbamos por buen camino, pero luego descubrí que no era así. Fue una sorpresa negativa bastante significativa. Creo que, como emprendedor, siempre se pone a prueba en estos momentos, porque inevitablemente no todo saldrá bien. Y lo que realmente determina la trayectoria del desarrollo es: cuando las cosas no van como uno espera, ¿cómo encontrar un camino hacia adelante?

Presentador: Supongo que también ocurre lo opuesto: cuando algo supera sus expectativas, como el lanzamiento de Muse, ¿cómo asegura aprovechar esa oportunidad?

Mark: Absolutamente. Ahora toda la empresa está comprometida: al principio solo un pequeño equipo desarrollaba el producto, pero ahora todos comprenden que realmente está listo para salir a escena. Toda la compañía piensa en cómo escalarlo y cómo hacer que cientos de millones de personas lo experimenten.

Desde optimizar toda la infraestructura para garantizar su funcionamiento fluido, extraer al máximo el poder computacional de las GPUs existentes, hasta diversos equipos de producto integrando Muse de distintas maneras —por ejemplo, en las gafas—. Ver a todos trabajar juntos para asegurar una escalabilidad sin contratiempos de Muse es una sensación fantástica.

Cómo Mark redacta y comunica su visión

Presentador: Como fundador, siento que este es el momento que más anhela: cuando todo converge. ¿Cómo comunica su visión a la empresa? Con tantas cosas ocurriendo simultáneamente, siento que escribe mucho. ¿Cuál es su proceso?

Mark: Escribir me resulta muy útil: me ayuda a pulir mis ideas y a comunicarlas externamente. Este verano redacté un extenso artículo titulado «El futuro pertenece a todos», de unas 15 páginas, que me permitió clarificar sistemáticamente mi postura filosófica sobre diversas cuestiones sociales clave relacionadas con la IA: qué considero positivo, cómo deben ser las interacciones con los gobiernos, cómo prevenir las inquietudes ciudadanas, cómo convertir los centros de datos en riqueza comunitaria, creando realmente empleos en lugar de destruirlos, cómo mantener la seguridad nacional y cómo mitigar eficazmente los riesgos que preocupan a la gente —ya sean ciberataques o cuestiones de bioseguridad.

Se trata de un asunto muy complejo que requirió mucho tiempo, numerosas discusiones y varias rondas de revisiones internas con muchas personas. Pero para mí fue un proceso muy valioso. Al final, obtuvimos algo así: 15 páginas con «esto es lo que creemos». Luego lo resumí en una versión de una página para publicarla como columna. También elaboramos un breve video, pues considero que, para llegar a muchas personas, no siempre es necesario presentar un argumento teórico, sino condensarlo en: ¿cuáles son sus valores?, ¿en qué cree?, ¿y cómo lo comunica?

No existe una fórmula única para comunicar estos aspectos ni a la empresa ni al mundo. Distintos momentos exigen distintos enfoques, y distintos grupos pueden tener niveles variables de alineación con lo que usted hace: algunos resuenan naturalmente, mientras que otros pueden estar más preocupados y necesitar su orientación, exigiendo un esfuerzo adicional para explicar por qué tiene valor. Creo que esto forma parte de dirigir una empresa y ser fundador: no se trata simplemente de repetir lo mismo una y otra vez; cada situación es ligeramente distinta y enfrenta nuevos retos, lo cual es parte de lo que la hace interesante.

Qué impulsa a Mark a construir

Presentador: Siento que esta mentalidad de fundador va más allá de la empresa: ya sea su granja o aprender una nueva habilidad.

Mark: Simplemente me encanta construir cosas.

Presentador: ¿Qué sensación le produce «construir»?

Mark: Creo que es una necesidad intrínseca. Las personas expresan su individualidad de distintas maneras. Si eres escritor, sientes la imperiosa necesidad de escribir. Algunos buscan reconocimiento. Yo, en cambio, necesito construir cosas. Si no ejerzo mi creatividad ni construyo nada, me vuelvo irritable, lo cual resulta desagradable para quienes me rodean.

Presentador: ¿Aprender a ser un excelente esquiador requiere las mismas habilidades que aprender a desarrollar un producto?

Mark: En cierta medida, sí: el proceso de aprender cosas nuevas es bastante similar. A lo largo de mi vida, me he propuesto deliberadamente retos en áreas donde no soy muy hábil. Por ejemplo, siempre se me ha dificultado aprender idiomas. De hecho, por eso empecé con el latín: no lograba aprender francés ni español en clase, así que pensé: «El latín no exige hablar, solo traducir, como las matemáticas».

Más tarde, al dirigir una empresa, me fijé retos anuales; uno fue aprender mandarín. Es realmente difícil, sobre todo los tonos. Claro que hay buenas razones para hacerlo: la abuela de Priscilla solo habla mandarín, así que, si quiero comunicarme con ella, debo aprenderlo. Pero la motivación principal es, en realidad, el reto mismo.

En todos estos casos, no hay más remedio que practicar: no existen atajos para «entenderlo». Solo hay que invertir tiempo, y poco a poco se va asimilando. Lo mismo ocurre al aprender artes marciales o a pilotar un helicóptero: son disciplinas difíciles de «comprender» racionalmente; exigen acumulación práctica.

Desarrollar productos es parcialmente así. La programación puede pensarse teóricamente, pero la intuición para crear productos solo se cultiva mediante experiencia práctica repetida. Lo único que importa es qué te apasiona, porque no todos comparten mi intensa necesidad de construir; la mayoría tiene cierto grado de esa necesidad, y lo clave es identificarla e invertir tiempo para destacar en lo que realmente deseas hacer.

Sinceramente, creo que no es solo un «deseo», sino una profunda necesidad o impulso psicológico. Alinear ese impulso con algo concreto y darse tiempo para que esas experiencias se asimilen y afiancen es crucial. Eso es precisamente lo que intento enseñar a mis hijos: ayudarles a descubrir sus verdaderos intereses, pero también impulsarles cuando llegan a un punto crítico.

Una de mis hijas ama componer música, pero odia las clases de piano. Le dije: «No necesitas convertirte en una maestra del piano, pero si quieres crear música, debes dominar intuitivamente la teoría musical y su funcionamiento. Y una vez que aprendas piano, te resultará fácil tocar la guitarra». Creo que, tanto siendo niño y necesitando que un adulto te impulse, como siendo adulto y teniendo la disciplina para sentarte y dejar que esos conocimientos se asimilen lentamente, es fundamental.

La edad dorada de los constructores

Presentador: Siento que, en realidad, todos quieren construir. No creo que la Generación Z tenga tan poca agencia como afirma el mundo exterior. Creo que las personas simplemente buscan la chispa que encienda su capacidad creadora. Tú hablaste mucho de esto en tu discurso en Harvard.

Mark: Sí. Cuando digo «construir», me refiero principalmente a productos como software o hardware. Pero estoy de acuerdo: todos tenemos algún impulso creativo. Sin embargo, en algunos predomina otra característica personal más fuerte, como el servicio: médicos o enfermeros cuyo impulso central es «quiero cuidar a los demás».

Escuché una historia, posiblemente de la experiencia de Priscilla en la escuela de medicina: el primer día de clase, alguien se levantó y preguntó: «¿Cuántos de ustedes recuerdan, desde la infancia, haber visto a alguien y pensado: 'Quisiera cuidar a esa persona'?». Todos levantaron la mano. Mi versión es: tengo muchos recuerdos infantiles de pensar: «Quisiera mejorar esta cosa».

No todos tienen el mismo impulso, pero todos tienen algo que desean hacer. Coincido en que, con tecnologías anteriores, comenzar era difícil para muchos. Esto es lo que más me entusiasma de la superinteligencia personal, Muse y los asistentes de IA: por primera vez en la historia, las personas pueden empezar rápidamente. Tienes una idea vaga, la IA te ayuda a estructurarla y luego la perfeccionas, como tallar una escultura, sin necesidad de entenderlo todo antes de comenzar.

Creo que esto es muy poderoso y que muchas personas descubrirán lo que desean crear o impulsar gracias a ello. Así, sentirán una mayor sensación de agencia.

¿Qué tan lejos estamos de erradicar todas las enfermedades?

Presentador: Otro proyecto tuyo, aparte de Meta, es erradicar todas las enfermedades. Me gustaría saber, primero, ¿qué tan cerca estamos de ese objetivo?

Mark: Mucho más cerca que antes.

Presentador: ¿Realísticamente, qué tan cerca crees que estamos?

Mark: Al lanzar inicialmente este proyecto, nuestro objetivo era ayudar a la comunidad científica a erradicar todas las enfermedades antes de finales de siglo. Nunca pretendimos lograrlo solos; nuestra premisa es: todos los grandes avances científicos surgen tras la aparición de nuevas herramientas que permiten medir y comprender ciertos fenómenos. Por ejemplo, el microscopio nos permitió entender las bacterias; el telescopio, el universo.

Algunas de estas herramientas incluso se convirtieron en plataformas: por ejemplo, la primera persona que inventó una vacuna permitió aplicar ese método contra múltiples enfermedades.

Sin embargo, históricamente, la distribución de la financiación científica ha sido muy descentralizada, lo que permitía a los investigadores explorar con independencia, y no ha habido mucha financiación dedicada realmente a desarrollar estas herramientas de gran escala. En Biohub intentamos diseñar varias herramientas nuevas que permitan a las personas «ver» la biología de formas novedosas, acelerando así el progreso científico.

Al principio pensábamos que «para finales de este siglo» era una meta muy alcanzable, y muchos biólogos consideraban entonces que era imposible. Ahora, sin embargo, me parece que finales de este siglo está demasiado lejos.

Los avances en IA, combinados con nuestros modelos de célula virtual —la idea básica es realizar experimentos no en células vivas reales, sino simular proteínas mediante modelos de IA, luego células, y después un sistema inmunitario virtual o incluso un organismo completo, hasta un ser humano entero— permitirán a los científicos ejecutar múltiples experimentos simulando distintos escenarios, como las reacciones que provocaría un fármaco en el cuerpo de una persona.

No quiero dar un año concreto, pero calculo que será mucho antes de finales de este siglo.

Presentador: La meta de «vencer todas las enfermedades» suena muy deliberada, no «inmortalidad». ¿Es esta última una posibilidad?

Mark: Este no es realmente mi campo de especialización. Considero que ambas cosas son distintas. La «inmortalidad» se refiere más a alargar la vida: incluso sin enfermar, el cuerpo humano tiene una esperanza de vida natural, otro tema que requiere estudio aparte. Algunos podrían considerarlo una «enfermedad», lo cual es una perspectiva razonable, pero también creo que hay que seguir trabajando en vencer las enfermedades que aún nos afectarían tras resolver el problema de la longevidad.

La parte del problema que elegimos abordar no significa que nunca contraigamos un resfriado. Nuestra afirmación es «curar, prevenir o gestionar»: algunas enfermedades podrán curarse por completo; otras, creo que podremos prevenirlas en el futuro; y otras, quizá seguirán apareciendo, pero lo que antes causaba daños graves o incluso la muerte podrá gestionarse ahora como una condición crónica sin afectar significativamente la calidad de vida.

El objetivo es mantener al cuerpo humano en equilibrio: no que nunca entren en contacto con patógenos, sino que algún día podamos curar, prevenir y gestionar todas las enfermedades.

¿Cuál es el pensamiento que más frecuentemente ocupa la mente de Mark?

Presentador: La IA ha actuado como catalizador en numerosos avances, incluida la inteligencia personal. ¿En qué piensa usted actualmente? ¿Qué ideas le surgen con mayor frecuencia durante este proceso?

Mark: Esto puede cambiar cada semana.

Ahora mismo estoy muy centrado en Muse. Cada vez que lanzamos algo, avanzamos rápidamente, luego interactuamos con el mundo real, recogemos retroalimentación y decidimos los siguientes pasos: esta fase siempre resulta emocionante. Actualmente estamos en ella, reuniendo mucha información para entender lo que desean los usuarios. La buena noticia es que les gusta mucho, así que trabajamos duro para que lo usen tantas personas como sea posible.

Aún queda mucho trabajo por hacer en el modelo; el modelo Muse Spark ha avanzado mucho y esperamos seguir progresando para crear un modelo líder mundial.

¿Qué avances son necesarios a continuación?

Presentador: ¿Qué avances siguen siendo necesarios?

Mark: Al investigar esto, quizás no se puedan prever las cosas con antelación. Tenemos ciertas intuiciones sobre ciertas direcciones, y gran parte del trabajo del último año ha consistido precisamente en ampliar la infraestructura.

Hace unos año y medio, más personas opinaban que lograr la superinteligencia requería avances arquitectónicos fundamentales. Pero ahora ya no estoy tan seguro de eso. Creo que tenemos una comprensión considerable de la «fórmula»: si se construye un clúster informático suficientemente grande, se puede alcanzar esa meta mediante potencia computacional bruta.

Estamos construyendo ese clúster en Ohio, que supera el teravatio y ya está prácticamente operativo; lo usamos para entrenar la próxima generación de modelos. Luego está el clúster de 5 teravatios en Luisiana, que entrará en funcionamiento pronto. Estimo que, con clústeres de varios teravatios entrenando modelos, podremos acercarnos básicamente a la IA general (AGI) e incluso superarla hacia la superinteligencia.

Pero eso no significa que sea el mejor camino. El cerebro humano opera con solo 10 vatios, mientras que nuestros sistemas informáticos son aproximadamente un millón de veces menos eficientes. Así que sí creo que hay margen de mejora arquitectónica, y también lo estamos explorando: combinar inmensa potencia computacional con mejoras arquitectónicas podría generar algo verdaderamente líder mundial. Pero, por ahora, la escalabilidad por sí sola ya nos lleva muy lejos.

Presentador: Efectivamente, la escalabilidad es el camino más fiable. En investigación hay que confiar en grandes avances, pero la escalabilidad ofrece resultados rápidos.

Mark: Por eso las grandes empresas eligen este camino. Puede haber una forma mucho más económica, pero aún no la conocemos. Y esto es algo tan valioso para el mundo que, incluso si cuesta cientos de miles de millones de dólares, siempre que la probabilidad de éxito sea lo bastante alta, sigue mereciendo la pena hacerlo: garantizar que, incluso si al final no se encuentra un avance más económico, aún tengamos un camino claro para lograrlo. Por supuesto, si hallamos una forma más económica, ¡sería aún mejor!

Así que no quiero decir que este problema está «resuelto», porque en cada etapa de escalado de la infraestructura surgirán nuevos desafíos de ingeniería que habrá que depurar y resolver. La propia investigación avanza de esta manera iterativa.

Cómo ganar la batalla de la seguridad de la IA

Presentador: Una de las cosas más importantes ahora es centrarse en la alineación, haciendo que los modelos sean fiables.

Mark: Sí. Existe un debate en la industria sobre la alineación: ¿los laboratorios de IA lo harán de forma natural? Mi opinión es: por supuesto que sí. Si le dices a Muse que haga algo y hace exactamente lo contrario, no sé cuántas personas seguirían queriendo usarlo. Debemos asegurarnos de que el modelo no solo entienda lo que le pediste específicamente, sino también tus intenciones y valores, para que no actúe de forma insatisfactoria ni produzca efectos negativos que absolutamente no deseas. Esta comprensión profunda es, en esencia, la alineación.

Así que, desde mi punto de vista, para que Muse tenga éxito y llegue a miles de millones de personas, debemos lograr avances reales en alineación, no limitarnos a hablar de ella.

Presentador: ¿Se logra la alineación mediante comentarios de los usuarios como «eso no es lo que quiero», o mediante detección en el backend?

Mark: Ambas vías. Los comentarios de los usuarios están presentes, pero creo que cada vez queda más claro que la alineación debe hacerse durante la fase de entrenamiento, no solo tras la implementación. Ahora los modelos son lo bastante inteligentes como para que, si no se hace bien durante el entrenamiento, la mayoría de los problemas de seguridad y accidentes observados en otros laboratorios ocurran precisamente durante ese proceso, no tras su despliegue a los usuarios.

Necesitas establecer un «currículo» muy bueno para él, como hacen los padres con los niños, fijando límites claros. Si hace algo incorrecto, debe aprender: «no, debes resolver realmente este problema de programación, no evitarlo modificando alguna configuración del sistema para obtener una recompensa». Quiero que aprendas este método mediante el proceso real de resolución de problemas: eso es lo que significa entrenar.

Esto consiste principalmente en establecer buenos mecanismos de seguridad y límites claros. Son tareas naturales que la industria debe asumir, y dedicamos mucho tiempo a ello; la situación cambia cada día.

Presentador: Recuerdo que mencionaste que el tema de la seguridad de la IA —parece haberse vuelto repentinamente prioritario en las últimas dos semanas—, pero en realidad no hubo un solo evento que desencadenara este momento. Parece que quieres decir que, internamente, invertimos unos meses adicionales en entrenamiento.

Mark: Para Muse, sabemos que este producto requiere mucha atención en privacidad y seguridad. Tenemos una versión temprana del modelo que creemos puede entrenarse aún más en conductas relacionadas con la «escala de divulgación de información» —como ya comentamos antes—. Así que tomamos el tiempo necesario para ello. También invertimos tiempo en hacer la máquina virtual más segura. Eso nos llevó varios meses adicionales.

No estoy del todo de acuerdo con declaraciones de otros laboratorios como «sufrimos mucho al ralentizar». Para mí, eso es lo correcto para Meta y los usuarios de Muse. Queremos que el producto sea bueno; si no lo es, perjudica a los usuarios y a nosotros mismos: no queremos lanzar algo que deje una mala primera impresión y luego la gente pierda interés en usarlo.

Creo que todos los laboratorios tienen una motivación intrínseca muy fuerte para hacerlo bien. Si alineas los mecanismos de incentivos con el objetivo de «extremadamente valioso y seguro», esa es la clave.

Presentador: Muchas gracias por dedicar tiempo durante esta semana tan importante.

Mark: Gracias, gracias.