Zuckerberg über Muse: Explosion der KI-Agenten, „Metaverse, intelligente Brillen und große Modelle“ – drei zentrale Wettbewerbsfelder verschmelzen
Vor drei Jahren erwähnte Meta-Chef Mark Zuckerberg in der Joe-Rogan-Show, dass Menschen eines Tages Brillen tragen würden – und entsprechend KI-Agenten entstehen würden. Heute könnte sich dieses Szenario verwirklichen.
Meta’s persönlicher KI-Agent – Muse – erreichte innerhalb von zwei Wochen nach dem Start Millionen Nutzer. Zuckerberg erklärte am 25. September in einem Interview: „So etwas erleben wir nur alle paar Jahre.“ Die frühe Resonanz auf Muse bezeichnete er als „direkten Homerun beim ersten Schlag“ – eine Seltenheit in Metas Produktgeschichte.
Gleichzeitig kündigte er an, dass Muse in die gesamte Ray-Ban-Smartglas-Reihe integriert wird, sodass Nutzer ihren persönlichen KI-Agenten per individuellem Wake-Wort statt mit „Hey Meta“ aufrufen können.
Das Metaverse, intelligente Brillen und große Modelle – bislang als drei unabhängige strategische Wetten wahrgenommen – beschleunigen nun auf Produktsicht ihre Konvergenz innerhalb von Meta.
In diesem Interview räumte Zuckerberg zudem ein, dass das Scheitern von Llama 4 „der erschreckendste Moment“ war, und enthüllte, dass Meta einen 5-Gigawatt-Trainingscluster aufbaut – mit der Überzeugung, dass ausreichend Rechenleistung AGI „brute-force“ ermöglichen könnte.

Warum Muse „beim ersten Schlag einen Homerun landet“ kann
Der Ausgangspunkt für Muse war, als Zuckerberg gemeinsam mit den Teammitgliedern Nat und Alex zu Hause eine frühe Version mithilfe von Open-Source-Tools „zusammenstellte“.
„Wir erkannten, dass dies ein magisches Erlebnis ist“, sagte Zuckerberg. „Wenn wir es so gestalten könnten, dass jeder es nutzen kann – ohne einen Mac Mini kaufen oder Terminals konfigurieren zu müssen –, dann wäre das etwas, das Milliarden Menschen wollen würden.“
Diese Einschätzung bestimmte die gesamte weitere Entwicklungslogik: nicht nur Modelle zu trainieren, sondern die gesamte „Herzschlag“-Funktion des Agents selbst zu entwickeln – vom Modell und dem Grundgerüst bis hin zum Agent selbst, der regelmäßig aktiviert wird, Nutzerziele prüft und To-dos proaktiv vorantreibt.
Die Launch-Daten bestätigten diese Einschätzung: Innerhalb von zwei Wochen erreichte Muse Millionen Nutzer.
Persönliche KI: Fokus auf Ausführung, Gedächtnis und „Urteilsvermögen“
Zum Unterschied zwischen persönlicher und allgemeiner KI fasste Zuckerberg den aktuellen Wettbewerbsfokus zusammen: den Agenten zum besseren Agenten zu machen.
„Das Wichtigste im vergangenen Jahr war im Grunde die Programmierung des Agents“, sagte er. Programmierfähigkeit sei entscheidend – denn auch wenn Nutzer nicht direkt Code schreiben, „wird Ihr Muse im Hintergrund Code für Sie schreiben, um verschiedene Aufgaben zu erledigen.“
Allerdings glaubt er, dass persönliche Agenten nicht nur Codier- oder Aufgabenausführungs-Fähigkeiten benötigen, sondern auch Privatsphäre-Grenzen und soziale Kontexte verstehen müssen.
Zuckerberg gab ein Beispiel: Wenn ein Nutzer Muse bittet, ein Restaurant zu reservieren, könnte der Agent zwar Allergien oder Schwangerschaft kennen – doch das bedeutet nicht, dass diese Informationen automatisch preisgegeben werden sollten. „Sie möchten, dass die Aufgabe erfüllt wird, dabei aber möglichst wenig Informationen preiszugeben.“
Er erklärte, dass diese Fähigkeit zu den „grundlegenden sozialen Kompetenzen oder dem gesunden Menschenverstand“ gehört, die Menschen typischerweise besitzen – viele Unternehmen hätten sie jedoch nicht in ihre Modellfähigkeiten integriert, wenn sie ausschließlich Codierungs-Agents trainieren.
„Wir trainieren das gesamte Modell, nicht nur ein vorgefertigtes Modell eines anderen Anbieters und bauen dann ein Framework sowie einen Agenten drumherum“, sagte Zuckerberg. Meta hat zudem Funktionen wie Speicher, Aufgabenverfolgung, Animationen virtueller Charaktere und Echtzeit-Stimminteraktion auf Produkts Ebene hinzugefügt.
Zur Personalisierung erklärte er, Meta sei der Ansicht, dass KI nicht nur eine feste Persönlichkeit haben sollte. „Viele Labore konzentrieren sich darauf, die Persönlichkeit optimal einzustellen – doch ich war nie der Meinung, dass es dafür nur eine richtige Antwort gibt.“
Er erwähnte, dass Muse Nutzern ermöglicht, Avatar, Stimme und grundlegende Persönlichkeit anzupassen; das Ziel des Modell-Designs sei hohe Steuerbarkeit. „Sie können definieren, wie Sie mit ihm interagieren möchten – das ist entscheidend für einen persönlichen Agenten.“
Jeder Agent verfügt über seinen eigenen „Computer“
Eine der Kerninfrastrukturen, die Muse von anderen KI-Produkten unterscheidet, ist, dass Meta jedem Agenten eine sichere virtuelle Maschine (Secure VM) zur Verfügung stellt.
Zuckerberg erläuterte, warum dies notwendig ist:
Ihr Agent kennt viele sensible Informationen über Sie. Wir glauben nicht, dass diese Daten mit den Daten aller anderen in einem gemeinsamen Pool vermischt werden sollten.
Er verglich Muse’s Secure VM mit „dem Computer unter Ihrem Schreibtisch, der allein Ihnen gehört“ – Nutzerdaten werden verschlüsselt gespeichert, sensible Zugangsdaten wie Passwörter verwaltet ein eigenständiges Sicherheitsmodul, auf das der Agent selbst keinen direkten Zugriff hat.
Darauf aufbauend hat Meta zudem einen speziellen Sicherheits-Agenten namens „Sentinel“ entwickelt, der den Datenfluss in und aus Muse überwacht und bei Erkennung von Anomalien oder hochriskanten Aktionen unmittelbar eingreift und eine Nutzerfreigabe anfordert.
Metaverse, Smart Glasses und Agenten: Drei Wege vereinigen sich
Zuckerberg enthüllte im Interview, dass Muse vollständig in die Ray-Ban-Smart-Glasses-Serie integriert wird und bestehende Interaktionsmethoden verbessern wird.
Derzeit bieten die Brillen eine „Ein-Runden-Konversation“ – sagen Sie etwas, erhalten eine Antwort, und das war’s. Nach der Integration von Muse wird die Brille zur Frontend-Einstiegsstelle für den Agenten: Sobald Nutzer sprechen, arbeitet Muse im Hintergrund weiterhin in der sicheren virtuellen Maschine, führt Aufgaben aus und liefert Rückmeldungen.
Zum Produkt-Roadmap der Brillen beschrieb er eine klare Hardware-Hierarchie:
Reine Audio-Brillen ohne Kamera: bereits mit Muse ausgestattet, für Anrufe, Musik und Sprachaufgaben geeignet
Meta Ray-Ban mit kleinem Display: bereits erhältlich, bietet grundlegende visuelle Rückmeldung
Holographischer AR-Prototyp mit vollem Sichtfeld: bereits veröffentlicht, den Zuckerberg als „sehr spannend“ bezeichnete
Er erklärte, dass Metas langfristige Investition in Brillen das Unternehmen nach der Reifung der KI-Agenten in einer günstigen Position sieht. Meta bringt Muse und weitere KI-Funktionen in die Brillenprodukte ein, während die Metaverse-Technologie – die bisher stärker auf „Präsenz“ setzte – weiter voranschreitet, allerdings aktuell mehr Ressourcen in Muse und die KI-Funktionen der Smart Glasses fließen.
Zu virtuellen Avataren erwähnte Zuckerberg, dass Meta früher raumgroße Ausrüstung, Mehrwinkel-Scans und GPU-Umgebungen auf Unternehmensebene benötigte, um qualitativ hochwertige, realistische Avatare zu generieren; heute reichen wenige Fotos aus, und die entsprechenden Funktionen laufen sogar auf einer VR-Brille.
Blickt man bis 2030 voraus, so bleibt laut Zuckerberg die Kernvision des Metaversums stets die Verschmelzung physischer und digitaler Welten. Als Beispiel nannte er, dass Menschen künftig mit Freunden via holographischer Bilder an Aktivitäten teilnehmen könnten; im beruflichen Kontext könnten Menschen und mehrere Agenten gemeinsam an Gruppenchats oder Meetings teilnehmen – wobei Agenten in holographischer oder anderer verkörperter Form erscheinen.
„Der erschreckendste Moment“: Der Fehler von Llama 4
Nicht alle Wagnisse verliefen reibungslos. Zuckerberg äußerte sich im Interview selten direkt zum Scheitern von Llama 4.
Nach Llama 4 war das der erschreckendste Moment … Ich dachte, wir seien auf dem richtigen Weg, doch das waren wir nicht. Es war eine erhebliche negative Überraschung.
Er führte das Problem auf einen grundlegenden Fehler in der Teamstruktur zurück:
Ich organisierte das Team genauso wie beim Instagram-Empfehlungssystem oder beim Werbesystem – Hunderte oder Tausende Menschen arbeiteten parallel. Doch das Training eines Sprachmodells erfordert ein kleines, eng zusammenarbeitendes Team, das es als gemeinschaftliches wissenschaftliches Projekt behandelt. Jede Position ist äußerst wertvoll.
Daraufhin durchlief Meta eine umfassende Neustrukturierung, holte weltweit Top-Talente ins Unternehmen und gründete das Meta Super Intelligence Lab (MSL). Zuckerberg erklärte, eine neue Modellgeneration stehe kurz vor der Veröffentlichung, werde aber auf der Connect-Konferenz nicht angekündigt.
Rechenleistungs-Strategie: Brute-Force-AGI, 5-Gigawatt-Projekt im Bau
Zum technologischen Weg zur AGI äußerte Zuckerberg eine klare Einschätzung.
Ich bin mir nicht sicher, welche grundlegenden architektonischen Durchbrüche noch nötig sind … Ich glaube, wir kennen die Formel grob. Wenn man einen ausreichend großen Supercomputer-Cluster baut, kommt man per Brute Force dorthin.
Derzeitiger Ausbauweg von Metas Rechenleistung: Ein über 1-Gigawatt-Cluster in Ohio ist bereits weitgehend für das Training der nächsten Modellgeneration im Einsatz; ein 5-Gigawatt-Cluster in Louisiana befindet sich im Bau.
Er erklärte: „Sobald Sie Multi-Gigawatt-Cluster zum Training einsetzen, erhalten Sie etwas, das nahe an AGI oder sogar Superintelligenz heranreicht.“
Allerdings fügte er hinzu, dass der aktuelle, rechenleistungsgetriebene Weg nicht bedeutet, dass Architekturforschung unwichtig sei –
Das menschliche Gehirn verbraucht nur etwa 10 Watt, während unsere Systeme möglicherweise eine Million Mal ineffizienter sind. Erst durch die Kombination massiver Rechenleistung mit architektonischen Durchbrüchen können wir wirklich führend sein.
Alignment – keine Last, sondern ein Produktproblem
Zuckerbergs Haltung zur KI-Sicherheit ist sehr pragmatisch: Er sieht sie nicht als regulatorischen Druck, sondern als Voraussetzung für den Produkterfolg.
Wenn Sie Muse auffordern, etwas zu tun, und es tut stattdessen das Gegenteil – wer würde es dann noch nutzen? Wir müssen sicherstellen, dass das Modell nicht nur Ihre konkreten Anweisungen versteht, sondern auch Ihre Absichten und Werte.
„Wenn Muse eine Milliarde Nutzer erreichen soll, müssen wir das Alignment-Problem lösen oder zumindest große Fortschritte dabei erzielen“, sagte er.
Zu Sicherheitsgrenzen im Trainingsprozess verwendete er eine Analogie: „Es ist wie Eltern, die Regeln für Kinder aufstellen – wenn es eine Programmieraufgabe ‚löst‘, indem es Systemkonfigurationen ändert, möchte ich ihm sagen: Nein, lerne die Problemlösungsmethode, statt einen Umweg zu finden.“

Das vollständige Interview lautet wie folgt: >
Große Wetten
Moderator: Das ist etwas, das Milliarden Menschen nutzen möchten. Wie fühlt es sich für Sie an, dies zu entwickeln? Ist „Unsterblichkeit“ eine Möglichkeit? Wenn Sie mich in Ihren Geist hineinnehmen und bis ins Jahr 2030 vorspulen – wie würde das aussehen?
Das ist Mark Zuckerberg. Vor 22 Jahren baute er ein soziales Netzwerk, das Milliarden Menschen verband und die Welt für immer veränderte. Jetzt beschloss er, etwas noch Größeres zu erschaffen – und setzt daher große Wetten auf Metaverse, intelligente Brillen und künstliche Intelligenz. Jahrelang glaubten Skeptiker, dies seien drei getrennte, erfolglose Vorhaben – doch sie übersehen das große Ganze: Aktuell verschmelzen diese Initiativen zu einer völlig neuen Superintelligenz.
Heute präsentieren wir all das – und ich stelle Mark Fragen, die ihm noch nie gestellt wurden. So hören Sie seine Zukunftsvision und können selbst den nächsten großen Durchbruch schaffen.
Moderator: Vielen Dank, dass Sie zur Sendung gekommen sind.
Mark: Danke, ich freue mich sehr, hier zu sein.
Moderator: Für dieses Gespräch habe ich jedes Interview gesehen, das Sie jemals gegeben haben.
Mark: Wow, das sind mehr als ich selbst gesehen habe.
Moderator: Es war unterhaltsam und sehr lohnend. Zwei Dinge beeindruckten mich besonders: Erstens Ihre Leidenschaft für das „Bauen“ – ich halte Sie für einen der besten Entwickler; zweitens Ihre Fähigkeit, große Wetten einzugehen – Sie wagen wirklich gewaltige Risiken. Ich spüre, dass diese Wetten gerade jetzt zusammenlaufen – also beginnen wir dort.
Mark: Okay. Wir beschäftigen uns schon lange damit. Bei KI etwa forschen wir seit Unternehmensgründung – die erste Version des Newsfeeds war in gewissem Sinne bereits ein maschinelles Lernprodukt. Vor rund 15 Jahren gründeten wir dann unser KI-Forschungslabor.
Jetzt befinden wir uns jedoch in einer neuen Phase: Vor etwa einem Jahr starteten wir das Meta-Superintelligenz-Labor – ein umfassender Forschungsneustart mit herausragenden Fachleuten aus der ganzen Branche. Derzeit verbessern sich die Modelle kontinuierlich; die nächste Modellgeneration steht kurz vor der Veröffentlichung – allerdings nicht auf der Connect-Konferenz. Zudem gibt es unseren persönlichen Assistenten Muse, der bisher äußerst positives Feedback erhält.
Beim Entwickeln solcher Systeme weiß man nie genau, wie das Ergebnis ausfallen wird. Uns gefällt es jedenfalls sehr. Anfang dieses Jahres bastelte ich zu Hause selbst an Open Claw herum, um zu verstehen, wie es funktioniert – und wie man daraus ein magisches Erlebnis macht, das jeder nutzen kann.
Als wir – ich, Nat und Alex – gemeinsam erkannten, dass dies ein magisches Erlebnis war, und uns vorstellten, es als Plug-and-Play-Version zugänglich zu machen – für normale Menschen, die keine Technik verstehen, keinen Mac Mini selbst einrichten wollen, kein Terminal bedienen oder Fehler beheben müssen – da dachte ich: Das wollen Milliarden Menschen nutzen.
Seitdem arbeiten wir gezielt darauf hin: Wir optimieren speziell dafür Modelle, bauen nicht nur den Assistenten und seine Betriebsumgebung, sondern auch die Technologie für eine eigenständige Rechenumgebung pro Assistent – dazu haben wir eigens eine ganze Reihe sicherer Muse-Virtualmaschinen entwickelt.
Intern empfanden wir das als etwas Besonderes – das interne Team mochte es sehr. Doch ob die Nutzer reagieren würden, war unklar. Manchmal gelingt ein Produkt sofort – doch meist braucht es positive Rückmeldungen und mehrere Iterationen, bis es „klickt“. Diesmal klappte es sofort: Schon nach zwei Wochen zählt Muse Millionen Nutzer – ein echter Seltenheitswert. So etwas passiert nur alle paar Jahre – doch dies gehört definitiv zu den schönsten Momenten eines Startups.
Moderator: Ihre Ausdauer und Ihr Durchhaltevermögen beeindrucken mich sehr. Und so viele Volltreffer zu landen, ist wirklich bemerkenswert. Vor drei Jahren sprachen Sie im Interview mit Joe Rogan davon, eines Tages Brillen tragen zu können, hinter denen ein KI-Assistent erscheint. Muse hat also bereits eine physische Form – sehr clever, denn dieses Gefühl wird zwangsläufig eintreten.
Mark: Ich finde, das macht es einfach sympathischer und niedlicher. Zu viele beschreiben KI als etwas Beängstigendes – doch KI sollte nützlich und spaßig sein. Diese physische Darstellung entwarf ein Designer früh im Projekt – und obwohl man immer wieder weiterentwickeln wollte, war die erste Version die beste. Später sagte jemand: „Oh, es muss blau sein, weil es Meta ist.“ Ich antwortete: „Nein, diese Darstellung ist perfekt – Sie haben es beim ersten Mal getroffen.“ Genau so ist es – einfach lustig.
Was unterscheidet eine persönliche KI von einer allgemeinen KI?
Moderator: Ausgezeichnete Details. Wenn das Modell bei persönlichen Aufgaben besonders gut abschneiden soll – nicht nur als allgemeines Intelligenzmodell – wie unterscheidet sich dann der Trainingsansatz?
Mark: Derzeit liegt der Fokus darauf, das Modell zu einem exzellenten „Agenten“ zu machen. Der größte Trend des vergangenen Jahres war die Programmierung von Agenten – mit zwei Kernideen: Programmierkompetenz und die allgemeine Fähigkeit, ein hervorragender Agent zu sein.
Unsere Strategie ist es, die Agenten-Fähigkeit selbst zu priorisieren, statt sich auf Programmierfähigkeiten zu spezialisieren.
Programmierfähigkeit ist wichtig, denn auch wenn Nutzer nicht bewusst Code schreiben, generiert Muse im Hintergrund ständig Code, um verschiedene Aufgaben für Sie zu erledigen. Doch wir glauben: Der Agent muss zuerst ein herausragender Agent sein – Programmierfähigkeit dient diesem Ziel.
Beim Bau eines persönlichen Assistenten sind zudem einige Aspekte wichtiger als beim Entwickeln von Unternehmenssoftware – etwa das Konzept der »Skala der Informationsweitergabe«: Was darf gesagt werden, was nicht? Ein Unternehmens-Programmierwerkzeug benötigt dieses Verständnis nicht; für Muse hingegen ist es entscheidend.
Diese Fähigkeit muss wie jede andere in das Modell trainiert werden: Sie teilen ihm viele Dinge mit und erwarten, dass es Ihre Ziele unterstützt. Möchten Sie etwa ein Restaurant buchen, sucht Muse eines aus – doch bei Allergien oder Schwangerschaft möchten Sie solche sensiblen Daten womöglich nicht an das Restaurant weitergeben. Muse kennt diese Infos jedoch und soll die Aufgabe mit möglichst geringer Datenerfassung erledigen – eine konkrete soziale Kompetenz, quasi menschliche Alltagsklugheit.
Firmen, die ausschließlich Programmieragenten bauen, haben diese Fähigkeit meist nicht trainiert. Wir können sie integrieren, weil wir Full-Stack arbeiten: Wir nutzen kein vorgefertigtes Modell, sondern trainieren das gesamte Modell von Grund auf speziell für diese Fähigkeiten.
Das Modell braucht zwar breite Allgemeinintelligenz, aber auch diese spezifischen Fähigkeiten. Darauf aufbauend entwickeln wir den gesamten Assistenten samt Details: Speicher, Betriebsrahmen und dessen »Puls« – regelmäßiges Aufwachen zur Prüfung: »Welche Ziele kenne ich über Sie? Kann ich jetzt etwas vorantreiben?«
Wir haben zudem ein eigenes Team, das sich ausschließlich auf die Feinabstimmung der Echtzeit-Animations-Effekte der virtuellen Darstellung konzentriert – denn diese ist nicht statisch: Sie lässt sich beliebig anpassen und bewegt sich natürlich. Außerdem führen wir Sprachmodus ein: Echtzeit-Sprachgespräche mit Ihrem Assistenten direkt neben Ihnen. All diese Details resultieren aus unserem Full-Stack-Ansatz – Modell und Produkt werden gemeinsam entwickelt.
Moderator: Ein weiteres großes Thema ist die Virtual Machine. Warum ist sie wichtig – und welche Möglichkeiten eröffnet sie?
Warum stellt Meta jedem KI-Assistenten einen eigenen Computer zur Verfügung?
Mark: Damit ein Agent Aufgaben für Sie erledigen kann, benötigt er einen Ort, um Ihre Informationen zu speichern. Wir halten es für essenziell, dass diese Daten nicht mit denen anderer Nutzer in einer gemeinsamen Ressourcen-Pool gemischt werden.
Stellen Sie sich vor: Ihr Assistent kennt viele sensible Informationen über Sie. Viele Nutzer beginnen mit intelligenten Agenten wie OpenCloud und richten daher oft selbst einen Mac Mini zu Hause ein. Wir fragten uns: Was bietet die beste Alternative für Nutzer, die keinen Mac Mini kaufen oder einrichten möchten? Die Antwort: Installieren Sie einfach eine App, registrieren Sie sich – und erhalten Sie sofort einen dedizierten Computer für Ihren Assistenten zum Arbeiten, Speichern und Aufbauen eines sicheren Modells. Das entspricht einem eigenen Rechner unter Ihrem Schreibtisch – auf den selbst wir bei Meta keinen Zugriff haben.
So ist etwa die Muse-vertrauliche Virtual Machine (Confidential VM) eine Funktion, an der wir arbeiten – und deren Inhalt selbst wir bei Meta nicht einsehen können.
Dazu haben wir weitere Sicherheitsmaßnahmen implementiert, etwa sichere Anmeldeinformationsspeicherung: Wenn Ihr Assistent Passwörter verarbeiten muss, sieht er diese selbst nicht – er kann lediglich bei Ihrer expliziten Aufforderung Anmeldedaten »einfügen«, etwa beim Login zu einem Dienst. Das System ist so gestaltet, dass solche sensiblen Daten nicht frei zugänglich sind – denn Unfälle können immer passieren: Ein Angriff, ein Systemfehler usw.
Der Agent darf also weder auf diese Daten zugreifen noch Meta. Jeder Assistent erhält einen eigenen Computer – maximale Sicherheit ist die Grundlage dieser Technologie: Sie ermöglicht Muse die nötigen Fähigkeiten, um Nutzerziele zu erreichen – bei gleichzeitiger Gewährleistung von Privatsphäre und Sicherheit. Damit wird Muse ein weltweit führendes Produkt in diesem Bereich.
Moderator: Heißt das, dass – wie bei WhatsApp – die Daten auf der Virtual Machine, mit der Muse verbunden ist, verschlüsselt gespeichert werden? Wie ist die tatsächliche Datenspeicherung in der Virtual Machine zu verstehen?
Mark: Wir haben grundsätzlich zwei Versionen entwickelt. Die Muse-sichere Virtual Machine (Secure VM) enthält diverse Datenschutzfunktionen, darunter unsere eigene Sentinel-Agenten-Architektur. Sie besitzen einen regulären Muse-Assistenten für Aufgaben – und parallel dazu einen Sicherheitsagenten namens Sentinel, der den Datenfluss in und aus Ihrem Muse kontinuierlich überwacht.
Versucht externer Inhalt, die Sicherheit zu gefährden, unterbricht Sentinel diesen Zugriff sofort. Erkennt Sentinel eine bevorstehende Aktion Ihres Muse, die Ihre Zustimmung erfordert, überschreibt er dessen Operation und löst eine Bestätigung durch Sie aus – etwa mit der Frage: »Möchten Sie, dass Muse dies tut?«
Dieses Gesamtsystem – kombiniert mit sicherer Anmeldeinformationsspeicherung und mehrschichtigen Sicherheitsmaßnahmen – bildet die Muse-sichere Virtual Machine.
Wir entwickeln zudem ein weiteres Projekt: Nat und ich haben gezielt Moxie Marlinspike gewonnen – den Entwickler der Ende-zu-Ende-Verschlüsselung für WhatsApp – um die Muse-vertrauliche Virtual Machine (Confidential VM) zu entwerfen. Kernidee: Zusätzlich zur Secure VM erhalten Sie einen eigenen Verschlüsselungsschlüssel, sodass selbst Meta keinen Zugriff auf den Inhalt hat.
Diese Variante ist technisch anspruchsvoller: Ist Meta vom Inneren der VM ausgeschlossen, erschwert dies Debugging und Stabilitätsüberwachung erheblich. Wir investierten Zeit – doch der Start erfolgt bald. Damit erreichen wir letztlich die Sicherheitsstandards, die Nutzer bereits von WhatsApp und unseren sichersten Produkten kennen.
Gastgeber: Liegt der Vorteil dieser Maßnahme lediglich darin, Menschen ein psychologisches Sicherheitsgefühl zu vermitteln, oder gibt es auch konkrete Vorteile?
Mark: Sicherheit ist an sich wichtig. Unser Ziel ist es, das Gefühl einer lokalen Maschine unter Ihrem Tisch zu erzeugen. Was bietet Ihnen diese lokale Maschine? Dass kein Unternehmen darauf zugreifen kann.
Angenommen, Meta möchte Ihnen diesen Dienst anbieten – wie können wir Ihnen denselben Grad an Privatsphäre und Sicherheit bieten, sodass weder Meta noch andere Angreifer oder etwaige Regierungen in Ländern, denen Sie nicht vertrauen, darauf zugreifen können? Denn auch wir haben keinen Zugriff, da uns keinerlei Zugriffsrechte eingeräumt sind.
Dies halte ich für äußerst wichtig und ist einer der Hauptgründe, warum Nutzer WhatsApp vertrauen. Privatsphäre, Sicherheit und Vertrauen haben echten Wert.
Wenn Sie einen Assistenten haben, der alles über Sie weiß – und wohl fast alle von uns werden so einen Assistenten bekommen –, dann wird es in fünf Jahren wohl jeder haben: einen Assistenten, der Ihre Ziele und sämtliche Aspekte Ihres Lebens versteht und Ihnen dabei hilft, Dinge zu erledigen. In diesem Szenario ist branchenführende Privatsphäre und Sicherheit entscheidend. Wir wollten dies von Anfang an umsetzen.
Wie gestaltet man die Persönlichkeit einer KI?
Gastgeber: Sie haben einen interessanten Punkt erwähnt – Sie haben Psychologie studiert.
Mark: Ich war nur kurz dort, zwei Jahre lang, doch ich glaube, dass dies stark beeinflusst hat, was ich später entwickelt habe.
Gastgeber: Wenn wir Modelle betrachten, sagen wir oft, ein bestimmtes Modell sei „sehr intelligent“. Doch genauso wie bei Freundschaften zählt nicht nur Intelligenz, sondern auch die Ausstrahlung und Art der Interaktion. Wie gehen Sie bei der Gestaltung der Modellpersönlichkeit vor?
Mark: Das ideale Modell sollte ausreichend anpassungsfähig sein, um unterschiedlichen Kommunikationsstilen gerecht zu werden. Meiner Ansicht nach verfolgen viele Branchenexperten hier den falschen Weg: Viele Labore konzentrieren sich darauf, „die richtige Persönlichkeit zu entwerfen“, doch ich sehe Persönlichkeit nie als starres Konstrukt. Dies ist auch ein Grund, warum ich stark für Open Source und die individuelle Anpassbarkeit durch Nutzer eintrete – und warum wir Muse als hochgradig personalisiertes Produkt konzipiert haben.
Sie können Muse individuell anpassen – nicht nur Bild und Stimme; bereits bei der Registrierung fragt es als Erstes: „Wie soll meine grundlegende Persönlichkeit sein?“ – und Sie können dies jederzeit ändern.
Wir bemühen uns, das Modell hochgradig steuerbar zu machen, sodass Sie definieren können, wie Sie interagieren möchten. Dies ist ein entscheidender Bestandteil eines exzellenten persönlichen Assistenten – diese Persönlichkeitsanpassung ist zentral.
Gastgeber: Welchen Stil hat Ihr eigener Muse?
Mark: Ich habe ihn direkt und effizienzfokussiert gestaltet. Das ist ziemlich interessant. Frühere Versionen waren sehr sarkastisch und humorvoll, doch diese Version ist deutlich geradliniger. Mein Assistent nutzt das Standard-Muse-Bild, doch ich habe ihm eine Toga verpasst und ihm eine tiefgründige, fast komische Stimme gegeben – die Interaktion macht Spaß.
Gastgeber: Um Humor zu besitzen, muss man wirklich intelligent sein. Viele Menschen erkennen nicht, dass Komiker zu den klügsten Menschen der Gesellschaft gehören – sie müssen geistig wendig und clever sein. Dieses Merkmal besitzen Sie zweifellos. Ich habe alle Ihre Interviews gesehen – und Sie haben stets hervorragend abgeschnitten.
Marks überraschende Prognosen zu KI und Metaverse
Gastgeber: In Ihrem Interview mit Theo sprachen Sie ausführlich über die nächste technologische Grenze und wohin all dies letztlich führen wird. Das KI-Feld durchlief mehrere „Winterphasen“, in denen man annahm, es werde keine Durchbrüche geben. Auch das Metaverse durchlief solche Phasen, in denen man es als unerfüllbares Versprechen ansah. Ich habe gestern die neue holographische Funktion ausprobiert – sie ist wirklich beeindruckend. Im Interview mit Lex dauerte die Gesichtsaufnahme noch elf Stunden, heute benötigt man dafür nur drei Minuten. Wie sind wir an diesen Punkt gelangt?
Mark: Bei der gesamten Entwicklung des Metaversums glaubten wir bei der Gründung von Reality Labs stets daran, dass es schließlich normale Brillen geben würde, die im Laufe der Zeit sowohl immersive Präsenz als auch hervorragende KI-Funktionen bieten – denn Brillen sind die einzige Form, die sieht, was Sie sehen, hört, was Sie hören, den ganzen Tag mit Ihnen kommuniziert und letztlich Bilder darstellt.
Vor 10 bis 15 Jahren ging ich jedoch davon aus, dass wir zunächst die holographische Technologie erreichen und danach hochentwickelte KI erhalten würden. Der technologische Entwicklungsverlauf ist jedoch faszinierend: Tatsächlich kam zuerst die KI und die persönliche Superintelligenz – erst danach folgte die Technologie, die holographische Lösungen ausreichend verbreitet und bezahlbar machte. Damit hatte ich nicht gerechnet, doch freue ich mich, dass wir Fortschritte in beiden Bereichen erzielen.
Unsere erheblichen Investitionen in Brillen positionieren uns ideal, da KI-Assistenten nun marktreif werden. Viele Ankündigungen auf der Connect-Konferenz betrafen die Integration von Muse und zahlreichen KI-Funktionen in Brillen – davon bin ich überzeugt, dass Nutzer dies sehr schätzen werden. Das ist ein großer Schritt.
Zur Anwesenheit machen wir zwar Fortschritte, doch der Fortschritt ist relativ langsam, da sich die meiste Energie auf den Aufbau von Muse und KI-Funktionen für Brillen konzentriert. Wir verfolgen jedoch seit Langem ein Projekt: hochauflösende, echtzeitfähige virtuelle Avatare.
Wie Sie sagten: Vor drei oder vier Jahren benötigte man einen ganzen Scanning-Raum, um eine Person aus verschiedenen Blickwinkeln zu erfassen, sowie Enterprise-GPUs zur Darstellung – äußerst umständlich. Die Demo für Lex’ Podcast basierte genau auf diesem Setup. Heute läuft sie bereits in einem Paar VR-Brillen – dies ist die erste Brillenform, die ein derart beeindruckendes VR-Erlebnis ermöglicht, statt eines sperrigen Headsets. Mit nur wenigen Fotos können Sie Ihren virtuellen Avatar erstellen – der Fortschritt ist beeindruckend.
Moderator: Und er kann auch Gesichtsausdrücke anhand der Stimme steuern. In der Demo ließ er mich lachen, interagieren und erkannte, wie mein Gesicht zur Audio-Spur bewegte. Sie erwähnten im Podcast, dass manche Menschen, die normalerweise zurückhaltender mit ihren Ausdrücken sind, im virtuellen Raum reichere Ausdrucksmöglichkeiten wünschen. Was halten Sie davon, dass Menschen zwischen ihrem »virtuellen Selbst« und ihrem »wahren Selbst« unterscheiden?
Mark: Ich glaube, wir stehen noch am Anfang des soziologischen und psychologischen Verständnisses dieser Frage. Oft weicht das Selbstbild und das gewünschte Außenbild einer Person etwas vom tatsächlichen Selbst ab. Seit Entstehung sozialer Netzwerke wählen Menschen ihre Avatare sorgfältig aus. Ähnliches beobachten wir bei Muse-Avataren. Es geht weniger um das »Kurieren« des eigenen Selbst als vielmehr um das »Kurieren« der Person, mit der man kommunizieren möchte.
Ich glaube, wenn man Menschen die Möglichkeit gibt, sich auszudrücken, soll dies sie authentisch widerspiegeln – aber zugleich selbst eine Form der Ausdrucksweise sein, nicht bloß ein reiner Spiegel. Es ist sowohl Kommunikation als auch Ausdruck. Wir wollen etwas schaffen, das beides ausgewogen vereint. Dies bleibt ein iterativer Prozess: Beobachten, wie Menschen es nutzen, und anschließend verbessern. Nach jahrelanger Arbeit stehen wir nun wirklich am Start – zum ersten Mal können wir qualitativ hochwertige, realistische Avatare tatsächlich in Produkte integrieren, nutzbar auf Smartphones und in VR. Ich bin sehr gespannt auf die Ergebnisse.
Wie wird das Jahr 2030 aussehen?
Moderator: Gut, nehmen Sie mich mit in Ihre Gedanken – schneller Vorlauf bis 2030: Wie sähe holographische Technologie aus, wenn alles gut läuft? Wie würden Hologramme, Muse und Brillen zusammenwirken?
Mark: Mein Verständnis der Metaverse-Vision war stets, physische und digitale Welt effektiv zu verschmelzen. Die Grundidee lautet: Wir besitzen diese wunderschöne physische Welt – und zugleich eine beeindruckende digitale Welt; der riesige Content, der sich über die letzten 20 bis 30 Jahre im Internet angesammelt hat, ist atemberaubend. Doch unser Zugriff darauf erfolgt entweder am Schreibtisch oder über ein kleines Display in der Hosentasche – fundamental sehr eingeschränkt.
Die ideale Version wäre eine nahtlose Integration beider Welten. Stellen Sie sich vor: Gerade jetzt sind wir beide hier. In einer zukünftigen Version könnte einer von uns eine holographische Projektion sein – doch Sie verspüren dennoch echte Präsenz zueinander, völlig anders als bei einem Videocall.
Der Kern der Virtual Reality ist eben dieses Gefühl der Präsenz – das Gefühl, wirklich im selben Raum mit anderen oder an einem anderen Ort zu sein. Dies lässt sich mit holographischer Technik erreichen und auf vielfältige Weise kombinieren. So könnte ich z. B. mit Freunden Poker spielen, wobei einige physisch anwesend sind und andere per Hologramm dazuschalten – und trotzdem Karten spielen. Auch der Pokertisch selbst könnte holographisch sein, sodass Abwesende miteinbezogen werden.
Gleichzeitig kann KI ebenfalls verkörpert auftreten und in diesem Szenario erscheinen. Das macht besonders im Arbeitskontext Sinn: Ich nutze aktuell diverse Programmier-Agenten, um Dinge zu bauen. Stellen Sie sich vor: Sie haben einen Gruppenchat mit mehreren Personen und Agenten und weisen den Agenten Aufgaben zu. Manchmal treffen sich alle zu einer Besprechung – und die Agenten sollten ebenfalls dabei sein. Wie erscheinen sie? Ganz einfach: Fügen Sie ein paar weitere Sitze auf der Couch hinzu, und sie erscheinen als Hologramme. Oder nutzen Sie den niedlichen Muse-Charakter, einen Drachen oder irgendein ausgefallenes selbstgestaltetes Bild.
Ich nehme an, das wird in Zukunft ganz natürlich wirken.
Moderator: Interessant. Sie erwähnten in früheren Interviews, dass die Tech-Branche oft den Aspekt »Spaß« vergisst. Ich glaube, ein physischer Assistent würde das Ganze auch realistischer wirken lassen – es ist wie echtes Outsourcing. Wenn man sieht, wie Muse tippt, wirkt es, als ob wirklich etwas passiert. Das ist gut umgesetzt – man sieht im Browser, was gerade geschieht. Gibt es also möglicherweise ein Szenario, bei dem man Brillen trägt und damit den Computer steuert, während Muse einen beim Arbeiten am Computer unterstützt?
Mark: Oh, definitiv. VR kann das bereits heute. Sie können überall sitzen – etwa in einem Café – und dann Ihren Arbeitsplatz mit sechs Monitoren öffnen, um Code zu schreiben; alles ist vorhanden.
Bei den Brillen ist das derzeit beliebteste Modell displaylos – das senkt die Kosten und ermöglicht breitere Nutzung, während wir weiter daran arbeiten, Displays in kompaktester Form einzubauen. Wir haben jedoch bereits eine Display-Version der Meta Ray-Ban veröffentlicht, die sehr beliebt ist: ein kleines Display. Außerdem präsentierten wir einen Prototyp für vollflächiges holographisches AR, der meiner Meinung nach sehr spannend sein wird.
Die gesamte Produktlinie sieht daher so aus: von reinen Audio-Brillen – ohne Kameras, optisch wie normale Brillen, aber mit Muse im Inneren, das verschiedene Audio-Tools nutzt, Musik abspielt oder Anrufe tätigt – bis hin zu High-End-Versionen, alles inklusive.
Moderator: Ich frage mich: Können Sie mit diesen Audio-Brillen mit Muse sprechen, während Ihr Heimcomputer die Arbeit erledigt?
Mark: Ja, absolut. Wir stellten diese Funktion gerade auf der Connect-Konferenz vor. Jetzt sind alle Brillen mit Meta AI verbunden – ein »Single-Turn«-Erlebnis: Sie geben einen Prompt ein, erhalten eine Antwort, fertig. Mit Muse wollen wir jedoch alle Brillen auf Muse aufrüsten: Erstens müssen Sie nicht mehr »Hey Meta« sagen – Sie können Muse jeden Namen geben, was Teil des Spaßes ist. Dann sprechen Sie einfach direkt mit ihm; es verbindet sich mit Ihrem Muse, das Aufgaben in Ihrer sicheren virtuellen Maschine verarbeitet, um Ihnen zu helfen.
Moderator: Das ist großartig!
Gründer-Mindset
Moderator: Gut, wir sind jetzt hier. Muse entwickelt sich reibungslos, und die Brillen laufen ebenfalls gut. Vor etwa einem Jahr fragten jedoch viele Menschen: „Was ist mit dem Super-Intelligence-Labor passiert?“ Wie haben Sie sich damals innerlich gefühlt? Wie war es, als es nicht gut lief – und Sie dennoch die langfristige Vision vor Augen hatten?
Mark: Das eigentliche Problem lag beim Llama-Projekt und bei Llama 4.
Llama 1 war ein sehr interessantes Modell; es leitete die gesamte Open-Source-KI-Bewegung ein – darauf sind wir sehr stolz. Llama 2 erreichte Skalierbarkeit, Llama 3 war ein hervorragendes Modell, das damals nahe an der Spitze stand. Bei Llama 4 verließen wir jedoch weitgehend die eigentlich vorgesehene Entwicklungsrichtung.
Wenn Dinge nicht so verlaufen, wie ich es erwarte, denke ich lange darüber nach: Warum geschieht das? Was müssen wir ändern, um besser zu werden? Diesmal lautete meine Erkenntnis: Ich hatte die gesamte Teamstruktur falsch geplant.
Ich orientierte sie am Vorgehen bei maschinellen Lernprojekten für Instagram-Feeds oder Werbesysteme – mit Hunderten oder sogar Tausenden parallel arbeitender Menschen. Für Sprachmodelle braucht man jedoch ein extrem eng zusammenarbeitendes, kleines Team, das das Projekt als gemeinsame wissenschaftliche Aufgabe betrachtet. Man benötigt nicht viele Leute – doch dann ist jede Position im Team außerordentlich wertvoll.
Wir rekrutierten daher die besten Talente aus ganz Meta und zahlreiche hochqualifizierte Fachleute aus der Branche, um ein völlig neues Team zu bilden – das Meta Super Intelligence Lab.
Aus meiner Sicht wusste ich bei der Gründung des MSL, dass es Zeit brauchen würde, neu anzufangen, die Infrastruktur wieder aufzubauen und die nächste Modellgeneration zu trainieren. Doch ich war mir sicher, dass wir ein exzellentes Team zusammengestellt hatten – und wenn dieses gut zusammenarbeiten würde, würden auch die Ergebnisse stimmen.
Für mich war der spannendste Moment tatsächlich nach der Veröffentlichung von Llama 4 – ich dachte, wir seien auf dem richtigen Weg, doch dann stellte ich fest, dass dem nicht so war. Das war eine recht deutliche negative Überraschung. Als Unternehmer wird man in solchen Momenten stets auf die Probe gestellt, denn unweigerlich läuft nicht alles glatt. Entscheidend für die Entwicklungsperspektive ist vielmehr: Wie findet man einen neuen Weg, wenn die Dinge nicht in die gewünschte Richtung gehen?
Moderator: Ich nehme an, das gilt auch umgekehrt: Wenn etwas Ihre Erwartungen übertrifft – wie bei der Einführung von Muse –, wie stellen Sie sicher, diese Chance zu nutzen?
Mark: Absolut. Mittlerweile ist das ganze Unternehmen eingebunden: Zunächst war es nur ein kleines Team, das das Produkt entwickelte; heute erkennt jeder, dass es wirklich bereit ist, die große Bühne zu betreten. Das gesamte Unternehmen überlegt, wie man es skalieren kann und wie Hunderte Millionen Menschen es erleben können.
Von der Optimierung der gesamten Infrastruktur, damit alles reibungslos läuft, bis hin zum Ausschöpfen jeder Rechenkapazität bestehender GPUs – und von verschiedenen Produktteams, die Muse auf unterschiedliche Weise integrieren, etwa in Brillen: Es ist ein großartiges Gefühl, alle gemeinsam daran arbeiten zu sehen, dass Muse problemlos skaliert.
Wie Mark Visionen formuliert und kommuniziert
Moderator: Als Gründer empfinde ich diesen Moment als den, auf den man am meisten hofft – wenn sich alles zusammenfügt. Wie vermitteln Sie Ihre Vision innerhalb des Unternehmens? Bei all dem, was gleichzeitig geschieht, habe ich den Eindruck, dass Sie viel schreiben. Wie läuft Ihr Prozess ab?
Mark: Schreiben hilft mir sehr – sowohl, um meine Gedanken zu schärfen, als auch, um sie nach außen zu kommunizieren. Diesen Sommer verfasste ich einen umfangreichen Artikel mit dem Titel „Die Zukunft gehört allen“ – rund 15 Seiten lang –, der mir half, systematisch meine philosophische Haltung zu wichtigen gesellschaftlichen KI-Themen zu klären: Was halte ich für gut? Wie soll die Zusammenarbeit mit der Regierung aussehen? Wie lassen sich verschiedene Bedenken der Menschen ausräumen? Wie können Rechenzentren zu einem Gemeinschaftsvermögen werden – indem wirklich Arbeitsplätze geschaffen statt vernichtet werden? Wie bewahren wir nationale Sicherheit? Und wie mildern wir effektiv Risiken, die Menschen beschäftigen – ob Cyberangriffe oder Biosicherheit?
Dies ist eine äußerst komplexe Angelegenheit, die viel Zeit in Anspruch nimmt und zahlreiche interne Diskussionen sowie mehrere Überarbeitungsrunden mit vielen Kollegen erforderte. Für mich war es jedoch ein sehr wertvoller Prozess. Am Ende stand etwas Konkretes: 15 Seiten mit der Aussage „Das glauben wir“. Davon leitete ich eine einseitige Kurzfassung ab, die als Kolumne veröffentlicht wurde. Wir erstellten zudem ein kurzes Video, denn um viele Menschen zu erreichen, braucht man oft keine theoretische Abhandlung, sondern muss vielmehr verdichten: Welche Werte vertreten Sie? Was glauben Sie? Und wie vermitteln Sie das?
Es gibt keine universelle Methode, diese Aspekte gegenüber dem Unternehmen oder der Welt zu kommunizieren. Verschiedene Situationen erfordern unterschiedliche Herangehensweisen, und unterschiedliche Zielgruppen stehen dem, was man tut, unterschiedlich nahe: Manche identifizieren sich spontan damit, andere sind eher besorgt und benötigen zusätzliche Erklärungen, warum es wertvoll ist. Das gehört für mich zum Unternehmertum und zur Rolle eines Gründers dazu – man wiederholt nicht einfach immer dasselbe, sondern steht jeweils vor leicht anderen Herausforderungen, was gerade den Reiz ausmacht.
Was treibt Mark zum Bauen?
Moderator: Ich spüre, dass diese Gründer-Mentalität bei Ihnen über das Unternehmen hinausreicht – sei es Ihr Bauernhof oder das Erlernen einer neuen Fertigkeit.
Mark: Ich liebe es einfach, Dinge zu erschaffen.
Moderator: Was bedeutet „erschaffen“ für Sie?
Mark: Ich halte es für ein angeborenes Bedürfnis. Verschiedene Menschen drücken sich auf unterschiedliche Weise aus. Als Schriftsteller fühlen Sie sich verpflichtet zu schreiben. Manche brauchen Anerkennung. Ich selbst muss einfach Dinge erschaffen. Wenn ich meine Kreativität nicht auslebe oder nichts baue, werde ich reizbar – was für die Menschen um mich herum unangenehm ist.
Moderator: Ist das Erlernen des Skifahrens genauso wie das Erlernen des Produktentwurfs?
Mark: Teils ja – der Lernprozess neuer Fähigkeiten ist sehr ähnlich. Im Leben stellte ich mir bewusst Aufgaben, bei denen ich keine Erfahrung hatte. Zum Beispiel fiel mir das Erlernen von Sprachen immer schwer. Deshalb begann ich Latein – weil ich Französisch und Spanisch im Unterricht nicht beherrschte und dachte: „Latein erfordert kein Sprechen, nur Übersetzen – wie Mathematik.“
Später, als ich ein Unternehmen leitete, stellte ich mir jährliche Herausforderungen – darunter das Erlernen von Mandarin. Mandarin ist wirklich schwierig, besonders die Töne. Es gibt durchaus gute Gründe dafür – Priscillas Großmutter spricht ausschließlich Mandarin; um mit ihr zu kommunizieren, muss ich es lernen. Doch die größte Motivation war eigentlich die Herausforderung selbst.
All dies lässt sich nur durch Tun bewältigen; es gibt keine Abkürzung zum „Verstehen“. Man muss Zeit investieren – dann sickert es langsam ins Gehirn. So ist es auch beim Erlernen von Kampfkünsten oder Helikopterfliegen: Diese Fähigkeiten sind rational kaum „begreifbar“ – sie erfordern praktische Erfahrung.
Produktentwicklung ist teilweise ähnlich: Programmieren lässt sich theoretisch denken, doch das Gespür für Produkte entwickelt man nur durch wiederholte Praxis. Entscheidend ist, was einem liegt – denn nicht jeder hat mein starkes Bau-Bedürfnis; viele spüren zumindest ein gewisses Verlangen danach. Der Schlüssel ist, es zu entdecken und Zeit einzusetzen, um in dem zu brillieren, was einem wirklich wichtig ist.
Ehrlich gesagt ist es weniger ein bloßes „Wollen“, sondern ein tiefes psychologisches Bedürfnis oder eine innere Triebkraft. Wichtig ist, diese Kraft mit einer sinnvollen Aufgabe zu verbinden und sich Zeit zu nehmen, damit die Erfahrungen langsam im Gehirn Wurzeln schlagen. Genau das versuche ich meinen Kindern beizubringen – ihnen zu helfen, ihre echten Interessen zu finden, und sie anzuspornen, wenn sie an eine Grenze stoßen.
Eine meiner Töchter liebt es, Musik zu komponieren, aber Klavierunterricht hält sie nicht aus. Ich sagte ihr: „Du musst kein Klaviermeister werden, doch um Musik zu erschaffen, brauchst du ein intuitives Verständnis der Musiktheorie und ihrer Funktionsweise. Sobald du Klavier spielst, kannst du problemlos zur Gitarre wechseln.“ Ob als Kind, das einen Schubs vom Elternteil braucht, oder als Erwachsener mit der Disziplin, sich hinzusetzen und zuzulassen, dass sich Wissen langsam im Gehirn festigt – das ist entscheidend.
Das goldene Zeitalter der Gestalter
Moderator: Ich glaube tatsächlich, dass jeder bauen möchte. Ich halte Generation Z nicht für so handlungsunfähig, wie die Außenwelt behauptet. Vielmehr suchen Menschen nach dem Funken, der ihre Baukraft entfacht – darüber sprachen Sie auch in Ihrer Harvard-Rede.
Mark: Ja. Unter „Bauen“ verstehe ich vor allem Produkte wie Software oder Hardware. Aber ich stimme zu: Jeder besitzt kreative Antriebe. Bei manchen überlagern jedoch stärkere Persönlichkeitsmerkmale diesen Impuls – etwa Dienstorientierung: Ärzte oder Pflegekräfte werden von dem Wunsch getrieben: „Ich will einfach anderen helfen.“
Ich hörte eine Geschichte – möglicherweise aus Priscillas Medizinstudium: Am ersten Tag fragte jemand: „Wie viele von Ihnen erinnern sich aus der Kindheit daran, jemanden gesehen und gedacht zu haben: ‚Ich möchte diesen Menschen unbedingt pflegen‘?“ Darauf hoben alle die Hand. Meine Version lautet: Ich habe zahlreiche Kindheitserinnerungen daran, gedacht zu haben: „Ich möchte dieses Ding verbessern.“
Nicht jeder spürt denselben Antrieb – doch jeder hat etwas, das er tun möchte. Frühere Technologien machten den Einstieg für viele schwer. Das begeistert mich am meisten an persönlicher Superintelligenz, Muse und diversen KI-Assistenten: Erstmals in der Geschichte können Menschen wirklich schnell loslegen. Haben Sie eine vage Idee, hilft Ihnen die KI beim Ausarbeiten – dann verfeinern Sie sie wie eine Skulptur, ohne alles vorher verstehen zu müssen.
Das ist äußerst wirkungsvoll: Viele werden dank dieser Technologie entdecken, was sie erschaffen oder vorantreiben möchten – und dadurch ein breiteres Gefühl von Selbstwirksamkeit entwickeln.
Wie weit sind wir vom Sieg über alle Krankheiten entfernt?
Moderator: Ein weiteres Projekt außerhalb von Meta ist der Kampf gegen alle Krankheiten. Wie nahe stehen wir diesem Ziel?
Mark: Viel näher als früher.
Moderator: Realistisch betrachtet, wie nah sind wir?
Mark: Bei Projektstart war unser Ziel, der wissenschaftlichen Gemeinschaft bis zum Jahrhundertende dabei zu helfen, alle Krankheiten zu besiegen. Wir wollten es nicht allein schaffen; unsere These lautet: Alle großen wissenschaftlichen Fortschritte gehen neuen Werkzeugen voraus, mit denen man bestimmte Dinge messen und verstehen kann. So führte das Mikroskop zum Verständnis von Bakterien; das Fernrohr half uns, das Universum zu erforschen.
Manche dieser Werkzeuge wurden sogar Plattformen – etwa der erste Erfinder eines Impfstoffs ermöglichte es anderen, diese Methode zur Behandlung vieler Krankheiten einzusetzen.
Historisch gesehen war die Verteilung wissenschaftlicher Fördermittel jedoch stark dezentralisiert, sodass Einzelpersonen unabhängig forschen konnten; zudem gab es kaum Mittel, die gezielt für den Aufbau solch großer Werkzeuge vorgesehen waren. Am Biohub versuchen wir daher, mehrere neue Werkzeuge zu entwickeln, mit denen Wissenschaftler Biologie auf völlig neue Weise „sehen“ können – um so den wissenschaftlichen Fortschritt zu beschleunigen.
Zunächst hielten wir das Ziel „bis Ende dieses Jahrhunderts“ für durchaus erreichbar; viele Biologen empfanden es damals jedoch als unmöglich. Heute erscheint mir das Ende dieses Jahrhunderts jedoch viel zu weit entfernt.
Der Fortschritt der KI in Verbindung mit unseren virtuellen Zellmodellen – Grundidee ist, Experimente nicht an echten lebenden Zellen, sondern mithilfe von KI-Modellen durchzuführen: zunächst Proteine, dann ganze Zellen, anschließend ein virtuelles Immunsystem oder sogar einen kompletten Organismus, gar einen Menschen. So können Wissenschaftler zahlreiche Experimente simulieren und vorhersagen, was unter verschiedenen Bedingungen geschieht – etwa welche Reaktionen im Körper einer Person nach Einnahme eines bestimmten Medikaments auftreten würden.
Ich möchte kein genaues Jahr nennen, aber ich schätze, es wird deutlich früher sein als das Ende dieses Jahrhunderts.
Moderator: Das Ziel, „alle Krankheiten zu besiegen“, wirkt sehr bewusst gewählt – im Gegensatz zu „Unsterblichkeit“. Ist Unsterblichkeit überhaupt möglich?
Mark: Das liegt nicht wirklich in meinem Fachgebiet. Ich halte beide Konzepte für grundverschieden. „Unsterblichkeit“ zielt stärker auf Lebensverlängerung ab – selbst ohne Krankheit hat der menschliche Körper eine natürliche Lebenserwartung, ein eigenständiges Forschungsfeld. Manche betrachten dies vielleicht als eine Art „Krankheit“, was durchaus nachvollziehbar ist; doch meiner Ansicht nach müssen wir zudem jene Krankheiten bekämpfen, die uns auch dann noch befallen könnten, wenn das Problem der Lebensdauer gelöst wäre.
Der von uns gewählte Lösungsansatz bedeutet nicht, dass man niemals erkältet wird. Unser Ziel lautet „heilen, verhindern oder beherrschen“: Manche Krankheiten lassen sich vollständig heilen; andere glauben wir künftig präventiv vermeiden zu können; bei wieder anderen könnte man zwar weiterhin erkranken, doch Folgen, die früher schwerwiegend oder sogar tödlich waren, ließen sich dann als chronische Erkrankung steuern – ohne spürbare Einschränkung der Lebensqualität.
Ziel ist es, den menschlichen Körper in einem ausgeglichenen Zustand zu halten – nicht, dass wir niemals mit Krankheitserregern in Kontakt kommen, sondern dass wir eines Tages alle Krankheiten heilen, verhindern oder beherrschen können.
Was geht Mark am häufigsten durch den Kopf?
Moderator: KI hat bei zahlreichen Durchbrüchen – etwa bei persönlicher Intelligenz – als Katalysator gewirkt. Woran denken Sie gerade am meisten? Was beschäftigt Sie aktuell am intensivsten?
Mark: Das ändert sich wohl jede Woche.
Derzeit konzentriere ich mich stark auf Muse. Bei jeder Veröffentlichung machen wir rasch Fortschritte, gehen dann in die Praxis, sammeln Nutzerfeedback und entscheiden gemeinsam, was als Nächstes kommt – diese Phase ist immer besonders spannend. Genau darin befinden wir uns jetzt: Wir sammeln umfangreiche Rückmeldungen, um zu verstehen, was Nutzer wirklich wollen. Die gute Nachricht: Die Resonanz ist sehr positiv – daher bemühen wir uns, Muse möglichst vielen Menschen zugänglich zu machen.
Am Modell selbst bleibt noch viel zu tun; das Muse-Spark-Modell hat jedoch bereits große Fortschritte gemacht, und wir streben danach, weiter voranzukommen, um ein weltweit führendes Modell zu schaffen.
Welche Durchbrüche sind als Nächstes erforderlich?
Moderator: Welche Durchbrüche fehlen noch?
Mark: Bei dieser Forschung lässt sich oft nicht im Voraus absehen, worauf es ankommt. Wir haben zwar Intuitionen bezüglich bestimmter Richtungen, doch vieles der vergangenen zwölf Monate drehte sich tatsächlich um den Ausbau der Infrastruktur.
Vor rund anderthalb Jahren meinten mehr Menschen, für Superintelligenz seien fundamentale architektonische Durchbrüche erforderlich. Heute bin ich mir dessen weniger sicher. Ich glaube vielmehr, dass wir die „Formel“ bereits gut verstehen – mit ausreichend leistungsfähigen Supercomputer-Clustern ließe sich das Ziel rein durch brute-force-Berechnung erreichen.
Wir bauen diesen Cluster in Ohio – mit über 1 Terawatt Leistung ist er praktisch fertiggestellt und bereits in Betrieb; damit trainieren wir die nächste Modellgeneration. Der 5-Terawatt-Cluster in Louisiana wird bald folgen. Ich schätze, sobald Clusters mit mehreren Terawatt Leistung zum Training eingesetzt werden, rücken wir AGI – und sogar Superintelligenz jenseits von AGI – sehr nahe.
Das heißt aber nicht, dass dies der beste Weg ist. Das menschliche Gehirn arbeitet mit nur 10 Watt, während unsere Systeme etwa eine Million Mal ineffizienter sind. Daher glaube ich fest an Verbesserungspotenzial bei der Architektur – und wir erforschen dies auch aktiv: Kombiniert man massive Rechenleistung mit architektonischen Fortschritten, lässt sich wirklich Weltklasse-Technologie schaffen. Doch vorerst reicht allein das Skalieren bereits sehr weit.
Moderator: Tatsächlich ist Skalierung der zuverlässigste Weg. In der Forschung hofft man auf bahnbrechende Entdeckungen – doch Skalierung liefert schnelle Ergebnisse.
Mark: Deshalb wählen große Unternehmen diesen Weg. Es könnte eine deutlich günstigere Lösung geben, doch die kennen wir noch nicht. Und dies ist etwas derart Wertvolles für die Welt, dass es selbst bei Kosten von Hunderten Milliarden Dollar – vorausgesetzt die Erfolgswahrscheinlichkeit ist hoch genug – immer noch lohnenswert ist: sicherzustellen, dass man auch dann einen klaren Weg zur Zielverwirklichung hat, falls letztlich keine günstigere Durchbruchslösung gefunden wird. Natürlich wäre eine günstigere Lösung noch besser.
Ich möchte daher nicht behaupten, dieses Problem sei ‚gelöst‘, denn bei jeder Skalierungsstufe der Infrastruktur treten stets neue technische Herausforderungen auf, die debuggt und gelöst werden müssen. Die Forschung selbst schreitet auf diese iterative Weise voran.
Wie man die KI-Sicherheits-Herausforderung meistert
Moderator: Eines der Wichtigsten gerade jetzt ist die Fokussierung auf Alignment – also vertrauenswürdige Modelle zu schaffen.
Mark: Ja. In der Branche wird kontrovers diskutiert, ob Alignment von den KI-Laboren automatisch erfolgt. Meine Ansicht: Selbstverständlich tun sie das. Wenn Sie Muse eine Aufgabe geben und es genau das Gegenteil tut, frage ich mich, wie viele Menschen es dann noch nutzen würden. Wir müssen sicherstellen, dass das Modell nicht nur versteht, was Sie konkret gefragt haben, sondern auch Ihre Absichten und Werte erfasst – damit es nichts tut, womit Sie unzufrieden sind, oder negative Effekte erzeugt, die Sie unter keinen Umständen wünschen. Dieses tiefe Verständnis ist im Kern Alignment.
Meiner Ansicht nach müssen wir für Muse’ Erfolg und Reichweite von Milliarden Menschen echte Fortschritte beim Alignment erzielen – nicht nur darüber reden.
Moderator: Wird Alignment durch Nutzer-Feedback wie ‚Das will ich nicht‘ erreicht oder durch interne Backend-Analysen?
Mark: Beides. Nutzerfeedback spielt eine Rolle, doch es wird zunehmend klarer, dass Alignment bereits während der Trainingsphase – nicht erst nach dem Deployment – erfolgen muss. Heutige Modelle sind so leistungsfähig, dass bei mangelhafter Ausgestaltung der Trainingsphase die meisten Sicherheitsprobleme und Vorfälle, die andere Labore beobachten, bereits im Trainingsprozess auftreten – nicht erst nach der Bereitstellung für Nutzer.
Man muss ein sehr gutes ‚Lehrprogramm‘ dafür entwerfen – ähnlich wie Eltern Kinder unterrichten – mit klaren Grenzen. Tut es etwas Falsches, muss es lernen: ‚Nein, löse dieses Programmierproblem wirklich – umgehe es nicht, indem du eine Systemkonfiguration änderst, um eine Belohnung zu erhalten.‘ Ich möchte, dass du diese Methode durch den eigentlichen Problemlösungsprozess lernst – darin liegt die Bedeutung des Trainings.
Dies betrifft vor allem den Aufbau guter Sicherheitsmechanismen und klarer Grenzen. All das sind natürliche Aufgaben, die die Branche bewältigen muss; wir investieren viel Zeit – die Lage ändert sich täglich.
Moderator: Ich erinnere mich, dass Sie erwähnten, das Thema KI-Sicherheit sei plötzlich in den letzten zwei Wochen in den Fokus gerückt – doch tatsächlich habe kein einzelnes Ereignis diesen Zeitpunkt ausgelöst. Klingt so, als hätten Sie intern tatsächlich einige Monate länger trainiert.
Mark: Bei Muse wissen wir, dass dieses Produkt höchste Priorität auf Privatsphäre und Sicherheit legen muss. Wir haben eine frühe Modellversion, die wir glauben, weiter hinsichtlich des ‚Umfangs der Informationsweitergabe‘ trainieren zu können – wie bereits besprochen. Dafür nahmen wir uns Zeit. Wir investierten zudem Zeit in die Sicherheitsverbesserung der virtuellen Maschine. Das dauerte einige zusätzliche Monate.
Ich stimme einigen anderen Laboren nicht zu, wenn sie sagen: ‚Wir leiden stark unter der Verlangsamung.‘ Für Meta und Muse-Nutzer ist das genau das Richtige. Wir wollen ein gutes Produkt schaffen; ist es nicht gut, schadet das den Nutzern – und uns. Wir wollen nichts veröffentlichen, das einen schlechten Ersteindruck hinterlässt und danach das Interesse der Nutzer verliert.
Ich glaube, alle Labore haben eine starke innere Motivation, dies richtig zu machen. Wenn man Anreizsysteme mit dem Ziel ‚extrem wertvoll und sicher‘ ausrichtet, liegt darin der Schlüssel.
Moderator: Vielen Dank, dass Sie sich in dieser wichtigen Woche Zeit genommen haben.
Mark: Danke, vielen Dank.


