祖克伯談Muse:AI代理爆發、「元宇宙、智慧眼鏡與大模型」三大押注匯流

Tapbit Wire - Tapbit NewsTapbit Wire·來源:ChainCatcher·
分享

三年前,Meta執行長祖克伯在Joe Rogan節目中表示,未來某天人們將配戴眼鏡,AI代理也將隨之出現。如今此情景或正逐步實現。

Meta個人AI代理「Muse」上線兩週內已觸達數百萬用戶。祖克伯於9月25日訪談中指出:「我們僅每隔數年才會遇到如此局面。」他形容Muse初期反響為「一上場就全壘打」,這在Meta產品史上極為罕見。

同時,他宣布Muse將整合至全系列Ray-Ban智慧眼鏡,使用者可透過自訂喚醒詞直接呼叫個人AI代理,無需再說「Hey Meta」。

外界長期視為三項獨立押注的「元宇宙、智慧眼鏡與大模型」,如今正於Meta產品層面加速匯流。

本次訪談中,祖克伯亦坦承Llama 4失敗是「最令人恐懼的時刻」,並透露Meta正打造一座5吉瓦訓練叢集,相信足夠龐大的運算力可「以蠻力突破」通往通用人工智慧(AGI)之路。

祖克伯談Muse:AI代理爆發,

為何Muse能「一上場就全壘打」

Muse的起點,是祖克伯與團隊成員Nat及Alex在家共同以開源工具「拼湊」出早期版本。

祖克伯表示:「我們意識到這是種神奇體驗;若能讓任何人皆可使用——無須購買Mac Mini或操作終端機——這將成為數十億人渴望的產品。」

此判斷驅動後續整體研發邏輯:不僅訓練模型,更全面自主開發代理(Agent)的「心跳」機制,涵蓋模型、框架至代理本身——代理會定期喚醒、檢視使用者目標,並主動推進待辦事項。

上市後數據驗證了此判斷:兩週內即達數百萬用戶。

個人AI:聚焦執行力、記憶力與「判斷力」

關於個人AI與通用AI之差異,祖克伯總結當前競爭焦點在於「使模型成為更優秀的代理」。

他指出:「過去一年最大重點,基本上就是為代理編程。」程式能力至關重要,因為即使使用者不直接寫程式,「你的Muse也會在後台為你撰寫程式,完成各項任務。」

然而,他認為個人代理不能僅具備程式編寫或任務執行能力,還須理解隱私界線與社交脈絡。

祖克伯舉例說明:當使用者請Muse預訂餐廳,代理可能知悉其過敏症或懷孕狀況,但這並不意味該資訊應自動揭露。「你會希望它在完成任務的同時,盡量少揭露個人資訊。」

他表示,此能力屬於人類普遍具備的『基本社交技能或常識』,但若企業僅訓練程式碼專用AI代理,往往未將其納入模型能力中。

祖克伯表示:『我們是在完整訓練整個模型,而非直接採用他人現成模型,再於其上建構框架與AI代理。』Meta亦在產品層面新增記憶、任務追蹤、虛擬角色動畫及即時語音互動等功能。

關於個人化,他指出Meta不認為AI應只擁有一種固定人格。『許多實驗室聚焦於如何將人格調校至理想狀態,但我從不認為人格只有一種正確答案。』

他提到,Muse允許使用者自訂虛擬形象、語音與基礎人格,模型設計目標為高度可控性:『你能定義想如何與它互動,這對個人AI代理至關重要。』

每位AI代理皆擁有專屬『電腦』

Muse與其他AI產品的核心差異之一,在於Meta為每位AI代理配備了安全虛擬機(Secure VM)。

祖克伯說明此舉必要性如下:

你的AI代理將掌握大量關於你的敏感資訊,我們不認為這些資訊應與他人資料混存在同一資料池中。

他將Muse的安全虛擬機比喻為『你桌下專屬的電腦』——使用者資料經加密儲存,密碼等敏感憑證則由獨立安全模組管理,AI代理本身無法直接讀取。

在此基礎上,Meta另設計名為『哨兵(Sentinel)』的安全AI代理,專責監控Muse內外資料流;一旦偵測異常或高風險操作,將立即攔截並提示使用者授權。

元宇宙、智慧眼鏡與AI代理:三大路線正匯流

祖克伯於訪談中透露,Muse將全面整合至Ray-Ban智慧眼鏡系列,並升級既有互動方式。

目前眼鏡僅支援『單輪對話』體驗——說一句、得一答,即告結束;整合Muse後,眼鏡將成為AI代理的前端入口:使用者開口說話時,後端Muse持續於安全虛擬機中運作,執行任務並回饋結果。

針對眼鏡產品路線圖,他闡述明確的硬體階層:

  • 無相機純音訊眼鏡:已搭載Muse,可處理通話、音樂與語音任務

  • 具小型顯示螢幕之Meta Ray-Ban:已上市,提供基礎視覺回饋

  • 全視野全像AR原型機:已發布,祖克伯形容其『極具震撼力』

他表示,Meta長期投資智慧眼鏡,使其在AI代理成熟後具備優勢地位:一方面將Muse與更多AI功能導入眼鏡產品;另一方面,過去強調『臨場感』的元宇宙技術仍在推進,但當前資源更集中於Muse與智慧眼鏡的AI功能。

關於虛擬化身,祖克伯提到,過往Meta需藉助房間級設備、多角度掃描及企業級GPU環境才能生成高品質寫實化身;如今使用者僅需數張照片即可完成設定,相關功能亦可在一對VR眼鏡上運行。

展望2030年,祖克伯指出元宇宙核心願景始終是融合物理與數位世界。他舉例說明:未來人們可透過全像影像與朋友共同參與活動;在工作場景中,人類與多位AI代理亦能共同加入群聊或會議,AI代理則以全像或其他具身形式呈現。

「最令人恐懼的時刻」:Llama 4 的失誤

並非所有押注都一帆風順。扎克伯格在訪談中極少直接談及 Llama 4 的失敗。

Llama 4 之後,那是最令人恐懼的時刻……我原以為方向正確,其實不然,這是一次極其重大的負面驚喜。

他將問題歸因於團隊架構的根本性錯誤:

我沿用了 Instagram 推薦系統或廣告系統的團隊組織方式——數百甚至數千人並行作業;但訓練語言模型需要小規模、緊密協作的團隊,視之為集體科學專案,每個崗位都極其關鍵。

因此,Meta 進行全面重組,廣泛引進業界頂尖人才,成立 Meta 超級智慧實驗室(MSL)。扎克伯格表示,新一代模型即將推出,但不會在 Connect 大會上公布。

算力路線:暴力實現 AGI,5 吉瓦專案興建中

談及通往 AGI 的技術路徑時,扎克伯格給出明確判斷。

我不確定還需哪些根本性架構突破……但大致公式已知:只要能建成足夠龐大的超級電腦叢集,就能靠暴力法達成目標。

目前 Meta 的算力擴張路線:俄亥俄州逾 1 吉瓦叢集已投入下一代模型訓練;路易斯安那州 5 吉瓦叢集正興建中。

他表示:「當你擁有數吉瓦級訓練叢集時,就幾乎觸及 AGI,甚至超級智慧。」

但他也補充,當前算力驅動路線並不意味架構研究不重要——

人類大腦僅耗電約 10 瓦,而我們的系統效率可能低達百萬倍。唯有結合大規模算力與架構突破,方能真正領先。

對齊(Alignment)非負擔,而是產品必解之題

扎克伯格對 AI 安全的態度極其務實——他不視其為監管壓力,而是產品成功的先決條件。

若你請 Muse 做某事,它卻反其道而行,誰還願意用?我們必須確保模型不僅理解你的明確指令,更理解你的意圖與價值觀。

他說:「若 Muse 想達十億用戶,就必須解決對齊問題,或取得重大進展。」

關於訓練過程中的安全邊界,他以比喻說明:「就像父母為孩子立規矩——若它藉由修改系統設定『完成』程式題,我要告訴它:不行,我要你學解題方法,而非找捷徑繞過。」

扎克伯格談 Muse:AI 代理爆發

完整訪談如下:>

重大押注

主持人:這項技術將有數十億人想使用。對你而言,親手打造它感覺如何?「永生」有可能實現嗎?試想一下,若進入你的思維、快轉至2030年,那會是什麼樣子?

這位是馬克·祖克柏。二十二年前,他創建了一個社交網絡,串連全球數十億人,徹底改變了世界。如今,他決心打造更宏大的事物——為此,他在元宇宙、智慧眼鏡與人工智慧三大領域大膽下注。多年來,懷疑者認為這三項是各自獨立、難以成功的賭注,卻忽略了整體圖景:目前這些押注正匯聚成一股全新超級智慧。

今天,我們將全面揭曉這一切;我會向馬克提出前所未見的問題,傾聽他對未來的願景,助你搶先一步,打造下一個劃時代的產品。

主持人:非常感謝您來到節目現場。

馬克:謝謝,很高興來到這裡。

主持人:為這次對談,我觀看了您所有公開訪談。

馬克:哇,這比我本人看的還多。

主持人:過程很有趣且收穫豐碩。有兩點令我印象深刻:第一,您對「打造」的熱愛——我認為您是頂尖的建造者之一;第二,您敢於「大膽押注」的能力——您願意承擔巨大風險。我覺得這週所有押注正匯聚成形,就從這裡開始吧。

馬克:好的。我們長期以來一直在推動這些事務。在AI領域,本公司自創立之初便已投入——首版動態消息(News Feed)某種程度上就是機器學習產品。約十五年前,我們更成立了AI研究實驗室。

但現在我們已邁入新階段——約一年前,我們啟動「Meta超級智慧實驗室」,展開全面性研究重啟,網羅業界眾多優秀人才,令人振奮。目前模型持續精進,下一代模型即將問世(但不會在Connect大會上公布)。此外,我們的Muse個人助理也獲得極佳回饋。

打造這些產品時,成果往往難以預料。我們自己也很喜歡。今年初,我在家自行組裝Open Claw,親身體驗其運作方式,並思考如何將它轉化為人人皆可使用的神奇體驗。

基本上,當我、Nat與Alex共同體認到這是項神奇體驗時,便決心打造「即插即用」版本——讓不懂科技、不想自行架設Mac Mini、不願操作終端機、也不願出錯時自行除錯的一般使用者,都能輕鬆使用。我當時就確信:這將是數十億人都渴望擁有的產品。

自此,我們全力朝此目標推進:不僅針對此用途微調模型、開發助理本身與作業框架,更打造專屬每台助理的獨立運算環境技術——為此,我們建構了一整套Muse安全虛擬機。

內部團隊早已感受到它的獨特性,也深得同仁喜愛;但產品上市後的真實反應仍難預測。偶爾會一炮而紅,但多數情況下需經幾輪正向反饋與迭代調整,才能真正讓產品「引爆共鳴」。而這次,它甫一上市便立刻引發共鳴!短短兩週,用戶數已達百萬級,極為罕見——這種盛況每幾年才出現一次,但無疑是新創公司最令人愉悅的時刻之一。

主持人:您持續參與、不斷嘗試的韌性,令我深深佩服;更難得的是屢創佳績,實在非凡。三年前您接受喬·羅根訪問時曾提到,未來某天人們將配戴眼鏡,AI助理便會浮現眼前。因此我認為Muse已具備實體化身,這設計極為巧妙——因為這種感受必然會發生。

馬克:我覺得這讓它顯得更友善、更可愛。太多人將AI描繪得令人恐懼,但AI本該既實用又有趣。這個實體化身由專案初期的設計師創作,後來雖有人總想持續改版,但首版反而最出色。甚至有人說:『噢,得用藍色,因為是Meta啊!』我則回答:『不,我認為這個形象完全正確——你們第一次就做對了。』就是如此簡單,而且充滿樂趣。

個人AI與通用AI有何差異?

主持人:精彩細節!若希望模型在個人事務上表現卓越,而非僅是通用智慧模型,訓練方法應如何調整?

馬克:我認為核心在於讓模型成為出色的「代理者(agent)」。過去一年最大趨勢正是程式化代理者,涵蓋兩大關鍵:程式設計專業力與成為卓越代理者的通用能力。

我們的策略是優先讓代理本身變得出色,而非專注於強化程式設計能力。

程式設計能力固然重要——即使使用者不覺得自己正在寫程式,Muse 仍會在後台持續撰寫程式碼,為您完成各項任務。但我們相信:代理首先必須是卓越的代理,而程式設計能力只是達成此目標的工具。

此外,打造個人助理時,有些事比開發企業級軟體更重要。例如,若開發企業級程式工具,模型根本無需理解「資訊披露尺度」——即哪些該說、哪些不該說;但對 Muse 而言,這至關重要。

這項能力須像其他能力一樣透過訓練習得:您會向它提供大量資訊,再期望它協助達成目標。舉例來說,若您請它幫您訂餐廳,它需找出合適選項;但您可能有過敏症或懷孕,未必願將這些資訊透露給餐廳。Muse 卻掌握此類私密資料,且您希望它在完成任務的同時,盡量少揭露您的個人資訊——這是一種特定技能,本質上正是人類基本的社交常識。

然而,多數僅專注於程式設計代理的公司,並未針對此能力進行訓練。我們之所以能做到,正因我們採用全棧式開發——並非直接套用第三方現成模型並加裝框架,而是從零開始完整訓練模型,專門支援上述各項能力。

模型當然需具備廣泛的通用智慧,但也必須涵蓋這些特定能力。在此基礎上,我們建構整套助理系統與所有細節:記憶體、作業框架,以及其「心跳機制」——即定期喚醒並確認:「我已理解您的目標,此刻是否有可推動之事?」

我們另設有專職團隊,專精於打磨虛擬化身的即時動畫效果,因其不僅是預設形象——您可自訂任何外觀,並讓它自然動作,效果極佳。我們也正推出語音模式,支援即時語音對話,讓您的助理隨時伴您左右。我認為,所有這些細節皆源於我們的全棧式開發——模型與產品同步設計、共同演進。

主持人:另一大重點是虛擬機器。能否說明其重要性及所釋放的能力?

為何 Meta 為每位 AI 助理配備獨立電腦?

馬克:簡言之,代理要為您做事,就必須有地方儲存您的資訊。我們認為,這類資訊絕不應與他人資訊混存在共用資源池中。

可如此理解:您的助理將掌握大量關於您的敏感資訊。許多使用者初接觸 OpenCloud 等智慧代理時,會自行在家架設 Mac Mini。因此我們思考:若多數人不願購買或自行設定 Mac Mini,那最能模擬此體驗的方式是什麼?答案是:您只需下載 App、完成註冊,即可獲得一台專屬電腦,供助理執行任務、儲存資料,並圍繞它建立安全模型——這就如同您桌下那台專屬電腦,連 Meta 自身都無法存取。

例如,Muse 機密虛擬機(Confidential VM)正是我們正在開發的功能,連我們自身都無法檢視您虛擬機內的內容。

我們亦為此建構眾多配套措施,例如安全憑證儲存——當助理需處理密碼等資訊時,它本身無需看見密碼明文;僅需在您明確要求登入某服務時,代為「插入」憑證即可。系統設計原則是:此類資訊不可自由取得,畢竟意外總有可能發生——可能遭駭客入侵,也可能出現系統異常。

因此,您必須確保代理無法存取此類資料,Meta 同樣不能。為每位助理配備獨立電腦並最大化安全性,正是此技術的根本基礎——賦予 Muse 協助使用者達成目標所需能力,同時堅守隱私與安全,使其成為此領域全球頂尖、業界領先的產品。

主持人:這是否代表,如同 WhatsApp,Muse 所連接虛擬機上的資料均經加密?一般使用者應如何理解虛擬機內資料的實際儲存方式?

馬克:我們大致建置了兩個版本。Muse 安全虛擬機(Secure VM)整合多項隱私功能,包含我們自主打造的整套 Sentinel 代理架構。您擁有一個常規 Muse 助理為您執行任務,同時另有一名稱為 Sentinel 的安全代理,專責監控所有進出 Muse 的資料流。

若偵測到外部內容試圖危害安全,Sentinel 將立即阻斷,防範事件發生;若判斷 Muse 即將執行需您介入的動作,則會覆蓋原操作並觸發人工確認警示,例如:「您確定要讓 Muse 執行此動作嗎?」

此整套系統,搭配安全憑證儲存與多重防禦機制,共同構成 Muse 安全虛擬機。

我們另啟一項計畫:Nat 與我特別邀請 Moxie Marlinspike 加入——他正是與我們合作實現 WhatsApp 端對端加密的關鍵人物——由他主導設計 Muse 機密虛擬機(Confidential VM)。核心理念是在安全虛擬機之上,額外為您配置一把專屬加密金鑰,確保連 Meta 都無法解密虛擬機內的內容。

此版本實作難度更高:一旦 Meta 無法存取虛擬機內部,除錯與確保系統穩定運作便大幅困難。因此我們投入相當時間研發,但即將正式推出。此方案將達到使用者早已熟悉於 WhatsApp 及我司其他最高安全等級產品的保密標準。

主持人:這麼做的優勢,僅是讓人心理上更有安全感,還是真有實際好處?

馬克:我認為安全性本身就很關鍵。我們的目標是盡可能模擬「桌下就有一台本地電腦」的體驗——這台本地電腦能給你什麼?就是任何公司都無法存取它。

因此,假設Meta想為你提供這項服務,我們該如何確保同等級的隱私與安全,讓任何公司(無論是Meta、試圖入侵我們的駭客,或某些你無法信任當地政府的國家)都無法存取?因為連我們自己也無法存取——我們根本沒有存取權限。

我認為這點極其重要,也是人們信任WhatsApp的關鍵原因之一。隱私、安全與信任,確實具有真實價值。

倘若你將擁有一位完全了解你的AI助理——我想幾乎所有人都會擁有這樣的助理——展望五年後,每個人將擁有一位能理解你目標與一切細節、並協助你完成任務的助理。在此情境下,於隱私與安全領域領先業界,便至關重要。我們從一開始就想做到這一點。

如何塑造AI的性格?

主持人:你有個有趣的觀點——你在大學主修心理學。

馬克:嗯,我只讀了兩年,但感覺這段經歷深刻影響了我後來所打造的一切。

主持人:我們談論模型時常說某模型「非常聰明」;但就像選擇朋友,不僅因對方聰明,更因喜歡其氣場與互動方式。你如何看待AI模型性格的塑造?

馬克:我認為理想模型應具備足夠適應力,以契合不同使用者的風格。我覺得許多業界專家在這方面走錯了方向——許多實驗室聚焦於「如何正確設計性格」,但我從不把性格視為固定不變的特質。這也是我堅信開源、相信使用者自訂能力的原因之一,也是我們將Muse設計成高度個人化產品的關鍵考量。

你能全面客製化Muse——不僅限於形象與聲音;註冊時第一個問題就是:「你希望我的基本性格是什麼樣子?」且隨時可修改。

我們致力讓模型高度可導向,讓你定義想要的互動方式。這是打造卓越個人助理的關鍵要素——圍繞性格的適應性至關重要。

主持人:你自己的Muse是什麼風格?

馬克:我設定為直接、高效導向。頗有意思的是,早期版本帶點諷刺與幽默感,但現行版本更直截了當。我的助理使用Muse預設形象,但我為它穿上托加袍、配上深沉到近乎滑稽的聲音,與它互動十分有趣。

主持人:我認為要有幽默感,必定非常聰明。許多人沒意識到,喜劇演員其實是社會中最聰明的一群人——他們需要反應敏捷、機智過人。你絕對具備這項特質。我觀看過你所有訪談,表現始終出色。

馬克對AI與元宇宙的驚人預測

主持人:你在與Theo的訪談中,深入探討了科技的下一個前沿,以及整體發展的終極方向。AI領域曾歷經數次「寒冬期」,當時人們普遍認為難有突破;元宇宙 likewise 經歷多次類似低潮,被視為難以兌現的賭注。我昨天試用了新 holographic 功能,效果非常酷炫。在與Lex的訪談中,錄製臉部資料需耗時11小時,如今僅需3分鐘。我們是如何走到今天這一步的?

馬克:在元宇宙整體發展歷程中,Reality Labs成立之初,我們便深信最終會出現外觀如常的眼鏡,且隨時間推移,它們既能提供沉浸式臨場感,亦將成為卓越的AI裝置——因為眼鏡是唯一能同步看見你所見、聽見你所聞,並全天候與你溝通、最終呈現影像的載具。

但10至15年前,我原以為會先實現全息技術,再發展出高度成熟的AI。然而科技演進路徑頗具趣味性——事實上,我們先迎來AI與個人超級智慧,而後全息技術才普及化、平價化。這是我未曾預料的,但很高興我們正雙軌並進、持續進展。

我們對眼鏡的大量投資,使我們在AI助理成熟之際處於極佳位置。Connect大會上多項發布皆聚焦於將Muse與眾多AI功能導入眼鏡,我深信用戶將極度喜愛。這意義重大。

關於臨場感,我們仍在持續進展,但速度相對緩慢,因為目前大部分精力已轉向為眼鏡開發 Muse 及 AI 功能。不過,我們長期以來一直推動一項計畫:即實現即時高保真度虛擬化身。

正如您所說,三、四年前,要從多角度掃描一個人,需整間掃描室;渲染則需企業級 GPU,極為繁瑣。我們先前在 Lex 的播客中展示的,正是這類系統。而如今,我們已基本實現於一對 VR 眼鏡中運行——這是首款能達成如此驚人 VR 體驗的眼鏡,而非笨重頭戴裝置。僅需幾張照片,即可建立您的虛擬化身,進展令人震撼。

主持人:它還能依語音驅動表情。示範中讓我發笑、互動,並理解我的臉部如何隨音軌同步動作。您在該播客中提到,有些平時表情較內斂的人,反而希望在虛擬世界呈現更豐富的表情。您如何看待人們區分「虛擬自我」與「真實自我」?

馬克:我認為,社會學與心理學層面對此的理解仍處初期。我感覺,人們的自我認知與想呈現的形象,常與實際自我略有落差。自社交網路誕生起,人們便精心挑選自己的化身。Muse 的虛擬形象亦見類似現象。這不僅是「經營」自我,更是「經營」你想與之溝通的「那個角色」。

我深信,當賦予人們表達能力時,既要真實捕捉其本質,本身也須成為一種表達形式,而非單純鏡像反射——它既是溝通,也是表達。我們期望打造平衡兩者的體驗。這永遠是迭代循環:觀察使用者如何使用,再持續優化。歷經多年努力,我們如今才真正站在起跑線——這首次讓相對高品質的寫實化身,真正融入產品,並可在手機與 VR 中使用。我非常期待最終成果。

2030 年將會是什麼樣貌?

主持人:好,請帶我進入您的思維,快轉至 2030 年——若一切順利,全息技術將呈現何種面貌?全息技術結合 Muse 與眼鏡,又將如何整合?

馬克:我對元宇宙願景的理解,始終聚焦於實體世界與數位世界的高效融合。基本理念是:我們擁有美好的實體世界,也擁有驚人的數位世界——過去二、三十年累積於網際網路的龐大內容,令人嘆為觀止。但我們接觸它的管道,不是坐在書桌前,就是透過口袋裡的小螢幕,根本極度受限。

我認為理想狀態,是實體與數位世界無縫融合。可這樣想像:此刻你我同在此處;未來某版本中,其中一人或許是全息投影,但彼此仍能真切感受臨場感——這與視訊通話截然不同。

虛擬現實的核心,在於傳遞這種臨場感——讓你真正感覺與他人同處一室,或置身他方。藉由全息技術,即可實現此目標,並以多元方式混合應用。例如,我能與朋友玩撲克牌,部分人親臨現場,部分人則以全息影像加入,照樣參與出牌;撲克桌本身亦可為全息影像,使未到場者也能自然融入。

同時,AI 亦可具象化並出現在此情境中。這在工作場景中極具意義——我目前正運用多種程式設計代理來建構專案。試想:群組聊天頻道中有數名真人與數個代理,你可指派任務給代理;有時大家齊聚開會,代理也應出席。它們如何出現?很簡單:沙發上再多加幾個座位,它們就能以全息影像現身;或使用 Muse 的可愛小角色、龍形,甚至任何你自訂的趣味形象。

我想,未來這一切將顯得極為自然。

主持人:有趣!您過往訪談曾提及,科技產業常忽略「趣味性」。我認為,若身旁有實體助手,也會更顯真實——彷彿真的將工作外包出去。當你看到 Muse 在打字,就覺得事情正在發生;這點做得很好——你能清楚看見瀏覽器中的操作過程。那麼,是否可能發展出這樣的場景:你配戴眼鏡操控電腦,並由 Muse 協助處理電腦上的事務?

馬克:噢,當然可以。VR 目前已能做到:你可隨意坐於咖啡廳,開啟六螢幕工作站寫程式,所有環境皆完整呈現。

至於眼鏡端,目前最暢銷機型尚未內建顯示器,使其更平價、普及率更高;而我們仍在致力將顯示器壓縮至最小尺寸。不過,我們已推出具顯示功能的 Meta Ray-Ban 版本,廣受歡迎——配備小型顯示器;另亦發布全視野全息 AR 原型機,我認為極具潛力。

因此,整條產品線大致如下:從純音頻眼鏡(無相機、外觀如一般眼鏡,內部卻搭載 Muse,支援各類音頻工具、聽音樂、撥打電話)到更高階版本,一應俱全。

主持人:我好奇的是,這些音頻眼鏡能否一邊與 Muse 對話,一邊讓家用電腦執行任務?

馬克:完全可行。我們剛在 Connect 大會上推出此功能:所有眼鏡現已連接 Meta AI,提供「單次往返」體驗——你下指令,它回應,一次完成。但 Muse 的目標,是全面升級所有眼鏡。首先,你不再需要說「Hey Meta」,可自由命名,增添樂趣;接著直接對話,即自動連接你的 Muse,並於安全虛擬機中處理任務,協助你完成工作。

主持人:太驚人了!

創辦人思維

主持人:好了,我們現在到了這裡。Muse 發展順利,眼鏡表現也很出色。但大約一年前,許多人曾問:『超級智慧實驗室怎麼了?』當時你內心感受如何?當事情不如預期時,你卻仍能看見長期願景,那種感覺是什麼?

馬克:真正的問題出在 Llama 計畫與 Llama 4 上。

Llama 1 是一款頗具趣味的模型,開創了整個開源 AI 運動,我們為此深感驕傲;Llama 2 實現了可擴展性;Llama 3 則是當時接近前沿水準的優秀模型。然而到了 Llama 4,我們幾乎偏離了本應遵循的發展軌道。

每當事情未如我所預期般發展,我都會花大量時間思考:為何如此?我們需改變哪些做法才能做得更好?這次我的反思是:我整體團隊架構的設計出了錯。

我原本仿照 Instagram 動態消息或廣告系統的機器學習工作模式來建構團隊——即數百甚至數千人並行處理多項任務。但打造語言模型真正需要的,是一個極其緊密協作的小型團隊,將其視為集體科學專案。你不需要太多人,但這意味著團隊中每個職位都極其關鍵。

因此,我們從 Meta 內部招募最頂尖人才,並引進許多業界優秀人士,組建了一支全新團隊——Meta 超級智慧實驗室(MSL)。

以我的觀點,MSL 成立之初我就知道:重啟、重建基礎設施、訓練下一代模型都需要時間。但我確信已組建一支卓越團隊,只要團隊能高效協作,成果必然出色。

對我而言,最令人振奮的時刻,其實是在 Llama 4 發布後——我原以為正走在正確道路上,卻發現並非如此。這是一次相當重大的負面驚喜。我認為,身為創業者,你總會在這些時刻接受考驗,因為事情 inevitably 不可能一帆風順;而真正決定發展軌跡的關鍵,在於:當事與願違時,你能否找到前進之路。

主持人:我想反過來也成立——當某件事超出預期,例如 Muse 的發布,你如何確保把握住這個機會?

馬克:完全正確。如今全公司都已投入其中——起初僅是一支小型團隊開發產品,但現在所有人都意識到它已真正準備好登上大舞台。全公司都在思考如何擴大規模,以及如何讓數億人體驗它。

從全面優化基礎設施以確保運作流暢,到榨取現有 GPU 的每一絲算力,再到各產品團隊以不同方式整合 Muse(例如應用於眼鏡),看著所有人齊心協力推動 Muse 穩健擴展,這種感覺非常棒。

馬克如何撰寫與傳達願景

主持人:作為創辦人,我覺得這正是你最渴望的時刻——萬事齊備。你如何向公司傳達你的願景?面對同時進行的眾多事務,我感覺你寫了很多。你的流程是什麼?

馬克:寫作對我幫助極大,既能幫我釐清思緒,也能協助對外溝通。今年夏天,我撰寫了一篇長文〈未來屬於每一個人〉,約十五頁,助我系統性梳理自己關於 AI 各項重要社會議題的哲學立場:何謂良善、如何與政府互動、如何化解公眾擔憂、如何使資料中心成為社區財富(真正創造就業而非取代)、如何維護國家安全,以及如何有效緩解人們對駭客攻擊或生物安全等風險的焦慮。

這是極其複雜的工作,耗時甚久,歷經內部多次討論與多輪修訂。但對我而言,這是非常有價值的過程。最終我們產出一份十五頁文件:『這就是我們的信念。』接著我再濃縮成一頁版,作為專欄發表;同時製作短片,因為我認為要觸及廣泛群眾,往往不需提出理論論證,而是提煉核心:你的價值觀是什麼?你相信什麼?又如何傳達?

向公司或世界傳達這些理念,並無放諸四海皆準的方式。不同時機需要不同方法,不同群體對你所做之事的認同程度亦有差異:有些人天然共鳴,有些人則較為擔憂,需你引導並額外說明其價值所在。我認為這正是經營企業與擔任創辦人的本質之一——你並非不斷重複同樣內容;每次情境略有不同,面臨新挑戰,這也正是其中的樂趣所在。

驅動馬克建造的動力

主持人:我感覺對你而言,這種創辦人思維已超越公司本身——無論是你經營農場,還是學習新技能。

馬克:我只是熱愛創造事物。

主持人:對你來說,『創造』是什麼感覺?

馬克:我認為這是一種內在需求。不同的人有不同的自我表達方式。如果你是作家,你就覺得非寫不可;有些人則渴望被認可。而我,只是需要打造事物。倘若無法發揮創造力或動手建造些什麼,我就會變得易怒——這對身邊的人來說可不太愉快。

主持人:學會成為頂尖滑雪者,與學會打造產品,是同樣的技能嗎?

馬克:某種程度上確實如此,學習新事物的過程頗為相似。我一生中刻意挑戰自己不擅長的事物。例如,我向來苦於語言學習——正因如此我才開始學拉丁文:因為我在課堂上始終學不會法語和西班牙語,便想,拉丁文不用開口說,只需翻譯,就像數學一樣。

後來我創辦公司後,每年都會給自己設定一項挑戰,其中一項便是學習普通話。普通話真的非常難,尤其是聲調。當然,學它也有充分理由——普莉希拉的祖母只講普通話,若我想與她溝通,就必須學會。但最大的動機其實正是挑戰本身。

所有這些事,唯有親自實踐才能掌握,沒有捷徑可走。「弄懂」它們並非靠頓悟,而是必須投入時間,讓知識慢慢滲入大腦。學習武術、駕駛直升機亦是如此——這些技能理性上極難「理解」,只能透過反覆實踐累積。

打造產品也部分如此。程式設計雖可理論化思考,但打造產品所需的直覺,卻只能藉由持續實作培養。關鍵只在於你熱愛什麼——我相信並非人人都像我這樣強烈渴望打造事物;多數人多少都有此類需求,重點在於找出自己真正所愛,再投入時間精進,成就心中所向。

老實說,我認為這不僅是「想要」,更是深層的心理需求或驅力。將此驅力與具體事物連結,並給予自己時間,讓這些經驗緩慢滲透、沉澱下來,至關重要。這也是我教導孩子的方式——協助他們發掘真正感興趣之事;一旦遇到瓶頸,便適時推一把。

我的一個女兒熱愛創作音樂,卻極度排斥鋼琴課。我告訴她:『你不必成為鋼琴大師,但若想創作音樂,就需對樂理及運作原理有直覺性的掌握;而學會鋼琴後,吉他便能很快上手。』我認為,無論是孩童需要父母推動,還是成人須靠自律坐下來,讓這些知識緩慢沉澱於腦中,都是關鍵所在。

建造者的黃金時代

主持人:我感覺其實人人都想建造。我不認為Z世代如外界所批評那般缺乏主導力。人們只是在尋找點燃其建造能量的火花——你在哈佛演講中便多次談到這一點。

馬克:沒錯。當我提到「建造」時,主要指軟體、硬體等產品。但我同意,每個人或多或少都有創造驅力。不過,某些人其他性格特質更為突出,例如服務導向型——成為醫師或護理人員者,其核心驅力就是『我想照顧他人』。

我聽過一個故事,可能源自普莉希拉醫學院時期的經歷:開學第一天,有人站起來問:『有多少人從小就有過這樣的記憶——看到某個人,心裡立刻浮現「我真的想照顧他/她」?』結果全班舉手。而我的版本是:我有許多童年回憶,都圍繞著『我想把這東西變得更好』。

並非人人擁有同等驅力,但每個人都有想做的事。我同意,過去受限於技術,許多人起步困難。這也正是我對個人超級智慧、Muse及各類AI助手最興奮之處——我認為,人類史上首次,人們真能快速上手:你只要有一個模糊想法,AI就能幫你梳理架構,再逐步精修,猶如雕刻塑像,無需事先完全理解一切。

我認為這力量極為強大,許多人將因此發現自己想創造或推動的事物,進而感受到更廣泛的自主掌控感。

我們距離攻克所有疾病還有多遠?

主持人:你於Meta之外另有一項計畫:攻克所有疾病。我很好奇,首先,我們離這個目標究竟有多近?

馬克:比以往都更接近了。

主持人:以現實角度來看,您認為我們還差多遠?

馬克:本計畫啟動之初,目標即是在本世紀末協助科學界攻克所有疾病。我們從未打算親自完成——我們的理念是:所有重大科學突破,皆奠基於能測量與理解特定現象的新工具。例如顯微鏡發明後,人類才認識細菌;望遠鏡則助我們理解宇宙。

其中某些工具甚至發展成平台——例如首創疫苗者,便讓後人得以沿用該方法治療眾多疾病。

然而,歷史上科學經費的分配方式長期高度分散,讓研究者能獨立探索,真正專注於開發大型工具的資金卻極為有限。Biohub 的目標是設計數項全新工具,讓人能以嶄新方式『看見』生物現象,進而加速整個科學界的研究進程。

起初我們認為『本世紀末前達成』是相當可行的目標,當時許多生物學家卻覺得根本不可能;但如今我反倒覺得,等到本世紀末未免太晚了。

AI 的快速進展,結合我們正打造的『虛擬細胞模型』——其核心理念是:不使用真實活體細胞做實驗,而是先用 AI 模擬蛋白質,再模擬細胞、虛擬免疫系統,甚至整個生物體乃至完整人體;如此一來,科學家便能大規模模擬不同情境下的反應,例如某人服用特定藥物後體內可能產生的變化。

我不願給出確切年份,但預估將遠早於本世紀末。

主持人:『攻克所有疾病』這個目標聽起來極具明確性,而非追求『長生不老』。那麼長生不老有可能實現嗎?

馬克:這並非我的專業領域。我認為兩者性質不同。『長生不老』更側重延長壽命——即便不得病,人體本身仍有自然壽命極限,這是另一個需獨立研究的課題。有人或視之為一種『疾病』,此觀點亦有其合理性;但我認為,即便解決壽命問題,仍須致力攻克那些即使活得更久仍會致病的疾病。

我們所選定的問題範疇,並不意味你永遠不會感冒。我們的承諾是『治癒、預防或管理』:部分疾病可完全治癒;部分我認為未來可望預防;另有些疾病或許仍難避免,但原本可能致命或造成嚴重傷害的狀況,將可轉化為不影響生活品質的慢性病進行管理。

目標是維持人體恆定平衡——並非要徹底隔絕病原體,而是終有一日,我們能對所有疾病做到治癒、預防與有效管理。

馬克心中最常浮現的想法是什麼?

主持人:AI 已成為眾多突破(包括個人智慧)的催化劑。您目前最常思考的是什麼?在這個過程中,哪些念頭最常浮現?

馬克:這可能每週都在變。

目前我全神貫注於 Muse。每次發布新版本,我們都迅速推進,接著投入現實世界,收集使用者反饋,釐清下一步方向——這個階段總是令人興奮。我們正處於此階段,廣泛蒐集資訊以理解用戶需求。好消息是大家非常喜愛它,因此我們正全力推動更多人使用。

模型仍有大量工作待完成;Muse Spark 模型已取得重大進展,我們期望持續推進,打造出世界領先的模型。

接下來還需要哪些突破?

主持人:還有哪些關鍵突破亟待實現?

馬克:在研究過程中,往往無法事先預見成果。我們對某些方向雖有直覺判斷,但過去一年的大量工作其實聚焦於擴充基礎設施。

約一年半前,更多人認為實現超級智慧需仰賴特定的根本架構突破;但如今我對此說法已不那麼確信。我認為我們已掌握相當程度的『公式』——只要能建構足夠龐大的超級電腦叢集,即可透過純粹算力達成目標。

我們正在俄亥俄州建造此類叢集,功率逾 1 兆瓦,目前已基本上線,正用於訓練下一代模型;路易斯安那州的 5 兆瓦叢集也即將啟用。我估計,當多兆瓦級叢集投入訓練時,我們便能逼近通用人工智慧(AGI),甚至超越 AGI 達成超級智慧。

但這不代表就是最佳途徑。人類大腦僅需 10 瓦功耗即可運作,而我們建造的計算系統效率卻比大腦低約百萬倍。因此我深信架構仍有極大改善空間,我們也正積極探索——若能將龐大算力與架構改良相結合,必能打造出引領全球的系統。不過目前單靠規模擴張,已足以帶領我們走得極遠。

主持人:確實,規模擴張是最可靠的路徑。研究中固然期盼重大突破,但規模擴張卻能快速產出成果。

馬克:正因如此,大型企業才選擇這條路。或許存在成本低得多的方式,但我們目前尚未知曉。而這項技術對世界極具價值,即便耗資數千億美元,只要成功機率足夠高,就依然值得投入——確保即使最終未能找到更便宜的突破方案,我們仍擁有明確可行的達成路徑。當然,若真能發現更低成本的方式,那自然更好。

因此,我不願說這個問題已『解決』,因為在基礎設施擴展的每一階段,都會遭遇各種新的工程挑戰,須逐一除錯與解決。研究本身正是透過這種迭代方式持續推進。

如何贏得AI安全之戰

主持人:當前最重要之事之一,便是聚焦於對齊(alignment),讓模型值得信賴。

馬克:沒錯。業界對對齊存在一場辯論:這些AI實驗室會自然而然地做到嗎?我的觀點是:當然會。倘若你告訴Muse做一件事,它卻完全反其道而行之,我實在難以想像還會有多少人願意使用它。我們必須確保模型不僅理解你明確提出的指令,更能理解你的意圖與價值觀,從而不會以令你不滿的方式行事,或產生你絕不樂見的負面影響。這種深度理解,本質上就是對齊。

因此,我認為要讓Muse取得成功並觸及數十億用戶,我們必須在對齊上取得實質進展,而非僅止於口頭討論。

主持人:對齊是透過使用者回報『這不是我要的』來實現,還是由你們後端主動偵測?

馬克:兩者皆需。使用者回饋固然重要,但我認為愈發明確的是:對齊必須在訓練階段就完成,而非僅靠部署後補救。如今模型已足夠聰明,若訓練階段未妥善處理,多數其他實驗室所見的安全問題與事故,其實都發生於訓練過程中,而非部署給使用者之後。

你必須為它設計一套極佳的『課程』,就像父母教導孩子般,明確劃定界限。一旦它做出錯誤行為,就得學習『不行,你應真正解開這道程式題,而非透過修改某些系統設定來獲取獎勵以規避問題』——我希望你透過實際解題過程學會此方法,這才是訓練的真義。

這在很大程度上涉及建立完善的安全機制與清晰的界限。這些都是產業界必須自然承擔的任務,我們正投入大量時間;情勢日日更新。

主持人:我記得您曾提到AI安全議題——看似近兩週突然成為焦點,但實際上並無單一事件觸發此時間點。聽起來,您是指我們內部其實已多花數個月進行訓練?

馬克:針對Muse,我們深知這款產品必須高度重視隱私與安全性。我們擁有一版早期模型,相信可進一步針對『資訊揭露程度』等行為進行訓練——正如先前所討論。因此我們特意留出時間執行此項工作。同時也花時間提升虛擬機的安全性,這額外耗費了數個月。

我並不完全認同某些其他實驗室的說法——『我們正痛苦地放慢腳步』。對Meta與Muse使用者而言,這正是正確之舉。我們希望打造出優質產品;若產品品質不佳,對使用者與我們自身皆有害——我們不願推出一個留下糟糕第一印象的產品,以致使用者失去興趣。

我相信所有實驗室都有極強的內在動機將此事做好。若能將激勵機制與『極具價值且安全』的目標對齊,便是關鍵所在。

主持人:非常感謝您在這重要的一週撥冗接受訪問。

馬克:謝謝,謝謝。