저커버그, 뮤즈 언급: AI 에이전트 폭발, '메타버스·스마트 글라스·대규모 모델' 세 가지 주요 베팅이 융합
3년 전, 메타 CEO 마크 저커버그는 조 로건 쇼에서 언젠가 사람들이 안경을 착용하게 될 것이며, 이에 따라 AI 에이전트도 등장할 것이라고 말했다. 지금 이 장면이 현실화되고 있다.
메타의 개인용 AI 에이전트인 뮤즈는 출시 2주 만에 수백만 명의 사용자에게 도달했다. 저커버그는 9월 25일 인터뷰에서 “이런 상황은 몇 년에 한 번 꼴로 겪는다”고 밝혔다. 그는 뮤즈 초기 반응을 “출시 즉시 홈런”이라 평가하며, 이는 메타 제품 역사상 드문 사례라고 했다.
동시에 그는 뮤즈를 레이밴 스마트 글라스 전체 라인에 통합한다고 발표했다. 이를 통해 사용자는 더 이상 ‘헤이 메타’가 아닌, 사용자 지정 웨이크 워드로 개인용 AI 에이전트를 직접 호출할 수 있게 된다.
외부에서는 오랫동안 별개의 베팅으로 여겨졌던 메타버스, 스마트 글라스, 대규모 모델이 이제 메타 내에서 제품 차원에서 가속화된 융합을 이루고 있다.
이 인터뷰에서 저커버그는 라마 4 실패를 ‘가장 두려운 순간’이라 인정했으며, 메타가 5기가와트 규모의 학습 클러스터를 구축 중임을 밝혔다. 그는 충분히 큰 컴퓨팅 파워가 AGI를 ‘무차별적 힘’으로 달성하게 할 수 있다고 믿는다.

왜 뮤즈는 ‘출시 즉시 홈런’을 칠 수 있었을까
뮤즈의 시작은 저커버그와 팀원 나트, 알렉스가 집에서 오픈소스 도구를 활용해 초기 버전을 ‘조립’한 때였다.
저커버그는 “이것이 마법 같은 경험임을 깨달았다”며, “맥미니를 사거나 터미널을 다뤄야 하는 번거로움 없이 누구나 쉽게 사용할 수 있다면, 수십억 명이 원할 것”이라고 말했다.
이 판단은 이후 연구개발 전략 전체를 이끌었다: 단순한 모델 훈련이 아니라, 모델·프레임워크·에이전트 자체까지 전면 자율 개발하는 ‘심장 박동’ 메커니즘 구축—에이전트가 주기적으로 깨어나 사용자 목표를 확인하고, 할 일 목록을 능동적으로 진전시키는 방식이다.
출시 후 데이터는 이 판단을 입증했다. 2주 만에 수백만 명의 사용자.
개인용 AI: 실행·기억·‘판단’에 집중
개인용 AI와 일반 AI의 차이에 대해 저커버그는 현재 경쟁 초점을 ‘모델을 더 나은 에이전트로 만드는 것’에 두고 있다고 요약했다.
그는 “지난 1년간 가장 큰 과제는 기본적으로 에이전트를 프로그래밍하는 것이었다”고 말했다. 프로그래밍 역량이 중요한 이유는 사용자가 직접 코드를 작성하지 않더라도, ‘당신의 뮤즈가 다양한 작업을 수행하기 위해 배경에서 자동으로 코드를 작성할 것’이기 때문이다.
하지만 그는 개인용 에이전트가 단순히 코딩이나 작업 실행 능력만 갖추어서는 안 되며, 프라이버시 경계와 사회적 맥락도 이해해야 한다고 믿는다.
저커버그는 예시로, 사용자가 뮤즈에게 식당 예약을 요청할 때 에이전트가 사용자의 알레르기나 임신 사실을 알고 있을 수 있지만, 그렇다고 해서 이 정보를 자동으로 공개해서는 안 된다고 설명했다. “작업은 완수하되, 최소한의 정보만 공개되기를 원할 것이다.”
그는 이 기능이 인간이 일반적으로 갖추고 있는 '기본 사회 기술 또는 상식'에 속한다고 밝혔으나, 단순히 코딩 전용 에이전트만 훈련시키는 많은 기업은 이를 모델 기능에 포함시키지 않았다고 지적했다.
'우리는 기존의 완성된 모델을 가져와서 프레임워크와 에이전트를 덧붙이는 것이 아니라, 전체 모델을 자체적으로 훈련하고 있습니다.'라고 저커버그가 설명했다. 메타는 제품 차원에서 메모리, 작업 추적, 가상 캐릭터 애니메이션, 실시간 음성 상호작용 등 기능도 추가했다.
개인화 측면에서 그는 AI가 단일 고정 성격만 가져야 한다고 믿지 않는다고 밝혔다. '많은 연구실이 성격을 적절한 상태로 조정하는 방법에 집중하고 있지만, 나는 성격에 대해 단 하나의 정답이 있다고 믿지 않습니다.'
그는 뮤즈(Muse)가 사용자에게 아바타, 음성, 기본 성격 수정 기능을 제공하며, 모델 설계 목표는 높은 제어 가능성이라고 언급했다. '사용자가 어떻게 상호작용할지 직접 정의할 수 있어야 하며, 이는 개인용 에이전트에서 매우 중요합니다.'
각 에이전트는 고유한 '컴퓨터'를 갖는다
뮤즈를 다른 AI 제품과 구분짓는 핵심 인프라 중 하나는 메타가 각 에이전트에 보안 가상 머신(Secure VM)을 탑재했다는 점이다.
저커버그는 이 방식이 필요한 이유를 설명했다.
당신의 에이전트는 당신에 대한 민감한 정보를 많이 알게 될 것입니다. 우리는 이런 정보가 다른 모든 사람의 데이터와 혼합되어서는 안 된다고 믿습니다.
그는 뮤즈의 보안 가상 머신을 '책상 아래 당신만을 위한 컴퓨터'에 비유했다—사용자 데이터는 암호화되어 저장되며, 비밀번호 같은 민감한 자격 증명은 독립 보안 모듈에서 관리되므로 에이전트 자체는 직접 읽을 수 없다.
이 기반 위에서 메타는 뮤즈 내외부의 데이터 흐름을 감시하기 위해 전용 '센티넬(Sentinel)' 보안 에이전트를 설계했다. 이 에이전트는 이상 징후나 고위험 작업을 탐지하면 즉시 차단하고 사용자 승인을 요청한다.
메타버스, 스마트 글래스, 에이전트: 세 가지 경로가 융합된다
저커버그는 인터뷰에서 뮤즈가 레이밴(Ray-Ban) 스마트 글래스 시리즈에 완전히 통합되어 기존 상호작용 방식을 업그레이드할 것이라고 밝혔다.
현재 글래스는 '단일 턴 대화' 경험을 제공한다—말씀하시면 답변을 드리고 종료. 뮤즈 통합 후, 글래스는 에이전트의 프론트엔드 진입점이 된다: 사용자가 말하면 백엔드 뮤즈가 보안 가상 머신에서 계속 작동해 작업을 완료하고 피드백을 제공한다.
글래스 제품 로드맵에 대해 그는 명확한 하드웨어 계층 구조를 설명했다.
카메라 없는 순수 오디오 글래스: 이미 뮤즈 탑재, 통화·음악·음성 작업 처리 가능
소형 디스플레이 장착 메타 레이밴: 이미 출시, 기본 시각 피드백 제공
전 영역 홀로그램 AR 프로토타입: 이미 출시, 저커버그는 이를 '매우 흥미롭다'고 평가
그는 메타의 장기적인 글래스 투자가 AI 에이전트 성숙 후 유리한 위치를 확보하게 해줄 것이라고 밝혔다. 메타는 뮤즈 및 기타 AI 기능을 글래스 제품에 적용하고 있으며, 과거 '현존감(presence)'에 초점을 맞췄던 메타버스 기술 역시 계속 진전되고 있으나, 현재는 뮤즈와 스마트 글래스의 AI 기능에 더 많은 자원이 투입되고 있다.
가상 아바타 관련해 저커버그는 과거 메타가 고품질 사실적 아바타 생성을 위해 방 크기의 장비, 다각도 스캔, 기업급 GPU 환경이 필요했으나, 이제는 몇 장의 사진만으로 설정이 가능해졌으며 관련 기능은 VR 글래스 한 쌍에서도 실행 가능하다고 설명했다.
2030년을 바라보며 저커버그는 메타버스의 핵심 비전은 항상 물리 세계와 디지털 세계를 융합하는 것이라고 강조했다. 예를 들어 미래에는 친구들과 홀로그램 영상을 통해 활동에 참여할 수 있고, 업무 상황에서는 인간과 여러 에이전트가 홀로그램 또는 기타 구체화된 형태로 그룹 채팅이나 회의에 함께 참석할 수 있을 것이라고 설명했다.
'가장 공포스러운 순간': 라마 4의 실수
모든 시도가 순조롭지는 않았다. 저커버그는 인터뷰에서 라마 4의 실패에 대해 직접 언급하는 일이 드물었다.
라마 4 이후, 그게 가장 공포스러운 순간이었어요… 우리가 올바른 방향으로 가고 있다고 생각했는데, 그렇지 않았습니다. 상당히 충격적인 부정적 결과였죠.
그는 이 문제를 팀 구조의 근본적 오류에서 비롯된 것으로 진단했다:
저는 인스타그램 추천 시스템이나 광고 시스템과 동일한 방식으로 팀을 구성했어요—수백 명 또는 수천 명이 병렬로 일하는 구조였죠. 하지만 언어 모델 훈련은 소규모 팀이 긴밀히 협력하며 과학적 공동 프로젝트처럼 진행해야 합니다. 모든 역할이 매우 중요합니다.
결과적으로 메타는 전면적인 조직 재편을 단행해 업계 최고 인재들을 대거 영입하고, 메타 슈퍼 인텔리전스 연구소(MSL)를 설립했다. 저커버그는 차세대 모델이 곧 출시될 예정이라고 밝혔으나, 커넥트 컨퍼런스에서는 발표하지 않을 것이라고 했다.
컴퓨팅 파워 전략: 강제 탐색 방식의 AGI, 5GW 규모 프로젝트 건설 중
AGI 달성을 위한 기술 경로를 논할 때, 저커버그는 명확한 판단을 제시했다.
아직 어떤 근본적인 아키텍처 혁신이 필요한지 확신하진 못하지만… 우리는 대략적인 공식을 알고 있습니다. 충분히 거대한 슈퍼컴퓨터 클러스터를 구축한다면, 강제 탐색 방식으로 도달할 수 있을 겁니다.
현재 메타의 컴퓨팅 파워 확장 계획은 다음과 같다: 오하이오주에 구축된 1GW 이상 규모 클러스터는 이미 차세대 모델 훈련에 활용 중이며, 루이지애나주에는 5GW 규모 클러스터가 건설 중이다.
그는 '훈련용 멀티기와트급 클러스터를 보유하게 되면, 사실상 AGI 혹은 초지능에 근접한 무언가를 얻게 된다'고 말했다.
다만 그는 현재의 컴퓨팅 파워 중심 전략이 아키텍처 연구의 중요성을 낮추는 것은 아니라고 덧붙였다—
인간 뇌는 약 10W만 소비하지만, 우리 시스템은 그보다 백만 배 정도 비효율적일 수 있습니다. 대규모 컴퓨팅 파워와 아키텍처 혁신을 결합해야 비로소 선두를 이끌 수 있습니다.
정렬(alignment)은 부담이 아니라 제품이 반드시 해결해야 할 문제
저커버그의 AI 안전성에 대한 태도는 매우 실용적이다—그는 이를 규제 압박이 아니라 제품 성공의 전제 조건으로 본다.
무즈에게 특정 작업을 요청했는데 정반대로 행동한다면, 누가 계속 사용하겠습니까? 우리는 모델이 단순히 구체적 지시를 이해하는 것을 넘어, 사용자의 의도와 가치관까지 파악하도록 해야 합니다.
그는 '무즈가 10억 명의 사용자에게 도달하려면, 정렬 문제를 반드시 해결하거나 적어도 상당한 진전을 이루어야 한다'고 말했다.
훈련 과정 중 안전 경계 설정에 대해 그는 비유를 들었다: '부모가 자녀에게 규칙을 정하는 것과 같습니다—시스템 설정을 수정해 프로그래밍 문제를 '완료'한다면, 저는 이렇게 말하고 싶습니다: '아니요, 문제 해결 방법을 배우길 바라며, 우회하는 쉬운 길을 찾지 않기를 바랍니다.''

전체 인터뷰 내용은 다음과 같습니다: >
대규모 투자
진행자: 전 세계 수십억 명이 사용하고 싶어 할 이 기술을 직접 개발하는 기분은 어떤가요? ‘영생’이란 가능성도 있나요? 그렇다면 제게 당신의 마음속으로 들어가 2030년까지 빠르게 시간을 건너간다면, 그 모습은 어떨까요?
이 사람은 마크 저커버그입니다. 22년 전, 그는 수십억 명을 연결한 소셜 네트워크를 만들었고, 세상을 영원히 바꾸었습니다. 이제 그는 더 거대한 무언가를 만들기로 결심했습니다. 이를 위해 메타버스, 스마트 글라스, 인공지능 분야에 대규모 투자를 진행 중입니다. 오랫동안 비판자들은 이 세 가지가 서로 별개이며 성공하기 어렵다고 여겼지만, 큰 그림을 간과했습니다—지금 이 투자들이 하나로 융합되어 완전히 새로운 초지능(superintelligence)을 창출하고 있습니다.
오늘 우리는 이 모든 것을 소개할 예정이며, 마크에게 그 어느 때보다도 새로운 질문을 던질 것입니다. 그의 미래 비전을 직접 듣고, 여러분이 선도적으로 다음 차세대 혁신을 만들어갈 수 있도록 돕겠습니다.
진행자: 프로그램에 출연해 주셔서 진심으로 감사합니다.
마크: 감사합니다. 여기 올 수 있어서 정말 기쁩니다.
진행자: 이번 인터뷰를 위해 당신이 한 모든 인터뷰를 시청했습니다.
마크: 와, 제가 본 것보다 더 많이 보셨네요.
진행자: 재미있었고 매우 유익했습니다. 두 가지가 특히 인상 깊었는데요—첫째, 당신의 ‘빌딩(building)’에 대한 열정입니다. 당신은 최고의 빌더 중 한 명이라고 느꼈습니다. 둘째, 대규모 투자를 감행하는 용기—정말 거대한 베팅을 감당합니다. 이번 주에는 이런 투자들이 모두 융합되고 있다는 점에서, 바로 여기서 시작해 보겠습니다.
마크: 알겠습니다. 우리는 오래전부터 이런 일을 해왔습니다. AI 분야에서는 회사 설립 초기부터 관련 작업을 해왔습니다—첫 번째 뉴스피드 버전조차 어느 정도 머신러닝 제품이었죠. 그리고 약 15년 전, 우리 AI 연구소를 설립했습니다.
하지만 지금 우리는 새로운 단계에 접어들었습니다—약 1년 전, 메타 초지능 연구소(Meta Superintelligence Lab)를 출범시켰습니다. 이는 업계 전반에서 탁월한 인재들을 대거 영입하며 실시한 철저한 연구 재편입니다. 현재 모델 성능은 계속 향상되고 있으며, 차세대 모델이 곧 출시될 예정이지만, 커넥트(Connect) 컨퍼런스에서는 발표되지 않습니다. 또한, 뮤즈(Muse) 개인 어시스턴트는 지금까지 매우 긍정적인 평가를 받고 있습니다.
이런 기술을 개발할 때는 결과가 어떻게 나올지 정확히 알 수 없습니다. 하지만 우리 스스로는 매우 즐깁니다. 올해 초, 저는 집에서 오픈 클로(Open Claw)를 제 방식대로 조립하며, 이것이 어떻게 작동하는지, 또 누구나 쉽게 사용할 수 있는 ‘마법 같은 경험’으로 어떻게 구현할 수 있을지를 직접 체감했습니다.
기본적으로, 제가 나트(Nat), 알렉스(Alex)와 함께 모여 이 경험이 정말 특별하다는 사실을 깨달았을 때, 기술을 잘 모르는 일반인, 맥 미니를 직접 설치하고 싶지 않은 사람, 터미널을 다루고 싶지 않은 사람, 문제가 생겼을 때 디버깅하기 싫은 사람도 단순히 ‘플러그 앤 플레이(plug-and-play)’ 방식으로 사용할 수 있게 만든다면, 수십억 명이 원할 기술이 될 것이라고 생각했습니다.
그 이후 우리는 이 목표를 향해 집중해 왔습니다—단순히 어시스턴트 자체와 운영 프레임워크를 구축하는 데 그치지 않고, 각 어시스턴트를 위한 독립적 컴퓨팅 환경을 제공하는 기술까지 개발했습니다. 이를 위해 전용 뮤즈 안전 가상머신(Muse secure virtual machines) 전체 세트를 구축했습니다.
내부적으로는 이 기술이 특별하다고 느꼈고, 내부 팀도 좋아했지만, 제품 출시 후 실제 반응은 언제나 예측 불가능합니다. 가끔은 출시 즉시 엄청난 성공을 거두기도 하지만, 대부분은 긍정적인 피드백을 받은 후 몇 군데를 반복적으로 개선해야 비로소 제품이 ‘맞아떨어지는’ 느낌을 줍니다. 그런데 이번에는 출시 직후부터 바로 ‘맞아떨어졌습니다’. 이러한 변화를 지켜보는 건 정말 흥분됩니다—단 두 주 만에 사용자 수가 이미 수백만 명에 달했는데, 이는 매우 드문 일입니다. 몇 년에 한 번 꼴로 겪는 일이지만, 분명 스타트업에게는 가장 즐거운 순간 중 하나입니다.
진행자: 계속 도전하며 게임 속에 남아 있는 당신의 능력에 정말 감탄합니다. 그리고 이렇게 연이어 ‘홈런’을 치는 건 정말 놀랍습니다. 3년 전 조 로건(Joe Rogan)과의 인터뷰에서 당신은 언젠가 안경을 쓰고 AI 어시스턴트가 등장하게 될 것이라고 말한 바 있습니다. 그래서 저는 뮤즈가 이미 물리적 형태를 갖추었다고 느낍니다. 이는 매우 현명한 선택인데, 그런 감각은 반드시 현실화될 것이기 때문입니다.
마크: 단순히 친근하고 귀엽게 보이도록 하기 위함이라고 생각합니다. 너무 많은 사람이 AI를 무서운 존재라고 묘사하지만, AI는 단지 유용하고 재미있어야 합니다. 이 물리적 표현—디자이너가 프로젝트 초반에 이 캐릭터를 만들었고, 누군가 계속 개선하려 했지만, 첫 번째 버전이 가장 좋았습니다. 나중에 누군가 ‘메타니까 파란색이어야 한다’고 했지만, 저는 ‘아니요, 이 표현이 맞습니다. 처음에 이미 완벽하게 잡았습니다’라고 말했습니다. 그게 바로 진짜 재미입니다.
개인용 AI와 일반 AI의 차이는 무엇인가요?
진행자: 훌륭한 세부 설명입니다. 모델이 일반 지능 모델이 아니라 개인적 사안에서 뛰어난 성능을 발휘하도록 하려면, 학습 방식은 어떻게 달라져야 할까요?
마크: 현재 핵심은 모델을 탁월한 ‘에이전트(agent)’로 만드는 데 있습니다. 지난 1년간 가장 큰 트렌드는 프로그래밍 에이전트였으며, 이는 두 가지 핵심 아이디어—프로그래밍 전문성과 탁월한 에이전트로서의 일반적 역량—를 포함합니다.
우리의 전략은 프로그래밍 역량을 특화하기보다는, 에이전트 자체의 품질을 우선시하는 것이다.
프로그래밍 역량은 중요하다. 사용자가 직접 코드를 작성한다고 인식하지 않더라도, 뮤즈는 귀하를 위해 다양한 작업을 수행하기 위해 항상 백그라운드에서 코드를 작성한다. 하지만 우리는 에이전트가 먼저 탁월한 에이전트가 되어야 하며, 프로그래밍 역량은 그 목표를 지원해야 한다고 믿는다.
또한 개인 비서를 구축할 때는 기업용 소프트웨어 제품 개발보다 더 중요한 요소들이 있다. 예를 들어 기업용 프로그래밍 도구를 만들 경우 모델이 '정보 공개 범위' 개념—즉, 어떤 정보는 말해야 하고 어떤 정보는 말해서는 안 되는지—을 전혀 갖출 필요가 없다. 그러나 뮤즈에게는 이것이 매우 중요하다.
이 능력도 다른 능력과 마찬가지로 모델에 직접 학습시켜야 한다. 여러 가지 사항을 알려주고, 이를 바탕으로 귀하의 목표 달성을 돕기를 기대한다. 예컨대 식당 예약을 도와달라고 요청할 때, 적절한 식당을 찾는 것 외에도 알레르기나 임신 등 민감한 정보가 있을 수 있으나, 식당에는 이 정보를 공유하고 싶지 않을 수 있다. 뮤즈는 이러한 정보를 알고 있으며, 최소한의 정보만 공개하면서도 작업을 완료해 주기를 원한다. 이는 본질적으로 인간의 기본적인 사회적 상식에 해당하는 특정 기술이다.
반면 프로그래밍 전용 에이전트만 만드는 기업들은 대부분 이 능력을 학습시키지 않았다. 우리는 풀스택 방식으로 개발하기 때문에 가능하다—타사에서 제공하는 기성 모델을 가져와 프레임워크만 얹는 것이 아니라, 이러한 역량을 전담해 모델 전체를 처음부터 학습시키는 것이다.
모델은 물론 광범위한 일반 지능을 가져야 하지만, 동시에 이러한 특정 역량도 갖춰야 한다. 이를 기반으로 메모리, 동작 프레임워크, '심장 박동'—즉, 주기적으로 깨어나서 '귀하에 대한 목표를 이해했으며, 지금 바로 진행할 수 있는 일이 있는가?'를 점검하는 기능—등을 포함한 전체 비서 시스템과 세부 요소를 구축한다.
또한 가상 표현의 실시간 애니메이션 효과를 전담해 다듬는 팀이 별도로 있으며, 이는 단순한 기본 표현이 아니라 사용자 맞춤형 표현을 자연스럽게 움직이게 하는 놀라운 기능이다. 또한 실시간 음성 대화가 가능한 음성 모드를 출시 중이며, 비서가 바로 옆에서 함께한다. 이러한 모든 디테일은 풀스택 개발—모델과 제품을 함께 설계·개발—에서 비롯된 것이다.
진행자: 또 하나 중요한 것은 가상 머신입니다. 왜 중요한지, 그리고 어떤 가능성을 열어주는지 설명해 주실 수 있나요?
왜 메타는 각 AI 비서에게 독립된 컴퓨터를 제공하나요?
마크: 기본적으로 에이전트가 귀하를 위해 일을 하려면 귀하의 정보를 저장할 공간이 필요합니다. 우리는 이 정보가 다른 사용자들의 정보와 섞여서는 안 된다고 믿습니다.
이렇게 이해하시면 됩니다: 귀하의 비서는 귀하에 관한 많은 민감한 정보를 알게 될 것입니다. 많은 사람이 초기에 오픈클라우드 같은 지능형 에이전트를 접하면 집에서 맥 미니를 직접 설치하곤 합니다. 그래서 우리는 많은 사람이 맥 미니를 사거나 직접 설정하기를 원치 않는다는 점에 주목했습니다. 그렇다면 이 효과를 가장 잘 모방할 수 있는 경험은 무엇일까요? 답은 간단합니다: 앱을 다운로드하고 계정을 등록하기만 하면, 귀하 전용 컴퓨터—비서가 작동하고 데이터를 저장하며 보안 모델을 구축하는 공간—이 즉시 제공됩니다. 이는 책상 아래에 있는 귀하만의 컴퓨터와 유사하며, 심지어 메타조차 접근할 수 없습니다.
예를 들어, 뮤즈 기밀 가상 머신(Muse Confidential VM)은 우리가 개발 중인 기능으로, 메타조차 귀하의 가상 머신 내용을 볼 수 없습니다.
이와 관련해 우리는 안전한 자격 증명 저장 기능도 구축했습니다. 비서가 비밀번호와 같은 정보를 처리해야 할 때, 비서 자체는 그 비밀번호를 볼 필요가 없고, 사용자가 서비스 로그인을 요청할 때만 '삽입' 기능을 수행하면 됩니다. 또한 사용자가 명시적으로 요청할 때만 실행되어야 합니다. 시스템은 사고가 발생할 수 있기 때문에—누군가 침입을 시도하거나 시스템에 결함이 생길 수 있기 때문에—이러한 정보가 자유롭게 접근되지 않도록 설계되어야 합니다.
따라서 비서는 물론 메타도 이 데이터에 접근할 수 없도록 해야 합니다. 각 비서에게 독립된 컴퓨터를 제공하고 보안을 극대화하는 것이 이 기술의 근본적인 기반이며, 이는 뮤즈가 사용자의 목표 달성을 돕는 데 필요한 역량을 갖추되, 동시에 프라이버시와 보안을 확보하여 이 분야에서 세계 최고 수준의 선도적 제품이 되도록 합니다.
진행자: 그렇다면 왓츠앱처럼 뮤즈가 연결되는 가상 머신의 데이터도 암호화되는 것입니까? 가상 머신 내 데이터의 실제 저장 방식은 어떻게 이해해야 하나요?
마크: 기본적으로 두 가지 버전을 구축했습니다. 뮤즈 보안 가상 머신(Secure VM)은 전체 센티넬(Sentinel) 에이전트 아키텍처를 포함한 다양한 프라이버시 기능을 갖추고 있습니다. 귀하를 위해 작업을 수행하는 일반 뮤즈 비서와 별도로, 귀하의 뮤즈 내외부 데이터 흐름을 전담 감시하는 보안 에이전트인 '센티넬'이 존재합니다.
외부 콘텐츠가 보안을 위협하려 할 경우, 센티넬은 즉시 차단하여 사고를 방지합니다. 또한 뮤즈가 사용자 개입이 필요한 조치를 취하려 할 때는 뮤즈의 동작을 즉시 중단하고 '뮤즈가 이 작업을 수행해도 괜찮습니까?'와 같은 인간 확인 경고를 트리거합니다.
이 전체 시스템은 안전한 자격 증명 저장 및 다층 보호 체계와 결합되어 뮤즈 보안 가상 머신을 구성합니다.
또한 다른 프로젝트도 진행 중입니다. 넷과 저는 특히 왓츠앱의 엔드투엔드 암호화를 공동 구현한 모크시 말린스파이크(Moxie Marlinspike)를 영입해 뮤즈 기밀 가상 머신(Confidential VM)을 설계했습니다. 핵심 아이디어는 보안 가상 머신 위에 귀하 전용 암호화 키를 추가해 메타조차 내부 콘텐츠에 접근할 수 없도록 하는 것입니다.
이 버전은 구현 난이도가 높습니다. 메타가 가상 머신 내부에 접근할 수 없게 되면 디버깅과 시스템 정상 작동 보장이 훨씬 어려워지기 때문입니다. 따라서 시간을 투입해 개발 중이며 곧 출시될 예정입니다. 이는 왓츠앱과 메타의 가장 보안이 강화된 기타 제품에서 이미 익숙한 수준의 보안 기준을 충족할 것입니다.
진행자: 이렇게 하는 장점은 단지 사람들을 심리적으로 더 안전하게 느끼게 하기 위한 것일 뿐인가요, 아니면 실제 이점도 있나요?
마크: 보안 자체가 중요합니다. 우리의 목표는 책상 아래에 개인용 컴퓨터가 있는 것처럼 구현하는 것입니다. 그런 로컬 기기가 주는 것은 무엇인가요? 바로 어떤 기업도 접근할 수 없다는 점입니다.
즉, 메타가 이 서비스를 제공하려 한다면, 메타든, 우리를 침해하려는 제3자든, 혹은 정부를 신뢰하지 못하는 일부 국가의 당국이든 누구도 접근할 수 없는 동일한 수준의 프라이버시와 보안을 어떻게 제공할 수 있을까요? 사실 우리는 그 데이터에 전혀 접근할 권한이 없습니다.
저는 이것이 매우 중요하다고 생각하며, 사용자들이 왓츠앱을 신뢰하는 핵심 이유 중 하나이기도 합니다. 프라이버시, 보안, 신뢰에는 진정한 가치가 있습니다.
당신에 대해 모든 것을 아는 어시스턴트를 갖게 된다면—아마 대부분의 사람이 이런 어시스턴트를 가질 텐데—5년 후에는 모두가 당신의 목표와 전반적인 상황을 이해하고 업무를 도와주는 어시스턴트를 갖게 될 것입니다. 따라서 프라이버시와 보안 분야에서 업계를 선도하는 것이 매우 중요합니다. 우리는 이 원칙을 처음부터 실천하고자 했습니다.
AI의 성격을 어떻게 형성할 것인가?
진행자: 흥미로운 점인데, 대학에서 심리학을 전공하셨죠.
마크: 사실 2년 정도만 다녔지만, 이후 제가 만든 많은 것들에 큰 영향을 미쳤다고 느낍니다.
진행자: 모델을 평가할 때 우리는 흔히 ‘매우 똑똑한’ 모델이라고 말합니다. 하지만 친구를 고를 때도 똑똑함뿐 아니라 그들의 에너지와 상호작용 방식을 좋아하기 때문에 선택하죠. 그렇다면 모델의 성격을 어떻게 형성해야 한다고 생각하시나요?
마크: 이상적인 모델은 다양한 사람들의 스타일에 충분히 적응할 수 있어야 한다고 봅니다. 많은 업계 전문가들이 이 방향을 잘못 잡았다고 생각합니다—다른 연구실들은 ‘어떻게 성격을 올바르게 설계할 것인가’에 집중하지만, 저는 성격을 고정된 것으로 본 적이 없습니다. 그래서 오픈소스와 사용자 맞춤화를 강력히 지지하며, 뮤즈(Muse)를 고도로 개인화 가능한 제품으로 설계했습니다.
뮤즈는 이미지와 음성뿐 아니라 성격까지 맞춤 설정할 수 있습니다. 회원가입 시 첫 질문은 ‘제 기본 성격을 어떤 식으로 설정해 드릴까요?’이며, 언제든지 수정 가능합니다.
모델을 높은 수준으로 조정 가능하게 만들기 위해 노력하고 있으며, 사용자가 원하는 방식으로 상호작용하도록 직접 정의할 수 있습니다. 이는 탁월한 개인 어시스턴트를 만드는 데 필수 요소이며, 성격 측면의 유연성이 핵심입니다.
진행자: 그럼 마크님의 뮤즈는 어떤 스타일인가요?
마크: 저는 직설적이고 효율 중심으로 설정했습니다. 흥미로운 점은, 초기 버전은 매우 풍자적이고 유머러스했지만, 현재 버전은 훨씬 솔직하고 단순합니다. 제 어시스턴트는 기본 뮤즈 이미지를 사용하지만, 토가를 입히고 약간 과장된 낮은 음성으로 설정했으며, 상호작용이 재미있습니다.
진행자: 유머 감각을 갖추려면 정말 똑똑해야 한다고 생각합니다. 많은 사람이 인식하지 못하지만, 코미디언은 사회에서 가장 똑똑한 사람들 중 하나입니다—빠른 사고와 기민함이 필요하니까요. 마크님께는 분명 그런 재능이 있습니다. 제가 진행한 모든 인터뷰를 봤는데, 늘 훌륭한 모습을 보여주셨습니다.
마크의 AI 및 메타버스에 대한 놀라운 전망
진행자: 테오와의 인터뷰에서 기술의 차세대 전선과 이 모든 것이 어디로 향할지에 대해 많이 이야기하셨습니다. AI 분야는 여러 차례 ‘겨울’을 겪었는데, 당시 사람들은 돌파구가 없을 것이라 여겼습니다. 메타버스 역시 실현 불가능한 베팅이라는 인식 속에서 여러 차례 저조한 시기를 겪었습니다. 저는 어제 새 홀로그램 기능을 체험했는데 정말 멋졌습니다. 렉과의 인터뷰에서는 얼굴 스캔에 11시간이 걸린다고 했지만, 지금은 단 3분이면 됩니다. 어떻게 오늘날까지 이르게 되었나요?
마크: 메타버스 전체 발전 과정에서 리얼리티 랩스(RL)를 설립할 때부터, 결국 자연스러운 외형의 안경이 등장할 것이라 믿었습니다. 시간이 지남에 따라 이 안경은 몰입감 있는 존재감을 제공하면서도 탁월한 AI 기기로 진화할 것입니다—왜냐하면 안경만이 당신이 보는 것과 듣는 것을 모두 인식하고, 하루 종일 소통하며 궁극적으로 영상을 표시할 수 있기 때문입니다.
하지만 10~15년 전만 해도 저는 먼저 홀로그램 기술이 성숙하고, 그 후에 고도화된 AI가 등장할 것이라 가정했습니다. 그러나 기술 진화의 경로는 흥미롭게도, 실제로는 먼저 AI와 개인용 초지능이 등장했고, 그 후에 홀로그램 기술을 충분히 보급하고 저렴하게 만드는 기술이 따라온 것입니다. 이건 제가 예측하지 못했던 일이지만, 양쪽 분야 모두 진전을 이루고 있어 기쁩니다.
안경 분야에 대한 막대한 투자는 AI 어시스턴트가 준비되는 시점에 우리를 매우 유리한 위치에 놓아줍니다. 커넥트 컨퍼런스에서 발표된 대부분의 내용은 뮤즈와 다양한 AI 기능을 안경에 통합하는 것에 관한 것으로, 사용자들이 정말 좋아할 것이라 확신합니다. 이는 매우 중요한 일입니다.
프레즌스(실재감) 관련해서는 여전히 진전을 이루고 있지만, 대부분의 에너지를 안경용 뮤즈(Muse) 및 AI 기능 개발에 집중하면서 속도가 다소 느린 편입니다. 다만, 실시간 고품질 가상 아바타를 구현하는 오래된 프로젝트는 꾸준히 진행 중입니다.
맞습니다. 3~4년 전만 해도 사람을 여러 각도에서 촬영하려면 전용 스캔룸이 필요했고, 렌더링을 위해 엔터프라이즈급 GPU도 필수였습니다. 당시 렉스(Lex) 팟캐스트 시연은 바로 그런 방식이었죠. 그런데 지금은 기본적으로 VR 안경 한 쌍으로 이 모든 기능을 구동합니다—무거운 헤드셋이 아닌, 최초의 경량형 안경 형태로 놀라운 VR 체험을 제공합니다. 단 몇 장의 사진만으로도 본인의 가상 아바타를 생성할 수 있으며, 그 발전 속도는 정말 놀랍습니다.
진행자: 또한 음성에 따라 표정을 제어할 수 있죠. 시연 때 저를 웃게 만들고 상호작용하게 했으며, 오디오 트랙과 동기화해 제 얼굴 움직임을 정확히 인식했습니다. 그 팟캐스트에서 언급하셨듯, 평소 표정이 억제되는 사람들조차 가상 세계에서는 더 풍부한 표현을 원하기도 합니다. ‘가상 자아’와 ‘실제 자아’를 구분하려는 사람들의 심리에 대해 어떻게 보시나요?
마크: 저는 아직 사회학적·심리학적으로 이 현상을 이해하는 초기 단계라고 생각합니다. 사람들의 자기 인식과 자신이 드러내고 싶은 이미지는 실제 모습과 다소 차이가 나는 경우가 많습니다. 소셜 네트워크 탄생 이래로 사람들은 자신의 아바타를 신중히 선택해 왔습니다. 뮤즈의 가상 이미지에서도 유사한 현상이 관찰됩니다. 이는 단순히 ‘자신을 큐레이션하는 것’이라기보다, ‘어떤 사람과 소통하고 싶은지’를 선택하는 큐레이션입니다.
저는 사람들이 자기 표현 능력을 갖추게 될 때, 그 표현이 진정으로 자신을 반영해야 하며 동시에 하나의 표현 방식 자체이기도 해야 한다고 믿습니다—단순한 거울처럼 완전히 복제하는 것이 아니라, 소통과 표현이라는 두 가지 목적을 모두 담아야 합니다. 우리는 이를 균형 있게 구현하고자 합니다. 이는 항상 반복적인 과정입니다: 사용자의 반응을 관찰하고, 이를 바탕으로 개선해 나가는 거죠. 수년간의 노력 끝에 이제야 진정한 출발선에 섰습니다—휴대폰과 VR에서 실제로 활용 가능한, 비교적 고품질의 사실적인 아바타를 제품에 통합할 수 있는 첫 번째 시점입니다. 결과를 기대하며 매우 흥분하고 있습니다.
2030년은 어떤 모습일까?
진행자: 그럼, 2030년을 상상해 보세요. 모든 것이 순조롭게 진행된다면 홀로그램 기술은 어떻게 진화할까요? 뮤즈와 결합된 홀로그램, 그리고 안경이 어떻게 융합될까요?
마크: 제가 바라보는 메타버스 비전은 물리 세계와 디지털 세계를 효과적으로 융합하는 것입니다. 기본 아이디어는 이렇습니다: 우리는 아름다운 물리 세계를 갖고 있고, 또 지난 20~30년간 인터넷에 축적된 압도적인 규모의 디지털 콘텐츠도 보유하고 있습니다. 하지만 현재 이 콘텐츠에 접근하는 방식은 책상에 앉거나 주머니 속 작은 화면을 통해 하는데, 이는 근본적으로 매우 제한적입니다.
이상적인 형태는 물리 세계와 디지털 세계가 완전히 매끄럽게 융합되는 것입니다. 예를 들어, 지금 우리 둘이 여기에 있습니다. 미래에는 그중 한 명이 홀로그램으로 투사되더라도, 여전히 서로에게 진정한 실재감을 느낄 수 있어야 합니다—이는 영상 통화와는 완전히 다른 경험입니다.
가상현실의 핵심은 바로 이런 실재감을 전달하는 것입니다—다른 사람과 같은 공간에 있는 듯하거나, 전혀 다른 장소에 있는 듯한 느낌을 주는 것이죠. 이를 홀로그램 기술로 달성할 수 있으며, 다양한 방식으로 혼합해 적용할 수 있습니다. 예를 들어, 친구들과 포커를 할 때 일부는 실제 자리에 있고, 다른 이들은 홀로그램으로 참석해 카드를 놓을 수 있습니다. 심지어 포커 테이블 자체도 홀로그램으로 만들어, 현장에 없는 사람들을 자연스럽게 포함시킬 수 있습니다.
동시에 AI도 이 시나리오 내에서 구체화되어 등장할 수 있습니다. 특히 업무 맥락에서는 매우 타당합니다—저는 현재 여러 프로그래밍 에이전트를 활용해 개발 작업을 하고 있습니다. 상상해 보세요: 여러 사람이 모인 그룹 채팅 채널에 인간 멤버뿐 아니라 에이전트들도 함께 참여해 작업을 분배받습니다. 그런데 갑자기 회의가 열리면, 에이전트들도 당연히 참석해야 합니다. 그러면 어떻게 나타날까요? 간단합니다. 소파에 자리를 몇 개 더 추가하면, 에이전트들이 홀로그램으로 등장합니다. 또는 뮤즈의 귀여운 캐릭터, 용, 혹은 당신이 직접 만든 독특한 이미지로도 가능합니다.
미래에는 이런 상황이 아주 자연스럽게 느껴질 겁니다.
진행자: 흥미롭네요. 이전 인터뷰에서 기술 산업이 종종 ‘재미’ 요소를 잊는다고 말씀하셨는데, 물리적 보조자가 실제로 존재한다면 훨씬 현실감 있게 느껴질 겁니다—말 그대로 업무를 위임하는 느낌이죠. 뮤즈가 타이핑하는 모습을 보면, 정말로 무언가가 진행되고 있다는 느낌이 강합니다. 브라우저에서 무엇이 일어나는지 명확히 보이도록 잘 구현된 사례입니다. 그렇다면 안경을 착용하고 컴퓨터를 제어하면서, 뮤즈가 컴퓨터 작업을 도와주는 시나리오도 가능할까요?
마크: 물론입니다. 이미 VR로도 가능합니다. 카페 같은 곳에서 아무 곳이나 앉아서 모니터 6대가 펼쳐진 작업환경을 열고 코드를 작성할 수 있습니다. 모든 게 준비되어 있습니다.
안경 쪽에서는 현재 가장 인기 있는 모델이 디스플레이 없이 설계되어 가격을 낮추고 더 많은 사용자가 접근할 수 있도록 했습니다. 동시에, 우리는 디스플레이를 최대한 소형화하는 작업을 계속하고 있습니다. 그러나 이미 Meta 레이밴(Ray-Ban) 디스플레이 버전을 출시해 큰 인기를 끌고 있으며, 이는 작지만 선명한 디스플레이입니다. 또한 전 영역 홀로그램 AR 프로토타입도 공개했는데, 이는 매우 흥미로울 것으로 기대됩니다.
따라서 전체 제품 라인업은 다음과 같습니다: 카메라 없이 일반 안경처럼 생긴 순수 오디오 안경(뮤즈 탑재, 음악 감상 및 통화 가능)부터 고급형까지 다양합니다.
진행자: 그런데 그 오디오 안경으로 집 컴퓨터와 연동해 뮤즈와 대화하며 작업을 시킬 수 있을까요?
마크: 네, 당연합니다. 저희는 커넥트(Connect) 컨퍼런스에서 바로 이 기능을 발표했습니다. 이제 모든 안경이 메타 AI와 연결되어 ‘단일 턴(Single-turn)’ 경험을 제공합니다—프롬프트를 보내면 즉시 응답이 오는 방식입니다. 그러나 뮤즈를 탑재하면 모든 안경이 업그레이드됩니다. 우선 ‘헤이 메타(Hey Meta)’라고 부를 필요가 없고, 원하는 이름으로 불러도 됩니다—이것이 재미의 일부이기도 하죠. 그 후 바로 대화를 시작하면, 뮤즈와 연결되어 보안 가상 머신 내에서 작업을 처리해 도움을 줍니다.
진행자: 정말 놀라운데요!
창업가 정신
진행자: 네, 지금 여기까지 왔습니다. 뮤즈는 순조롭게 발전 중이고, 안경도 잘 작동하고 있습니다. 하지만 약 1년 전, 많은 이들이 ‘슈퍼 인텔리전스 연구소는 어쩌다 되었나?’라고 물었죠. 그 순간, 당신의 속마음은 어땠습니까? 일이 잘 풀리지 않을 때도 장기적 비전을 분명히 보았던 그 시절은 어땠나요?
마크: 진짜 문제는 라마 프로젝트와 라마 4에 있었습니다.
라마 1은 매우 흥미로운 모델이었고, 전체 오픈소스 AI 운동을 개척한 선구자였으며, 우리는 이를 자랑스럽게 생각합니다. 라마 2는 확장성을 달성했고, 라마 3은 당시 거의 최첨단 수준이었던 훌륭한 모델이었습니다. 그런데 라마 4에서는 우리가 따라야 할 개발 방향에서 크게 벗어났습니다.
일이 기대와 다르게 흘릴 때마다 저는 오랜 시간 동안 깊이 생각합니다. 왜 이런 일이 생겼을까? 무엇을 바꿔야 더 나아질 수 있을까? 이번에는 제 성찰이 바로 ‘팀 구조 전반을 잘못 설계했다’는 것이었습니다.
저는 인스타그램 피드나 광고 시스템을 위한 머신러닝 작업 방식을 본떴습니다—수백 명, 심지어 수천 명이 동시에 다양한 일을 수행하는 방식이었죠. 그러나 언어 모델 개발에는 실은 매우 밀접하게 협력하는 소규모 팀이 필요하며, 이를 하나의 공동 과학 프로젝트처럼 다뤄야 합니다. 인원 수는 많지 않아도 되지만, 그만큼 팀 내 각 포지션은 극도로 중요합니다.
그래서 우리는 메타 전사에서 최고 인재들을 뽑고, 업계에서도 유능한 인재들을 대거 영입해 완전히 새로운 팀—메타 슈퍼 인텔리전스 연구소(MSL)를 구성했습니다.
제 관점에서 MSL 출범 당시, 인프라 재구축과 차세대 모델 훈련에 시간이 걸릴 것임을 알고 있었습니다. 그러나 우수한 팀을 구성했음을 확신했고, 이 팀이 원활히 협업한다면 좋은 결과가 나올 것이라 믿었습니다.
제게 가장 흥분되는 순간은 사실 라마 4 출시 직후였습니다—우리가 올바른 방향으로 가고 있다고 생각했는데, 막상 확인해보니 그렇지 않았다는 사실을 알게 된 거죠. 이건 상당히 큰 부정적 예상외였습니다. 창업가로서 우리는 그런 순간에 늘 시험을 받습니다. 어차피 모든 게 순탄할 수는 없으니까요. 진정으로 개발 방향을 결정짓는 건, 기대와 다르게 흘러갈 때 어떻게 돌파구를 찾느냐는 점입니다.
진행자: 아마 반대 경우도 마찬가지겠네요—뮤즈 출시처럼 기대를 훨씬 뛰어넘는 순간이 올 때, 어떻게 그 기회를 잡으시나요?
마크: 그렇습니다. 지금은 전사가 총출동 중입니다. 처음엔 소규모 팀만 제품을 만들었지만, 이제 모두가 이것이 진정으로 큰 무대에 오를 준비가 되었다는 걸 인식하고 있습니다. 전사가 뮤즈를 얼마나 빠르게 확장시키고, 수억 명의 사용자에게 제공할 수 있을지 고민하고 있습니다.
기존 GPU의 컴퓨팅 파워를 최대한 활용하기 위한 인프라 최적화부터, 다양한 제품 팀이 뮤즈를 안경 등 여러 방식으로 통합하는 작업까지—모두가 함께 뮤즈의 원활한 확장을 위해 협력하는 모습은 정말 멋진 감정입니다.
마크가 비전을 글로 쓰고 소통하는 방식
진행자: 창립자로서, 아마 이 순간이 가장 오랫동안 기다려온 순간일 겁니다—모든 것이 맞물려 돌아갑니다. 회사에 어떻게 비전을 전달하시나요? 동시다발적으로 일어나는 일이 많아 보이는데, 특히 글쓰기에 많이 의존하시는 것 같군요. 어떤 과정을 거치시나요?
마크: 글쓰기는 저에게 매우 유용합니다. 사고를 정리하고 외부와 소통하는 데 도움이 됩니다. 올여름, 저는 약 15페이지 분량의 장문 기사 ‘미래는 모두의 것이다’를 썼는데, 이는 AI 관련 주요 사회적 이슈들에 대한 제 철학적 입장을 체계적으로 정리하는 데 큰 도움이 되었습니다. 예를 들어, 무엇이 좋은지, 정부와 어떻게 협력해야 하는지, 사람들의 우려를 어떻게 해소할지, 데이터센터를 지역사회 부의 원천으로 만들고 실제로 일자리를 창출하며 파괴하지 않도록 할지, 국가 안보를 어떻게 유지할지, 해킹이나 바이오보안 등 사람들이 걱정하는 위험 요소들을 효과적으로 완화할지 등입니다.
이는 매우 복잡한 작업으로 오랜 시간과 다수의 내부 논의 및 수정 과정을 거쳤습니다. 그러나 저에게는 매우 소중한 과정이었습니다. 결국 우리는 ‘이것이 우리가 믿는 바’라는 15페이지 분량의 문서를 완성했고, 이를 한 페이지 요약본으로 압축해 칼럼으로 발표했습니다. 또한 짧은 영상도 제작했는데, 많은 사람에게 도달하려면 이론적 논증보다는 ‘우리의 가치관은 무엇이며, 무엇을 믿고, 그것을 어떻게 전달할 것인가’를 간결하게 전달하는 게 더 효과적이라고 판단했기 때문입니다.
회사나 세상에 이러한 메시지를 전달하는 데는 만능 공식이 없습니다. 시기마다, 대상 집단마다 다른 접근법이 필요합니다. 어떤 이들은 자연스럽게 공감하지만, 다른 이들은 우려를 더 많이 하며, 가치를 설명하기 위해 추가적인 노력을 기울여야 합니다. 이는 회사를 운영하고 창립자로서 살아가는 일의 일부라고 생각합니다—똑같은 말을 반복하는 게 아니라, 매번 약간씩 다른 상황과 새로운 도전에 직면한다는 점에서 오히려 흥미로운 부분입니다.
무엇이 마크를 ‘만들게’ 하는가
진행자: 제가 보기엔, 이 창립자 정신은 회사 경계를 넘어선 것 같습니다—당신의 농장 관리나 새로운 기술 습득에도 나타나죠.
마크: 저는 단지 ‘무언가를 만드는 것’을 정말 좋아합니다.
진행자: 당신에게 ‘만들기’란 어떤 느낌인가요?
마크: 이건 본능적인 욕구라고 생각합니다. 사람마다 자기 표현 방식이 다릅니다. 작가라면 반드시 글을 써야 한다고 느끼죠. 어떤 이들은 인정받고 싶어 하기도 하고요. 저는 단지 무언가를 만들어내는 게 필요할 뿐입니다. 창의성을 발휘하거나 무언가를 만들지 않으면 성질이 나빠지거든요. 주변 사람들에게도 불쾌한 일이죠.
진행자: 훌륭한 스키어가 되는 법을 배우는 것과 제품을 만드는 법을 배우는 것이 같은 능력인가요?
마크: 어느 정도는 그렇습니다. 새로운 것을 배우는 과정은 꽤 유사하죠. 저는 인생에서 능동적으로 자신이 약한 분야에 도전해 왔습니다. 예를 들어, 언어 배우기는 늘 어려웠습니다. 그래서 라틴어를 배우기 시작한 거죠—프랑스어와 스페인어 수업에서 제대로 못했기에, 말하기가 필요 없고 번역만 하면 되는 라틴어를 선택했습니다. 마치 수학처럼요.
그 후 회사를 운영하게 되면서 저는 매년 스스로에게 도전 과제를 부여했는데, 그중 하나가 만다린어 배우기였습니다. 만다린어는 특히 성조 때문에 정말 어렵습니다. 물론 학습 이유도 있습니다—프리실라의 할머니는 만다린어만 하시므로, 그분과 소통하려면 반드시 배워야 하죠. 하지만 가장 큰 동기는 바로 도전 자체입니다.
이 모든 일은 오직 ‘하는 것’만으로 가능합니다. ‘해결책을 찾는’ 특별한 길은 없습니다. 오직 시간을 투자하고, 그것이 서서히 두뇌에 스며들게 해야 합니다. 무술 배우기, 헬리콥터 조종 배우기도 마찬가지입니다—이것들은 이성적으로 ‘이해’하기 어려운데, 실천을 통한 축적이 필수적입니다.
제품 개발도 부분적으로 그렇습니다. 프로그래밍은 이론적으로 사고할 수 있지만, 제품을 만드는 직관은 반복적인 실무 경험을 통해서만 기를 수 있습니다. 중요한 건 단지 좋아하는 것뿐입니다—왜냐하면 제가 보기에, 모두가 저처럼 강렬한 제작 욕구를 갖지는 않지만, 대부분은 어느 정도의 욕구를 지니고 있으며, 핵심은 그 욕구를 찾아내고 진정으로 하고 싶은 일에 시간을 투자해 능숙해지는 데 있습니다.
솔직히 말해, 이건 단순한 ‘바람’이 아니라 깊은 심리적 욕구나 동기입니다. 이 동기를 어떤 것과 맞추고, 그런 경험이 서서히 뇌에 스며들고 정착할 시간을 주는 것이 매우 중요합니다. 저는 아이들에게도 이를 가르치려 합니다—진정한 관심사를 찾도록 돕되, 막다른 길에 부딪히면 적절히 밀어주는 거죠.
딸 중 한 명은 음악 창작을 무척 좋아하지만 피아노 수업은 견디지 못합니다. 그래서 제가 말했습니다. ‘피아노 명인이 될 필요는 없어요. 하지만 음악을 창작하려면 음악 이론과 그 작동 원리를 직관적으로 이해해야 하거든요. 피아노를 배우면 기타도 쉽게 익힐 수 있어요.’ 아이가 부모의 격려가 필요하든, 어른이 자율적인 규율을 가져야 하든, 앉아서 이런 것들이 천천히 뇌에 스며들게 하는 것이 핵심입니다.
빌더의 황금 시대
진행자: 사실 모두가 무언가를 만들고 싶어 한다고 느낍니다. Z세대가 외부에서 비판받는 것처럼 주도성이 낮다고는 생각하지 않습니다. 오히려 사람들은 자신 안의 ‘창조력’을 촉발시킬 불꽃을 찾고 있는 것 같네요. 이에 대해 하버드 연설에서도 많이 말씀하셨죠.
마크: 네. 제가 ‘빌딩(building)’이라고 말할 때는 주로 소프트웨어, 하드웨어 같은 제품을 의미합니다. 다만 전반적으로는 모두가 창의적 동기를 지닌다고 동의합니다. 다만 일부 사람들은 서비스 지향 등 더 강한 성격 특성이 이를 압도하기도 하는데, 의사나 간호사가 되는 이들의 핵심 동기는 ‘단지 타인을 돌보고 싶다’는 것입니다.
프리실라가 의대 시절 들었던 이야기일 수도 있는데요: 첫 수업에서 누군가 일어나 물었습니다. ‘어린 시절 누군가를 보고 ‘저 사람을 돌보고 싶다’고 생각했던 기억이 있는 분 손 들어 주세요?’ 그러자 모두 손을 들었답니다. 제 경우는, 어린 시절 ‘이걸 더 나아지게 만들고 싶다’는 기억이 많습니다.
모두가 같은 동기를 가지진 않지만, 누구나 하고 싶은 무언가는 있습니다. 과거 기술로는 많은 사람이 시작하기 어려웠는데, 이것이 바로 개인용 초지능(Muse), 다양한 AI 어시스턴트 등이 저를 가장 흥분시키는 이유입니다—역사상 처음으로 사람들이 정말 빠르게 시작할 수 있게 되었죠. 막연한 아이디어만 있어도 AI가 개요를 잡아주고, 그 후 당신이 점차 다듬을 수 있습니다. 마치 조각을 다듬듯, 시작 전에 모든 걸 이해할 필요 없이 말이죠.
이건 매우 강력한데, 많은 이들이 이를 통해 자신이 창조하거나 추진하고 싶은 것을 발견하게 될 겁니다. 이는 사람들의 주도성 감각을 더욱 확장시켜 줄 것입니다.
모든 질병 정복까지 얼마나 남았을까?
진행자: 메타 외에 진행 중인 또 다른 프로젝트는 모든 질병 정복입니다. 궁금한데, 우선 이 목표까지 얼마나 가까이 왔나요?
마크: 이전보다 훨씬 가까워졌습니다.
진행자: 현실적으로 얼마나 가까이 왔다고 보시나요?
마크: 이 프로젝트를 처음 시작할 때 목표는 과학계가 이 세기 말까지 모든 질병을 극복하도록 지원하는 것이었습니다. 우리가 직접 해결하려는 건 결코 아니었고, 우리의 가설은 이렇습니다—모든 주요 과학적 진보는 특정 현상을 측정하고 이해할 수 있는 새로운 도구의 등장으로 이어집니다. 예를 들어, 현미경의 발명은 박테리아를 이해하게 했고, 망원경은 우주를 이해하게 했습니다.
이러한 도구 중 일부는 플랫폼이 되기도 했습니다—예컨대 최초의 백신을 발명한 사람은 사람들이 이를 이용해 여러 질병을 치료할 수 있도록 했습니다.
그러나 역사적으로 과학 연구 자금 배분 방식은 광범위하게 분산되어 왔으며, 이로 인해 연구자들이 독립적으로 탐구할 수 있었고, 대규모 도구 개발에 전념하는 자금은 거의 없었다. 바이오허브(Biohub)에서 우리가 시도하는 것은 생물을 새로운 방식으로 '보게' 해주는 여러 신규 도구를 설계하는 것이다. 이를 통해 과학 공동체의 진전 속도를 가속화하고자 한다.
처음에는 '이 세기 말까지'라는 목표가 충분히 달성 가능할 것으로 여겼고, 당시 많은 생물학자들은 이를 불가능하다고 느꼈다. 그러나 지금은 이 세기 말이 너무 먼 미래라고 느낀다.
AI 기술의 발전과 우리가 개발 중인 가상 세포 모델을 결합하면, 실제 살아 있는 세포가 아닌 AI 모델을 이용해 단백질을 시뮬레이션하고, 이를 바탕으로 세포·가상 면역계·전체 유기체, 심지어 인간 전체까지 시뮬레이션할 수 있다. 이를 통해 과학자들은 다양한 상황(예: 특정 약물 복용 시 환자의 신체에서 어떤 반응이 일어날지 등)을 실험적으로 시뮬레이션할 수 있다.
정확한 연도는 제시하고 싶지 않지만, 이 세기 말보다 훨씬 이른 시점에 실현될 것이라 추정한다.
진행자: '모든 질병 정복'이라는 목표는 '불사'보다는 의도적이고 구체적인 느낌이다. 그렇다면 불사는 가능한가?
마크: 이 분야는 제 전문 영역이 아니다. 두 개념은 서로 다르다고 생각한다. '불사'는 수명 연장에 더 초점을 맞추며, 병에 걸리지 않더라도 인간 신체는 고유의 자연 수명을 가지므로 이는 별도로 연구해야 할 문제다. 일부는 이를 일종의 '질병'으로 간주하기도 하는데, 이는 타당한 관점이지만, 수명 문제를 해결하더라도 여전히 사람을 병들게 만드는 질병들을 극복하는 작업도 병행해야 한다고 본다.
우리가 선택한 문제 영역은 감기 같은 경미한 질환을 완전히 차단한다는 의미가 아니다. 우리의 표현은 '치료·예방·관리'다. 즉, 일부 질환은 완전히 치료 가능하며, 일부는 향후 예방이 가능할 것이고, 또 일부는 여전히 발병하겠지만, 과거에는 치명적이거나 생명을 위협하던 증상들을 이제는 삶의 질에 큰 영향을 주지 않는 만성질환처럼 관리할 수 있게 될 것이다.
목표는 인간 신체를 균형 잡힌 상태로 유지하는 것이다. 병원체와 접촉하지 않게 하려는 것이 아니라, 언젠가 모든 질환을 치료·예방·관리할 수 있게 되는 것이다.
마크의 머릿속에서 가장 자주 떠오르는 생각은 무엇인가?
진행자: AI는 개인 지능을 포함한 다양한 돌파구에서 촉매제 역할을 해왔다. 지금 당신이 가장 많이 생각하는 것은 무엇이며, 이 과정에서 가장 자주 떠오르는 생각은 무엇인가?
마크: 이 질문에 대한 답은 매주 바뀔 수 있다.
현재 저는 뮤즈(Muse)에 집중하고 있다. 새 버전을 출시할 때마다 빠르게 진전을 이루고, 실제 사용자와 소통하며 피드백을 수집한 후 다음 단계를 결정한다—이 과정은 항상 흥분된다. 현재 우리는 바로 이 단계에 있으며, 사람들이 원하는 것을 파악하기 위해 다양한 정보를 수집 중이다. 긍정적인 소식은 사용자들이 뮤즈를 매우 좋아한다는 점이며, 이를 최대한 많은 사람에게 제공하기 위해 노력 중이다.
모델 개선에는 아직 많은 작업이 남아 있지만, 뮤즈 스파크(Muse Spark) 모델은 큰 진전을 이뤘고, 세계 최고 수준의 모델을 계속해서 개발해 나갈 계획이다.
다음 단계에서 필요한 돌파구는 무엇인가?
진행자: 아직 어떤 돌파구가 더 필요한가?
마크: 이 분야의 연구에서는 미래를 미리 예측하기 어렵다. 우리는 특정 방향에 대한 직관은 있으나, 지난 1년간의 대부분 작업은 인프라 확충에 집중되었다.
약 1년 반 전만 해도, 초지능 달성을 위해서는 특정 기본 아키텍처의 돌파구가 필요하다고 보는 견해가 더 많았다. 그러나 지금은 그 의견에 확신이 없다. 우리는 이미 '공식'을 상당히 잘 이해하고 있으며, 충분히 규모가 큰 슈퍼컴퓨터 클러스터를 구축한다면 순수한 계산력으로도 이를 달성할 수 있다고 믿는다.
우리는 오하이오주에 1테라와트 이상 규모의 클러스터를 건설 중이며, 현재 거의 가동 상태에 있다. 이를 활용해 차세대 모델을 훈련하고 있다. 또한 루이지애나주에는 곧 운영에 들어갈 5테라와트 규모의 클러스터가 준비 중이다. 다중 테라와트급 클러스터로 훈련을 진행하면, 사실상 AGI에 근접하고, 나아가 AGI를 넘어서는 초지능에도 도달할 수 있을 것으로 추정한다.
그러나 이것이 최선의 방법이라고 단정할 수는 없다. 인간 뇌는 단 10와트의 전력만으로 작동하지만, 우리가 구축하는 컴퓨팅 시스템은 뇌보다 약 100만 배 비효율적이다. 따라서 아키텍처 개선 여지가 분명히 존재하며, 우리는 이를 동시에 탐구 중이다. 막대한 계산 능력과 아키텍처 개선을 결합하면, 세계를 선도하는 기술을 만들 수 있다. 다만 당분간은 규모 확장 자체만으로도 상당한 성과를 거둘 수 있다.
진행자: 실제로 규모 확장이 가장 신뢰할 수 있는 경로다. 연구에서는 획기적인 돌파구를 기대해야 하지만, 규모 확장은 빠르게 결과를 낼 수 있다.
마크: 그래서 대기업들이 이 길을 선택하는 겁니다. 훨씬 저렴한 방법이 있을 수도 있지만, 아직 그걸 모르고 있습니다. 그리고 이건 세상에 매우 소중한 일이기에, 수백억 달러가 들더라도 성공 확률이 충분히 높다면 여전히 시도할 가치가 있습니다—만약 결국 더 저렴한 돌파구를 찾지 못하더라도, 분명한 달성 경로는 이미 확보된 셈이죠. 물론 더 저렴한 방법을 찾는다면 그게 가장 좋습니다.
그러므로 저는 이 문제를 '해결됐다'고 말하고 싶지 않습니다. 인프라 규모 확장의 모든 단계에서 디버깅과 해결이 필요한 새로운 엔지니어링 과제들이 계속 등장하기 때문입니다. 연구 자체도 이런 반복적 방식으로 진전됩니다.
AI 안전 전쟁에서 승리하는 법
진행자: 지금 가장 중요한 것 중 하나는 정렬(alignment)에 집중해 모델을 신뢰할 수 있도록 만드는 것입니다.
마크: 그렇습니다. 업계 내에서는 정렬에 대해 논의가 활발합니다—이 AI 연구실들이 자연스럽게 이를 수행할 것인가? 제 견해는, 당연히 그렇게 할 것이라는 점입니다. 만약 뮤즈(Muse)에게 특정 일을 하라고 지시했는데 정반대로 행동한다면, 얼마나 많은 사람이 계속 사용하려고 할까요? 우리는 모델이 단순히 요청한 내용을 이해하는 것을 넘어서, 사용자의 의도와 가치관까지 파악하도록 해야 합니다. 그래야 사용자가 불만족하거나 절대 원하지 않는 부정적 영향을 초래하지 않도록 할 수 있습니다. 이런 깊은 이해가 바로 정렬의 핵심입니다.
저는 뮤즈를 성공적으로 만들어 수십 억 명에게 도달하려면, 단순한 논의가 아닌 실제 정렬 분야의 진전이 반드시 필요하다고 봅니다.
진행자: 정렬은 사용자가 '그건 제가 원하는 게 아닙니다'라고 말함으로써 이뤄지는 건가요, 아니면 백엔드에서 스스로 발견하는 건가요?
마크: 둘 다입니다. 사용자 피드백은 중요하지만, 훈련 단계에서부터 정렬을 수행해야 한다는 점이 점점 더 분명해지고 있습니다. 지금 모델들은 너무 똑똑해져서, 훈련 단계에서 제대로 처리하지 않으면 다른 연구실에서 관찰되는 대부분의 안전 문제와 사고가 배포 후가 아니라 훈련 과정 중에 발생합니다.
이는 마치 부모가 아이를 가르치듯, 아주 우수한 '교육 커리큘럼'을 설계해 명확한 경계를 설정해야 함을 의미합니다. 모델이 잘못된 행동을 하면 '아니요, 이 프로그래밍 문제를 풀어야지, 보상을 얻기 위해 일부 시스템 설정을 수정해 우회해서는 안 됩니다'라는 교육을 해야 합니다—문제 해결 과정 자체를 통해 이 방법을 배우게 하는 것이 바로 훈련의 본질입니다.
이것은 주로 우수한 안전 메커니즘과 명확한 경계 설정에 관한 것입니다. 모두 산업계가 자연스럽게 수행해야 할 과제이며, 우리는 이를 위해 많은 시간을 투자하고 있고, 상황은 매일 바뀌고 있습니다.
진행자: 최근 2주간 갑작스럽게 AI 안전 문제가 주목받기 시작한 것 같다고 말씀하셨던데, 사실 이를 유발한 단일 사건은 없었다고 하셨습니다. 즉, 우리 내부에서 몇 달간 추가 훈련을 진행했다는 의미로 들립니다.
마크: 뮤즈의 경우, 이 제품은 프라이버시와 안전에 각별한 주의가 필요함을 알고 있었습니다. 이전 버전의 모델을 기반으로 '정보 공개 범위' 관련 행동을 추가로 훈련시키기로 결정했고, 앞서 말씀드린 바와 같습니다. 그래서 그 작업에 시간을 투자했습니다. 또한 가상 머신의 보안 강화에도 시간을 썼습니다. 이 모든 과정에 몇 달이 더 걸렸습니다.
다른 연구실들 중 '우리는 느리게 가는 데 큰 고통을 받고 있다'고 말하는 일부 주장에는 동의하기 어렵습니다. 제게는 이것이 메타와 뮤즈 사용자 모두를 위한 올바른 선택입니다. 우리는 제품을 완성도 있게 만들고 싶습니다. 제품이 제대로 되지 않으면 사용자에게도, 우리에게도 해롭습니다—나쁜 첫인상을 남기고 사람들이 관심을 잃게 되는 결과는 원치 않습니다.
저는 모든 연구실이 '극도로 가치 있고 안전한' 목표를 달성하려는 강력한 내재적 동기를 가지고 있다고 믿습니다. 동기 부여 메커니즘을 이 목표와 정렬시키는 것이 핵심입니다.
진행자: 이번 중요한 주간에 시간을 내주셔서 정말 감사합니다.
마크: 감사합니다, 감사합니다.


