Executive Summary

이 글은 AMD가 2026년 9월 28일 발표한 82억 달러짜리 월드랩스 인수에서, 매체가 지나간 자리를 읽는다. 대부분의 보도는 이 거래를 칩 회사가 AI 스타 연구자를 영입한 일로 정리했다. 그런데 AMD 보도자료를 끝까지 읽으면 인수 자산 목록의 마지막에 "로봇 학습과 시뮬레이션 기술"이 붙어 있고, 월드랩스 자신의 글을 따라가면 그 기술이 어디서 왔는지가 적혀 있다. 월드랩스가 두 달 전에 인수한 SceniX라는 회사다.

그 엔진이 내놓은 결과는 7월에 블로그 한 편으로 공개됐다. 실측 학습 데이터 없이 시뮬레이션에서 배운 정책이 실물 로봇 다섯 종에 그대로 옮겨 갔다는 내용이다. 본문에는 성공률이 한 개도 적혀 있지 않다. 그림을 열면 사정이 달라진다. 축에는 성공률 눈금이 있고, 평가 대상이 엔비디아와 피지컬 인텔리전스가 만든 모델 둘이며, 가로축이 사후학습 반복 횟수라는 사실이 범례와 축 라벨에 적혀 있다. 본문이 말하지 않은 것을 그림이 말한다.

월드랩스는 같은 글에서 품질의 기준을 새로 세웠다. 쓸 만한 시뮬레이션은 실제 성공률을 정확히 맞출 필요가 없고 현실과 같은 결정을 내리게 해 주면 된다는 것이다. 합리적인 완화다. 문제는 그다음이다. 같은 명제를 정량으로 재는 지표가 2024년에 이미 나와 있고, 그 지표를 만든 연구실이 페이페이 리가 몸담았던 곳이다. 월드랩스는 그 지표를 쓰지 않았고, 남이 같은 지표로 다시 측정해 볼 도구도 열지 않았다. 생성기를 만드는 쪽이 평가 지표까지 쥐면 비는 자리는 독립적으로 측정하는 자리다.

±5.9 %p

실물 100회가 남기는 오차

성공률 0.9 근방의 95% 신뢰구간 반폭. 월드랩스가 체크포인트당 돌린 실물 시행이 100회다. 페블러스 계산

0건

로봇 발표문이 인용한 벤치마크와 기준선

원문 전수 검색 결과 benchmark, baseline, 순위 상관계수, 인용 문헌이 모두 0건이다

69일

SceniX 인수에서 AMD 발표까지

월드랩스가 로봇 시뮬레이션 회사 SceniX를 산 2026년 7월 21일부터 AMD 발표일까지의 간격

20 : 1

시뮬레이션 대 실물 시행 비율

체크포인트당 시뮬 2,000회 대 실물 100회. ALOHA 큐브 핸드오버 과제 기준이며, 학습 데이터량이 아니라 평가 횟수다

1

82억 달러는 확정가가 아니다

발표된 82억 달러는 AMD가 종결 시점에 실제로 치를 값이 아니다. 이 거래는 현금이 한 푼도 들어가지 않는 전액 보통주 교환이고, 교환에 쓰일 주식 수가 아직 정해지지 않았기 때문이다. AMD가 2026년 9월 26일 체결한 합병계약을 담은 Form 8-K는 그 사실을 회사 스스로 적어 두었다.

"the number of shares to be issued … is not known"

AMD, Form 8-K (amd-20260926), 2026년 9월 26일 체결 · 발행 주식 수는 종결일 2거래일 전까지의 10거래일 일별 거래량가중평균가격으로 산정한다고 같은 문서가 밝힌다.

발표는 미국 동부 시간 9월 28일 16시 5분, 정규장이 닫힌 뒤에 나왔다. 종결은 2026년 말까지로 예정돼 있고 규제 승인과 통상적인 종결 조건이 걸려 있다. 종결 전까지 AMD는 월드랩스를 반도체 사업과 분리해 운영한다고 CNBC가 전했다. 법인명은 World Labs Technologies, Inc.이고 본사는 샌프란시스코다.

이 8-K를 어느 항목으로 제출했는지도 함께 볼 만하다. 제출 항목은 3.02, 곧 미등록 주식 발행 하나뿐이다. 중요 계약 체결을 알리는 1.01 항목이 아니고, 제출 문서 목록에 합병계약서 자체가 첨부되지 않았다. 그래서 위약금과 규제 승인 관련 약정, 인력 유지 조건, 기존 투자자 지분의 처리 같은 조건은 공개 기록에 아예 없다. 발행 방식도 공모가 아니다. 같은 문서가 1933년 증권법 제4조(a)(2)와 레귤레이션 D 룰 506에 따른 사모 발행이라고 적는다. 이 글이 뒤에서 여러 번 공표되지 않았다고 적게 되는 까닭의 절반이 여기 있다. 조건을 담은 문서가 제출되지 않았으니 읽을 수가 없다. 8-K가 적은 금액도 "approximately $8.2 billion…subject to customary adjustments"라, 총액 자체에 조정 여지를 달아 두었다.

1.1자일링스 선례가 보여 주는 폭

전액 주식 거래에서 발표가와 종결가가 얼마나 벌어지는지는 AMD 자신의 이력에 답이 있다. 자일링스 인수는 2020년 10월 27일 약 350억 달러로 발표됐고, 2022년 2월 14일 종결됐다. 종결 시 회계상 인수대가는 488억 달러였다. FY2022 Form 10-K에 적힌 값이다. 발표 시점보다 39.4% 높다.

그래서 널리 퍼진 "AMD 역대 두 번째 규모"라는 서술은 축이 어긋난 비교다. 자일링스를 490억 달러로 적는 기사들이 쓰는 값은 종결가이고, 월드랩스의 82억 달러는 발표가다. 발표가끼리 견주면 350억 달러 대 82억 달러다. 순위 자체는 바뀌지 않지만, 두 숫자를 나란히 놓고 배수를 말하는 문장은 서로 다른 시점의 값을 곱하고 나누는 셈이 된다.

두 거래를 한 표에 넣어 보면 어긋난 자리가 보인다. 아래 표의 마지막 행이 이 글에서 가장 덜 알려진 수치다.

항목 자일링스 월드랩스
발표2020-10-27 · 약 350억 달러2026-09-28 · 약 82억 달러
대가 형태전액 AMD 보통주전액 AMD 보통주
종결2022-02-142026년 말 예정
종결 시 회계상 인수대가488억 달러미정
발표가 대비 이동+39.4 %미정
발행 주식 수4억 2,900만 주미정 · 9/28 종가 환산 약 1,350만 주

표 1. 자일링스 값은 AMD FY2022 Form 10-K와 2020년 발표문에서, 월드랩스 값은 2026년 9월 28일 보도자료와 Form 8-K에서 가져왔다. 자일링스의 488억 달러는 AMD 4억 2,900만 주의 공정가치 485억 달러에 대체 주식보상 2억 7,500만 달러를 더한 값이고, 적용 주가는 2022년 2월 11일 종가 113.18달러다. 월드랩스의 1,350만 주는 82억 달러를 9월 28일 종가로 나눈 환산값이므로 실제 발행 수는 종결 시점 주가 흐름에 따라 달라진다.

표의 첫 행과 마지막 행을 이어 읽으면 통념과 반대되는 그림이 나온다. 발표가로 견주면 자일링스가 월드랩스의 네 배쯤이다. 그런데 주식 수로 견주면 서른두 배 차이가 난다. 자일링스 때 AMD 주가는 113달러였고 지금은 600달러를 넘기 때문이다. 같은 돈을 주식으로 치르는 비용이 주가와 함께 내려간 셈이다. 이 비교에도 한 겹의 주의가 붙는다. 자일링스의 4억 2,900만 주는 종결 시 실제로 발행된 수이고, 월드랩스의 1,350만 주는 9월 28일 종가로 환산한 값이다. AMD의 희석률은 82억 달러를 그 종가 기준 시가총액으로 나눈 0.83%에 그친다.

시가총액   1,632,000,000주 × 607.87달러 = 9,920억 달러
희석률     82억 ÷ 9,920억 = 0.83 %
주식 수    82억 ÷ 607.87달러 = 약 1,350만 주
자일링스 대비  4억 2,900만 주 ÷ 1,350만 주 = 약 32배

발행주식수는 AMD의 2026년 6월 27일 기준 Form 10-Q 값이고 자사주는 없다. 주가는 9월 28일 종가다. 세 값 모두 9월 28일 종가를 고정한 환산이므로, 8-K가 정한 10거래일 가중평균 방식과는 다르다.

1.2주가가 뉴스를 반영한 날은 9월 29일이다

이 거래를 다룬 글에서 가장 흔한 날짜 착오가 여기 있다. 9월 28일 AMD 주가는 3.61% 내렸는데, 발표는 그날 장이 닫힌 뒤에 나왔다. 그 하락은 반도체 종목 전반의 조정이고 이 거래에 대한 반응이 아니다. 뉴스를 반영한 첫 정규장은 9월 29일이었다. 그날 주가는 장중 한때 1.3%까지 올랐다가 반락해 607.57달러로 닫혔고, 전일 대비 0.05% 낮은 사실상 보합이었다. 애널리스트 반응은 대체로 우호적이었다고 복수 매체가 전한다. 로젠블랫과 스티펠이 매수를 유지했고 BofA는 목표가를 720달러로 올렸다.

1.382억 달러는 AMD에 어느 정도 체급인가

희석률 0.83%라는 숫자는 이 거래가 AMD 주주에게 작은 일이라는 인상을 준다. 손익계산서 쪽으로 옮기면 인상이 달라진다. 82억 달러는 AMD의 FY2026 2분기 총매출 115억 달러의 71%에 해당하고, 같은 해 상반기 연구개발비 합계 49억 2,800만 달러의 1.66배다. 분기 매출의 열에 일곱쯤을 한 연구소에 얹은 거래이고, 반년치 연구개발 예산보다 크다.

월드랩스 쪽 사다리도 짧다. 2024년 9월 스텔스를 벗을 때 기업가치는 약 10억 달러로 보도됐고, 2026년 2월 18일 오토데스크가 주도한 10억 달러 라운드 때는 50억 달러가 거론됐다. 그 50억 달러는 블룸버그가 2026년 1월 23일 "Fei-Fei Li's AI Startup World Labs in Funding Talks at $5 Billion Valuation"이라는 제목으로 먼저 보도한 값이고, 월드랩스는 확인도 반박도 하지 않았다. 2월 라운드 발표문에도 기업가치는 적히지 않았다. 82억 달러가 그 1.6배라는 서술은 맞지만, 분모가 보도값이고 분자가 발표 시점 환산가라 배수 자체가 두 겹의 불확정 위에 있다.

덧붙일 주의가 하나 있다. 일부 3차 출처가 이 라운드의 기업가치를 12억 달러대로 적었는데, 그 값은 월드랩스가 창업 이후 모은 누적 조달액이다. 기업가치로 옮겨 쓰면 숫자의 뜻이 바뀐다. 2월 라운드에 이름을 밝힌 투자자 목록에는 AMD 자신과 오토데스크, 에머슨 콜렉티브, 피델리티, 엔비디아, 씨가 들어 있다. 이 목록은 월드랩스 자사 블로그에 그대로 적혀 있다.

2

로봇 학습 엔진을 만든 곳은 SceniX다

AMD가 산 로봇 학습 역량의 엔진은 월드랩스가 직접 만든 것이 아니다. 두 달 전에 인수한 다른 회사에서 왔다. 이 귀속은 페블러스의 추론이 아니라 월드랩스가 자기 글에 적은 문장이다. 그런데 CNBC, 톰스하드웨어, 재팬타임스 어디에도 그 회사 이름이 나오지 않는다.

출발점은 AMD 보도자료 본문이다. 월드랩스가 무엇을 만드는 회사인지 설명하는 문장의 끝에 조항 하나가 붙어 있다.

"World Labs develops spatial-intelligence models that generate, reconstruct and simulate interactive 3D environments from text, image and video inputs, as well as technology for robotic learning and simulation."

AMD, 「AMD to Acquire World Labs to Advance the Future of AI Compute」, 2026년 9월 28일

"로봇 학습과 시뮬레이션 기술"이라는 이 마지막 구절이 가리키는 자산이 어디서 왔는지는 월드랩스 블로그에 적혀 있다. 회사는 2026년 7월 21일 SceniX라는 로봇 시뮬레이션 회사를 인수했고, 일주일 뒤 발표문에서 그 회사가 무엇을 만들어 왔는지 밝혔다.

"On July 21, SceniX, a robotics and simulation company, joined World Labs. SceniX has been building systems that turn real robots, environments, and interactions into simulations for policy training and evaluation, developing a real-to-sim-to-real (R2S2R) engine that turns one physical task into many controllable, reusable worlds, helping robotics teams train policy models and test changes faster, uncover failures earlier, and reduce costly experimentation on hardware."

World Labs, 「Building Worlds That Train Robots」, 2026년 7월 28일

R2S2R은 실물을 시뮬레이션으로 옮기고, 거기서 학습한 정책을 다시 실물로 되돌리는 왕복 경로를 뜻한다. 월드랩스가 AMD에 넘기는 로봇 학습 설비의 이름이 그것이고, 그 엔진을 만든 주체를 회사 스스로 SceniX라고 적었다. 인수 발표까지 걸린 시간은 69일이다.

실물 로봇 조작 과제를 정렬된 시뮬레이션 세계로 옮기고, 외관·물체 배치·잡동사니·물리·로봇 자세·카메라 각도를 체계적으로 바꿔 가며 통제 가능한 변형 세계 여러 개를 만들어 내는 R2S2R 파이프라인 도식
▲ 실물 과제 한 건을 정렬된 시뮬레이션으로 옮긴 뒤, 외관·물체 배치·잡동사니·물리·로봇 자세·카메라 여섯 축을 체계적으로 바꿔 통제 가능한 세계 여러 개를 만든다 | Source: World Labs, "Building Worlds That Train Robots"

이 귀속은 7월 발표문 한 군데에만 있는 것도 아니다. 인수 발표 당일 페이페이 리가 자기 이름으로 올린 글에 같은 문장이 다시 나온다. 회사가 2024년 창업 이후 쌓은 역량을 열거하는 대목에서 "with the acquisition of SceniX, we're building towards an industry leading capability for robotics simulation"이라고 적는다. 회사가 AMD로 넘어가는 날 대표가 직접 꼽은 로봇 역량의 출처가 SceniX다. 그 이름이 없는 문서는 AMD 보도자료 쪽이다.

2.169일 안에 벌어진 네 가지 일

네 사건을 날짜순으로 늘어놓으면 무게중심이 어디로 기울었는지 보인다. SceniX 인수와 R2S2R 공개 사이는 일주일이고, Atlas 공개와 AMD 발표 사이는 4주가 되지 않는다. 회사가 로봇 쪽으로 방향을 튼 시점과 인수 발표가 같은 분기 안에 들어 있다.

07-21 SceniX 인수 조건 비공개 07-28 R2S2R 첫 결과 공개 SceniX 인수 7일 뒤 09-01 Atlas 공개 신청제 early access 09-28 AMD 인수 발표 82억 달러 전액 주식 69일

도식 1. 월드랩스 자사 블로그의 발표일을 그대로 옮긴 타임라인이다. 가로축 간격은 실제 날짜 간격에 비례한다. R2S2R 공개에서 AMD 발표까지는 62일, Atlas 공개에서 AMD 발표까지는 27일이다.

7월 21일 SceniX 인수 발표문 자체는 거의 비어 있다. 전문이 약 230단어이고, 밝힌 것은 회사 이름과 "a robotics company"라는 한 마디가 전부다. 창업자 이름도, 팀 규모도, 거래 조건도, 기술 내용도 적혀 있지 않다. 글은 스스로 이렇게 닫는다. "We'll share more soon about some of the early technologies SceniX has built." 그 soon이 일주일 뒤의 R2S2R 발표였다.

2.2같은 주에 AMD도 로봇으로 틀었다

월드랩스 쪽만 보면 7월의 방향 전환이 한 회사의 일로 읽힌다. 같은 주에 AMD가 무엇을 했는지 겹쳐 놓으면 그림이 달라진다. AMD는 2026년 7월 23일 샌프란시스코 모스콘 센터에서 연례 행사 Advancing AI 2026을 열었고, 그 자리에서 로봇용 프로세서를 내놨다. Ryzen AI Embedded X100 시리즈다. 회사가 적은 적용 분야의 첫 항목이 로보틱스이고 사용 사례로 휴머노이드와 수술 로봇이 들려 있다. 고객 샘플 출하는 6월에 시작됐고 양산은 4분기로 예정돼 있다. 같은 행사에서 로봇 파트너 네트워크와 피지컬 AI 통합 플랫폼도 함께 발표했다.

날짜를 나란히 늘어놓으면 이렇다. 7월 21일 월드랩스가 로봇 시뮬레이션 회사를 사고, 23일 AMD가 로봇용 칩을 내놓고, 28일 월드랩스가 로봇 학습 결과를 공개했다. 일주일 사이에 벌어진 일이다. 이 두 줄의 날짜를 겹쳐 놓은 보도는 찾지 못했다.

두 회사가 그 주에 처음 만난 것도 아니다. 인수 발표 당일 페이페이 리의 글에 관계의 이력이 적혀 있다. 창업 초기부터 AMD와 협력해 왔다고 적고, 지난해부터 AMD GPU에서 모델 학습과 추론 최적화를 함께 하는 깊은 기술 협력이 있었다고 적는다. 회사 블로그의 인수 공지도 같은 문장을 쓴다. 같은 글은 AMD의 CEO 리사 수가 초기 투자자였다고도 적는데, 개인 자격인지 회사를 통한 것인지는 그 글이 가르지 않는다. 칩 회사가 세계 모델 연구소를 왜 샀는지에 대한 가장 짧은 답이 여기 있다. 그 연구소는 이미 그 회사의 GPU를 쓰는 고객이었고, 두 회사는 같은 달에 같은 방향으로 움직였다.

2.3옛 동료를 다시 부른 인수이기도 하다

SceniX 공동창업자는 윈주 리와 창시 정이고 둘 다 컬럼비아대 교수다. 윈주 리의 이력이 이 연쇄를 다른 각도에서 설명한다. 베이징대를 나와 MIT CSAIL에서 안토니오 토랄바와 러스 테드레이크의 지도로 박사를 받은 뒤, 스탠퍼드 비전·러닝 랩에서 포스닥으로 있었다. 본인 홈페이지에 그 대목이 축자로 적혀 있다. "Postdoc at the Stanford Vision and Learning Lab (SVL), working with Fei-Fei Li and Jiajun Wu." 창시 정은 코넬대 박사 출신으로 컴퓨터 그래픽스와 물리 시뮬레이션을 연구한다. 유체와 충돌과 음향이 그의 분야다.

그러니 월드랩스가 SceniX를 산 일은 기술 자산을 사들인 거래이면서 옛 공동연구자를 다시 부른 일이기도 하다. 그 계보는 4절에서 다시 등장한다. 같은 연구실에서 나온 사람들이 로봇 시뮬레이션의 평가 지표를 만들었기 때문이다.

다만 SceniX에 대해 확인된 것은 여기까지다. 기업 데이터베이스 집계로는 2024년에 설립된 뉴욕 회사이고 직원은 스무 명이 되지 않으며 공개된 투자 라운드 기록이 없다. 이 값들은 제3자 집계이고 회사가 공표한 적이 없다. 월드랩스가 치른 인수가도 비공개이고, 추정치를 보도한 매체조차 찾지 못했다.

2.4회사가 스스로 그린 세 칸 중 어디를 파는가

월드랩스는 AMD 발표 넉 달 전에 월드모델을 세 범주로 갈라 놓는 글을 냈다. 무엇을 출력하는지로 나눈 분류다. 렌더러는 사람이 보는 픽셀을 내놓고, 시뮬레이터는 기계가 계산할 수 있는 상태를 내놓고, 플래너는 행동을 내놓는다. 렌더러의 한계를 회사 스스로 이렇게 적었다. "The model carries no explicit understanding of three-dimensional structure." 보기에 그럴듯해도 물리적으로 불가능한 결과가 나올 수 있다는 뜻이다.

그리고 세 칸 중 시뮬레이터를 linchpin, 곧 핵심 축이라 불렀다. 시각적 겉모습과 행동의 결과가 모두 거기서 파생되기 때문이다. 이 자기 규정이 인수를 읽는 틀이 된다. AMD가 산 자산 목록에서 무게가 실린 칸은 사람이 보는 영상을 만드는 쪽이 아니라 기계가 계산할 상태를 만드는 쪽이다. 데이터 품질을 묻는 질문은 정확히 그 경계에 선다. 보기 좋은 세계와 계산 가능한 세계를 회사가 스스로 갈라 놓았기 때문이다.

3

본문에 없는 성공률이 그림에는 있다

월드랩스는 성공률을 공표했다. 다만 글이 아니라 그림 안에만 공표했다. R2S2R 발표문 본문에는 퍼센트가 하나도 적혀 있지 않은데, 본문 중간에 걸린 차트 이미지를 내려받아 확대하면 축과 범례에 값이 들어 있다. 이 절의 수치는 그 이미지를 직접 판독한 결과이고, 판독임을 드러내기 위해 오차를 함께 밝힌다.

3.1그림을 열면 나오는 것

차트는 4327×2027 픽셀 PNG 한 장이고 캡션은 "Charts comparing policy performance in simulation and on real hardware"다. 패널이 세 개다. 왼쪽은 시뮬레이션 성공률을 가로, 실물 성공률을 세로로 놓은 산점도이고 양축 모두 0.0에서 1.0까지 0.2 간격 눈금이 있다. 가운데는 학습 곡선 두 벌이고, 오른쪽은 큐브 위치를 좌표로 놓은 성공·실패 공간 지도다. 점을 세면 산점도에 열여섯 개, 학습 곡선에 여덟 개다.

그림에서 가장 값나가는 것은 눈금이 아니라 범례다. 평가 대상 정책의 이름이 거기 있다. GR00T N1.6과 π0.5, 곧 엔비디아의 로봇 파운데이션 모델과 피지컬 인텔리전스의 비전·언어·행동 모델이다. 그런데 이 두 이름은 R2S2R 발표문 본문에 한 번도 나오지 않는다. 본문은 "across policy architectures"라고만 적는다. 원문 HTML을 전수 검색해 확인한 사실이다. 글을 읽어서는 월드랩스가 무엇을 평가했는지 알 수 없고, 차트를 열어야 알 수 있다. 이 두 이름을 보도한 매체도 없다.

월드랩스 R2S2R 발표문의 차트 원본 — 시뮬레이션·실물 성공률 산점도, GR00T N1.6과 pi_0.5의 사후학습 반복별 학습 곡선, 큐브 위치 성공·실패 공간 지도
▲ 본문에는 없는 성공률 수치가 이 그림의 범례와 눈금에만 있다 — 표 2는 가운데 패널 학습 곡선을 판독한 값이다 | Source: World Labs, "Building Worlds That Train Robots"

학습 곡선의 여덟 측정점을 눈금에서 읽으면 아래와 같다. 판독 오차는 눈금 한 칸의 십분의 일 수준, 대략 0.01에서 0.02다.

정책 사후학습 반복 시뮬 성공률 실물 성공률
π0.52K0.430.46
π0.55K0.6750.71
π0.510K0.8550.88
π0.520K0.845 ↓0.90 ↑
GR00T N1.610K0.090.12
GR00T N1.620K0.560.59
GR00T N1.630K0.640.68
GR00T N1.650K0.630.67

표 2. 월드랩스 R2S2R 발표문의 차트 이미지를 확대해 눈금에서 읽은 값이다. 월드랩스가 숫자로 적은 것이 아니라 페블러스가 판독한 값이므로, 소수 둘째 자리는 판독 오차 범위 안에 있다. 반복 횟수는 그림의 가로축 라벨 Post-Training Iterations를 그대로 옮겼다.

이 표에서 먼저 눈에 걸리는 것은 마지막 행이 아니라 가로축 이름이다. Post-Training Iterations, 곧 사후학습 반복 횟수다. 본문도 같은 낱말을 쓴다. "ID refers to cube positions within the distribution used to post-train the policy." 그리고 범례에 이름이 적힌 두 정책은 둘 다 실측 로봇 데이터로 사전학습된 모델이다. 엔비디아 모델 카드는 GR00T N1.6이 "real captured data"를 포함한 혼합 데이터로 학습됐다고 적고, 피지컬 인텔리전스 공식 저장소는 공개 체크포인트가 "pre-trained on 10k+ hours of robot data"라고 적는다.

여기까지가 1차 출처 넷이 각각 적어 둔 사실이다. 다음 한 단락은 그 사실들을 이어 붙인 페블러스의 해석이다. 그림이 다루는 구간에서 "zero real-world training data"는 사후학습 구간의 0으로 읽힌다. 베이스 정책 두 개에는 이미 실측 데이터가 들어가 있기 때문이다. 같은 글의 "trained entirely in simulation"이 파이프라인 전체를 뜻하는지, 사후학습 단계만 뜻하는지는 월드랩스가 밝히지 않았다. 확인할 수 있는 것은 글이 그 구분을 적지 않았다는 사실까지다.

같은 발표문 안에 이 해석을 거드는 대목이 또 있다. 회사는 시뮬레이션이 통한 선례로 자율주행을 든다. 그런데 그 문장이 "some of the most successful L3 or L4-level self-driving cars running on the road today are powered by models trained using both real-world driving and simulation data"다. 둘 다라고 적혀 있다. 시뮬레이션의 힘을 논증하려고 회사가 직접 고른 선례가 실측과 합성의 혼합이다.

같은 글 안에서 표현이 한 번 흔들리는 대목도 있다. 본문은 "zero"라 적고 결론부는 "minimal"이라 적는다. 두 문장을 나란히 놓는다.

"The policies shown here were trained entirely in simulation, with zero real-world training data, and transferred directly to diverse real robot platforms."

본문

"Sim-to-Real uses those worlds to train policies with minimal real-world training data, uncover failures, and predict performance on hardware."

같은 글 결론부

어느 쪽이 정확한지를 회사가 밝힌 적은 없다. 둘 중 하나를 골라 단정하는 대신 두 문장이 같은 글에 함께 있다는 사실만 적어 둔다.

3.2곡선 끝에서 두 선의 방향이 갈린다

표 2의 네 번째 행으로 돌아간다. π0.5의 1만 반복에서 2만 반복 구간에서 시뮬 성공률은 0.855에서 0.845로 내려가고 실물 성공률은 0.88에서 0.90으로 올라간다. 월드랩스가 내건 명제 가운데 하나가 학습 중의 개선이 하드웨어로 이어질지를 예측한다는 것인데, 그 명제가 겨누는 축에서 방향이 갈린다.

그리고 여덟 측정점 전부에서 시뮬 성공률이 실물보다 낮다. 무작위로 흩어진 오차가 아니라 한 방향으로 쏠린 과소추정이다. 월드랩스 자신의 기준으로는 이것이 결함이 아니다. 성공률을 정확히 맞출 필요가 없다고 스스로 적었기 때문이다. 다만 편향의 방향이 여덟 점에서 한 번도 뒤집히지 않았다는 사실 자체는 적어 둘 만하다.

이 대목을 주장이 틀렸다는 뜻으로 읽어서는 안 된다. 산점도의 실물 분포 폭이 넓어 두 값은 통계적으로 갈리지 않는다. 가를 수 없다는 사실이 이 글의 논지이고, 그것을 숫자로 만드는 작업이 4절이다.

3.3Atlas 표도 같은 모양을 하고 있다

발표문의 요약과 표 안의 값이 어긋나는 패턴은 로봇 글에만 있는 것이 아니다. 9월 1일 공개된 Atlas도 자사 요약이 표준 벤치마크 전반에서 우수하다고 밝혔다. 페이지에 실린 차트의 값을 전수 추출해 보면 일곱 칸 중 여섯 칸이 최고이고 한 칸은 2위다. 지표는 포인트맵 재구성 오차이고 낮을수록 좋다.

벤치마크 Atlas Pi3X π³ VGGT-Ω 1B Depth Anything 3 MapAnything
평균25.328.734.736.439.347.7
DTU8.611.116.29.711.918.2
ETH3D9.318.725.411.423.834.8
KITTI60.060.274.8101.493.3115.3
NRGBD6.513.317.510.511.320.2
7-Scenes37.839.344.445.250.847.4
T&T42.442.447.040.255.160.8
ScanNet12.415.717.436.629.037.0

표 3. 월드랩스 Atlas 발표 페이지의 SVG 차트에서 값을 전수 추출한 것이다. 지표는 포인트맵 재구성 오차(AbsRel ×10−3)이고 낮을수록 좋다. 주황색이 각 행의 최저값이다. 일곱 값 모두 월드랩스 자체 평가이고 제3자 검증이 아니다. T&T는 Tanks and Temples이며 이 칸에서는 VGGT-Ω 1B가 Atlas보다 낫다.

헤드라인은 평균 25.3 대 28.7이다. 평균이 일곱 칸의 단순 산술평균임을 확인하고 칸마다 기여를 다시 계산해 보면 격차가 어디서 나왔는지가 드러난다. 차순위 Pi3X 대비 평균 격차 3.39 가운데 68.4%가 ETH3D와 NRGBD 두 칸에서 나온다. 오차 규모가 가장 큰 KITTI는 60.0 대 60.2로 사실상 무승부이고 격차 기여가 0.8%이며, T&T는 정확히 동률이라 기여가 0이다.

평균 확인   177.0 ÷ 7 = 25.286 → 25.3      200.7 ÷ 7 = 28.671 → 28.7
평균 격차   23.7 ÷ 7 = 3.39
칸마다 몫   ETH3D 9.4 (39.7 %)   NRGBD 6.8 (28.7 %)   ScanNet 3.3 (13.9 %)
            DTU 2.5 (10.5 %)     7-Scenes 1.5 (6.3 %)  KITTI 0.2 (0.8 %)   T&T 0.0 (0.0 %)

페블러스 재계산. 여섯 열 전부를 다시 평균해 표기값과 일치함을 확인했다.

스케일이 제각각인 일곱 값을 균등 평균하면 이런 구조가 생긴다. 값이 큰 칸은 평균의 수준을 지배하지만 격차에는 거의 기여하지 않고, 값이 작은 두 칸이 격차를 거의 다 만든다. 평균 하나만 보면 전면적 우위로 읽히고, 칸을 펴면 두 칸에 쏠린 우위로 읽힌다. 어느 쪽도 틀린 서술은 아니지만 두 서술이 주는 인상은 다르다.

이 표를 한 번 더 들여다볼 이유가 인수 발표 당일 생겼다. 페이페이 리는 자기 글에서 Atlas를 "outperforming state of the art results even by specialized models"라고 적었다. 전문 모델들이 내놓은 최고 성적까지 넘어섰다는 문장이다. 표 3에서 Atlas가 1위를 놓친 칸은 일곱 중 하나뿐인데, 그 한 칸을 내준 상대가 하필 전문 모델 VGGT-Ω 1B다. 어긋나는 폭은 한 칸이지만 그 한 칸이 문장이 겨눈 바로 그 상대다.

카메라 경로를 따르는 영상 생성에 대한 인간 선호도 비교는 다섯 건이 실려 있다. 투표자가 Atlas를 고른 비율이 MiniMax H3 대비 75%, Gemini Omni Flash 대비 81%, Happy Horse 1.1 대비 86%, FLUX 3 대비 93%, Seedance 2.5 대비 94%다. 투표자 수와 모집 방법, 과제 구성은 어디에도 없다. 표 3과 마찬가지로 이 비율도 자사 평가다.

4

실물 100회로는 체크포인트를 가를 수 없다

순위가 보존된다는 주장을 확인해 줄 정답지 쪽이 시뮬레이션보다 훨씬 성기다. 월드랩스가 공표한 평가 프로토콜은 체크포인트당 시뮬 2,000회와 실물 100회다. 20 대 1이라는 이 비율은 비용 절감의 상징으로 읽히지만, 100회가 어느 정도 해상도를 주는지는 어디에도 적혀 있지 않다. 계산해 보면 이야기가 뒤집힌다.

"Each checkpoint is evaluated on 2,000 simulated trials (1,000 ID and 1,000 OOD) and 100 real-world trials (50 ID and 50 OOD)."

World Labs, R2S2R 발표문의 그림 캡션 · 이 문장은 ALOHA 양팔 큐브 핸드오버 과제 한 건에만 적용된다. 나머지 네 플랫폼과 다섯 과제에 대해서는 한 시간 무개입 연속 작동 같은 정성적 결과만 실렸다. 그 한 시간 표기가 붙은 과제에는 전선 정리와 전원 코드 배선, 시험관 옮기기, 마커와 연필 분리 등이 있는데, 시행 횟수가 적힌 큐브 핸드오버는 그 다섯 과제에 들어 있지 않다. 숫자가 있는 과제와 지속 작동을 보인 과제가 서로 겹치지 않는다.

4.1100회가 남기는 오차는 6에서 10 %p다

성공률은 비율이고, 비율의 불확실성은 시행 횟수로 정해진다. 이항비율의 정규근사로 95% 신뢰구간 반폭을 구하면 아래와 같다. 계산식을 그대로 적는다.

신뢰구간 반폭   1.96 × √(p(1−p)/n)

실물 100회, p=0.9    1.96 × √(0.09/100)   = ±5.9 %p
실물 100회, p=0.5    1.96 × √(0.25/100)   = ±9.8 %p
실물  50회, p=0.9    1.96 × √(0.09/50)    = ±8.3 %p
실물  50회, p=0.5    1.96 × √(0.25/50)    = ±13.9 %p
시뮬 2,000회, p=0.85 1.96 × √(0.1275/2000)= ±1.6 %p
시뮬 1,000회, p=0.9  1.96 × √(0.09/1000)  = ±1.9 %p

페블러스 계산. ID와 OOD를 갈라 보면 각 조건의 실물 표본은 50회이므로 아래쪽 두 행이 적용된다. 성공률 입력값은 표 2의 판독값이다.

이 오차로 실제 판정을 해 보면 결과가 분명해진다. 인접한 두 체크포인트의 실물 성공률 차이가 통계적으로 갈리는지 보려면 두 독립 비율 차의 신뢰구간을 쓴다. 반폭은 1.96 × √(2p(1−p)/n)이다.

비교 실제 차이 가르는 데 필요한 차이 판정
π0.5 실물 10K(0.88) 대 20K(0.90)2.0 %p8.7 %p못 가른다
GR00T N1.6 실물 30K(0.68) 대 50K(0.67)1.0 %p13.0 %p못 가른다

표 4. 페블러스 계산. 실물 100회로는 두 체크포인트 가운데 어느 쪽이 나은지 판정할 수 없다. 정규근사는 n과 p가 작을 때 부정확해지므로, 성공률이 0.1 근방인 GR00T N1.6의 1만 반복 구간은 이 판정에서 제외했다. 위 두 비교는 성공률이 0.6에서 0.9 사이여서 근사가 유효하다.

그래서 20 대 1이라는 비율은 뒤집어 읽어야 한다. 시뮬레이션을 2,000회 돌려 1.6 %p까지 정밀하게 측정해도, 그 정밀함을 확인해 줄 정답지 쪽은 6에서 10 %p로 흔들린다. 3절에서 본 곡선 끝의 불일치, 곧 시뮬은 내려가고 실물은 올라간 그 구간은 이 표본으로는 어느 쪽이 맞는지 판정할 수 없는 구간이다. 검증의 해상도가 실물 100회에 묶여 있다.

공정하게 읽으려면 월드랩스가 이 표본으로 무엇을 하겠다고 적었는지를 봐야 한다. 발표문은 용도를 두 가지로 적는데, 두 용도에 필요한 해상도가 다르다. 하나는 선별이다. 상당수 체크포인트를 실물 시험 전에 걸러내고 값비싼 하드웨어 평가는 가장 유망한 정책에만 쓴다고 했다. 성공률 0.09와 0.56처럼 멀리 떨어진 두 체크포인트를 가르는 일이라면 실물 100회로 충분하다. 오차 6 %p가 문제가 되지 않는 간격이다.

다른 하나가 문제다. 같은 발표문은 시뮬 평가가 학습 중의 개선과 정체를 함께 추적한다고 적는다. 원문은 "tracks improvements and plateaus across checkpoints"다. 정체를 말하는 것은 차이가 0에 가깝다는 주장이고, 그 주장은 차이가 있었다면 잡아냈을 해상도를 갖춘 뒤에야 성립한다. 실물 100회가 두 체크포인트를 가르는 문턱은 8.7 %p다. 그 안에서는 정체와 8.7 %p짜리 실제 개선이 같은 모양으로 보인다. 표 2의 π0.5 1만에서 2만 반복 구간이 정확히 그 자리다. 선별에는 넉넉한 표본이 정체 판정에는 모자란다.

파이프라인 전체에 이 표본 크기를 얹어 보면 어느 지점에 좁은 목이 있는지 보인다. 아래 도식에서 실물 촬영은 맨 앞의 입력이고, 실측 학습 데이터가 0이라는 주장이 걸리는 자리는 오른쪽의 정책 학습 구간이다.

실물 한 과제 촬영 3차원 재구성 변형 생성 여러 세계 정책 사후학습 실물 로봇 이식 입력은 실물 촬영이다. "실측 0"이 걸리는 자리는 이 왼쪽이 아니라 오른쪽 정책 학습 구간이다 체크포인트마다 시뮬 2,000회 → 오차 ±1.6 %p 체크포인트마다 실물 100회 → 오차 ±5.9 %p 정답지 쪽이 세 배 넘게 거칠다 ALOHA 큐브 핸드오버 과제 기준. 다른 네 플랫폼의 시행 횟수는 공표되지 않았다

도식 2. 단계 이름은 월드랩스 발표문의 서술을 옮긴 것이고, 표본 크기는 같은 글의 그림 캡션에서 가져왔다. 오차 값은 페블러스 계산이다.

4.2학계는 이 명제를 2024년부터 숫자로 측정한다

월드랩스가 정성으로 주장한 명제, 곧 시뮬 평가가 실물 순위를 보존한다는 명제에는 이미 표준 측정 도구가 있다. 2024년 5월 공개된 SIMPLER가 그것이다. UC 샌디에이고와 스탠퍼드, UC 버클리, 구글 딥마인드 연구자 열여섯 명이 함께 쓴 논문이고, 로봇 두 종과 공개 정책 여섯 개 체크포인트에 대해 약 1,500회의 실물과 시뮬 짝지은 평가를 돌렸다.

SIMPLER가 세운 지표는 두 개다. 순위 위반의 정도를 측정하는 MMRV와 피어슨 상관계수다. 논문이 그림 3의 설명에서 두 지표를 이렇게 정의한다.

"Illustration of Mean Maximum Rank Violation (MMRV, range [0, 1], lower is better) and Pearson correlation coefficient (Pearson r, range [−1, 1], higher is better) for assessing the correlation between policy performances in real-world and simulation, as well as the overall quality of simulated evaluation pipelines."

Li et al., 「Evaluating Real-World Robot Manipulation Policies in Simulation」, arXiv:2405.05941

MMRV를 따로 만든 이유가 이 글의 논지와 정확히 겹친다. 피어슨 상관계수 하나로는 안 되는 대목을 논문이 직접 적어 두었다.

"Pearson correlation does not reflect the range of values it is computed over. Thus, for policy sets that lie within a narrow range of real-world performances, r may change drastically based on small real-world performance differences, which can often be attributed to the inherent noise in real-world evaluations."

같은 논문. 다른 대목에서는 "overly sensitive to minor noise in evaluations when different policies perform similarly in the real world"라고 적는다.

학계가 2024년에 이름 붙여 둔 이 실패 양상이 월드랩스 그림의 곡선 끝 구간에서 그대로 나타난다. 실물 성능이 좁은 범위에 몰려 있고, 그 안의 작은 차이가 실물 평가의 잡음에서 나올 수 있는 상황이다. SIMPLER는 그런 구간을 위해 MMRV를 만들었고, 실제로 값을 냈다. 브리지데이터 V2 실물 대 시뮬 비교에서 MMRV 0.014, 피어슨 0.890이다. 시뮬을 쓰지 않고 검증 손실로 순위를 매기는 기준선은 MMRV 평균 0.375였고, SIMPLER는 0.143이었다. 시뮬 평가가 검증 손실보다 순위를 잘 맞힌다는 것을 그 두 수치가 보인다.

R2S2R 발표문에는 이 지표가 없다. 원문 HTML을 전수 검색한 결과 benchmark는 0회, baseline도 0회, 스피어만과 켄들과 MMRV도 각각 0회다. 인용 문헌 목록도, 논문 링크도, 코드 저장소 링크도 없다. 대문자 SIMPLER는 한 번도 나오지 않는다.

4.3그 지표를 만든 사람들이 옆자리에 있다

지표를 쓰지 않은 것이 지표를 몰랐기 때문이라고 보기는 어렵다. 월드 생성 평가의 첫 통합 벤치마크인 WorldScore는 페이페이 리가 공저자이고, 시니어 저자 자자쥔 우는 SIMPLER 공저자이기도 하다. 그리고 2절에서 본 대로 SceniX의 윈주 리는 그 두 사람과 스탠퍼드 비전·러닝 랩에서 함께 연구했다. 세 갈래가 한 연구실에서 만난다.

사람 평가 지표를 만든 쪽 회사 쪽
페이페이 리WorldScore 공저자월드랩스 공동창업자·CEO → AMD 부사장 겸 최고과학자
자자쥔 우WorldScore 시니어 저자 · SIMPLER 공저자스탠퍼드 잔류
윈주 리—SceniX 공동창업자 → 월드랩스 → AMD

표 5. WorldScore는 arXiv:2504.00983으로, 테스트 예제 3,000개와 모델 19개를 평가하며 제어 가능성·품질·동역학 세 축을 잰다. 윈주 리의 스탠퍼드 이력은 본인 홈페이지에서 확인했다. Atlas 발표 페이지를 전수 검색하면 WorldScore는 0회 나온다.

이 대비를 위선으로 읽을 이유는 없다. 회사가 자체 지표를 쓰는 것은 흔한 일이고, 기존 벤치마크가 자사 과제를 담지 못할 수도 있다. 다만 적을 수 있는 것이 하나 남는다. 쓸 수 있는 지표가 있었고 그 지표를 만든 사람들이 회사 안에 있는데 쓰지 않았으며, 그래서 제3자가 같은 지표로 재현하거나 대조할 방법이 없다.

규모를 견줄 값도 하나 적어 둔다. 공개 실측 코퍼스 하나인 DROID는 궤적 7만 6,000건에 350시간 분량이고, 13개 기관 50명이 열두 달에 걸쳐 모았다. 그 궤적 수는 R2S2R 체크포인트 한 번의 시뮬 평가 2,000회의 38배다. 다만 이 비교를 읽을 때 범주를 섞지 않도록 주의해야 한다. DROID의 7만 6,000건은 학습 코퍼스의 규모이고 2,000회는 평가 시행 횟수다. 두 숫자를 나란히 놓고 시뮬이 실측을 대체한다고 읽으면 층위가 다른 값을 맞대는 오류가 된다.

5

'열린 생태계'를 약속했지만 자산은 아직 신청제다

AMD가 강화하겠다고 적은 열린 생태계와, 실제로 산 자산의 공개 범위가 어긋난다. 이 어긋남은 해석을 보태지 않아도 성립한다. 세 개의 1차 출처가 각각 자기 자리에서 적어 둔 문장만으로 표가 채워진다.

먼저 AMD 쪽이다. 열린 생태계라는 표현은 보도자료 한 장에 세 번 나온다. 부제, 본문의 전략 서술, 그리고 리사 수 CEO 인용문이다.

"Acquisition brings leading AI model research expertise to AMD, helping to shape future AI infrastructure and strengthen the open AI ecosystem."

AMD 보도자료 부제 · 본문에는 "The acquisition advances AMD's strategy to deliver AI infrastructure for an open ecosystem."이라고 적혀 있다.

"Building the compute platforms for the next generation of AI requires a deep understanding of how models are evolving. … Together, we can use that insight to develop the hardware, software and systems that will power the next generation of AI and strengthen the open AI ecosystem."

리사 수, AMD 회장 겸 CEO

같은 보도자료에 실린 페이페이 리의 인용문에는 열린이라는 낱말이 없다. 모델 연구와 시스템과 연산에 걸친 긴밀한 협력이 필요하다고 적고, AMD에 합류하면 연구를 가속할 자원과 엔지니어링 역량을 얻는다고 적는 데서 끝난다. 그런데 같은 날 회사 블로그와 본인 글에서는 사정이 다르다. 월드랩스는 "hardware, software, platforms, and widely accessible open models"에 걸친 종단간 열린 AI 생태계를 구축하는 데 전념한다고 적었고, 페이페이 리는 "the best open models and platforms"를 제공하는 데 전념한다고 적었다. 공개 모델을 내놓겠다는 약속은 AMD의 말이기만 한 것이 아니다. 인수되는 쪽이 발표 당일 자기 이름으로 적은 말이다. 그러면 아래 표는 위선의 증거가 아니라 그 약속이 출발한 날의 기록이 된다.

다음은 월드랩스가 실제로 연 범위다. Atlas는 선별된 파트너와의 신청제 early access로 들어갔다고 회사가 스스로 적었다. 가중치도, 코드도, 학습이나 합성 데이터셋도, 평가 도구도 공개되지 않았다. 3절에서 본 벤치마크 수치는 전부 자체 평가이고, 같은 조건으로 남이 다시 측정할 경로가 없다.

세 번째는 같은 문제를 다루는 경쟁 제품이다. 엔비디아는 2026년 6월 22일 Cosmos 3 기술보고서에서 공개 범위를 이렇게 밝혔다.

"To accelerate open research and deployment in Physical AI, we make our code, model checkpoints, curated synthetic datasets, and evaluation benchmark available under the Linux Foundation's OpenMDW-1.1 License."

NVIDIA, 「Cosmos 3: Omnimodal World Models for Physical AI」기술보고서, 2026년 6월 22일

세 출처를 한 표에 넣으면 어느 항목이 열리고 어느 항목이 닫혔는지가 보인다.

공개 항목 AMD 보도자료가 말한 것 월드랩스가 실제로 연 것 엔비디아 Cosmos 3
표현"strengthen the open AI ecosystem"—"accelerate open research"
모델 가중치—신청제 early access공개 (OpenMDW-1.1)
코드—없음공개
학습·합성 데이터셋—없음공개
평가 벤치마크—없음공개
로봇 정책 체크포인트—없음 (평가 대상이 남의 모델)Cosmos3-Nano-Policy-DROID
제3자 평가 인용—자체 인간 선호 투표Artificial Analysis · RoboArena · PAI-Bench

표 6. 세 열 모두 1차 출처에서 가져왔다. 월드랩스 열은 Atlas 발표 페이지, 엔비디아 열은 Cosmos 3 기술보고서다. 공개 체크포인트에는 Cosmos3-Super와 Cosmos3-Nano 계열이 들어 있고, 공개 합성 데이터셋은 SDG-PhyxSim과 SDG-RobotSim이다.

가장 날카로운 칸은 가중치가 아니라 평가 벤치마크다. 엔비디아는 남이 자기를 검증할 도구까지 같이 열었고, 월드랩스는 자기 결과를 검증할 도구를 열지 않았다. 그런데 "열린 생태계"라는 말은 AMD 보도자료에 있다.

AMD 쪽의 열린 생태계가 말만인 것은 아니라는 점도 적어 둔다. 2.2절에서 본 로봇용 프로세서는 리눅스와 ROCm 소프트웨어 스택 위에서 돌고 파이토치와 ONNX 같은 표준 프레임워크를 쓰며, 회사는 CUDA 코드를 ROCm으로 옮기는 도구를 벤더 종속을 피하는 근거로 내세웠다. 소프트웨어 층에서는 실제로 여는 쪽에 서 있다. 그러니 위 표가 가리키는 공백은 소프트웨어 층이 아니다. 모델과 평가 층이다. 이 인수로 AMD 안에 들어오는 자산이 정확히 그 두 층이다.

공정하게 읽으려면 한 가지를 덧붙여야 한다. 엔비디아는 칩으로 돈을 버는 회사라서 모델을 열 유인이 크다. 세계 모델을 많이 쓰게 만드는 일이 곧 가속기를 많이 파는 일이기 때문이다. 그러니 이 대비는 엔비디아가 착하다는 이야기가 아니라 사업 구조가 공개 범위를 정한다는 이야기다. 그리고 AMD 역시 칩 회사다. 그래서 "열린 생태계"라는 말과 신청제 자산 사이의 간격이 앞으로 어느 쪽으로 좁혀질지가 이 거래의 열린 물음이 된다.

관련해서 단정할 수 없는 대목도 적어 둔다. 엔비디아는 2026년 2월 월드랩스 라운드의 투자자 명단에 있으니 전액 주식 거래에서 AMD 주식을 받게 된다는 추론이 나온다. 그런데 기존 투자자 지분이 어떻게 처리되는지는 AMD도 월드랩스도 공표하지 않았다. 팀 규모와 Marble·Atlas·World API의 상업적 운명도 마찬가지로 밝혀진 것이 없다.

5.1지난 글이 던진 물음에 대한 첫 단서

페블러스는 9월 21일 쓰임새를 모르고 만든 데이터로 좋은 AI가 나올까?에서 데이터 공급사가 무엇에 맞춰 만들지를 모른다는 문제를 다뤘다. 병목이 데이터의 양이 아니라 조준점이라는 이야기였고, 독자에게 넘긴 점검표의 세 번째 항목이 이렇게 적혀 있었다. "납품물을 우리가 어떻게 평가할지를 공급자가 작업 전에 알고 있는가. 채점표를 뒤에 숨기면 다음 차수가 나아지지 않는다."

이번 사건은 그 물음에 대한 구체적인 첫 답을 준다. 월드랩스는 채점표를 공개적으로 내걸었다. 쓸 만한 시뮬레이션의 조건이 무엇인지, 무엇을 맞히면 합격인지를 문장으로 내놓았다. 그 점에서는 앞선 글이 아쉬워한 자리가 메워진 셈이다. 다만 그 채점표로 매긴 점수는 그림 안에만 있고, 남이 같은 채점표를 들고 다시 매길 도구는 열리지 않았다. 지난 글의 점검표가 이번 사건을 읽는 렌즈가 된다.

6

페블러스 관심의 이유

이 인수가 건드린 자리는 페블러스가 데이터 품질 작업에서 반복해 만나는 자리와 모양이 같다. 아래 세 대목은 제품 소개가 아니다. 앞 절들이 보여 준 구조가 실무에서 어떻게 다시 나타나는지를 본다.

6.1걸러낼 원본이 없으면 준비의 정의가 바뀐다

AI-Ready Data라는 말은 수집된 것을 고르고 라벨을 붙이고 결함을 걸러내는 일을 가리켜 왔다. 로봇이 밟을 바닥과 집을 케이블과 넘어질 조명 조건이 실측 기록이 아니라 모델 출력으로 공급되면 그 순서가 뒤집힌다. 걸러낼 원본이 없고, 만들어 낸 것이 곧 원본이다. 준비된 상태를 판정하는 일이 고르는 일보다 앞에 온다.

데이터클리닉이 데이터셋의 결함을 진단하는 도구라면, 합성 환경에서는 진단할 결함의 정의부터 다시 세워야 한다. 월드랩스가 적은 정의, 곧 현실과 같은 결정을 내리게 해 주면 된다는 조건이 지금 업계에 나와 있는 가장 구체적인 답이다. 받아들이든 반박하든 입장을 가져야 할 명제다.

6.2기수에서 서수로 내려간 품질 지표

월드랩스의 기준 재정의를 지표의 언어로 옮기면 기수에서 서수로 내려간 것이다. 두 정책 중 어느 쪽이 나은지만 맞히면 되고 얼마나 잘하는지는 틀려도 된다. 이 완화는 개발 속도를 크게 올린다. 실물 평가가 가장 비싼 자원이기 때문이다.

대가도 있다. 서수 지표는 분포가 바뀌면 함께 무너진다. 학습과 평가가 모두 같은 생성기에서 나온 세계라면, 그 생성기가 놓친 상황에서는 순위조차 보존된다는 보장이 없다. 그리고 4절에서 계산한 대로 순위를 확인해 준 표본은 체크포인트당 실물 100회이고, 그 100회는 인접 체크포인트를 가르지 못한다. 순위 보존이라는 주장과 그 주장을 확인한 표본 사이의 거리가 이 거래에서 가장 덜 알려진 값이다.

6.3내년에 받을 제안과 그때 되물을 한 줄

로봇과 자율주행과 물류 자동화 고객이 내년에 받을 제안은 이런 모양일 것이다. 실측 수집을 줄이고 생성 환경에서 학습하시라, 하드웨어 평가는 상위 체크포인트에만 쓰시면 된다. 경제적으로 강력한 제안이다. 실무자가 물어야 할 것은 가격이 아니라 인수 조건이다.

이 제안의 모양을 페블러스가 상상할 필요는 없다. R2S2R 발표문이 이미 그렇게 적어 두었다. 정렬된 시뮬레이션이 "a primary source of training experience for real-world robot deployment, not merely a supplement to hardware data"가 될 수 있다는 증거라고 회사가 직접 썼고, 그 기술의 경제적 함의가 거대하다는 문장을 바로 뒤에 붙였다. 같은 글은 R2S2R이 정책과 몸체에 무관하게 작동해서 서로 다른 로봇과 센서와 정책 스택을 쓰는 고객들을 같은 시스템으로 지원할 수 있다고 적고, 시연 과제들을 고객에게서 착안한 것이라고 적는다. 제안은 이미 문서로 나와 있다.

  • 생성 환경이 우리 작업장을 충분히 닮았다는 것을 무엇으로 보이는가. 충실도인가 결정 동치인가, 둘 중 어느 잣대로 합격을 매기는가.
  • 순위 보존이 우리 과제에서도 성립한다는 것을 몇 회의 실물 시행으로 확인했는가. 그 횟수가 남기는 오차는 몇 %p인가.
  • 생성기가 놓친 상황을 찾는 책임은 공급자에게 있는가 우리에게 있는가.
  • 같은 결과를 제3자가 다시 측정할 도구가 함께 오는가.

네 물음이 과한 요구가 아니라는 증거는 이 거래의 매수 쪽에 있다. AMD는 7월 로봇 프로세서 발표에서 경쟁 제품 대비 실시간 신뢰성이 최대 3.4배라는 수치를 내걸었고, 그 수치의 각주에 조건을 적었다. 벤치마크는 AMD가 의뢰한 것이고, 측정은 X199 규격에 맞춰 설정한 소비자용 미니 PC에서 했고, 비교 대상은 엔비디아 젯슨 AGX 토르 개발자 키트다. 측정을 수행한 기관과 발행일과 보고서 주소까지 적어 두었다. 자기 수치가 어떤 조건에서 나왔는지를 스스로 적는 관행이다. R2S2R 발표문에 없는 층이 바로 그 층이다.

네 번째 물음이 이번 사건에서 가장 늦게 답을 받은 항목이다. 칩 회사가 세계 모델 연구소를 사고, 세계 모델 연구소가 로봇 시뮬레이션 회사를 사면서 생성기와 검증자가 같은 지붕 아래로 들어갔다. 조건을 각주에 적는 관행과 성적표를 그림에만 두는 관행도 이제 한 회사 안에 함께 있다. 어느 쪽이 남는지가 이 인수에서 지켜볼 대목이다. 여기까지는 날짜와 문서로 확인되는 사실이다. 그 구조에서 어느 자리가 비는지는 독자가 판단할 몫이다.

확인하지 못한 것도 적어 둔다. R2S2R 그림의 성공률은 페블러스가 이미지를 확대해 판독한 값이므로 소수 둘째 자리는 오차 범위 안에 있고, 월드랩스가 숫자로 공표한 것이 아니다. a16z 대담은 발언을 인용하지 않았다. 영상 자동 생성 자막은 기계 판독이고 원본 전사가 공개되지 않아 축자 대조가 불가능했다. 확인한 것은 a16z가 공개한 영상 설명과 구간 목록까지다. AMD 임원의 고객 경합 관련 발언도 애널리스트 게시물 경유라 이 글에서는 쓰지 않았다. 자일링스 외의 전액 주식 거래 선례와 중국을 포함한 규제 심사 일정은 조사하지 못했다. 합병계약서가 8-K에 첨부되지 않아 종결 조건과 기존 투자자 지분의 처리는 공개 기록으로 확인할 길이 없다. SceniX의 직원 수와 투자 이력은 제3자 기업 데이터베이스 집계이고 회사가 공표한 값이 아니다. 긴 글 읽어 주셔서 감사하다.

R

참고문헌

본문의 근거는 네 갈래다. 1번부터 6번까지는 AMD의 공시와 보도자료와 제품 발표문이고, 거래 조건과 자일링스 선례의 수치, 2.2절의 로봇용 프로세서 일정이 여기서 왔다. 7번부터 14번까지는 월드랩스 자사 1차 출처이며, 3절의 판독과 2절의 SceniX 귀속이 이 글들에 실린 문장과 그림에서 나왔다. 귀속은 7월 발표문과 9월 대표 서한 두 곳에 각각 있다. 15번부터 18번까지가 4절의 학술 앵커이고, 19번 이후는 업계 기술 문서와 매체와 페블러스 선행 글이다. 4절의 신뢰구간과 3절의 격차 기여 계산은 페블러스가 직접 했으며 계산식을 본문에 노출했다.

1차 기업 공시·보도자료

  • 1.AMD. (2026-09-28). AMD to Acquire World Labs to Advance the Future of AI Compute. AMD Newsroom / Investor Relations. 부제와 리사 수·페이페이 리 인용문, 자산 서술의 축자가 여기서 왔다.
  • 2.AMD. (2026-09-26). Form 8-K (amd-20260926). SEC. 발행 주식 수 미정과 10거래일 가중평균 산정식, 사모 발행 근거 조항.
  • 3.AMD. (2026). Form 10-Q, FY2026 Q2 (2026-06-27 마감). SEC. 발행주식수 16억 3,200만 주, 총매출 115억 달러, 연구개발비 25억 2,800만 달러.
  • 4.AMD. (2022). Form 10-K, FY2022. SEC. 자일링스 종결 시 인수대가 488억 달러, 발행 주식 4억 2,900만 주, 적용 주가 113.18달러.
  • 5.AMD. (2026-07-23). AAI 2026: AMD Delivers Leadership Heterogeneous Compute for Physical AI. AMD Newsroom. Ryzen AI Embedded X100 시리즈의 로보틱스 적용 분야, 6월 샘플 출하와 4분기 양산 일정, Advancing AI 2026 발표 사실. 행사 일자와 장소는 AMD의 2026년 4월 28일 보도자료 「AMD Announces "Advancing AI 2026"」에서 확인했다(7월 23일, 샌프란시스코 모스콘 센터).
  • 6.AMD. (2026-07-23). From Benchmarks to Behavior: Rethinking Performance in Autonomous Robotics. AMD Blogs. 실시간 신뢰성 3.4배 수치와 그 각주의 조건 서술(AMD 의뢰, Ryzen AI Max+ 395를 X199 규격으로 설정한 미니 PC 측정, 엔비디아 젯슨 AGX 토르 개발자 키트 대조, Open Navigation LLC 2026-07-23 발행).

월드랩스 자사 1차 출처

  • 7.World Labs. (2026-07-28). Building Worlds That Train Robots. R2S2R 발표문. 표 2의 판독값은 이 글에 실린 차트 이미지(wlt-ai-cdn.art/videos/2026-robotics-blog/diagram-2.png, 4327×2027 PNG)에서 읽었다. 축자 인용 다섯 건의 출처이기도 하다.
  • 8.World Labs. (2026-07-21). World Labs Acquires SceniX. 약 230단어 전문. 창업자·팀 규모·조건·기술이 적히지 않았고 "We'll share more soon"으로 닫힌다.
  • 9.World Labs. (2026-09-01). Atlas: A World Model for Spatial Intelligence. 표 3의 값은 이 페이지 SVG 차트의 텍스트 노드에서 전수 추출했다. 인간 선호도 다섯 건과 신청제 early access 서술도 같은 페이지에 있다.
  • 10.World Labs. (2026-06-03). A Functional Taxonomy of World Models. renderer·simulator·planner 세 범주와 시뮬레이터를 linchpin이라 부른 대목.
  • 11.World Labs. (2026-02-18). 시리즈 B 라운드 발표. 조달액 10억 달러와 투자자 명단(AMD·Autodesk·Emerson Collective·Fidelity·NVIDIA·Sea). 기업가치는 적히지 않았다.
  • 12.a16z. (2026-07-28). Fei-Fei Li on Spatial Intelligence and Robotics (Martin Casado · Fei-Fei Li · Yunzhu Li, 42분 21초). R2S2R 발표문이 직접 링크한 대담. youtube.com · 영상 설명과 구간 목록만 대조했고 발언은 인용하지 않았다.
  • 13.World Labs. (2026-09-28). World Labs is Joining AMD. 인수 공지. AMD GPU에서의 모델 학습·추론 최적화 협력이 지난해 시작됐다는 서술과 "widely accessible open models" 축자가 여기서 왔다.
  • 14.Li, Fei-Fei. (2026-09-28). To Seek a Newer World. 본인 뉴스레터. 인수 공지가 "here"로 링크한 대표 서한. SceniX 귀속의 두 번째 1차 출처이고, 창업 초기부터의 AMD 협력과 리사 수의 초기 투자자 서술, Atlas의 "even by specialized models", 공개 모델 제공 약속이 모두 이 글에 있다.

학술

  • 15.Li, X., Hsu, K., Gu, J., Pertsch, K., Mees, O., Walke, H. R., Fu, C., Lunawat, I., Sieh, I., Kirmani, S., Levine, S., Wu, J., Finn, C., Su, H., Vuong, Q., & Xiao, T. (2024). Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER). arXiv:2405.05941. MMRV·피어슨 정의와 값은 PDF 본문과 표에서 직접 확인했다. arxiv.org
  • 16.Duan, H., Yu, H.-X., Chen, S., Fei-Fei, L., & Wu, J. (2025). WorldScore: A Unified Evaluation Benchmark for World Generation. arXiv:2504.00983 (v2 2025-11-29). 테스트 예제 3,000개·모델 19개. arxiv.org
  • 17.Khazatsky, A., 외 (2024). DROID: A Large-Scale In-the-Wild Robot Manipulation Dataset. arXiv:2403.12945. 궤적 7만 6,000건·350시간·13개 기관·열두 달.
  • 18.Open X-Embodiment Collaboration. (2023). Open X-Embodiment: Robotic Learning Datasets and RT-X Models. arXiv:2310.08864. 실측 코퍼스 규모의 비교 기준.

업계 기술 문서

  • 19.NVIDIA. (2026-06-22). Cosmos 3: Omnimodal World Models for Physical AI (기술보고서). OpenMDW-1.1 라이선스 축자와 공개 체크포인트·데이터셋·평가 벤치마크 목록.
  • 20.NVIDIA. GR00T-N1.6-3B 모델 카드. Hugging Face. "real captured data"를 포함한 혼합 학습 데이터 서술.
  • 21.Physical Intelligence. openpi 저장소 README. "pre-trained on 10k+ hours of robot data".
  • 22.Yunzhu Li 개인 홈페이지. 스탠퍼드 비전·러닝 랩 포스닥 이력 축자와 MIT CSAIL 지도교수.

매체

  • 23.CNBC. (2026-09-28). AMD acquiring Fei-Fei Li's World Labs AI firm in deal worth $8.2 billion. 종결 전 분리 운영 서술의 출처. 차세대 모델 연구로 칩 요구사항을 미리 계획한다는 대목은 기자의 서술이고 AMD의 공식 표현이 아니다.
  • 24.Bloomberg. (2026-01-23). Fei-Fei Li's AI Startup World Labs in Funding Talks at $5 Billion Valuation. 50억 달러 기업가치의 최초 보도. 월드랩스는 확인도 반박도 하지 않았다.

페블러스 선행 글

  • 25.페블러스. (2026-09-21). 쓰임새를 모르고 만든 데이터로 좋은 AI가 나올까? 데이터 공급사가 맞출 사양이 공개되지 않는다는 문제를 다뤘고, 5.1절이 인용한 점검표가 그 글에 있다. blog/world-model-secrecy-data-spec