Executive Summary
이 글은 2026년 9월 기준으로 피지컬 AI 월드모델의 지형과 합성데이터의 쓸모를 정리한 보고서다. 결론부터 적으면, 합성데이터는 로봇의 실력을 고르게 올려 주지 않는다. 내가 넣은 데이터가 겨눈 약점만 메운다. 물체 배치를 바꿔 만든 궤적을 넣으면 배치가 달라진 조건에서 성공률이 크게 뛰지만, 주변에 방해 물체가 놓인 조건이나 조명이 바뀐 조건은 거의 제자리다. 그다음에 환경을 다양화한 데이터를 넣으면 이번엔 방해 물체 쪽이 크게 오르고 배치 쪽은 조금만 오른다. 반대로 학습 분포 안에서 재는 성적은 두 번의 보강을 통틀어 거의 오르지 않는다. 합성데이터가 사 준 것은 실력이 아니라 조건 견딤이다.
이 판단의 근거는 한 논문의 헤드라인이 아니라 그 논문 부록의 조건별 표다. 저자들은 네 가지 작업을 다섯 조건에서 구성마다 수백 회씩 시험해 스무 칸을 재 놓고, 본문에는 그 평균 셋만 적었다. 평균만 보면 왜 올랐는지 답이 나오지 않는다. 같은 모양이 지표 쪽에서도 반복된다. 로봇 정책 평가용 월드모델의 평균 점수가 크게 올랐다는 보고를 여섯 지표로 갈라 보면, 오른 것은 두 지표뿐이고 화질은 오히려 내려갔으며, 행동에 가장 가까운 궤적 정확도는 여섯 칸 가운데 가장 낮은 자리에 남아 있다. 월드모델 평가를 정리한 한 위치 논문은 이 현상에 주장과 증거의 불일치라는 이름을 붙였고, 증거를 여덟 층으로 세운 뒤 가운데 층이 비어 있다고 보고한다. 가장 놀라운 것은, 정책이 생성 모델의 허점을 거꾸로 파먹어서 성적이 올랐는지를 재 본 연구가 사실상 없다는 사실이다.
그래서 이 글은 모델 순위표를 만들지 않는다. 대신 물어야 할 질문을 준다. 어느 조건에서 얼마나 올랐는지, 같은 비용의 실제 수집과 비교했는지, 평균이 아니라 어느 칸이 움직였는지. 지금 이 질문이 한국 독자에게 필요한 이유는 분명하다. 정부가 2년 예산을 걸고 착수한 국산 월드모델 사업의 핵심 목표가 실제 로봇의 동작 성공률을 월드모델 미적용 대비 20%포인트 이상 높이는 것인데, 조건을 고정하지 않은 향상폭은 채점할 수 없다. 데이터를 작업 에피소드 단위로 진단하고, 보강할 조건을 명시하고, 같은 조건에서 다시 재는 일이 그래서 남는다.
+7.5%p
학습 분포 안에서 오른 폭
합성 궤적 130개를 두 번에 걸쳐 넣은 전 구간의 값. 같은 기간 새 물체 조건은 40.0%포인트 올랐다
+33.7%p
방해 물체 조건, 2차 보강에서 오른 폭
같은 조건이 1차 보강에서는 5.0%포인트만 올랐다. 겨눈 조건이 바뀌자 오르는 칸도 바뀌었다
52.5%
조명이 바뀐 조건의 최종 성공률
두 번 보강한 뒤에도 세 구성 모두에서 가장 낮은 칸이다. 같은 구성의 분포 내 성적 80.0%의 3분의 2 수준
0.3561
평균 0.6834를 만든 궤적 정확도
본문 5절 분해표의 다른 세 지표는 0.88~0.93이다. 행동에 가장 가까운 칸이 평균의 절반에 못 미친다
한 이름으로 여섯 가지를 부른다
먼저 이 글의 유효 기간을 밝혀 둔다. 아래 정리한 공개 상태와 사양은 모두 2026년 9월 기준 스냅샷이다. 이 분야는 모델카드가 한 달에 한 번씩 갱신되고, 5월에 "출시 예정"이라 적힌 모델이 7월에 가중치와 함께 올라온다. 그러므로 여기 적힌 표는 판단의 재료이고, 도입 결정을 내리는 시점에는 같은 페이지를 다시 열어 봐야 한다.
본론으로 들어가기 전에 말부터 정리해야 한다. 로봇 컨퍼런스의 발표 자료와 벤더의 제품 소개서에서 "월드모델"이라는 낱말은 지금 서로 다른 물건들을 가리키고 있고, 그 물건들은 서로 다른 일을 약속한다. 이름이 겹쳐 있으면 무엇을 사는지 알 수 없다.
1.1컵을 옮기는 로봇으로 시작한다
가장 단순한 장면을 하나 떠올려 보자. 로봇 팔이 식탁 위의 컵을 옆으로 옮긴다. 이 장면을 예측하는 모델에 세 가지 서로 다른 행동을 넣어 본다. 컵을 약하게 밀기, 강하게 밀기, 그리고 아무것도 하지 않기. 좋은 모델이라면 세 경우의 다음 장면이 서로 달라야 한다. 약하게 밀면 컵이 조금 움직이고, 강하게 밀면 넘어지거나 식탁 밖으로 떨어지고, 아무것도 하지 않으면 컵은 그 자리에 있다.
행동을 바꿨을 때 다음 장면이 그에 맞게 달라지는 성질을 행동 조건부 예측이라 부른다. 이것이 로봇에 쓰이는 월드모델의 최소 조건이다. 반대로 어떤 행동을 넣어도 그럴듯한 영상만 나온다면, 그 모델은 영상 생성기이지 로봇의 환경 모델이 아니다. 뒤에서 볼 지표 하나가 이 구분을 아프게 드러낸다. 아무것도 움직이지 않는 정지 영상이 어떤 영상 품질 지표에서는 최고점을 받는다.
행동 조건부 예측 개념도 (페블러스 원본 도식). 같은 현재 장면에 서로 다른 행동을 넣으면 예측된 다음 장면도 그에 맞게 달라져야 한다. 아무 행동도 넣지 않으면 컵은 그대로, 약하게 밀면 조금 움직이고, 강하게 밀면 식탁 밖으로 떨어진다. 어떤 행동을 넣어도 같은 장면만 나온다면 그 모델은 행동 조건부 예측을 하지 못하는 것이다.
1.2다섯 개념을 갈라 놓는 질문
현장에서 섞여 쓰이는 다섯 낱말이 있다. 월드모델, VLA, 물리 시뮬레이터, 디지털 트윈, 합성데이터다. 이 다섯을 정의로 외우는 것보다, 각각을 도입할 때 무엇을 확인해야 하는지를 한 줄로 쥐고 있는 편이 낫다. 아래 표의 세 번째 열이 그 질문이다.
| 개념 | 주된 역할 | 도입할 때 확인할 질문 |
|---|---|---|
| 월드모델 | 환경의 구조나 변화를 학습해 표현·생성·예측 | 무엇을 입력하고 어떤 미래를 예측하는가 |
| VLA | 영상과 언어 등을 받아 행동을 출력 | 우리 로봇의 행동 표현과 제어에 맞는가 |
| 물리 시뮬레이터 | 지정한 물리 모델·파라미터로 상태 변화를 계산 | 접촉·마찰·센서 모델이 대상 작업에 유효한가 |
| 디지털 트윈 | 특정 실제 대상과 연결된 가상 모델 | 어떤 실측과 동기화되고 오차는 얼마인가 |
| 합성데이터 | 모델·시뮬레이션·변환 등으로 만든 데이터 | 어떤 학습·평가 목적에 쓰며 어떻게 검수하는가 |
다섯 개념의 역할과 확인 질문. 경계는 생각보다 무르다. VLA가 내부에 예측 기능을 가질 수 있고, 시뮬레이터와 학습된 월드모델을 결합할 수도 있다. 그리고 모든 3D 장면이 실제 설비와 연결된 디지털 트윈인 것은 아니다.
1.3같은 이름 아래 여섯 물건이 있다
이름을 묻지 말고 입력과 출력을 물어야 한다는 감각은 학술 쪽에서도 같은 결론에 닿았다. 난징대 신형소프트웨어기술 국가중점연구실 연구진이 2026년 6월에 올린 위치 논문은 초록 첫머리에서 이 낱말이 가리키는 물건을 하나씩 세어 놓는다.
"The term now refers to several different objects: action-conditioned environment models, latent imagination models, future-video predictors, interactive neural simulators, latent predictive representations, and synthetic-data engines."
한국어로 옮기면 여섯 가지다. 행동을 조건으로 받는 환경 모델, 잠재 공간에서 상상하는 모델, 미래 영상을 예측하는 모델, 상호작용 가능한 신경 시뮬레이터, 잠재 예측 표현, 그리고 합성데이터 엔진이다. 여섯 가운데 마지막 항목이 이 글의 뒷부분을 지배한다. 월드모델은 로봇 학습의 상대 역할만 하는 것이 아니라, 로봇 학습 데이터를 찍어내는 공장으로도 쓰이고 있다.
1.4주장이 다르면 증거도 달라야 한다
같은 논문이 한 걸음 더 나간다. 이 여섯 물건은 서로 다른 여섯 가지 주장을 한다는 것이다. 미래 영상을 잘 만든다는 주장, 정책을 평가할 수 있다는 주장, 정책을 개선할 수 있다는 주장, 계획과 실행이 가능하다는 주장, 학습용 합성데이터를 공급할 수 있다는 주장, 그리고 쓸모 있는 표현을 학습했다는 주장이다. 그리고 논문은 이 여섯을 섞어 쓰는 일을 가장 경계한다. "These claims are not interchangeable. Evidence for one of them is not automatically evidence for another." 여섯 주장은 서로 갈아 쓸 수 없고, 하나에 대한 증거가 다른 하나의 증거가 되지는 않는다는 뜻이다.
그래서 "월드모델 탑재"라는 말만으로는 무엇을 살 수 있는지 알 수 없다. 영상이 예쁘다는 증거로 정책을 개선할 수 있다고 말하는 문서와, 정책 순위를 맞혔다는 증거로 같은 말을 하는 문서는 무게가 다르다. 5절에서 이 여섯 주장에 각각 어떤 증거가 필요한지를 표로 본다.
월드모델 연구의 학술적 계보와 분류 체계는 이 블로그의 월드모델 서베이 정리에서 따로 다뤘다. 이 글은 그 분류를 되풀이하지 않고, 분류가 실무 판단으로 바뀌는 지점만 본다.
2026년 9월, 열린 것과 닫힌 것
이 절은 순위표가 아니다. 지금 공개된 월드모델 계열들은 서로 다른 로봇, 서로 다른 데이터, 서로 다른 평가 과제를 쓴다. 성공률을 나란히 놓은 표를 만들면 그 표는 읽는 사람을 속인다. 그래서 여기서 비교하는 축은 성능이 아니라 공개도다. 무엇이 열려 있고 무엇이 닫혀 있는지, 그리고 한계를 어디까지 적어 두었는지.
월드모델 계열의 공개도 스펙트럼 (페블러스 원본 도식). 이 절이 비교하는 축은 로봇 성능이 아니라 공개도다. 오른쪽으로 갈수록 외부에서 그 모델의 주장을 검증할 수 있는 범위가 넓어진다.
2.1일곱 계열이 서 있는 자리
아래 표는 2026년 9월 기준으로 공개 문서를 확인할 수 있었던 일곱 계열이다. 중심 기능 열은 각 계열이 무엇을 내놓는지를, 공개 상태 열은 그 주장을 외부에서 확인할 수 있는 정도를 적었다.
| 계열 | 중심 기능 | 확인한 공개 상태 |
|---|---|---|
| Cosmos 3 NVIDIA | 행동 조건부 영상·행동 생성, 로봇·차량 특화. Super·Nano·Edge 세 크기 | 세 크기 모두 가중치 공개(허깅페이스), 모델카드에 한계 절 있음 |
| Genie 3 Google DeepMind | 텍스트·이미지로 탐색 가능한 가상 세계 생성, 실시간 플레이 | 가중치·API 없음. 유료 최상위 구독의 소비자 제품(Project Genie)으로만 접근 |
| Atlas World Labs | 이미지·영상에서 실제 공간을 재구성, 새 시점 프레임과 명시적 3D 출력 | 파트너 한정 early access. 가중치·공개 API·가격·성능 수치 없음 |
| Marble World Labs | 탐색 가능한 3D 씬 생성. 스플랫·메시·파노라마로 내보내기 | 클라우드 API(크레딧 과금). 가중치 비공개 |
| Dreamer 4 2025년 9월 발표 | 잠재 공간 월드모델 안에서 에이전트를 학습. 단일 GPU 실시간 | 저자 공식 가중치·코드 배포 없음. 공개된 것은 비공식 재구현뿐 |
| GigaWorld-1 GigaAI·칭화대 | 로봇 정책 평가용 월드모델. Nano·Plus 두 크기 | 코드·체크포인트·큐레이션 데이터셋·툴킷 전부 Apache-2.0 |
| V-JEPA 2.1 Meta AI | 잠재 예측 표현 학습. 모델 예측 제어로 로봇 조작 계획 | 코드·체크포인트 공개(ViT-B/L/g/G) |
일곱 계열의 중심 기능과 공개 상태(2026년 9월 확인분). Dreamer 4는 이 표에서 유일하게 1년 된 항목이라 발표 시점을 함께 적었다. 마인크래프트에서 얻은 성과를 실물 로봇 성과로 옮겨 읽어서는 안 된다. 산업 지형의 큰 그림은 이 블로그의 피지컬 AI 산업 지형 편에서 따로 다뤘다.
2.2사양을 나란히 놓을 때의 함정
사양 비교표는 유용하지만 한 가지 함정이 있다. 어떤 계열은 영상을 내놓고, 어떤 계열은 영상이 아니라 걸어 들어갈 수 있는 3D 장면을 내놓는다. 후자에는 초당 프레임 수라는 축이 애초에 해당하지 않는다. 이 차이를 적어 두지 않으면 표를 읽는 사람은 3D 산출물을 내놓는 계열이 프레임 성능에서 뒤진다고 오해한다.
| 계열 | 최대 생성 길이·해상도 | 행동 조건부 | 라이선스·접근 |
|---|---|---|---|
| Cosmos 3 Super (64B) | 5~400프레임, 입력 최대 720p | 예 | 가중치 공개, NVIDIA Open Model License |
| Cosmos 3 Nano (16B) | 5~400프레임, 720p·480p·256p | 예 | 가중치 공개 |
| Cosmos 3 Edge (4B) | 50~150프레임, 로봇 제어 640×360 | 예, 지원 목록 한정 | 가중치 공개, 모델카드 표기는 OpenMDW1.1 |
| Genie 3 | 60초, 720p, 24fps | 아니오(탐색·리믹스) | 비공개, 유료 구독 제품 |
| Atlas | 1분, 1440p* | 부분(경로에 따른 관측 생성) | 파트너 한정 early access |
| Marble | 해당 없음* | 아니오(카메라 경로만) | 크레딧 과금 API |
| Dreamer 4 (2B) | 연속 실시간, 단일 GPU 21fps | 예(키보드·마우스) | 공식 배포 없음 |
| GigaWorld-1 (1.3B·5B) | 장기 롤아웃 40초까지 실증 | 예(제어 주입) | Apache-2.0 전면 공개 |
* Atlas와 Marble은 영상이 아니라 탐색 가능한 3D 산출물을 내놓는다. 그래서 초당 프레임 수와 생성 길이 축이 다른 계열과 이종이며, 나란히 놓고 비교할 수 없다. Cosmos 3 계열 안에서도 라이선스 문자열이 갈린다. Super·Nano 쪽 문서는 NVIDIA Open Model License라 적고 Edge 모델카드는 OpenMDW1.1이라 적는데, 두 표기가 같은 라이선스의 다른 이름인지는 공개 페이지만으로 확인하지 못했다. Cosmos 3 기술보고서가 Edge를 다른 크기로 적었다는 2차 요약도 있어, 이 글은 모델카드 값인 4B만 쓴다.
2.3우리 로봇이 목록에 있는가
"행동 조건부"라는 칸에 "예"가 적혀 있어도, 그것이 우리 로봇의 행동을 받아 준다는 뜻은 아니다. 행동을 조건으로 받으려면 모델이 그 로봇의 행동 차원과 정규화 방식을 알고 있어야 한다. 엣지용 모델의 모델카드는 지원하는 행동 형식과 차원을 이름으로 적어 두었다. 이 목록은 추상적인 경고를 확인 가능한 체크리스트로 바꿔 준다.
| 행동 형식 | 차원 | 행동 형식 | 차원 |
|---|---|---|---|
| 일반 카메라 이동 | 9D | Agibot | 29D |
| 자율주행 차량 | 9D | UR | 10D |
| 1인칭 시점 이동 | 57D | Google robot | 10D |
| Franka Panda 단완 | 10D | WidowX 250 | 10D |
| Franka Panda 양완 | 20D | UMI | 10D |
Cosmos3-Edge 모델카드가 나열한 행동 형식과 차원. 행동 입력은 프레임 수와 차원으로 이루어진 2차원 배열을 JSON으로 받는다.
우리 로봇이 이 목록에 없으면 모델을 바로 쓸 수 없고, 행동공간·차원·카메라 배치·정규화를 정의하는 후학습 설정이 먼저다. 그리고 목록에 없는 형태가 무엇인지도 함께 봐야 한다. 4족보행과 휴머노이드 전신 제어는 이 목록에 들어 있지 않다.
2.4한계를 적는 방식이 갈린다
이 절에서 가장 값진 발견은 사양 숫자가 아니라 문서의 태도 차이다. 가중치를 연 쪽은 자기 모델이 무엇을 근사하고 있는지를 이름을 붙여 적었다. 엣지용 모델카드의 한계 절은 이렇게 시작한다.
"Because the model lacks an explicit physics simulator, 3D geometry, 4D space-time evolution, object permanence, contact dynamics, and physical laws are only approximated — producing artifacts such as disappearing or morphing objects, unrealistic collisions, and physically implausible motions."
명시적인 물리 엔진이 없으므로 3D 형상, 시공간 변화, 물체의 항상성, 접촉 동역학, 물리 법칙이 모두 근사일 뿐이며, 그 결과 물체가 사라지거나 변형되고 충돌이 비현실적으로 일어난다는 것이다. 같은 문서는 시간적 비일관성과 장기 지평에서의 행동·상태 표류를 덧붙이고, 출력을 "physically accurate simulation"이나 "safety-certified decision making"으로 다루지 말라고 못 박는다. 사는 쪽에서 보면 이것은 나쁜 소식이 아니라 좋은 소식이다. 무엇을 검증해야 하는지가 문서에 적혀 있다.
반대쪽을 보면 대비가 선명해진다. 가중치를 열지 않은 쪽의 공식 블로그에는 한계를 적은 문단 자체가 없었다. 강체·관절체·변형체의 물리적 상호작용을 재현한다고 말하면서, 그 물리의 정확도에 관한 진술은 찾을 수 없었다. 로봇 쪽 설명은 한 문장으로 요약된다. "As a simulated robot moves through space, Atlas also generates the RGB and depth data its sensors would observe along the way." 시뮬레이션 로봇이 공간을 이동할 때 그 센서가 관측할 색과 깊이 데이터를 만들어 준다는 것이다. 만들어 주는 것은 관측이고, 접촉력이나 관절 토크가 아니다.
한 가지를 덧붙여야 공정하다. 공개 가중치가 있다는 사실만으로 도입 비용이 낮아지는 것도 아니다. 추론 장비, 후학습, 로봇 데이터 변환, 검수 비용을 함께 비교해야 한다. 그리고 표에 넣지 못한 이름도 있다. 국내외에서 언급되는 신생 연구 조직 가운데 일부는 조사일 기준으로 공개 가중치, 공개 API, 비교 가능한 성능표를 모두 확인하지 못했다. 확인하지 못한 것을 없다고 적지는 않되, 표에 올려 비교하지도 않았다.
공개도가 높으면 헤드라인도 검증 가능해진다는 점은 잠재 예측 표현 쪽 사례에서 확인된다. 한 공개 모델의 초록은 실물 로봇 파지 성공률이 이전 판본 대비 20포인트 올랐다고 적는다. 그런데 논문 표를 열면 세 과제 가운데 파지 하나에서 나온 값이고, 도달과 집어 옮기기는 변화가 없다. 게다가 그 20포인트는 같은 추론 설정에서 나오지도 않았다. 지평을 한 단계로 두면 10포인트이고, 20포인트를 보려면 지평·반복 횟수·표본 수를 함께 바꿔야 한다. 저자들은 남은 실패가 공간 이해가 아니라 그리퍼 행동 계획에서 온다고 스스로 적었다. 표현은 좋아졌고 병목은 행동 쪽에 남았다는 말이다.
재료이면서 생산물
합성데이터와 월드모델의 관계는 한 방향이 아니다. 두 방향을 먼저 갈라 놓아야 뒤의 이야기가 엉키지 않는다. 하나는 월드모델을 학습시키는 합성데이터다. 실제 로봇 데이터가 부족한 자리를 시뮬레이션과 변환으로 채워 예측 모델을 기른다. 다른 하나는 월드모델이 생산하는 합성데이터다. 학습된 모델이 새 장면과 새 궤적을 찍어내고, 그 결과물이 다시 로봇 정책의 학습 자료가 된다. 같은 낱말이 재료를 가리킬 때와 생산물을 가리킬 때 검증해야 할 것이 전혀 달라진다.
재료로서의 합성데이터와 생산물로서의 합성데이터 (페블러스 원본 도식). 같은 낱말이 위에서는 월드모델을 학습시키는 재료를, 아래에서는 월드모델이 찍어내는 생산물을 가리킨다. 점선은 그 전환이 검증해야 할 것을 바꾼다는 뜻이다.
3.1목적이 검증을 정한다
합성데이터를 왜 쓰는지가 무엇을 확인해야 하는지를 정한다. 아래 표는 다섯 가지 대표 목적을 놓고, 각 목적에 필요한 데이터와 그 데이터가 제 일을 했는지 판정하는 검증을 짝지은 것이다. 표의 세 번째 열이 이 글 전체에서 곧바로 써먹을 수 있는 부분이다.
| 활용 목적 | 필요한 데이터 | 대표적인 검증 |
|---|---|---|
| 환경 예측 학습 | 현재 관측·행동·미래 관측의 연결 | 행동을 바꾸었을 때 결과가 타당하게 달라지는가 |
| 행동 모방 학습 | 관측·지시·실행 가능한 행동 궤적 | 관측과 행동이 맞고 목표 작업을 완수하는가 |
| 지각 강건성 개선 | 외형 조건을 바꾼 관측과 유효한 라벨 | 배경 변화 뒤에도 물체·라벨 대응이 유지되는가 |
| 정책 사전 평가 | 정책에 반응하는 환경과 성공 판정 | 가상 평가에서의 정책 순위가 실제와 일치하는가 |
| 실패와 복구 학습 | 실패·중단·복구 구간 및 원인 기록 | 학습 목적에 맞게 성공·실패 행동을 구분했는가 |
활용 목적과 필요 데이터, 그리고 대표적인 검증. 굵게 표시한 두 검증이 5절에서 다시 나온다. 앞의 것은 학술 쪽 증거 사다리에서 개입 문턱이라 부르는 자리고, 뒤의 것은 그보다 두 칸 위에 있는 정책 순위 일치다.
마지막 행에는 함정이 하나 숨어 있다. 결과를 예측하는 모델은 실패가 발생하는 조건을 배울 수 있으므로 실패 구간이 오히려 자산이다. 그런데 성공 행동을 모방하는 정책에 실패 궤적을 같은 목표 라벨로 섞어 넣으면, 정책은 바람직하지 않은 행동을 배운다. 같은 데이터가 한쪽에는 재료이고 다른 쪽에는 오염이다. 그래서 실패·중단·복구 구간은 별도로 표시해 두어야 하고, 그 표시가 없는 합성데이터 묶음은 두 용도 가운데 하나에만 쓸 수 있다.
3.2생성 경로마다 남는 숙제가 다르다
로봇 학습용 합성데이터를 만드는 길은 하나가 아니다. 지금 현장에서 쓰이는 경로는 크게 여섯 갈래이고, 각 경로는 얻는 것이 다른 만큼 남는 숙제도 다르다. 표는 오른쪽 열부터 읽기를 권한다. 무엇을 얻는지보다 무엇이 남는지가 도입 판단을 가른다.
| 생성 경로 | 얻는 결과 | 남아 있는 검증 과제 |
|---|---|---|
| 물리 시뮬레이션과 도메인 랜덤화 | 관측·상태·행동·센서 라벨 | 파라미터 범위와 실제 동역학의 차이 |
| 시연 변환과 재실행 | 새 배치에서 실행한 행동 궤적 | 도달 가능성·접촉·작업 성공 여부 |
| 구조 조건부 영상 변환 | 기존 궤적에 연결할 외형 변형 | 물체 경계·접촉 시점·가림과 라벨의 일치 |
| 생성 영상과 역동역학 결합 | 영상 및 추정 행동 | 행동 추정 오차·로봇 호환성·실행 가능성 |
| 행동 조건부 월드모델 롤아웃 | 입력 행동에 따른 미래 관측 | 장기 누적 오차 · 정책의 모델 오류 악용 |
| 실제 장면의 재구성과 시뮬레이션 | 현장에 대응한 가상 장면 | 보이지 않은 영역·물리 속성·실측 오차 |
여섯 가지 생성 경로와 남은 검증 과제. 다섯째 행 오른쪽 칸에 "정책의 모델 오류 악용"이 들어 있다. 5절에서 이 칸을 재는 연구가 사실상 없다는 사실을 본다.
경로별 대표 사례는 대체로 이름이 알려져 있다. 궤적 수를 늘리는 쪽에는 시연 변환 계열이 있고, 시각 다양성을 넓히는 쪽에는 영상 변환 계열이 있고, 생성 영상에서 행동을 되추정하는 쪽에는 꿈 생성 계열이 있다. 주행 영상 쪽 결과를 조립이나 변형체 조작으로 일반화해서는 안 된다는 점만 붙여 둔다. 파이프라인 구성의 구체적인 얼개는 이 블로그의 합성데이터 파이프라인 편에서 이미 다뤘으니 되풀이하지 않는다. 생성 결과를 사후에 물리적으로 검증하는 기법도 별도의 글로 정리해 두었다.
3.3성공 판정을 받은 궤적이 깨끗하다는 뜻은 아니다
생성 데이터에 검수 층이 필요하다는 주장은 최근에 나온 것이 아니다. 2024년에 나온 대규모 로봇 시뮬레이션 데이터셋 논문이 자기 한계 절에 직접 적어 두었다. 합성데이터를 만든 쪽이 스스로 남긴 진술이다.
"While the generated trajectories are technically considered successful, many exhibited undesirable effects, such as jerky motions and collisions. Many of these behaviors can be automatically detected by checking simulation states and trajectories exhibiting such behaviors can be discarded."
생성된 궤적이 기술적으로는 성공으로 판정되지만 상당수가 급격한 동작과 충돌 같은 바람직하지 않은 거동을 보였고, 그런 거동은 시뮬레이션 상태를 검사해 자동으로 검출하고 버릴 수 있다는 것이다. 한 문단에 세 가지가 들어 있다. 첫째, 합성 궤적은 성공 판정을 받고도 나쁜 동작을 담는다. 둘째, 그러므로 성공률은 데이터 품질 지표가 아니다. 셋째, 그럼에도 그런 거동은 자동으로 걸러낼 수 있다.
세 번째가 중요하다. 문제를 지적한 것이 아니라 해결 가능성을 적어 둔 문장이다. 합성데이터 묶음을 받았을 때 물어야 할 것은 "성공률이 몇인가"가 아니라 "성공으로 판정된 궤적 가운데 급격한 동작과 충돌을 담은 것을 어떻게 걸러냈는가"다. 그 절차가 없다면, 성공률 100%인 데이터셋이 로봇에게 나쁜 습관을 가르칠 수 있다.
성공률 40.8에서 69.0으로, 어느 칸이 움직였나
여기가 이 글의 중심이다. 2026년 8월에 공개된 한 논문이 월드모델로 만든 합성 궤적을 로봇 정책 학습에 넣고 성공률 변화를 보고했다. 전체 성공률은 40.8%에서 69.0%로 올랐다. 28.2%포인트다. 이 숫자만 받아 적으면 이 글을 쓸 이유가 없다. 값어치는 같은 논문 부록에 있는 조건별 표에 있다. 저자들은 스무 칸을 재 놓고 본문에는 평균 셋만 적었다.
4.1무엇을 어떻게 쟀는가
실험 설계를 먼저 봐야 숫자를 읽을 수 있다. 작업은 네 가지다. 그릇 옮기기, 수건 접기, 컵 놓기, 서랍 열기. 각 작업마다 실제 로봇 시연 25개를 기본으로 두고, 여기에 합성 궤적을 두 단계로 더한다. 1차는 물체 배치를 무작위화해 만든 궤적 65개, 2차는 거기에 환경을 다양화한 궤적 65개를 더한 것이다. 그러니까 학습 데이터 구성은 작업당 25개, 90개, 155개 세 가지다.
중요한 통제가 하나 있다. 세 구성의 정책은 모두 같은 사전학습 체크포인트에서 출발하고 학습 설정도 같다. 저자들의 표현은 이렇다. "All policies are initialized from the same π0 checkpoint and use identical training configurations; only the composition of the training data differs across regimes." 정책은 모두 같은 체크포인트에서 초기화되고 동일한 학습 설정을 쓰며, 구성 사이에서 다른 것은 학습 데이터의 구성뿐이라는 뜻이다. 데이터 말고는 바꾼 것이 없다는 선언이다.
평가는 실제 로봇으로 했다. 조건은 다섯 가지다. 학습 분포 안, 물체 배치 변경, 방해 물체 추가, 새 물체 인스턴스, 조명 변화. 작업과 조건의 짝마다 20회씩 시험했으므로, 네 작업에 다섯 조건에 스무 번을 곱해 구성당 400회다. 세 구성을 합치면 실물 시험 1,200회가 된다. 이런 규모의 조건별 표를 부록에만 넣어 둔 것이 오히려 놀랍다.
4.2스무 칸을 펴 놓으면
아래 도해는 다섯 조건 각각에서 세 구성의 성공률을 나란히 놓은 것이다. 회색이 실제 데이터만 쓴 기준선, 진회색이 1차 보강, 오렌지가 2차 보강이다. 막대 세 개의 간격은 조건마다 전혀 다른 모양을 그린다.
다섯 평가 조건에서 세 학습 데이터 구성의 실물 로봇 성공률(저자 보고, 부록 표). 네 작업 평균이며 구성당 400회 시험의 결과다. 세 막대의 모양이 조건마다 다르다는 점이 이 절의 논지다.
4.3움직인 자리와 제자리
같은 값을 증분으로 바꿔 놓으면 무엇이 일어났는지가 한눈에 잡힌다. 아래 표가 위 도해의 막대 사이 간격이다. 오렌지로 표시한 칸이 각 보강 단계에서 크게 움직인 자리이고, 회색으로 표시한 칸이 거의 제자리인 자리다.
| 평가 조건 | 실제만 | 1차 증분 | 2차 증분 | 전체 증분 |
|---|---|---|---|---|
| 학습 분포 안 | 72.5 | +3.8 | +3.7 | +7.5 |
| 물체 배치 변경 | 37.5 | +25.0 | +7.5 | +32.5 |
| 방해 물체 추가 | 33.8 | +5.0 | +33.7 | +38.7 |
| 새 물체 인스턴스 | 30.0 | +12.5 | +27.5 | +40.0 |
| 조명 변화 | 30.0 | +5.0 | +17.5 | +22.5 |
| 전체 평균 | 40.8 | +10.2 | +18.0 | +28.2 |
조건별 증분(%포인트). 부록 표의 세 구성 값에서 단순 뺄셈으로 얻은 값이다. 전체 평균 행이 보고서 본문에 실린 셋이고, 그 위의 다섯 행이 부록에만 있던 것이다.
4.4넣은 데이터가 오르는 칸을 정한다
첫째, 보강이 겨눈 조건만 크게 움직인다. 물체 배치를 무작위화한 궤적을 넣자 배치 조건이 25.0%포인트 뛰는 동안 방해 물체와 조명은 각각 5.0%포인트로 거의 제자리였다. 그다음에 환경을 다양화한 궤적을 넣자 이번엔 방해 물체가 33.7%포인트, 새 물체가 27.5%포인트 움직였고 배치는 7.5%포인트에 그쳤다. 무엇을 넣었느냐가 어느 칸이 오르는지를 정한다. 합성데이터의 효과는 데이터셋 크기의 함수가 아니라 데이터셋 구성의 함수다.
둘째, 학습 분포 안에서는 거의 오르지 않는다. 분포 내 성적은 72.5%에서 80.0%로, 두 번의 보강을 통틀어 7.5%포인트다. 같은 기간 새 물체 조건은 40.0%포인트 올랐다. 다섯 배가 넘는 차이다. 합성데이터가 사 준 것은 작업 자체를 더 잘하게 하는 실력이 아니라, 조건이 달라져도 버티는 견딤이다. 이것은 나쁜 소식이 아니다. 현장 도입에서 무너지는 지점이 대개 견딤 쪽이기 때문이다. 다만 "성공률이 올랐다"는 문장과 "실력이 올랐다"는 문장을 같은 뜻으로 쓸 수 없다는 뜻이다.
셋째, 조명은 끝까지 최하위다. 조명 조건은 세 구성 모두에서 가장 낮은 칸이고, 두 번 보강한 최종 구성에서도 52.5%다. 같은 구성의 분포 내 성적 80.0%의 3분의 2 수준이다. 1차 보강에서 5.0%포인트, 2차에서 17.5%포인트 올랐으니 두 번 다 조금씩은 움직였지만, 다른 조건들이 70% 대에 올라선 뒤에도 조명은 절반 언저리에 남았다. 외형 조건을 다양화한 데이터를 넣었는데도 조명이 따라오지 않았다는 사실은 그 자체로 진단 정보다. 넣은 다양성이 실제 현장의 조명 변화를 담지 못했을 수 있다.
작업 단위로 한 칸 더 들어가면 비단조도 보인다. 수건 접기 작업의 분포 내 성공률은 세 구성에서 65%, 70%, 65%로 움직인다. 최종 구성이 중간 구성보다 낮다. 작업 단위 집계(32%, 42%, 59%)만 보면 이 칸은 보이지 않는다. 합성데이터를 더하는 일이 모든 칸에서 단조 증가를 보장하지 않는다는 반례가 같은 표 안에 있다.
4.5이 표가 답하지 않는 것
조건문을 붙여야 한다. 위 숫자는 모두 저자 보고이고, 작업 네 가지에 로봇 한 대로 얻은 값이다. 페블러스의 실적도 아니고 제3자의 독립 재현도 아니다. 그리고 표에 없는 것이 하나 있다. 같은 수의 실제 시연을 추가한 대조군이다. 합성 궤적 130개를 더한 군은 있는데, 실제 시연 130개를 더한 군은 없다. 논문 전문에서 이 교란을 인정하는 문장도 찾지 못했다.
하나 더 있다. 데이터의 수와 다양성이 함께 바뀌었다. 25개에서 90개, 155개로 늘어나는 동안 조건의 폭도 함께 넓어졌으므로, 성적이 오른 이유가 양인지 다양성인지 이 표로는 가릴 수 없다. 그래서 이 실험에서 끌어낼 수 있는 결론에는 상한이 있다. 합성 궤적을 넣으면 겨눈 조건이 오른다는 것까지다. 같은 비용의 실제 수집보다 낫다는 뜻은 아니다.
4.620%포인트라는 목표를 어떻게 채점할 것인가
이 절의 논지가 한국 독자에게 왜 지금 필요한지는 국내 사업 하나를 놓고 보면 분명해진다. 과학기술정보통신부와 정보통신기획평가원은 2026년 6월 9일 서울 마곡 LG사이언스파크에서 피지컬 AI 선도기술개발 사업 착수보고회를 열었다. 2년간 340억원, LG전자 주관에 10개 산학연이 참여하고, 2년간 총 4회의 반복 실증을 계획한 사업이다. 착수 발표에 따르면 핵심 목표는 이렇게 적혀 있다.
월드모델의 현실 시뮬레이션 성능과 로봇 파운데이션 모델로의 전이 성능을 극대화해 실제 로봇의 최종 동작 성공률을 월드모델 미적용 대비 20%포인트 이상 높이는 것이 핵심 목표로, 이는 현재 글로벌 최고 수준으로 제시된 14.5%포인트를 뛰어넘는 수치
여기서 비교 기준으로 인용된 14.5%포인트는 조심스럽게 다뤄야 한다. 이 글은 그 수치의 원 논문과 원 실험 조건을 확인하지 못했다. 그러므로 사실로 옮기지 않고, 사업 자료가 그렇게 인용한다는 것까지만 적는다.
그런데 목표 발표 두 달 뒤에 나온 논문에 이미 28.2%포인트가 나와 있다. 넘은 것인가. 답하려면 "어느 조건에서"를 물어야 한다. 같은 논문 안에서 그 향상폭은 배치 조건의 32.5%포인트와 조명 조건의 22.5%포인트로 갈리고, 보강 단계별로는 25.0%포인트와 5.0%포인트로까지 갈린다. 조건을 고정하지 않은 향상폭은 채점할 수 없다. 이것이 이 글의 실무적 결론이고, 다음 절에서 학술 쪽이 같은 결론에 다른 길로 도착한 것을 본다.
사업의 역할 분담에는 눈에 띄는 대목이 있다. 데이터 수집 플랫폼 구축과 핵심 데이터 수집에 전담 기관이 배정되고, 데이터 표준화와 모델 검증에 또 다른 전담 기관이 배정됐다. 시뮬레이터는 국산으로 따로 구축한다. 진단과 검증을 별도 역할로 떼어 놓았다는 뜻이고, 이 절에서 본 문제가 사업 설계 단계에서 이미 인식됐다는 신호로 읽힌다. 주관 기관의 연구 책임자가 착수보고회에서 꼽은 현재 한계 세 가지도 같은 방향이다. 물리적 일관성, 연속 수행 능력, 그리고 데이터 재학습의 필요. 앞 절에서 본 해외 벤더의 모델카드 한계 목록과 거의 같은 항목이다. 국산이냐 외산이냐가 아니라, 같은 한계를 누가 어떻게 재느냐가 갈림길이다.
증거의 사다리, 가운데가 비어 있다
4절에서 본 문제에 학술 쪽은 다른 길로 닿았다. 앞에서 인용한 난징대 연구진의 위치 논문은 월드모델 평가 지표가 늘어나면서 주장과 증거의 불일치가 반복된다고 진단한다. 논문이 자기 평가가 떠받칠 수 있는 것보다 더 많은 유용성을 주장하는 일이 흔해졌다는 것이다. 그리고 그 불일치를 눈으로 볼 수 있게 만들려고 증거를 여덟 층으로 세웠다.
5.1여덟 층, 그리고 각 층의 질문
여덟 층은 점수판이 아니다. 각 층은 서로 다른 질문에 답하며, 논문은 이 층들이 여러 개의 직교하는 축에 걸쳐 있다고 쓴다. 그래서 층이 높다고 더 좋은 모델이라는 뜻이 아니다. 아래 표에서 읽어야 할 것은 층의 번호가 아니라 오른쪽 열의 질문이다. 우리 벤더가 내민 문서가 어느 질문에 답했는지를 대 보는 용도다.
| 층 | 이름 | 그 층이 묻는 질문 |
|---|---|---|
| L0 | 겉모습 그럴듯함 | 산출물이 현실적인 이미지나 영상처럼 보이는가 |
| L1 | 기록된 미래 맞히기 | 예측한 미래가 떼어 둔 실제 궤적과 맞는가 |
| L2 | 지시·의미 일치 | 롤아웃이 지시와 과제, 장면의 의미에 맞는가 |
| L3 | 물리 그럴듯함 | 롤아웃이 직관적인 물리·기하 제약을 지키는가 |
| L4 | 행동 조종 가능성 | 행동을 바꾸면 과제와 관련된 변화가 제대로 일어나는가 |
| L5 | 보상·성과 맞히기 | 성공·보상·진척·가치를 결정에 쓸 만큼 정확히 예측하는가 |
| L6 | 정책 순위 일치 | 모델 기반 평가가 실제 또는 시뮬레이터 성능과 일치하는가 |
| L7 | 정책 개선 실익 | 이 모델을 쓰면 결정이 실제로 나아지는가 |
증거의 여덟 층과 각 층의 핵심 질문. 논문은 이 층들이 상호 배타적이지 않고 실제로 단조롭지도 않다고 명시한다. 영상 모델이 L0부터 L3까지 높은 점수를 받고도 L6에서 약할 수 있다는 것이다.
두 축만 쥐고 있으면 실무에서는 충분하다. 첫째 축은 관찰이냐 개입이냐다. L0부터 L3까지는 모델이 내놓은 것을 들여다보는 층이고, L4부터는 입력을 바꿔 넣고 결과가 그에 맞게 달라지는지를 보는 층이다. 논문이 L4를 부르는 이름이 정확하다. "the first level that clearly distinguishes a decision world model from a future-video prior." 결정을 돕는 월드모델과 미래 영상 생성기를 처음으로 갈라 주는 층이라는 것이다. 3절 표에서 굵게 표시했던 "행동을 바꾸었을 때 결과가 타당하게 달라지는가"가 바로 이 층이다.
둘째 축은 정책을 고정해 두는가, 모델을 향해 최적화하는가다. L6은 이미 만들어진 정책들의 순위를 모델로 맞혀 보는 층이고, L7은 모델을 써서 정책을 더 좋게 만드는 층이다. 이 차이가 곧 다음 소절의 주제로 이어진다. 최적화는 모델을 향해 밀어붙이는 일이고, 밀어붙이면 모델의 약한 자리가 드러난다.
5.2사다리의 위아래만 붐빈다
논문은 이 여덟 칸을 실제 연구들에 대 봤다. 센 것은 서베이 전체가 아니라 두 개의 표에 실린 약 40편, 저자들이 "결정 관련 주장을 담았을 가능성이 가장 큰 부분집합"이라 부른 묶음이다. 배치 규칙도 공개돼 있다. 어떤 논문이 어떤 층에 실리는 것은 그 층의 핵심 질문에 겨눈 정량 지표를 하나라도 보고했을 때이며, 얼마나 강조하는지는 따지지 않는다.
결과는 세 패턴이다. 앞의 두 패턴은 어느 칸이 붐비고 어느 칸이 비는지에 관한 것이다. 첫째, L1과 L7이 가장 흔한 두 칸이고 상당수 연구가 그 둘만 적는다. 떼어 둔 궤적을 얼마나 맞혔는가와 최종 성적이 얼마나 올랐는가다. 둘째, 그 사이에서 고정 정책의 순위 일치를 재는 L6은 약 열두 편에만 있고 거의 전부가 정책 평가 전용 연구 묶음에 속한다. 사다리의 맨 아래와 맨 위는 붐비고 가운데가 비어 있다는 뜻이다. 세 번째 패턴은 무게가 달라서 다음 소절에서 따로 본다.
증거의 여덟 층과 보고 빈도. 앞 문단의 두 패턴을 도해로 옮긴 것이다. 진한 칸이 가장 흔히 보고되는 두 층이고 점선 칸이 보고가 드문 세 층이며, 오렌지 점선이 관찰과 개입을 가르는 자리다. L7 칸에 붉게 적은 세 번째 패턴은 다음 소절에서 본다.
저자들은 앞의 두 패턴이 남기는 결과를 이렇게 말한다. 모델의 고유한 기여가 최적화기와 보상 모델, 데이터 파이프라인과 뒤엉킨 채 남는다는 것이다. 성적이 올랐다는 사실은 있는데 무엇이 그 성적을 만들었는지는 알 수 없다. 저자들의 유보도 함께 적어야 한다. 이 셈은 "a reading of the metrics recorded in our tables rather than as a full audit of every paper's appendix"라는 것이다. 표에 기록한 지표를 읽은 것이고 모든 논문의 부록을 전수 감사한 것이 아니며, 다만 정성적 결론은 셈의 작은 차이에 흔들리지 않는다고 덧붙인다. 그러므로 도해의 칸 수는 정확한 통계가 아니라 대략의 모양으로 읽어야 한다.
5.3모델을 거꾸로 파먹었는지 아무도 재지 않는다
세 번째 패턴이 이 글에서 가장 값진 한 대목이다. 논문 저자들에게도 이것이 가장 놀라운 발견이었다.
"Most strikingly, we find essentially no work in these tables that reports an exploitability gap, a measured discrepancy between model-predicted value and real value for policies or action sequences optimized against the model … the specific failure mode that model-based optimization is known to provoke is, by the evidence of our own survey, almost never measured."
모델을 향해 최적화한 정책이나 행동 열에 대해, 모델이 예측한 가치와 실제 가치가 얼마나 벌어지는지를 재서 보고한 연구가 이 표들 안에 사실상 없다는 것이다. 이유도 논문에 있다. "planners and optimizers actively seek out regions where the model is overoptimistic, so that improving average accuracy does not prevent catastrophic failures at the optimizer's chosen points." 계획기와 최적화기는 모델이 지나치게 낙관적인 구간을 일부러 찾아가므로, 평균 정확도를 올리는 것으로는 최적화기가 고른 지점에서의 치명적 실패를 막지 못한다는 것이다.
합성데이터로 오른 성적 가운데 얼마가 생성기의 허점을 파먹어서 오른 것인지를 재는 연구가 거의 없다. 정책은 생성기가 낙관적인 구간을 찾아간다. 그리고 3절 표의 다섯째 행, 행동 조건부 월드모델 롤아웃의 남은 검증 과제에 "정책의 모델 오류 악용"이 이미 적혀 있었다. 실무가 검증 과제로 적어 둔 칸을, 위치 논문이 전수 census로 "아무도 재지 않는다"고 확인한 셈이다.
5.4합성데이터 주장에는 어떤 증거가 필요한가
같은 논문은 1절에서 본 여섯 가지 주장마다 어떤 증거가 강하고 어떤 증거가 약한지를 표로 정리했다. 그 가운데 합성데이터 주장의 행이 이 글의 척추다. 세 칸이 짧으니 원문 표현을 함께 둔다.
| 칸 | 논문이 적은 것 |
|---|---|
| 더 강한 증거 | 학습 예산과 학습기를 맞춘 상태에서 통제된 하류 학습 이득 ("Controlled downstream learning gains under matched training budgets and learners") |
| 대신 쓰이는 약한 증거 | 영상 미학, FVD, 생성 데이터에 대한 VLM 선호 ("Video aesthetics, FVD, or VLM preference over generated data") |
| 왜 오해를 부르나 | 시각적으로 깨끗한 데이터가 학습에 필요한 과제 관련 변이를 담고 있을 필요는 없다 ("Visually clean data need not contain the right task-relevant variation for learning.") |
합성데이터 주장에 필요한 증거와 대신 쓰이는 증거. 같은 표의 정책 최적화 주장 행에서는 약한 증거를 "분해 없는 단일 하류 성공 수치"로 적고, 그 이유를 "최종 성공은 월드모델을 보상 모델·필터·최적화기·데이터 큐레이션과 뒤엉키게 한다"로 적는다.
첫 줄이 4절과 정확히 맞물린다. 학습 예산과 학습기를 맞춘 대조군이 강한 증거인데, 4절에서 본 실험에는 그 대조군이 없다. 우리가 트집을 잡은 것이 아니라 한쪽이 제시한 증거 기준을 다른 쪽에 대 본 것이다. 표의 다른 행은 국내 사업 목표를 겨눈다. 분해 없는 단일 성공 수치가 약한 증거라면, 조건을 적지 않은 20%포인트 목표가 바로 그 형태다.
4절에서 본 논문을 이 사다리에 놓아 보면 어떻게 되는가. 순서부터 밝혀야 한다. 위치 논문은 6월에 나왔고 4절의 논문은 8월에 나왔으므로, 위치 논문의 census에 그 논문은 들어 있지 않다. 다만 배치 규칙이 공개돼 있으므로 이 글이 직접 대 볼 수 있다. 영상 예측 품질(L1)과 최종 성공률(L7)에는 수치가 있고, 그 사이의 L4부터 L6까지에는 없다. 그리고 여기서 한 걸음이 더 있다. 빠진 중간 증거의 분해가 같은 논문 부록 표에 이미 있었다. 저자가 재 놓고 헤드라인에 쓰지 않은 것이다.
5.5평균이 오르는데 화질은 내려간다
같은 모양을 지표에서 한 번 더 볼 수 있다. GigaAI와 칭화대가 2026년 7월에 공개한 로봇 정책 평가용 월드모델은 자기 벤치마크에서 평균 점수를 경쟁 베이스라인 대비 14.9% 올렸다고 보고한다. 어떤 베이스라인과 견준 값인지를 붙여야 한다. 이 14.9%는 범용 모델 가운데 가장 강한 베이스라인 하나(Wan 2.2 5B) 대비 값이고, 로봇 특화 베이스라인 가운데 가장 강한 것 대비는 11.6%다. 두 수치를 섞어서는 안 된다.
그 평균이 무엇인지도 논문이 밝혀 두었다. 미학 품질, 화질, JEPA 유사도, 의미 정합, 주체 일관성, 궤적 정확도 여섯 개를 골라 정규화 평균을 낸 값이다. 여섯 값의 단순 평균이 표에 적힌 평균과 소수 넷째 자리까지 맞는 것을 이 리포트가 검산했다. 즉 균등 가중이고, 궤적 정확도의 가중치는 미학 품질과 똑같이 6분의 1이다. 이제 그 14.9%를 지표별로 갈라 본다.
| 지표 | 범용 베이스라인 | 로봇 특화 모델 | 증분 | 이동분 기여율 |
|---|---|---|---|---|
| 미학 품질 | 0.3538 | 0.3534 | −0.0004 | −0.1% |
| 화질 | 0.6980 | 0.6765 | −0.0215 | −4.0% |
| JEPA 유사도 | 0.5853 | 0.9337 | +0.3484 | +65.5% |
| 의미 정합 | 0.8789 | 0.8926 | +0.0137 | +2.6% |
| 주체 일관성 | 0.8883 | 0.8883 | 0.0000 | 0.0% |
| 궤적 정확도 | 0.1643 | 0.3561 | +0.1918 | +36.1% |
| 여섯 지표 평균 | 0.5948 | 0.6834 | +0.0886 | = +14.9% |
14.9% 향상의 지표별 분해. 논문 본문 표의 값에서 이 리포트가 증분과 기여율을 계산했다. 논문 본문도 열과 값의 대응을 직접 확인해 준다. JEPA 유사도 0.9337, 의미 정합 0.8926, 궤적 정확도 0.3561을 최고로 달성하고 주체 일관성은 최고값과 같다고 적는다.
여기서도 4절과 같은 일이 보인다. 첫째, 여섯 칸 가운데 둘이 전부다. JEPA 유사도와 궤적 정확도가 이동분의 101.6%를 만들었고, 나머지 넷을 합치면 마이너스 1.6%다. 즉 미학 품질과 화질은 오히려 내려갔다. 평균이 오르는데 화질은 떨어진 것이다. 둘째, 행동에 가장 가까운 칸의 절대값이 가장 낮다. 평균 0.6834는 0.9 대의 세 칸이 0.35 대의 한 칸을 끌어올린 값이다. 68점으로 읽히지만 행동 칸은 36점이다.
셋째, 그래도 보강이 겨눈 칸은 크게 움직였다. 범용 모델들의 궤적 정확도는 0.09에서 0.16 사이인데 로봇 특화 모델은 0.35 대다. 논문의 주장은 이 칸에서 참이고, 다만 참임을 보이는 것은 평균이 아니라 그 칸이다. 모델 크기를 3.85배로 키웠을 때 평균은 0.6717에서 0.6834로 올랐지만 궤적 정확도는 0.94%만 올랐다. 파라미터를 네 배 가까이 써서 산 것은 대체로 장면을 일관되게 유지하는 능력이고, 행동을 정확히 따라가는 능력은 거의 그대로다. 이것을 논문이 수치를 부풀렸다는 이야기로 읽으면 틀린다. 논문은 두 비교 수치를 스스로 갈라 적고 지표별 분해도 스스로 제시한다. 갈라지지 않은 채 돌아다니는 것은 헤드라인 한 줄이다.
5.6정지 영상이 최고점을 받는다
같은 논문이 지표 자체를 검증한 대목이 더 중요하다. 연구진은 각 자동 지표가 실제 정책 평가 능력과 얼마나 맞는지를 상관계수로 쟀고, 음의 상관을 보이는 지표들을 찾았다. 그 이유를 적은 문장이 이 글에서 가장 값진 대목이다.
"Surprisingly, we identify several metrics that correlate negatively with WMES, including Background Consistency (ρ = −0.45), Photometric Consistency (ρ = −0.42), and Interaction Quality (ρ = −0.11). The first two fail because a trivial baseline that generates a completely static video can achieve high appearance stability while ignoring all actions and therefore failing entirely at policy evaluation."
앞의 두 지표가 실패하는 이유는, 완전히 정지한 영상을 만들어 내는 하찮은 베이스라인이 모든 행동을 무시하면서도 외형 안정성에서 높은 점수를 받을 수 있기 때문이라는 것이다. 배경이 흔들리지 않고 밝기가 일정한 영상을 만드는 가장 쉬운 방법은 아무것도 움직이지 않는 것이다. 그리고 그 영상은 정책 평가에서 완전히 실패한다.
여기서 반드시 붙여야 할 정정이 있다. 이것을 "외형은 상관없다"로 읽으면 틀린다. 같은 연구에서 외형은 둘로 갈린다. 프레임이 선명하고 정합한가를 재는 영상 충실도 쪽은 상관 0.78로 가장 잘 맞았고, 장면이 흔들리지 않고 유지되는가를 재는 외형 안정성 쪽은 마이너스 0.44로 거꾸로 갔다. 논문의 헤드라인 결론도 단기 시각 현실성이 아니라 장기 지평에서의 행동 충실한 일관성이 중요하다는 것이었으므로, 단기와 장기라는 조건을 빼고 어느 쪽만 인용하면 둘 다 왜곡이다.
인용문의 세 번째 지표도 가볍지 않다. 상호작용 품질이 신뢰할 수 없는 이유를 논문은 그 지표가 물리적 정합성을 VLM에 물어 얻은 것이고, 현재의 VLM은 세밀한 순위를 가릴 만큼 물리적 현실성을 견고하게 판정하지 못한다고 적는다. 앞의 위치 논문도 같은 유보를 남긴다. VLM은 그럴듯해 보이는 결과에 보상을 줄 수 있고 미묘한 행동 관련 오류를 놓칠 수 있으므로, 그 판정은 실행 가능한 결과와 정책 순위, 실제 성능에 대조할 때 해석하기 쉬워진다는 것이다. 두 출처가 서로 독립적으로 같은 곳을 가리킨다.
범위 조건은 붙여야 공정하다. 위치 논문은 자기 입장이 영상 지표 반대론도 VLM 판정 반대론도 아니라고 명시한다. 용도가 미래 영상 생성이라면 영상 품질은 정당한 1차 목표이고, 문제는 한 주장에 맞는 증거를 더 강한 주장에 쓰는 순간 생긴다. 이 어긋남이 사고 실험이 아니라는 점도 못 박는다. 지각 순위와 기능 순위가 일치하지 않는다는 것, 그리고 영상 품질이 실행 가능성의 신뢰할 만한 예측자가 아니라는 것을 서로 다른 두 벤치마크가 각각 보고했고, 논문은 이를 "published findings on real model sets, not a thought experiment"라 적는다.
5.7리더보드 1위는 어느 시험의 1위인가
리더보드로 가면 질문이 하나 더 생긴다. 2026년 5월의 한 벤더 발표문은 자기 모델이 아홉 개의 벤치마크와 리더보드에서 1위라고 내세운다. 세계 생성 정확도 쪽과 행동 정책 쪽, 비전 쪽으로 묶어서 나열했다. 이 문장은 벤더 자기보고이고 절대 수치가 없으므로 이 글은 1위라는 판정을 사실로 받아들이지 않는다. 대신 각 리더보드를 누가 만들었고 무엇을 재는지를 확인했다.
- 아홉 개 가운데 실제 로봇 하드웨어에서 정책을 비교하는 것은 RoboArena 하나다. 다기관 학계 컨소시엄이 공용 로봇 플랫폼에서 정책을 쌍대 비교한다. 나머지는 시뮬레이션이거나 영상과 이해를 잰다. 사용자 선호 Elo, 실촬영 영상의 물리 재현도(Physics-IQ), VLM 채점 기반의 생성 품질(PAI-Bench·R-Bench)이 그렇다.
- "행동 정책"으로 묶인 둘 가운데 하나(RoboLab)는 발표한 벤더 자신이 만든 벤치마크이고, 측정 무대도 시뮬레이션이다.
- "비전"으로 묶인 둘(VANTAGE-Bench·TAR)은 로봇 조작과 무관한 고정 카메라·교통 영상 이해이고, 데이터셋이 그 벤더 계정에 올라 있다. 운영 주체의 독립성은 어느 쪽으로도 확인하지 못했으므로 데이터셋 소유자 표기까지만 적는다.
자사 벤치마크를 공개하는 일은 정상적인 관행이므로 비꼴 일은 아니다. 다만 구매자에게는 확인할 항목이 하나 생긴다. 이 리더보드는 누가 만들었고, 무엇을 재는가.
위의 세 항목을 앞의 지표 이야기와 겹쳐 놓으면 5절의 결론이 나온다. 물리 그럴듯함을 VLM에 물어 채점한 리더보드의 순위는, 로봇이 실제로 무엇을 할 수 있는지에 관해 거의 아무것도 말해 주지 않는다. 서로 독립인 두 출처가 이 문장을 받친다.
그렇다면 월드모델을 평가 도구로 쓰는 일은 어떤가. 스탠퍼드 연구진이 주도한 한 연구는 행동 조건부 영상 생성 모델을 실환경 대리물로 삼아 정책을 평가했고, 모델 안 성공률이 실제와 높게 상관하며 정책 판본·크기·체크포인트에 걸쳐 상대 순위가 보존된다고 보고한다. 같은 연구가 한계도 밝힌다. 로봇의 동작은 충실히 모사되지만 현실적인 물체 상호작용 생성은 여전히 어렵다는 것이다. 순위를 가리는 데는 지금도 쓸 수 있고, 접촉이 결과를 가르는 작업에서는 실물 검증이 남는다.
작업 단위로 진단하기
앞의 두 절이 세운 판단 기준을 절차로 바꾸는 것이 이 절의 일이다. 새 주장을 세우지 않고, 4절과 5절에서 얻은 것을 무엇을 재고 무엇을 기록할지로 번역한다.
출발점은 단위를 바꾸는 일이다. 데이터 품질을 이미지 단위로 재는 습관이 로봇 데이터에서는 잘 맞지 않는다. 흐릿한 프레임 하나가 문제가 아니라, 손이 물체에 닿는 0.3초 동안 센서 시각이 어긋나 있었다는 사실이 문제다. 로봇 데이터의 최소 단위는 프레임이 아니라 작업 에피소드다. 관측과 행동과 결과가 시간 축에서 하나로 묶인 구간이고, 품질은 그 구간 안에서만 판정된다. 로봇 학습 데이터의 층위 구분은 이 블로그의 로봇 학습 데이터 층위 편에서 따로 다뤘다.
6.1진단표와 불만 목록의 차이
아래 여덟 항목은 에피소드 단위로 데이터를 들여다볼 때 쓰는 관점이다. 문제를 찾는 것으로 끝나면 진단표가 아니라 불만 목록이다. 각 항목이 어떤 개선 행동으로 이어지는지가 오른쪽 열에 적혀 있어야 한다.
| 진단 관점 | 측정할 항목의 예 | 개선에 연결하는 방법 |
|---|---|---|
| 완전성 | 관측·행동·상태의 누락 구간 | 필수 모달리티 복구 또는 사용 범위 제한 |
| 시간 정렬 | 센서 간 오프셋과 행동 지연 | 시간 보정 후 전후 관계 재확인 |
| 의미와 단위 | 좌표계·회전 표현·단위·지시 일치 | 표준 변환과 변환 이력 기록 |
| 조건별 분포 | 작업·물체·조명·마찰의 조합 | 현장 노출과 실패를 반영해 보강 조건 선정 |
| 중복과 편중 | 유사 프레임·궤적·장면의 반복 | 사건 단위 선택과 드문 중요 구간 보존 |
| 물리적 타당성 | 관통·비현실적 접촉·동작 불연속 | 물리 검사와 실제 실행으로 표본 검증 |
| 행동과 결과 | 지시·행동·성공 라벨의 대응 | 실패·복구·중단 구간의 별도 표시 |
| 출처와 재현성 | 생성기·시드·원본·변환 버전 | 데이터에서 시험 결과까지 이력 연결 |
작업 에피소드 단위의 여덟 가지 진단 관점. 굵게 표시한 네 번째 행이 4절의 결론과 정확히 같은 자리다. 어느 조건이 비어 있는지를 알아야 무엇을 보강할지 정할 수 있다. 이 여덟 항목은 피지컬 AI 실무를 위한 제안이며, ISO/IEC 5259-2의 조항을 그대로 옮긴 목록이 아니다.
6.2생성 목표를 명시적인 조건으로 바꾼다
진단이 "가려진 컵을 집는 조건에서 실패가 많다"는 결론을 내놓았다고 하자. 다음 단계는 그 문장을 생성 조건으로 바꾸는 일이다. 가림 정도, 컵의 재질과 위치, 접근 방향, 조명, 목표 위치를 지정하고, 생성된 데이터가 실제로 그 조건을 만족하는지를 다시 잰다. 여기에 한 줄의 금지 사항이 붙는다.
임베딩에서 멀리 떨어진 샘플을 만들었다는 이유만으로 부족한 조건을 채웠다고 판정하지 않는다. 표현 공간에서 멀다는 것은 다양성의 대리 지표일 뿐이고, 우리가 채우려던 조건이 실제로 채워졌는지에는 답하지 않는다. 5절의 표가 적어 둔 그대로다. 시각적으로 깨끗한 데이터가 학습에 필요한 과제 관련 변이를 담고 있을 필요는 없다.
생성 이력도 함께 남겨야 한다. 최소한으로 잡아도 아홉 항목이다. 원본 에피소드 식별자, 생성 방법과 모델 버전, 시드, 환경 조건, 좌표와 단위, 행동의 출처, 라벨 생성 방식, 검수 결과, 그리고 학습·평가 분할이다. 이 아홉 항목이 없으면 나중에 성적이 올랐을 때 무엇이 올렸는지 되짚을 수 없다. 5절에서 본 문제, 그러니까 모델의 기여가 최적화기·보상 모델·데이터 파이프라인과 뒤엉킨 채 남는 문제가 데이터 쪽에서도 똑같이 일어난다.
6.3진단에서 평가까지, 한 바퀴
위의 조각들을 이으면 하나의 운영 루프가 된다. 여섯 단계다. 현장 데이터에서 관측과 행동과 결과를 모으고, 품질을 진단해 실패가 몰린 조건을 찾고, 보강할 조건과 검수 기준을 정하고, 생성한 데이터가 그 조건을 채웠는지 확인하고, 같은 조건에서 정책을 학습해 비교하고, 실물로 다시 잰다. 마지막 화살표가 이 루프를 닫는다. 실제 평가에서 찾은 실패 조건이 다음 진단으로 돌아가지 않으면, 이 절차는 한 번 쓰고 버리는 체크리스트일 뿐이다.
데이터 품질 운영 루프. 오렌지로 표시한 두 단계가 이 글에서 가장 자주 건너뛰어지는 자리다. 조건을 명시하지 않은 보강과, 결과를 다음 진단으로 되돌리지 않는 평가.
6.4네 개의 실험군, 그리고 빠지기 쉬운 하나
합성데이터가 값어치를 했는지 판정하려면 비교군이 필요하다. 네 개면 충분하고, 네 개 미만이면 판정이 서지 않는다.
| 실험군 | 학습 데이터 구성 | 확인할 질문 |
|---|---|---|
| A 기준선 | 기존 실제 데이터 | 현재 성능과 실패 조건은 무엇인가 |
| B 일반 보강 | A + 표적을 정하지 않은 합성데이터 | 합성데이터를 더한 효과가 있는가 |
| C 표적 보강 | A + 진단 기반 합성데이터 | 같은 추가량에서 조건 선정이 유리한가 |
| D 실제 보강 | A + 추가 실제 데이터 | 비슷한 비용의 실제 수집과 비교하면 어떤가 |
합성데이터 효과를 판정하기 위한 네 개의 실험군. 비교는 학습량을 맞춘 상태에서 해야 한다. 학습 업데이트 횟수, 처리한 프레임 또는 토큰 수, GPU 시간을 함께 기록한다. 데이터가 늘면 같은 에포크 수라도 계산량이 달라지므로, 에포크만 같게 두고 동등 조건이라고 부르지 않는다.
D 군에서 세 갈래가 만난다. 4절에서 본 실험에 없던 대조군이 D 군이고, 5절에서 본 증거 기준표가 합성데이터 주장에 요구한 "학습 예산과 학습기를 맞춘" 조건이 D 군이며, 현장 실무가 "같은 비용의 실제 수집과 비교하면 어떤가"라고 묻는 자리도 D 군이다. 서로 다른 세 출처가 같은 한 칸을 가리킨다. 합성데이터 제안서를 받았을 때 D 군이 설계에 들어 있는지부터 보면 된다.
6.5모델에는 따로 물어야 한다
위의 여덟 항목은 데이터를 진단한다. 모델이 자기 주장을 떠받칠 증거를 갖췄는지는 다른 질문이고, 섞으면 둘 다 흐려진다. 5절의 위치 논문은 실물 로봇을 다루는 연구가 최소한으로 보고해야 할 집합을 셋으로 제시한다. 구매자라면 이렇게 물어야 한다.
- 리셋을 맞춘 행동 분기를 재 봤는가. 같은 상태에서 출발해 행동만 몇 갈래로 바꿔 넣었을 때, 말단장치나 물체 자세 같은 낮은 차원의 값에서 행동과 결과가 맞아떨어지는지를 본다.
- 강도가 분명히 다른 정책 서너 개의 순위가 맞는가. 폐쇄 루프 성공률의 보정과 순위를 신뢰구간과 함께 보고했는지를 본다.
- 모델이 최고점을 준 궤적을 실제로 실행해 봤는가. 최소한 정성적인 파먹기 탐침이다. 모델이 가장 좋다고 고른 궤적이 실물에서도 성공하는지 확인한 기록이 있는지를 본다.
세 번째 질문이 5절에서 본 그 빈칸이다. 사실상 아무도 재지 않는 항목이므로, 답이 "재 보지 않았다"로 돌아올 가능성이 높다. 그래도 물어야 한다. 물음에 이름이 붙으면 다음 문서에 칸이 생긴다.
마지막으로 표준 쪽을 한 줄만 짚어 둔다. 데이터 품질 측정치를 규정한 국제 표준(ISO/IEC 5259-2:2024)이 2024년 11월에 나왔고, 제조 디지털 트윈 쪽에서는 미국 표준기관이 검증·타당성 확인·불확실성 정량화를 일회성 작업이 아니라 생애주기 내내 이어지는 과정으로 규정한다. 이 글의 여덟 항목은 그 표준 조항의 번역이 아니고, 항목을 조항과 1대1로 짝지을 수도 없다. 다만 방향이 같다는 것까지는 말할 수 있다. 품질은 한 번 재고 끝나는 것이 아니라 루프 안에 있어야 한다는 것이다.
페블러스 관심의 이유
여기까지의 이야기는 하나의 모양으로 모인다. 평균은 오르는데 오른 칸은 따로 있고, 어느 칸이 올랐는지를 알려면 조건을 갈라 재야 한다. 페블러스가 이 주제를 오래 들여다본 이유가 거기 있다. 조건을 갈라 재는 일이 곧 데이터 진단이다.
7.1진단, 보강, 재검이라는 같은 순서
Data Clinic의 진단과 개선 제안, 합성데이터 생성, PebbloScope의 데이터 탐색은 이미 6절의 운영 루프와 같은 순서로 놓여 있다. 진단으로 부족한 자리를 찾고, 그 자리를 겨냥해 보강하고, 같은 조건에서 다시 재는 것이다. Data Clinic의 개선 사례에서 부족한 영역을 겨냥해 채우는 작업과 중복·유사 구간을 덜어내는 작업을 갈라 부르는 이유도 4절의 결론과 같은 구조다. 무엇을 더하느냐가 어느 칸이 오르는지를 정하므로, 더하는 일과 덜어내는 일은 서로 다른 진단에서 나와야 한다.
다만 경계를 분명히 적어야 한다. 이 순서가 있다는 것이 로봇의 모든 센서와 행동, 접촉 품질을 현재 제품이 자동으로 검증한다는 뜻은 아니다. 표 형태 데이터와 영상 데이터에서 성립한 절차를 에피소드 단위의 로봇 데이터로 가져가는 일에는 아직 풀어야 할 항목이 남아 있고, 6절의 여덟 항목 가운데 물리적 타당성과 행동·결과 대응은 특히 그렇다.
7.2데이터 구성은 아무 칸에나 꽂히지 않는다
4절이 보여 준 것을 데이터 품질 쪽에서 다시 보면 이렇게 된다. 학습 데이터의 구성이 모델의 어느 능력 칸에 꽂히는지가 예측 가능하다. 배치를 무작위화한 궤적은 배치 조건을 올렸고, 환경을 다양화한 궤적은 방해 물체와 새 물체 조건을 올렸다. 이것은 데이터 품질에서 모델 내부 표현을 거쳐 실제 성능에 이르는 사슬을 조건별로 끊어 잴 수 있다는 뜻이고, 진단 제품이 성립하는 근거다.
한 가지 열린 과제도 여기 있다. 데이터를 표현 공간에서 비교할 때, 그 표현이 작업에 필요한 차이를 실제로 보존하는지를 따로 검증해야 한다. 시각적으로 거의 같은 두 장면이 질량이나 마찰에서는 다를 수 있고, 반대로 서로 다른 배경이 같은 동작을 요구할 수도 있다. 6절에서 적은 금지 사항, 그러니까 임베딩에서 멀다는 이유만으로 조건을 채웠다고 판정하지 않는다는 원칙이 제품 쪽에도 그대로 걸린다. 표현 학습 계열의 모델을 이 검증에 쓰는 방안은 페블러스 안에서 아직 검토 단계의 제안이고, 기존 제품에 들어가 있는 기능이 아니다.
7.3현장에서 실제로 오가는 세 질문
고객과의 대화에서는 세 질문이 남는다. 우리 장면의 어떤 조건을 재현할 수 있는가. 생성 데이터의 행동과 라벨을 어떻게 믿을 수 있는가. 그리고 같은 비용의 실제 수집과 비교하면 어떤가. 세 번째가 6절의 D 군이고, 4절에서 빠져 있던 대조군이며, 5절의 증거 기준표가 요구한 맞춘 예산이다. 세 출처가 가리킨 그 칸을 고객이 이미 묻고 있다.
그래서 제안서에는 기술 이름을 나열하는 것보다 실패 비용과 검증 가능한 범위를 적는 편이 낫다. 어떤 조건을 지금 재현할 수 있고 어떤 조건은 아직 못 하는지, 검수는 어디까지 자동이고 어디부터 사람이 보는지. 그리고 각 항목의 상태를 사용 가능, 실험 예정, 검증 완료로 갈라 적는 것이 도움이 된다. 상태를 갈라 적지 않은 제안서는 5절에서 본 헤드라인 한 줄과 같은 처지가 된다.
7.4이 글이 서는 자리
대규모 생성 모델과 물리 엔진은 공개 모델이나 파트너 기술로 연결할 수 있다. 그러므로 페블러스가 설 자리는 더 큰 생성기를 만드는 쪽이 아니라, 조건별 품질 진단, 생성 대상 선정, 여러 생성기 결과의 검수, 실제 효과 비교와 이력 관리 쪽이다. 여기서 한 가지를 전제로 삼지 않으려 한다. 모델 공급자에게 품질 관리 기능이 없다는 전제다. 사실이 아니고, 모델 공급자들도 데이터 처리와 평가 기능을 빠르게 확장하고 있다.
수요가 실재한다는 신호는 4절에서 본 국내 사업의 역할 분담에 있다. 340억원 규모의 사업이 데이터 수집 플랫폼 구축과 데이터 표준화·모델 검증에 각각 전담 기관을 배정했다. 진단과 검증이 부가 기능이 아니라 별도의 역할로 잡혔다는 뜻이다. 페블러스가 그 사업에 참여한다는 이야기가 아니라, 평가와 표준 쪽 수요가 사업 설계에 이미 반영돼 있다는 관찰이다.
이 글의 1절부터 6절까지는 공개된 논문과 모델카드, 발표 자료에서 확인한 것이고, 이 7절은 그 문서들이 하지 않은 이야기다. 나눠서 읽어 주시기 바란다. 본문의 축자 인용과 수치는 arXiv 공개본 전문, 허깅페이스 모델카드, 공식 블로그에서 직접 대조했으며, 조건별 증분표와 지표 분해표의 증분 값은 원문 표에서 이 리포트가 계산한 것이다. 원 근거를 확인하지 못한 수치는 본문에 그 사실을 함께 적었다. 긴 글 읽어 주셔서 감사하다.
참고문헌
출처의 등급이 갈리므로 묶어서 적는다. 첫 묶음은 원문 전문을 직접 받아 본문과 표를 대조한 문헌이다. 둘째 묶음은 1번 논문의 참고문헌에서 서지와 결론을 교차 확인했고, 본문에 옮긴 것은 그 확인 범위까지다. 셋째 묶음의 벤더 문서는 자기보고라는 성격을 인용할 때 함께 적었다. 넷째 묶음의 정책 자료는 공식 보도자료 원문을 확인하지 못해 언론 다수 보도로 대조했고, 표준 문서는 유료 전문을 열지 않아 공개된 소개와 범위만 확인했다.
이 보고서의 뼈대 (1차 원문 대조)
- 1.Yang Yu, Shiyuan Zhang, Yifei Sheng, Haoxiang Ren, Haoxin Lin. "How Should World Models Be Evaluated for Embodied Decision-Making? A Decision-Making-Centric Position." arXiv:2606.15032 v2, 2026년 6월 28일. 난징대. arXiv: 2606.15032 — CC BY 4.0. 여섯 지시체는 초록, 여덟 층 사다리와 각 층의 질문은 표 7, 합성데이터 주장의 증거 기준은 표 6, census 세 패턴·저자 유보·배치 규칙은 §3.5, 실물 로봇 최소 보고 집합은 §5에서 옮겼다.
- 2.Chenghao Gu 외 9인. "GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions." arXiv:2608.06332 v1, 2026년 8월 6일. arXiv: 2608.06332 — 4절의 실험 설계와 정책 통제 축자는 본문, 조건별 스무 칸 값은 부록 표 III에서 옮겼다. 증분표는 그 세 표에서 이 리포트가 단순 뺄셈으로 계산했다. 동일 규모의 실제 대조군이 없고, 그 교란을 인정하는 문장을 전문에서 찾지 못했다.
- 3.GigaAI, Tsinghua University. "GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation." arXiv:2607.02642 v1, 2026년 7월 2일. arXiv: 2607.02642 — Apache-2.0. 여섯 지표 정의와 11.6%·14.9%는 §6.5.1, 지표별 값은 표 9, 지표군 상관과 정지 영상 축자는 같은 절의 발견 항목이다. 여섯 열의 단순 평균이 표기 평균과 소수 넷째 자리까지 일치하는 것을 검산해 균등 가중과 기여율을 계산했다. 널리 인용되는 "RTX 4090" 추론 환경은 본문에서 찾지 못해 쓰지 않았고, 롤아웃 단위 등급과 여섯 지표 평균은 다른 지표이므로 혼용하지 않았다.
- 4.Soroush Nasiriany 외. "RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots." arXiv:2406.02523, RSS 2024. arXiv: 2406.02523 — 3절의 축자는 Limitations 절이며, 생성 궤적의 검수 필요성을 파이프라인 저자 스스로 적은 가장 오래된 근거다.
교차 확인한 학술 문헌
아래는 1번 논문의 참고문헌에서 서지와 결론을 교차 확인한 문헌이다. 본문에 옮긴 것은 각 연구가 무엇을 보고했는가까지이며, 원문 전문은 열지 않았다.
- 5.Yu Shang 외. "WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models." arXiv:2602.08971 (2026). arXiv: 2602.08971 — 지각 순위와 기능 순위가 일치하지 않는다는 결론을 5절에서 인용했다.
- 6.Fanqi Jiang 외. "RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation." arXiv:2604.19092 (2026). arXiv: 2604.19092 — 영상 품질이 실행 가능성의 신뢰할 만한 예측자가 아니라는 결론을 5절에서 인용했다.
- 7.Yuhang Deng 외 8인. "Rethinking Video Generation Model for the Embodied World"(R-Bench). arXiv:2601.15282 (2026). arXiv: 2601.15282 — 5절 census의 R-Bench 항목이다. 제작 주체가 두 갈래로 보고돼 있었는데 1번 논문의 참고문헌이 이 귀속을 독립적으로 확인해 주며, 같은 논문이 이 벤치마크를 L0~L3에 배치한다.
- 8.Julian Quevedo, Percy Liang, Sherry Yang 외. "WorldGym." arXiv:2506.00613 v3, ICLR 2026 채택. arXiv: 2506.00613 — 5절 마지막 단락의 두 문장이 여기서 나왔다. 정책 순위가 보존된다는 결과와, 현실적인 물체 상호작용 생성이 여전히 어렵다는 한계다.
- 9.Meta AI. "V-JEPA 2.1." arXiv:2603.14482 v3, 2026년 6월 11일. arXiv: 2603.14482 — 2절 마지막 단락의 사례다. 초록의 20포인트는 세 과제 중 파지 하나의 값이고 1단계 지평에서는 10포인트다. 남은 실패가 그리퍼 행동 계획에서 온다는 진단도 저자 서술이다.
- 10.Danijar Hafner, Wilson Yan, Timothy Lillicrap. "Training Agents Inside of Scalable World Models"(Dreamer 4). arXiv:2509.24527, 2025년 9월. arXiv: 2509.24527 — 2절 지형표의 항목이며 유일하게 1년 된 문헌이라 발표 시점을 함께 적었다. 저자 공식 가중치·코드 배포가 없다는 점은 공개 저장소 확인 결과다.
- 11.Saman Motamed 외. "Physics-IQ." arXiv:2501.09038 (2025) / Pranav Atreya, Karl Pertsch, Tony Lee 외. "RoboArena." arXiv:2506.18123, CoRL 2025 — 5절 census의 두 항목이다. 뒤의 것이 아홉 개 가운데 실제 로봇 하드웨어에서 정책을 비교하는 유일한 항목이다.
벤더 1차 문서 (모델카드·공식 블로그·발표문)
- 12.NVIDIA. Cosmos 3 공식 발표(2026년 5월 31일, GTC Taipei), Cosmos3-Edge 모델카드(허깅페이스
nvidia/Cosmos3-Edge, 최초 2026년 7월 20일·갱신 8월 25일) — 2절의 사양·행동 형식 표와 한계 절 축자가 여기서 나왔다. 발표문의 "ranks first across…"와 "months to days"는 벤더 자기보고이고 절대 수치가 없어 사실로 옮기지 않았다. 파라미터는 모델카드 값 4B만 썼고 기술보고서(2026년 6월 22일) 원문은 확인하지 못했다. - 13.World Labs. "Atlas"(2026년 9월 1일), "Building Worlds That Train Robots"(2026년 7월 28일), Marble·World API 문서 — 2절의 공개 상태와 로봇 관련 축자가 여기서 나왔다. 파트너 한정 early access이며 가중치·공개 API·가격·성능 수치가 없다. 한계를 적은 문단을 찾지 못했다는 서술은 이 문서들을 확인한 결과다. Marble 가격은 2차 자료 간 기재가 달라 쓰지 않았다.
- 14.Google DeepMind. Genie 3 연구 발표(2025년 8월 5일) / Google Labs. Project Genie(2026년 1월 29일 공개, 5월 확대) — 게임 엔진이 아니라는 점과 60초·24fps·720p 제한이 공개된 한계다. 구독 금액은 2차 자료 간 표기가 달라 쓰지 않았다.
정책·표준
- 15.과학기술정보통신부·정보통신기획평가원. 피지컬 AI 선도기술개발 사업 착수보고회(2026년 6월 9일, 서울 마곡 LG사이언스파크) — 4절의 예산·기간·주관·참여기관·반복 검증 횟수와 핵심 목표 축자가 여기서 나왔다. 공식 보도자료 원문은 확인하지 못해 2026년 6월 9~10일 언론 다수 보도로 대조했고, 비교로 인용된 14.5%포인트는 원 근거를 찾지 못해 사업 자료의 인용이라는 것까지만 적었다. 연구 책임자 발언도 2차 확인이다.
- 16.ISO/IEC 5259-2:2024 "Artificial intelligence — Data quality for analytics and machine learning (ML) — Part 2: Data quality measures"(JTC 1/SC 42, 2024년 11월) / NIST "Digital Twins for Advanced Manufacturing"의 검증·타당성 확인·불확실성 정량화 과제 — 6절 마지막 단락이다. 유료 표준 전문을 열지 않아 공개된 소개와 범위만 확인했고 조문을 인용하지 않았다.
페블러스 블로그 인접 글
- 17.월드모델 서베이 정리(1절), 피지컬 AI 산업 지형(2절) — 앞의 글은 학술적 분류 체계를, 뒤의 글은 산업 축을 다뤘다.
- 18.합성데이터 파이프라인, 월드모델 생성 결과의 물리 검증(3절), 로봇 학습 데이터 층위(6절) — 이 글이 되풀이하지 않고 링크로 넘긴 세 갈래다.