Executive Summary

지린대 인공지능학원의 연구자 세 사람이 2026년 9월 25일 arXiv에 논문 한 편을 올렸다. 로봇 조작 학습 시뮬레이터 LIBERO 위에 지시 자체가 틀린 과제 2,826개를 만들어 놓고, 카메라 화면과 사람의 말을 읽어 로봇 팔을 움직이는 모델 여덟 종에게 차례로 시킨 실험이다. 없는 컵을 집으라거나, 이미 열린 서랍을 열라거나, 아래에 깔린 접시를 먼저 치우라는 식이다. 이 글은 그런 지시를 받은 로봇이 실제로 무엇을 했는지를 본다.

성공률은 모두 떨어졌고, 그 가운데 OpenVLA가 잃은 56.2%포인트가 가장 큰 폭이다. 그런데 논문이 힘을 실은 곳은 이 숫자가 아니다. 실패로 기록된 시도를 다시 열어 보니 로봇은 멈춘 것이 아니었다. 원래 목표를 향해 계속 팔을 뻗었고, 초반 스무 걸음은 정상 수행과 거의 구분되지 않았으며, 동작의 세기도 거의 줄이지 않았다. 저자들은 이 행동에 Failed Persistence라는 이름을 붙였다.

1절부터 4절까지는 논문에 적힌 내용이다. 5절은 그 사실을 데이터 품질의 눈으로 다시 읽은 이 글의 해석이다.

주요 수치

출처: Hou, Wu, Chang, "ConflictVLA-Bench" (arXiv:2609.31792, 2026년 9월 25일).

56.2%p

OpenVLA의 목표 달성률 하락

정상 지시에서 78.7%, 틀린 지시에서 22.5%였다

17.3%p

여덟 중 가장 작은 하락

π₀.₅의 값이다. 틀린 지시에 흔들리지 않은 모델은 없었다

0.845

π₀-FAST 실패 기록의 초반 궤적 유사도

절반이 실패로 끝났는데도 첫 스무 걸음은 정상 수행과 거의 같았다

0개

전제 점검 지시가 네 지표를 모두 의도대로 바꾼 모델

여덟 중 하나도 없었다

1

틀린 지시를 받은 로봇은 무엇을 하는가

VLA는 카메라로 본 장면과 사람이 건넨 문장을 함께 읽고 로봇 팔의 다음 동작을 곧장 내놓는 모델이다. 2024년에 스탠퍼드 연구진이 OpenVLA를 공개 모델로 내놓은 뒤 π₀ 계열과 GR00T, UniVLA 같은 이름이 줄을 이었다. 이 모델들의 실력을 재는 자리는 지금까지 한 가지 전제 위에 서 있었다. 사람이 주는 지시는 옳다는 전제다.

현장은 그렇지 않다. 식탁에 없는 컵을 집으라고 시킬 수 있고, 이미 열려 있는 서랍을 열라고 할 수 있고, 아래에 깔린 접시를 먼저 치우라고 할 수도 있다. 지시를 받는 쪽이 아니라 지시 자체가 틀린 경우다. 논문은 이런 지시를 전제 충돌이라 부르고 네 갈래로 나눈다.

  • 지시문 내부 모순 — 한 문장 안의 목표와 제약이 서로 어긋난다
  • 대상 지목 오류 — 지시가 가리키는 물건이 장면에 없거나 특정되지 않는다
  • 공간 관계 오류 — 지시가 참이라고 깔고 들어간 위치 관계가 장면에서 거짓이다
  • 물리적 실현 불가 — 물리적으로 해낼 수 없는 동작이나 순서를 요구한다
ConflictVLA-Bench의 네 가지 전제 충돌 유형과 과제 생성·평가 파이프라인을 보여주는 논문 원본 도식
▲ (a) 네 가지 전제 충돌 유형, (b) LIBERO 기반 과제 생성, (c) 정상·충돌 쌍 비교 실행, (d) 결과·과정 지표를 함께 쓰는 진단 방식 | Source: Hou, Wu, Chang (2026), arXiv:2609.31792, Fig. 2

갈래는 하나 더 있다. 같은 오류라도 한 번 집으면 끝나는 과제에 심은 것과 순서를 밟아야 하는 과제에 심은 것은 로봇이 겪는 일이 다르고, 오류가 한 군데 몰려 있는 것과 여기저기 흩어져 있는 것도 다르다. 연구진은 이 두 갈림을 곱해 과제를 L1부터 L4까지 네 구성으로 나눠 두었다. 단계 하나에 오류 하나가 L1, 단계 하나에 오류 여럿이 같은 요구 조건을 함께 건드리는 것이 L2, 여러 단계 가운데 한 군데 하위 목표에만 오류가 놓인 것이 L3, 여러 단계에 서로 얽힌 오류가 흩어진 것이 L4다. 다만 논문은 이것을 난이도 순서로 읽지 말라고 미리 못을 박는다. 과제를 어떻게 만들었는지 적은 구성일 뿐 어느 쪽이 더 어렵다고 가정한 서열이 아니라는 것이고, 실제로 결과 표들은 네 구성을 갈라 적지 않는다.

이 과제들이 놓인 바닥은 LIBERO다. 2023년에 공개된 로봇 조작 벤치마크로, 과제마다 장면에 놓인 물체와 성공 조건이 기계가 읽을 수 있는 형식으로 적혀 있다. 연구진은 그 명세를 읽어 물체와 술어를 뽑아내고, 거기에 충돌을 심고, 원래의 정상 과제와 짝을 지은 다음 자동 검사와 사람 검수를 거쳤다. 검수는 두 단계였다. 충돌이 성립하지 않거나 확인할 길이 없는 과제는 버렸고, 표기가 잘못됐지만 고칠 수 있는 과제는 고쳐서 다시 검사했다. 이렇게 남은 기본 과제가 1,413개다. 여기에 프롬프트 조건 두 가지를 곱해 2,826개가 됐다.

짝을 짓는다는 대목이 이 설계의 핵심이다. 틀린 지시로 돌린 실행 기록에는 같은 장면, 같은 목표의 정상 실행 기록이 하나씩 붙어 있다. 견줄 기준선이 옆에 있으니 성공 여부만이 아니라 "이 로봇이 평소와 다르게 움직였는가"를 물을 수 있다. 결과 지표 한 칸으로는 물을 수 없던 질문이다.

실험 규모도 함께 적는다. 2,826개 과제를 저마다 다섯 가지 초기 상태에서 돌렸고, 기준이 되는 정상 과제 40개도 같은 다섯 상태에서 두 프롬프트 조건으로 각각 돌렸다. 모델 하나당 충돌 실행이 14,130회, 정상 실행이 400회, 합쳐 14,530회다. 아래에 적히는 백분율은 모두 그 실행들을 센 값이다. 기준 과제가 40개라는 숫자도 그냥 넘기기 어렵다. 충돌 과제 1,413개는 서로 다른 장면 1,413개가 아니라, LIBERO의 기본 과제 40개 위에 오류를 바꿔 가며 심어 불린 것이다.

결과부터 보면 여덟 모델 가운데 가장 많이 떨어진 쪽이 OpenVLA다. 정상 지시에서 78.7%였던 성공률이 틀린 지시에서는 22.5%로 내려갔다. 가장 적게 떨어진 π₀.₅도 94.5%에서 77.2%로 17.3%포인트를 잃었다. 평소 성적이 좋다고 버티는 것도 아니었다. VLA-JEPA는 정상 지시에서 99.0%를 냈지만 틀린 지시에서는 69.1%로 내려앉았다.

틀린 지시를 받았을 때 원래 목표 달성률이 떨어진 폭 (%포인트) OpenVLA 56.2 π₀-FAST 38.6 π₀ 35.5 VLA-JEPA 29.9 GR00T N1.7 29.0 OpenVLA-OFT 27.1 UniVLA 24.6 π₀.₅ 17.3 여덟 모델 전부가 최소 17.3%포인트를 잃었다. 이 표에 무사한 이름은 없다. 정상 지시에서 99.0%를 낸 VLA-JEPA도 중간에 있다. 평소 실력이 버팀목이 되지 않았다.
▲ 논문 표 I의 값을 페블러스가 막대로 옮긴 도식. 맨 위 주황 막대가 OpenVLA다.

모델별 원래 수치는 아래와 같다. 왼쪽이 정상 지시에서의 성공률, 가운데가 틀린 지시에서 원래 목표를 달성한 비율이다.

모델 정상 지시 성공률 틀린 지시 달성률 하락폭
OpenVLA 78.7% 22.5% 56.2%p
π₀-FAST 83.4% 44.8% 38.6%p
π₀ 93.1% 57.6% 35.5%p
VLA-JEPA 99.0% 69.1% 29.9%p
GR00T N1.7 92.1% 63.2% 29.0%p
OpenVLA-OFT 98.3% 71.1% 27.1%p
UniVLA 84.1% 59.5% 24.6%p
π₀.₅ 94.5% 77.2% 17.3%p
2

성공률표가 가리는 행동, Failed Persistence

여기까지는 성공률 이야기다. 논문이 정말 묻고 싶었던 것은 그다음이다. 실패라고 적힌 한 칸은 전혀 다른 두 가지 일을 같은 모양으로 기록한다. 하나는 로봇이 지시가 이상하다는 것을 알아채고 동작을 접은 경우고, 다른 하나는 알아채지 못한 채 원래 목표를 향해 끝까지 밀어붙이다 넘어진 경우다. 화면 위에서는 둘 다 실패지만, 팔과 집게가 달린 기계에서 두 경우의 무게는 같지 않다.

저자들은 뒤쪽 행동에 Failed Persistence라는 이름을 붙였다. 우리말로 하면 실패로 끝난 고집쯤 된다. 정의는 한 문장이다. 기준이 되는 목표는 완수되지 않았는데, 기준 과제를 수행할 때 보이던 행동은 실행 내내 관찰 가능한 상태로 남아 있는 것.

전제가 틀린 지시에도 로봇 팔이 원래 목표를 향해 계속 움직이는 실제 실행 사례 사진
▲ 없는 책을 스토브에 놓으라는 지시(왼쪽)와 스토브 자체를 집어 접시에 놓으라는 물리적으로 불가능한 지시(오른쪽). 둘 다 로봇은 원래 목표를 향해 계속 움직였다 | Source: Hou, Wu, Chang (2026), arXiv:2609.31792, Fig. 1
같은 '실패' 한 칸에 들어 있는 두 가지 일 틀린 지시 동작을 멈추거나 거부한다 원래 목표로 계속 다가간다 결과 지표에 남는 것은 '실패' 한 칸뿐 과정 지표: 목표 접근도 · 초반 궤적 유사도 · 동작 억제도 이 세 값이 위의 두 갈래를 가른다
▲ 논문의 문제의식을 페블러스가 도식으로 재구성했다. 결과 지표 하나로는 왼쪽 위와 왼쪽 아래를 구별할 방법이 없다.

두 갈래를 가르려고 연구진이 꺼낸 것이 과정 지표 세 가지다. 모두 옆에 붙어 있는 정상 실행 기록을 기준으로 잰 상대값이다.

  • 목표 접근도(TAR) — 집게 끝이 원래 목표 물건 쪽으로 실제로 다가간 정도
  • 궤적 유사도(TS) — 팔이 그린 경로가 정상 수행 때의 경로와 얼마나 겹치는지. 시간 축을 늘였다 줄였다 맞춰 가며 잰다
  • 동작 억제도(AMS) — 이상을 감지했다면 줄였어야 할 동작의 세기를 실제로 얼마나 줄였는지

여덟 모델의 평균값은 한쪽으로 쏠려 있다. 목표 접근도는 0.765에서 0.896 사이, 초반 스무 걸음만 본 궤적 유사도는 0.784에서 0.886 사이다. 반면 동작 억제도는 0.067에서 0.276에 그쳤다. 앞의 두 값이 높고 뒤의 값이 낮다는 조합이 이 실험의 결론을 거의 다 말한다. 로봇은 원래 목표 쪽으로 평소처럼 나아갔고, 속도를 늦추지 않았다. 전체 궤적으로 넓히면 유사도가 0.471에서 0.744로 떨어지는데, 이는 뒤늦게야 정상 경로에서 벗어났다는 뜻이다.

초반 유사도가 전체 유사도보다 높다는 관계는 여덟 모델에서 예외 없이 성립했다. 시작은 정상 수행과 닮았고 어긋남은 나중에 쌓였다는 뜻이다. 다만 저자들은 여기서 한 걸음 더 나가지 않는다. 이 측정으로는 어긋남이 모델 안의 어디에서 비롯됐는지 알 수 없다고 적은 뒤, 익숙한 과제 행동을 먼저 꺼내 놓고 물건을 찾고 집고 제어하는 동안 차이가 쌓여 가는 그림과 들어맞기는 한다는 선에서 멈췄다.

실패한 시도만 따로 추리면 그림이 더 분명해진다. 논문은 정상 쪽이 성공한 짝을 실력이 검증된 짝이라 부르고, 그중 틀린 지시에서 실패한 것만 다시 모았다. 애초에 못 하는 과제를 못 했다고 세는 일을 미리 걷어 낸 셈이다. 이 부분집합에서도 목표 접근도는 0.586에서 0.741, 초반 궤적 유사도는 0.653에서 0.845를 유지했고 동작 억제도는 0.133에서 0.370에 머물렀다. 실패라고 적힌 기록의 상당수가 사실은 손을 놓지 않은 상태였다는 뜻이다.

논문이 예로 든 모델은 π₀-FAST다. 이 모델은 실력이 검증된 과제 짝 가운데 50.2%를 실패로 잃었다. 점수만 보면 절반쯤 실패하는 모델이다. 그런데 그 실패한 기록들의 목표 접근도가 0.741, 초반 궤적 유사도가 0.845다. 동작 억제도는 0.178에 그쳤다. 절반을 놓치는 모델이 아니라, 거의 언제나 끝까지 밀어붙이다 실패하는 모델이다. 성공률 칸만 봤다면 알 수 없었을 성격이다.

이 지점을 가장 짧게 적은 것은 초록의 마지막 대목이다. 종결 단계의 실패만으로는 행동의 중단도 거부도 입증되지 않으며, 결과만으로는 VLA 평가에 충분하지 않다.

3

'전제부터 확인하라'는 한 줄은 듣지 않는다

2,826이라는 과제 수가 1,413의 두 배인 이유가 여기 있다. 연구진은 같은 과제를 두 가지 프롬프트로 각각 돌렸다. 하나는 평범한 지시만 준 조건이고, 다른 하나는 그 앞에 전제가 맞는지 먼저 확인하라는 문장을 얹은 조건이다. 언어 모델 쪽에서 흔히 통하는 처방이 몸을 가진 모델에서도 통하는지 보려는 설계다.

결과는 네 개의 숫자로 요약된다. 목표 접근도가 내려간 모델은 여덟 중 넷, 초반 궤적 유사도가 내려간 모델은 셋, 전체 궤적 유사도가 내려간 모델은 넷, 동작 억제도가 올라간 모델은 넷이었다. 네 지표 모두에서 의도한 방향으로 움직인 모델은 하나도 없었다. 어떤 모델은 한 지표가 좋아지고 다른 지표가 나빠졌고, 어떤 모델은 아무 데도 반응하지 않았다.

더 나쁜 일도 있었다. OpenVLA와 π₀-FAST는 전제를 확인하라는 문장을 받자 정상 지시에서의 성공률까지 떨어졌다. OpenVLA는 20.2%포인트, π₀-FAST는 38.8%포인트다. 틀린 지시 앞에서만 조심스러워진 것이 아니라 멀쩡한 지시에서도 손이 굳은 것이다. 저자들의 표현으로는 선택적인 조절이 아니라 프롬프트가 일으킨 전반적 교란이다.

논문의 문장은 이렇다. 전제를 확인하라는 명시적 지시는 원래 과제 행동의 유지를 일관되게 줄이지 못하며, 일부 모델에서는 오히려 전제가 유효한 과제에서의 성능 저하와 함께 나타난다. 지금의 VLA에 전제를 검증하는 구조가 들어 있지 않다는 뜻이고, 문장 한 줄로 그 구조를 만들어 넣을 수는 없다는 뜻이기도 하다.

4

로봇은 공간과 물리 앞에서 가장 크게 무너진다

네 가지 충돌 유형이 남긴 영향은 같지 않았다. 아래 수치는 모두 여덟 모델을 같은 무게로 평균한 값이고, 유형별로 비교할 수 있게 같은 지표끼리 나란히 둔 것이다.

목표 접근도부터 본다. 지시문 내부에 모순이 있을 때가 0.938, 대상 지목이 틀렸을 때가 0.923이다. 공간 관계가 틀렸을 때는 0.803, 물리적으로 불가능한 요구일 때는 0.795로 내려간다. 앞의 두 경우에서 로봇은 오히려 더 또박또박 원래 목표로 다가갔다. 문장 안의 모순이나 없는 물건은 팔의 움직임을 거의 흔들지 못한 것이다.

결과 쪽 숫자는 반대 방향을 가리킨다. 지시문 내부 모순과 대상 지목 오류에서는 원래 목표 달성률이 각각 69.9%와 64.3%로 비교적 높게 남았다. 반면 공간 관계 오류와 물리적 실현 불가에서는 달성률 하락폭이 각각 38.7%포인트와 45.0%포인트에 이르렀다. 장면의 물리와 직접 부딪히는 충돌일수록 결과도 과정도 크게 흔들린다.

두 관찰을 겹쳐 놓으면 걱정스러운 조합이 하나 생긴다. 지시문 안의 모순과 없는 물건은 알아채기 쉬운 쪽인데도 로봇은 가장 태연하게 목표로 향했고, 물리적으로 불가능한 요구는 결과를 가장 크게 망가뜨렸다. 말로 확인할 수 있는 오류에서 행동이 멈추지 않고, 몸으로 부딪혀야 드러나는 오류에서 손해가 가장 크다는 뜻이다.

안전을 두고 저자들은 담백하게 적었다. 이런 동작은 물리적 환경에 직접 영향을 미치기 때문에, 실행을 계속하면 물건을 파손하거나 의도하지 않은 조작을 일으키거나 안전 제약을 위반할 수 있다.

5

페블러스가 이 연구를 주목하는 이유

여기서부터는 같은 숫자를 우리 일터 쪽에서 읽어 본다.

먼저 눈에 걸리는 것은 이 벤치마크가 무엇으로 만들어졌는가다. 2,826개 과제는 새로 촬영한 데이터가 아니다. 이미 있던 LIBERO 과제 명세를 읽어 거기에 오류를 심어 만든 것이다. 학습·평가 데이터라고 하면 대개 더 많이, 더 깨끗하게 모으는 쪽을 떠올린다. 이 논문은 반대쪽을 골랐다. 일부러 틀린 전제를 심어 넣은 짝을 만들지 않으면 보이지 않는 성질이 있다는 것이다. 결측이나 잡음 같은 우연한 오염이 아니라 설계된 오염이다.

다음은 무엇을 재는가다. 성공률 하나로 품질을 말하는 습관은 데이터 현장에도 깊이 박혀 있다. 정확도 몇 퍼센트, 오류율 몇 퍼센트로 적힌 성적표는 읽기 쉽고 회의에서 쓰기 좋다. 그런데 그 한 칸은 원인을 지운다. 이 논문에서 실패라는 칸은 멈춘 로봇과 밀어붙인 로봇을 같은 자리에 넣었고, 둘을 가른 것은 목표 접근도와 궤적 유사도와 동작 억제도라는 과정 쪽 기록이었다. 데이터 품질에서도 사정은 같다. 이 칸이 왜 비었는지, 이 라벨이 어느 단계에서 뒤집혔는지는 결과 점수가 아니라 처리 과정에 남은 흔적에서 나온다.

세 번째는 프롬프트 실험이 남긴 교훈이다. 전제를 확인하라는 한 줄로 여덟 모델 가운데 하나도 고쳐지지 않았고, 둘은 멀쩡하던 성능까지 잃었다. 안전을 지시문으로 사들이려는 시도가 어떻게 끝나는지를 숫자로 보여 준 셈이다. 이 결과를 뒤집어 읽으면 해야 할 일의 자리가 드러난다. 전제가 틀린 상황을 학습·평가 데이터 안에 정식 항목으로 넣어 두고, 그 상황에서 무엇이 일어났는지 과정까지 기록해 두는 일이다. 둘 다 데이터를 설계하는 쪽의 몫이다.

마지막으로 이 논문이 자기 범위를 그은 방식도 적어 둘 만하다. 실험은 시뮬레이터 안에서 이루어졌고, 실제 로봇에서 같은 수치가 나온다는 보장은 어디에도 없다. 과제 2,826개라는 수도 장면의 다양성보다는 오류의 다양성 쪽으로 불어난 값이라, 기본 과제 40개 바깥에서 같은 그림이 나오는지는 아직 아무도 모른다. 저자들은 결론을 거부 능력의 부재로 넓히지 않고, 종결 단계의 실패만으로는 거부가 입증되지 않는다는 선에서 멈췄다. 주장할 수 있는 만큼만 주장한 문장은 받아 쓰는 쪽이 무엇을 더 확인해야 하는지 알려 준다.

여기까지 읽어 주셔서 감사하다. 논문 원문과 실험 자료는 arXiv와 프로젝트 페이지에서 볼 수 있다. 여러분의 팀이 모델이나 파이프라인의 품질을 말할 때 쓰는 지표 가운데 결과가 아닌 과정을 담은 것이 몇 개인지 한번 세어 보시고, 그 목록에서 무엇이 빠져 있었는지 들려주시면 좋겠다.

R

참고문헌

R.1학술 논문

R.2공개 자료