Executive Summary
이 글은 앤트로픽이 지난달 공개한 로봇 노출 지수가 어떻게 만들어진 수인지를 1차 출처로 되짚는다. 오늘의 로봇이 미국 물리 작업의 74%를 수행할 수 있다는 것이 헤드라인 수치였고, 보도는 여기에 가장 빠른 시나리오에서도 물리 작업의 절반이 넘어가는 시점은 2050년이라는 문장을 붙여 안도의 기사를 썼다. 같은 연구가 기본으로 삼은 기준 시나리오의 날짜는 2085년인데, 그 숫자는 기사 어디에도 없다.
체인을 거꾸로 되짚으면 밖에서 들어온 자료는 네 종류뿐이다. 직업 설명서, 고용과 보수 통계, 인구 통계, 로봇 가격 자료. 그 사이의 열 단계는 전부 클로드 오푸스 5의 추정이다. 로봇 쪽 근거도 현장 기록이 아니라 제품 소개 페이지와 업계 기사이고, 공개 데이터셋을 세어 보면 인용 출처 세 건 중 한 건 가까이가 그 로봇을 만든 회사 자신의 웹사이트다. 일은 직무 기술서를 쓴 사람의 글로 들어왔고, 로봇은 만든 회사의 글로 들어왔다. 양쪽이 다 문서다. 그리고 같은 종류의 채점표를 모델만 바꿔 돌려 본 논문이 다섯 달 앞서 나와 있다. 거기서는 채점자를 바꾸자 작업 판정의 절반 가까이가 갈렸다.
여기까지는 사실이다. 해석은 이렇다. 저자들은 자기 손으로 한계를 적었다. 비슷한 작업을 하는 로봇에 기댄 판정을 빼면 노출 비중이 4분의 3에서 2분의 1로 내려간다고 부록에 적었다. 물리 작업의 상당 부분은 할 수는 있어도 규모 있게 자동화할 수 없다는 문장도 그들이 직접 적은 것이다. 50년 백테스트가 검증한 자리는 공장 안이고 이 연구가 새로 말하는 창고와 도로에 관해 과거 데이터는 말해 주는 바가 적다는 단서 역시 부록에 있다. 민감도와 사정거리를 스스로 그은 연구다. 이 글이 묻는 것은 저자들의 성실성이 아니라, 그 부록을 버리고 74%와 2050년만 옮긴 유통 과정이다. 그리고 더 근본적으로는 피지컬 AI의 미래를 재려는 자리에 현장에서 센 값이 없다는 상태다.
3/4 → 1/2
비슷한 로봇에 기댄 판정을 뺐을 때
저자들이 부록에 직접 적은 민감도다. 24%포인트가 판단 하나에 걸려 있다
56.9%
모델을 바꿨을 때의 판정 일치율
같은 채점표를 다른 모델로 돌린 연구의 값이다. 같은 모델을 세 번 돌렸을 때는 99.0%였다
80 / 105
정돈 안 된 환경 작업 중 운전이 아닌 것
도로 같은 환경에서 로봇이 일한다고 판정된 작업은 105개이고, 그중 80개는 운전과 무관하다
30.8%
로봇 제조사 자기 웹사이트에서 온 근거
공개된 인용 출처 56,933건을 도메인으로 갈라 센 하한값이다
네 개의 숫자, 그리고 빠진 하나
앤트로픽이 2026년 9월 30일 「로봇은 어떤 일을 할 수 있는가」를 공개했다. 러셀 리게이트양과 맥심 마센코프 두 사람이 쓴 본문 45쪽, 부록 57쪽짜리 자사 연구 보고서다. 학술지에 실린 논문이 아니라 회사가 낸 보고서라는 점은 먼저 밝힌다. arXiv 번호도 DOI도 없고, 두 사람이 제시한 인용 형식도 온라인 문서용이다. 대신 프롬프트 전문과 작업 단위 데이터셋이 함께 공개됐고, 이 글의 재계산은 전부 그 공개분에서 나왔다.
발표 다음 날 야후 파이낸스가 기사를 냈고, 그 기사가 헤드라인 수치 세 개를 옮겼다. 로봇이 할 수 있는 물리 작업이 74%, 그 작업이 차지하는 근무시간이 34%, 그리고 사람보다 로봇이 싼 작업이 0.3%. 다만 그런 수치는 셋이 아니라 넷이고, 네 수는 분모가 같지 않다. 분모를 가르지 않으면 바로 다음 문장에서 뜻이 어긋난다.
1.1네 숫자는 저마다 다른 것을 센다
아래 표가 네 수의 분모다. 74%는 미국 물리 작업 가운데의 비중이고, 34%와 0.3%는 물리든 아니든 모든 근무시간 가운데의 비중이다. 뒤의 두 수는 분모가 같아서 나란히 읽을 수 있다. 보고서 본문의 문장이 그 대비다. 로봇이 이론상 할 수 있는 일이 전체 근무시간의 34%에 이르는데, 오늘 사람보다 값이 싼 일은 같은 분모에서 0.3%에 그친다.
| 수치 | 무엇을 센 값인가 | 분모 |
|---|---|---|
| 74% | 오늘의 로봇이 수행할 수 있다고 판정된 작업 | 미국 물리 작업 |
| 34% | 그 작업이 차지하는 근무시간 | 전체 근무시간 |
| 0.3% | 사람보다 로봇이 싼 작업 | 전체 근무시간 |
| 81% | 로봇 또는 대규모 언어모델에 노출된 작업 | 전체 작업시간 |
보고서 본문과 핵심 발견 항목에서 옮긴 값이다. 네 번째 수는 핵심 발견 항목이 "약 80%"로, 본문 14쪽이 "81%"로 적었다. 같은 값의 어림수와 정밀수라 이 글에서는 81%로 통일한다.
같은 직업 데이터베이스 위에 세운 지표를 페블러스가 전에 다룬 적이 있다. 에이전트 위임 가능성의 직업 지도가 그것인데, 그쪽은 대상이 텍스트 작업이다. 이번 보고서는 같은 데이터베이스에서 물리 작업만 골라내 로봇을 붙였다. 두 지표를 겹쳐 읽을 때는 대상이 다르다는 점을 먼저 확인해야 한다.
1.2축은 통제 강도가 아니라 환경을 얼마나 손봐야 하는가
이 보고서의 설계에서 가장 중요한 장치는 네 칸짜리 등급이다. 보도는 이것을 "환경 통제 수준 네 단계"로 요약했는데, 요약 자체는 맞지만 축의 방향을 뒤집어 읽기 쉽다. 축이 묻는 것은 환경이 얼마나 통제되어 있느냐가 아니라, 로봇이 그 일을 하려면 사람이 환경을 얼마나 손봐야 하느냐다. 손을 가장 많이 대야 하는 쪽이 E1이고, 손을 대지 않아도 되는 쪽이 E3다. 그래서 가장 노출이 높은 등급은 E3다.
| 등급 | 뜻 | 물리 작업 중 | 전체 작업 중 |
|---|---|---|---|
| E0 | 로봇이 못 한다 | 약 25% | 12% |
| E1 | 로봇 전용으로 지은 환경에서만 한다 (공장 조립 라인) | 50% | 23% |
| E2 | 사람이 쓰는 정돈된 시설에서 한다 (물류 창고) | 22% | 10% |
| E3 | 정돈되지 않은 환경에서 한다 (도시 도로) | 2% | 1% |
E1부터 E3까지를 더하면 물리 작업 기준 74%, 전체 작업 기준 34%가 된다. E0 비중은 가중 방식과 기준 연도에 따라 24%에서 30% 사이로 갈리므로 이 글에서는 고용 가중 기준값만 쓴다.
74%라는 수의 안쪽 구성이 여기서 드러난다. 50%포인트가 E1이다. 로봇을 위해 작업장을 새로 지어야 하는 칸이 74%의 3분의 2를 넘게 차지한다. 도시 도로처럼 손대지 않은 환경에서 하는 일, 그러니까 사람들이 "로봇이 우리 일을 한다"고 들을 때 떠올리는 장면에 해당하는 칸은 물리 작업의 2%다.
1.3빠진 하나는 기준 시나리오의 연도다
보고서는 가격이 떨어지는 속도를 두 가지로 가정해 도달 연도를 냈다. 기준 시나리오는 로봇 배치 비용이 해마다 3%씩 떨어지는 경우이고, 급속 시나리오는 하드웨어 값이 해마다 12%씩 떨어지면서 로봇이 못 하던 일을 하게 되는 속도도 두 배로 빨라지는 경우다. 물리 작업의 절반이 사람보다 싸지는 해는 기준 시나리오에서 2085년, 급속 시나리오에서 2050년이다.
보도가 옮긴 날짜는 뒤의 하나였다. 야후 파이낸스 기사는 2050년과 "40년"을 실었고, 2085년을 적지 않았다. E0부터 E3까지의 등급도, 부록에 실린 74%의 민감도도, 규제에 걸린 작업이 14%라는 수치도 기사에 없다. 프레임은 안도 쪽이었다. 블루칼라 노동자에게 수십 년의 여유가 있다는 것이다. 그 방향이 틀렸다고 말하려는 글은 아니다. 다만 안도의 근거로 쓰인 2050년은 보고서가 가장 빠른 경우라고 이름 붙인 쪽의 값이고, 보고서가 기본으로 삼은 값은 그보다 35년 뒤다.
앞세운 수치만 옮기면 두 가지가 같이 떨어져 나간다. 74% 안에서 E1과 E3가 구분되지 않고, 두 도달 연도 가운데 기준값이 사라진다. 이 글의 나머지는 그 두 가지가 왜 중요한지를 보고서 자신의 부록으로 따라간다.
74%는 어디서 왔는가
74%는 로봇을 관찰해 얻은 값이 아니다. 작업 하나하나에 대해 클로드 오푸스 5가 "오늘 나와 있는 로봇이 이 일을 할 수 있는가"를 판정하고, 그 판정을 고용 수치로 가중해 합친 값이다. 그래서 이 수를 읽는 방법은 하나다. 판정에 들어간 입력이 무엇이고, 판정의 규칙이 무엇이었는지를 보는 것. 둘 다 공개돼 있다.
2.1밖에서 들어온 자료는 네 종류다
부록 A부터 F까지를 따라가며 모델이 만들지 않은 입력만 추리면 넷이 남는다. 미국 노동부의 직업 정보 데이터베이스 오넷(O*NET) 29.3판, 노동통계국의 직업별 고용과 임금 그리고 총보수 자료, 인구조사국의 지역사회 조사, 그리고 1990년 이후의 로봇 가격 자료다. 923개 직업과 1만 8,796개 작업 서술문이 전부 첫 번째에서 왔다.
그 네 입력 사이를 잇는 단계는 전부 모델의 추정이다. 아래 표가 그 열 단계다. 어느 단계도 숨겨져 있지 않다. 저자들이 부록에 단계마다 프롬프트를 붙여 공개했기 때문에 밖에서 이렇게 셀 수 있었다.
| # | 모델이 추정한 것 | 근거 문서 |
|---|---|---|
| 1 | 작업을 물리·인지·대인으로 가르고 시간과 숙련도를 매김 | 부록 A.1 |
| 2 | 작업마다 대표 사례를 열거하고 빈도로 가중 | 부록 A.3 |
| 3 | 사례마다 노출 등급 판정, 웹 검색으로 로봇을 찾아 출처 인용 | 부록 A.3 |
| 4 | 직업 안에서 각 작업이 차지하는 시간 비중 | 부록 A.1 |
| 5 | 사람이 그 작업으로 1년에 만드는 산출량 | 부록 D.1 |
| 6 | 작업별 로봇 연간 총비용 | 부록 D.1 |
| 7 | 직업 단위 합산, 중복 제거와 협조 비용 가산 | 부록 D.1 |
| 8 | 자동화를 막는 장애 요인 네 종류 판정 | 부록 C.2 |
| 9 | 로봇이 못 하는 작업 군집 열 개의 서술 | 부록 C.1 |
| 10 | 1977·1991·2002·2008년 시점의 과거 노출 등급 | 부록 B.2 |
부록 A부터 F까지에서 정리한 추정 단계. 외부 자료가 닿는 자리는 1단계의 작업 서술문, 6·7단계의 인건비, 그리고 가격 하락 추세뿐이다.
2.2근거를 요구하는 장치는 설계에 들어 있다
모델이 혼자 판단했다는 뜻은 아니다. 부록 A.3이 판정 규칙을 이렇게 적는다.
이 요구가 실제로 돌았다. 과거 시점 등급까지 합쳐 웹 검색이 약 65만 회, 인용이 27만 5,000건 이상, 고유 웹페이지가 9만 개 이상 동원됐다. 공개된 현재 시점 파일만 세어도 인용 출처가 56,933건이다. 판정마다 출처가 붙어 있고 그 출처의 성숙도가 배치·상업 판매 주장·시연 셋으로 갈려 기록돼 있다. 모델에게 근거를 요구하고 그 근거를 외부가 셀 수 있는 형태로 남긴 설계다. 이 점을 먼저 적지 않으면 뒤에 오는 이야기가 고발문이 된다.
2.3"작업장을 실제로 다시 지을지는 판단에서 빼라"
그러면 모델은 무엇을 판정했는가. 부록 F의 프롬프트가 등급 판정 규칙을 두 개의 이름으로 규정한다. 하나는 상한 규칙이다. 사례는 자기가 실제로 일어나는 환경의 등급을 넘어설 수 없다. 호텔 복도에서 일어나는 일은 아무리 잘해야 E2다. 다른 하나가 이 글의 핵심이다.
이 한 문단이 74%의 성격을 정한다. 물리 작업의 절반을 차지하는 E1은 "지금 그 작업장에서 로봇이 일하고 있다"가 아니라 "일을 기계 앞에 고정해 가져다 놓는다면 로봇이 끝낼 수 있다"는 뜻이다. 그 작업장을 실제로 다시 지을지는 판단에서 명시적으로 빠졌다. 추측이 아니라 설계이고, 저자들은 그 설계를 감추지 않고 프롬프트로 공개했다.
같은 보고서가 부록 C.2에 적어 둔 문장이 이 규칙의 뒷면이다. 물리 작업의 최소 42%포인트는 "어느 환경에서는 로봇이 할 수 있지만 오늘의 역량으로는 규모 있게 자동화할 수 없다". 할 수 있다는 판정과 쓸 만하다는 판정 사이의 거리를 저자들이 스스로 수치로 밝힌 것이다. 그러니 74%를 "측정"이라 부르면 틀린다. 정확한 이름은 판정이다.
2.4그 근거는 어떤 종류의 글인가
판정에 쓰인 근거를 성격별로 갈라 보면 또 한 겹이 나온다. 공개 데이터셋의 출처 56,933건에서 도메인을 뽑아 세면 고유 도메인이 11,174개인데, 그중 적어도 17,551건, 전체의 30.8%가 그 로봇을 만든 회사 자신의 도메인이다. 보도자료 배포 서비스를 거친 벤더 발표나 롱테일에 숨은 자사 도메인은 이 집계에 들어가지 않았으므로 하한값이다. 가장 많이 인용된 단일 도메인은 업계 매체인 더로봇리포트로 1,629건, 전체의 2.86%다.
여기서 흔히 나오는 요약 하나를 바로잡아야 한다. "현장 센서 기록이 아니라 직무 기술서로 쟀다"는 문장은 절반만 맞다. 일이 들어온 통로는 직무 기술서가 맞지만, 로봇이 들어온 통로는 직무 기술서가 아니라 제품 소개 페이지와 업계 기사와 보도자료다. 양쪽이 다 문서다. 일은 오넷 작성자가 적은 글로, 로봇은 만든 회사와 업계 매체가 적은 글로 지표에 들어왔다. 어느 쪽도 현장에서 센 값이 아니다.
앤트로픽이 자사 모델로 자사 지표를 만든 구도를 외부에서 되짚는 일은 전에도 있었다. 페블러스가 같은 회사의 AI 사용 지표를 독립 코퍼스로 맞대어 본 기록이 그것이다. 그때와 이번의 차이는 이번에는 프롬프트와 작업 단위 데이터가 함께 공개됐다는 점이고, 그래서 다음 절의 재계산이 가능했다.
저자들은 자기 숫자를 두 번 깎았다
이 보고서를 깎아내리기 쉬운 자리는 전부 부록에 이미 적혀 있다. 공표된 비중을 흔드는 민감도 두 개를 저자들이 직접 계산해 실었고, 백테스트의 사정거리도 자기 손으로 그었다. 그러니 아래에 폭로는 없다. 저자들이 적은 것, 공개 데이터로 외부가 다시 센 것, 그리고 끝내 적히지 않은 것을 차례로 놓는다.
3.1두 번의 깎임은 저자들의 계산이다
첫 번째 깎임은 부록 A.4에 있다. 판정의 근거가 그 작업을 직접 하는 로봇이 아니라 비슷한 작업을 하는 로봇이었던 경우를 빼면, 노출 물리 작업 비중이 "약 4분의 3에서 약 2분의 1로" 내려간다. 24%포인트가 "이 로봇이 저 작업도 할 수 있다고 볼 것인가"라는 판단 하나에 달려 있다는 뜻이다. 반면 시연만 근거로 든 판정을 빼는 경우에는 1%포인트밖에 움직이지 않고 직업 순위 상관도 0.99로 유지된다. 두 민감도의 크기 차이가 이 지표의 약한 고리가 어디인지를 가리킨다.
페블러스가 공개 데이터셋으로 같은 방향을 독립적으로 확인했다. 등급을 결정한 근거 사례만 추려 전이 전용 사례를 걷어내면 노출 물리 작업 비중이 66.5%에서 49.3%로, 17.2%포인트 내려간다. 두 숫자를 섞으면 안 된다. 저자들의 24%포인트는 고용 가중값이고 전이에 기댄 판정을 아예 다시 매긴 결과로 보이는 반면, 페블러스의 17.2%포인트는 가중 없는 값이고 공표된 사례 구조를 그대로 둔 채 사후에 빼기만 한 결과다. 방법이 다르니 크기도 다르다. 같은 것은 방향이다. 시연 제외 쪽도 마찬가지여서, 페블러스 재계산으로는 0.21%포인트 하락에 그친다.
두 번째 깎임은 부록 C.2에 있다. 어느 환경에서도 로봇이 못 하는 물리 작업이 26%, 역량 때문에 자동화가 막힌 물리 작업이 68%다. 뒤에서 앞을 빼면 최소 42%포인트가 남는데, 저자들이 그 구간에 붙인 설명이 "어느 환경에서는 로봇이 할 수 있지만 오늘의 역량으로는 규모 있게 자동화할 수 없다"이다. 74% 안에 이 42%포인트가 들어 있다.
다만 이 42%포인트는 74%와 같은 종류의 판정이 아니다. 장애 요인 분류는 노출 등급과 따로 한 번 더 돌린 것이고, 묻는 질문도 다르다. 오늘 로봇이 하지 않는 작업에 대해서는 먼저 오늘의 기술로 그런 로봇을 만들 수 있는지를 묻고, 만들 수 있다고 보면 비슷한 로봇을 참고해 무엇이 걸림돌이 될지를 판정한다. 그 차이를 보고서가 바로 그 옆에 적어 뒀다. 이 추정치는 노출 지표보다 앞을 더 멀리 내다보는 대신 오늘의 로봇에는 덜 기대고 있다는 것이다. 그러니 두 민감도를 나란히 놓을 때 앞의 24%포인트와 뒤의 42%포인트는 무게가 같지 않다.
판정을 떠받친 근거의 성숙도도 공개돼 있다. 출처 56,933건 가운데 실제 배치 사례가 36.7%, 상업 판매 주장이 45.2%, 시연이 18.1%다. 가장 큰 덩어리가 "팔고 있다"는 주장이라는 사실은 그 자체로 결함이 아니다. 다만 "깔려 있다"와 "팔고 있다"가 다른 종류의 증거라는 점은 4절에서 다시 만난다.
3.2부등호 하나까지 밖에서 되짚을 수 있었다
작업 등급은 사례별 등급을 가중 다수결로 모아 정한다. 부록 A.3이 그 식을 적는데, 산문과 수식 모두 "가중치 기준 절반 이상"이라고 쓴다. 그런데 데이터를 실제로 만든 부록 F의 프롬프트는 같은 규칙을 "100점 가운데 50점을 넘게"라고 쓴다. 이상과 초과, 부등호 하나가 다르다.
데이터가 어느 쪽을 따랐는지는 세어 보면 나온다. 공개된 7,594개 물리 작업에 "절반 이상"으로 식을 구현하면 48개(0.6%)가 공표 등급과 어긋나고, 그 48건은 전수가 가중치 합이 정확히 50.0인 동점이다. 부등호를 "초과"로 바꾸면 7,594건이 전수 일치한다. 즉 데이터는 프롬프트를 따랐고, 어긋난 쪽은 방법 서술 문장이다.
이 발견의 값은 크기가 아니라 종류다. 0.6%는 공표된 비중에 영향을 주지 않는다. 중요한 것은 프롬프트 전문과 작업 단위 데이터가 함께 공개됐기 때문에 외부에서 저자들이 실제로 쓴 부등호까지 특정할 수 있었다는 사실이다. 수작업 보정의 흔적이 아니라 부등호 하나로 전부 설명된다는 것도 같이 확인됐다. 이 대목은 재현 가능성의 증거로 읽어야 한다.
3.3원격 지원을 가르는 선은 공개된 칸에 없다
로봇이 사람의 조종을 받는 경우를 이 보고서는 어떻게 다루는가. 본문은 로봇이 "대체로" 사람의 통제 없이 움직여야 한다고 적고, 부록 F의 수행 조건은 더 정확하다. 간헐적인 원격 지원은 허용하고 연속적인 원격조작이나 단계별 스크립트 조종은 불허한다. 선이 "간헐이냐 연속이냐"에 그어져 있다.
공개 데이터셋에서 그 선을 확인하려고 하면 막힌다. 출처마다 붙은 자율성 표시는 자율·원격조작·불명 세 값뿐이고, 어느 값도 "간헐"과 "연속"을 가르지 않는다. 인용문은 앞 다섯 낱말에서 잘려 있어 56,758건, 전체의 99.7%가 여섯 어절이다. 그런데 노출 작업의 23.6%는 등급을 결정한 근거 안에 원격조작 또는 자율성 불명으로 표시된 출처가 끼어 있다. 시간 비중으로 세도 23.8%로 거의 같다.
이 숫자는 저자들이 자기 기준을 어겼다는 뜻이 아니다. 기준은 간헐 지원을 허용하므로, 원격 지원이 붙은 출처가 근거에 들어 있다는 사실만으로는 위반이 아니다. 그래도 하나가 남는다. 그 판정이 기준의 어느 쪽인지를 외부에서 가를 수 없다.
공개된 칸 밖에도 빈자리가 하나 있다. 부록 F의 세 프롬프트가 모두 같은 문장을 담는다. "당신의 평가는 경제 연구에 쓰이며 인간 검토자의 감사를 받는다." 그런데 부록 A부터 F까지를 전수로 훑으면 평가자 간 일치도를 뜻하는 용어가 한 번도 나오지 않는다. 카파 계수도, 반복 실행도, 온도나 시드 설정도 적혀 있지 않다. 부록 A.2에 있는 검증은 작업을 물리·인지·대인으로 가른 분류 축을 노동통계국 직업요건조사와 맞댄 것이고, 상관은 각각 0.76, 0.89, 0.78로 좋다. 다만 그것은 노출 등급 자체의 일치도가 아니다. 감사를 하겠다고 모델에게 적었고, 감사의 결과는 독자에게 적지 않았다.
3.4채점자를 바꾼 실험은 다섯 달 앞서 있었다
"같은 프롬프트를 다른 모델로 돌리면 어떻게 되는가"는 보통 답이 없는 질문이다. 이번에는 답이 있다. 2026년 4월, 전미경제연구소 워킹페이퍼 35110번으로 나온 논문이 같은 직업 데이터베이스의 같은 작업에 같은 채점표 문구를 쓰고 모델만 바꿔 돌렸다. 대상은 로봇이 아니라 언어모델 노출이지만, 모델에게 작업 서술문을 읽혀 등급을 매긴다는 방법은 이 보고서와 같은 종류다.
| 무엇을 쟀나 | 값 |
|---|---|
| 모델 간 작업 단위 판정 일치율 | 56.9~73% (카파 0.36~0.56) |
| 직업 평균 노출의 모델 간 격차 | 3.6배 (0.14에서 0.51까지) |
| 불일치의 방향 | 한 모델이 노출로 본 작업 2,728개를 다른 모델은 미노출로 봤고, 반대 방향은 56개뿐 |
| 그 라벨을 쓴 하류 회귀 | 개인 단위 계수가 2.4배 벌어지고, 지역 단위는 부호가 뒤집힘 |
| 같은 모델을 세 번 돌렸을 때 | 90.8~99.0% (카파 0.85~0.98) |
Yin, Vu, Persico (2026), 전미경제연구소 워킹페이퍼 35110. 마지막 행은 같은 논문 부록 표 A2의 값으로, 온도를 0으로 고정하고 세 번 반복 실행한 결과다.
마지막 줄이 결정적이다. 깨지는 쪽은 반복이 아니라 모델이다. 같은 모델을 세 번 돌리면 판정이 거의 그대로 나오고, 모델을 바꾸면 절반 가까이가 갈린다. 그리고 불일치가 양방향으로 상쇄되지 않는다는 점, 즉 한쪽 모델이 체계적으로 더 후하게 매긴다는 점이 함께 보고됐다. 앤트로픽은 둘 중 어느 쪽도 재지 않았다. 설령 나중에 "반복 실행이 안정적이다"를 내놓더라도, 그것은 이 문헌이 이미 문제가 아닌 쪽으로 판정한 지표다.
판본은 반드시 같이 적어야 한다. 그 논문이 쓴 것은 클로드 4.5이고 이 보고서가 쓴 것은 클로드 오푸스 5다. 같은 모델이 아니므로 "앤트로픽의 등급도 저만큼 흔들린다"고 단정할 수 없다. 다만 그 비교에서 노출을 가장 높게 본 채점자가 클로드 계열이었다는 사실은 그대로 적어도 된다.
더 가까운 증거가 보고서 안에도 있다. 이 연구는 언어모델 노출 지표를 엘라운두 등의 2024년 연구에서 가져오는데, 그 연구의 공개 파일에는 인간 평가자 열과 모델 평가자 열이 나란히 있고 앤트로픽은 모델 열을 골랐다. 그리고 본문 각주 46이 두 열의 차이를 직접 인용한다. 컴퓨터 프로그래머는 인간 평가자 기준 25위인데 모델 평가자 기준 6위이고, 시인과 작사가는 11위와 14위다. 페블러스가 그 공개 파일로 923개 직업을 다시 세어 보면 각주의 사례는 예외가 아니다. 모델 평가자가 직업 평균 노출을 인간보다 8.6%포인트 높게 매겼고, 순위가 100위 이상 어긋난 직업이 310개로 전체의 3분의 1이다.
엘라운두 쪽 원문을 열면 또 하나가 보인다. 그 연구는 인간과 모델의 일치율을 65.6%에서 82.1%까지 표로 내놨고, 같은 모델에 채점표 문구만 바꿔 돌렸을 때 라벨의 24%가 뒤집힌다는 것도 적었으며, "인간 주석자의 결과를 주 결과로 제시한다"고 명시했다. 그 연구의 채점표에는 "작업 시간을 최소 절반(50%) 줄인다"는 수치 임계까지 있었다. 계보에서 사라진 것이 숫자다.
3.5계보 전체가 채워 온 칸 하나가 비었다
직업 노출 지표는 10년 넘게 쌓인 계보가 있고, 그 계보는 "라벨을 누가 어떻게 믿을 수 있게 만들었나"를 저마다 수치로 내 왔다. 아래 표가 그 칸이다.
| 연구 | 라벨을 누가 만들었나 | 채점자 검증 수치 |
|---|---|---|
| 프레이·오즈번 (2013/2017) | 연구자 70개 직업 수작업 뒤 분류기 | 반분 교차검증 100회, 곡선 아래 넓이 0.894 |
| 웹 (2020) | 사람 없음, 특허와 직업 서술문의 결정론적 중첩 | 채점자가 없어 역사 실증으로 점검 |
| 엘라운두 등 (2023/2024) | 인간 + GPT-4 | 인간과 모델, 모델과 모델 일치율 65.6~91.1% |
| 콜롬보 등 (2025, 피어리뷰) | 오픈 가중치 7B급 모델 3개 | 세 모델 합의도 공개, 사람 3명 동의 71~75% |
| 샬 (2025) | 모델 3개 | 모델 간 상관 0.60~0.81 |
| Yin 등 (2026) | 모델 3개 | 일치율·카파·반복 실행·하류 회귀 |
| 이 보고서 (2026) | 클로드 오푸스 5 단독 | 노출 등급의 일치도·안정성·교차검증 없음 |
마지막 행의 부록 A.2 검증은 작업 분류 축을 직업요건조사와 맞댄 것이고, 노출 등급 자체의 재현성은 보고되지 않았다.
콜롬보 등의 자리가 특히 눈에 걸린다. 자원이 훨씬 적은 학계 팀이 7B급 오픈 가중치 모델 셋으로 모델 다중화와 보수적 집계와 합의도 공개와 사람 세 명의 검증을 전부 했고, 그 선택의 이유를 "이 연구의 재현 가능성을 보장하기 위해"라고 적었다. 모델을 여럿 쓰는 일이 큰 회사만 할 수 있는 일은 아니라는 뜻이다.
빈칸의 가격도 숫자로 나와 있다. 앤트로픽이 자기 부록 각주 10에 인용한 러드윅·멀레이너선·람바찬의 논문이 그 답을 적었다. 그 논문은 언어모델 활용을 둘로 가른다. 예측 문제의 조건은 학습 누출이 없을 것이고, 경제 개념의 측정을 자동화해 하류 분석에 넣는 추정 문제의 조건은 검증 표본이다. 앤트로픽이 인용한 것은 앞쪽이고 앤트로픽이 한 일은 뒤쪽이다. 그 논문의 모의실험은 모델 라벨을 보정 없이 회귀에 넣으면 명목 95% 신뢰구간의 실제 포함률이 크게 무너지고, 전체 라벨의 5%만 사람이 다시 달면 제자리로 돌아온다고 보고한다.
물리 작업 7,594개의 5%는 약 380개다. 프롬프트가 세 번 약속한 인간 검토자의 감사를 380건만 실제로 수행해 일치율을 적었다면, 이 숫자의 지위가 달라졌을 것이다. 다만 여기서 더 밀고 나갈 수는 없다. 모의실험의 설정과 이 보고서의 설계가 같지 않으므로, 쓸 수 있는 문장은 "명목 95%가 실제 95%라는 보장이 없다"까지다.
3.6"할 수 있다"에는 조건이 있고 숫자가 없다
수행 가능의 기준이 아예 없는 것은 아니다. 부록 F의 프롬프트는 "사례를 완수한다"를 세 조건으로 이름 붙여 규정한다. 하위 단계가 아니라 사례 전체를 처음부터 받아들여지는 산출물까지 끝낼 것, 고용주가 그 노동자의 산출물 대신 받아들일 품질일 것, 그리고 자율로 동작할 것. 조건은 글로 또렷이 적혀 있다. 없는 것은 숫자다. 성공률 몇 퍼센트 이상인지, 몇 번 시도해 본 값인지, 사람이 몇 번까지 끼어들어도 되는지, 교란이 들어와도 되는지, 사람보다 몇 배까지 느려도 되는지. 다섯 칸이 비어 있다.
그렇다고 학계가 그 자리에 늘 숫자를 넣어 온 것도 아니다. 로보틱스 쪽의 대표적인 조작 벤치마크도 성공의 정의만 주고 시행 횟수는 정하지 않는다. 국제표준화기구의 로봇 용어 표준은 자율성을 계량하는 지표가 의료 전기기기 쪽에만 존재한다고 표준 스스로 적어 두었고, 자동차 자율주행 등급은 "사양을 제공하지 않는다"고 세 번 명시하는 설계 의도 분류다. 숫자를 붙인 선례로 확인된 것은 2007년 미국 표준기술연구소 문서 하나인데, 거기서는 중간 자율 등급을 "운용자 입력에 약 50% 의존"으로 정의했다. 앤트로픽의 "간헐적 원격 지원은 허용한다"는 2007년에 숫자로 채워졌던 자리를 2026년에 다시 비운 셈이다.
비어 있는 칸 가운데 하나는 보고서 자신의 인용과 부딪힌다. 수행 조건에는 "사례의 목적에 맞게 제때 내놓을 것"이 들어 있다. 그런데 이 보고서가 세 번 인용한 에포크 AI의 분석이 로봇은 사람보다 3배에서 10배 느리다고 적고, 본문 각주 43은 청소 로봇이 "사람보다 최대 10배 느리다"고 스스로 적는다. 속도를 기준에 적어 넣고, 속도 미달을 등급에서 깎지 않았다. 증거 요건이 한쪽으로만 기울어 있다는 점도 같은 종류의 설계 사실이다. 부록 F.3은 할 수 있다고 판정하려면 증거를 최소 한 건 인용하라고 요구하면서, 못 한다는 판정에는 증거를 요구하지 않는다.
검증된 것은 공장 안이고 새 소식은 창고와 도로다
이 보고서에는 깎을 데 없는 실증이 하나 들어 있다. 50년치 과거 자료로 "노출 등급이 높았던 직업에 실제로 무슨 일이 일어났는가"를 검정한 부록 B다. 먼저 그 실증을 제대로 소개한다. 그다음은 저자들이 스스로 그어 둔 사정거리다. 그 선을 그은 쪽이 보고서 자신이라는 점이 중요하다.
4.150년 백테스트는 제대로 된 실증이다
저자들은 1977·1991·2002·2008·2026년 다섯 시점의 직업 서술문에 같은 등급 판정을 돌려 과거 노출도를 만들고, 약 300개의 일관된 직업을 20년짜리 구간 세 개로 추적했다. 결과는 분명하다. 모든 작업이 노출된 직업은 20년 뒤 임금이 7.1% 낮고(95% 신뢰구간 5.4~8.9%), 고용은 34.2% 줄었다(신뢰구간 16.4~52.0%). 1977년 노출도가 1970년대 임금에는 아무 효과가 없다는 위약 검정을 통과했고, 특허 기반의 다른 노출 지표와 같이 넣어도, 숙련과 해외이전과 노조율을 통제해도 효과가 남는다.
사례 하나가 숫자보다 설득력이 있다. 1991년 기준 노출 상위 5%였던 기계 조작공은 모터차량 부문에서 1990년 약 10만 명에서 2012년 약 5만 명으로 반 토막 났다. 같은 산업에서 노출이 4분의 1 수준이던 산업기계 수리공은 고용이 50% 늘었고, 거의 노출되지 않은 생산 감독자도 10% 늘었다. 이 지표가 아무것이나 가리키지 않는다는 증거다.
4.2그 실증의 사정거리를 저자들이 그었다
부록 B.3의 마지막 단락이 이 보고서에서 가장 정직한 문장이다.
검증된 것은 공장 안이고, 이 연구가 새로 말하는 것은 창고와 도로다. 그리고 그 사정거리는 이 연구가 낸 숫자 안에서도 확인된다. 앞서 본 고용 34.2% 감소는 세 구간을 똑같이 가중한 평균인데, 구간별로 보면 고용 효과가 1980~2000년의 50%에서 그 이후 구간의 25% 안팎으로 줄었다. 저자들이 붙인 이유가 결정적이다. 노출 집합이 "서비스직 같은 새로운 종류의 일자리"로 넓어졌기 때문이라는 것이다. 1977년에는 노출 직업의 절반이 근무시간의 95% 이상을 물리 작업에 썼는데 2002년에는 그런 직업이 24%뿐이다. 노출 집합이 공장스러움에서 멀어질수록 계수가 작아졌고, E2와 E3는 정확히 그 방향으로 더 멀리 간 집합이다.
한 겹 더 있다. 로봇과 고용을 다룬 경제학 실증의 정본인 애쓰모글루와 레스트레포의 2020년 연구가 쓴 국제로봇연맹 집계는 용도가 하나로 고정된 기계를 명시적으로 뺀다. 그 제외 예시가 하필 "자동 창고의 보관·반출 설비"다. 앤트로픽이 E2의 대표 예로 든 물류 창고가 역사 데이터 인프라에서는 아예 세어진 적이 없다는 뜻이다. 그 연구가 보고한 효과는 노동자 1,000명당 로봇이 한 대 늘 때 고용인구비율 0.2%포인트, 임금 0.42% 하락이다. 부록 B.3의 단서 한 줄은 이 보고서만의 한계가 아니라 이 분야 데이터 인프라 전체의 한계이기도 하다.
4.3정돈되지 않은 환경의 작업 105개를 전수로 열어 보면
새 소식에 해당하는 칸이 실제로 얼마나 큰지는 세어 볼 수 있다. 공개 데이터셋에서 E3로 판정된 작업은 105개다. 물리 작업 7,594개의 1.4%이고, 전체 작업으로는 0.56%다. 보고서 본문은 이 칸을 "주로 운전"이라고 요약했는데, 작업 개수로 보면 그렇지 않다. 105개 중 80개, 그러니까 76%는 운전과 무관하다. 벽돌 쌓기, 벽면 마감, 포장·다짐 기계 조작, 농지 데이터 수집, 공사 현장 점검, 산림 매핑처럼 야외 현장 작업 전반이 섞여 있다. 다만 시간 비중으로 가중하면 상위 네 자리를 택시·트럭·셔틀 운전이 차지해 운전 비중이 39.7%로 올라간다. 요약도 절반은 맞는 셈이다.
이 칸을 떠받치는 회사는 소수에 몰려 있다. E3 작업에 인용된 고유 출처 973건에서 고유 시스템 이름이 803개, 개발사가 535개로 다양해 보이지만, 인용 빈도로 세면 웨이모 한 회사가 105개 작업 중 31개에 이름을 올린다. 그리고 가장 노출이 높다는 이 등급에서도 105개 중 6개는 실제 배치라 부를 근거가 하나도 없고, 전부 상업 판매 주장이나 시연에 기대고 있다.
4.4청소부 한 사람의 하루에서 이 방법이 어디서 맞고 어디서 비는가
추상적인 방법론 이야기를 사람의 일로 내려 보려면 직업 하나를 골라 작업 단위로 열어 보면 된다. 청소·관리직이 좋은 사례다. 근무시간의 큰 몫을 차지하는 세 작업이 서로 다른 등급을 받았고, 공개 데이터셋에서 각 판정에 인용된 로봇의 실명을 읽을 수 있다.
| 작업 | 근무시간 | 등급 | 실제 상용 제품 | 모형의 비용 판정 |
|---|---|---|---|---|
| 바닥 청소 | 27.3% | E2 | 있다 (테넌트·아비드봇·소프트뱅크·가우시움) | 사람보다 40% 비쌈 |
| 쓰레기 수거 | 15.2% | E1 | 없다 | 사람의 15배 |
| 화장실 청소 | 16.7% | E0 | 스타트업 세 곳이 인용됨 | 못 한다 |
공개 데이터셋의 해당 작업 출처 필드에서 기계 이름을 읽어 확인한 것이다. 통계를 다시 센 값은 여기 없다.
첫 줄에서 이 방법은 정확하다. 바닥 청소 로봇은 실제로 팔린다. 보고서의 "사람보다 40% 비싸다"를 청소·관리직 중위 총보수와 그 작업의 시간 비중으로 환산하면 연 1만 6,800달러쯤이 되는데, 이 값은 상용 바닥 청소 로봇의 실제 총소유비용 구간인 1만 3,500~2만 1,900달러의 한가운데에 떨어진다. 구독형으로 빌리면 오히려 모형보다 싸다. 현장 가격으로 검증할 수 있는 유일한 작업에서 이 연구의 비용 추정은 맞는다.
둘째 줄이 다르다. "쓰레기를 모아 비운다"는 작업에 인용된 출처 아홉 건을 전부 열어 보면, 건물을 돌며 휴지통을 비우는 로봇은 하나도 없다. 재활용 선별장 컨베이어 위의 폐기물 선별 로봇팔, 포장 라인의 비닐봉투 삽입기, 폐기물 컨테이너를 옮기는 이동 베이스, 병원 물품 배송 카트, 화장실 스크러버, 잔디밭의 쓰레기 줍는 야외 기계, 그리고 시연 둘이다. 그러니까 "사람의 15배"는 비싼 쓰레기 로봇을 재어 나온 값이 아니다. 그런 로봇이 없어서 가장 가까운 기계의 가격이 들어간 값이다.
그래도 오류는 아니다. 저자들은 이 작업을 E1으로 매겼고, 재활용 선별장은 정확히 E1 환경이다. 등급 판정은 증거와 일치한다. 게다가 데이터셋을 공개해 누구나 그 아홉 건을 확인할 수 있게 해 두었다. 일어난 일은 이렇다. 모형은 "이 일을 하는 로봇은 전용 시설 안에만 있고 열다섯 배 비싸다"고 정직하게 답했고, 그 답이 기사 제목으로 옮겨지면서 "로봇이 청소부 일을 할 수 있다"가 됐다.
셋째 줄은 반대 방향의 증거다. 화장실 청소에는 상업 판매를 주장하는 스타트업 셋이 인용됐는데도 등급이 E0, 즉 못 한다로 떨어졌다. 벤더 자료가 있다고 무조건 노출로 넘기지 않았다는 뜻이고, 가중 다수결이 보수적으로 작동한 자리다. 세 줄을 함께 보면 이 방법의 성질이 드러난다. 제품이 양산되는 자리에서는 현장 가격과 맞고, 제품이 없는 자리에서는 가장 가까운 산업 설비의 가격을 대신 적는다. 문제는 방법이 아니라, 그 두 자리가 74% 안에서 구분되지 않는다는 데 있다. 그리고 그 구분은 등급과 공개 데이터셋에 이미 들어 있다.
4.5이름이 불린 로봇과 실제로 깔린 로봇
보고서가 본문에서 이름을 댄 사례들을 설치 실적과 맞대 보면 다른 그림이 나온다. 아마존의 선반 적재 로봇은 두 곳에 들어가 있고 회사의 동사는 "배치할 계획"이다. 아마존 로봇 100만 대라는 수치의 출처는 아마존이 아니라 언론 보도이고, 그 수치가 세는 로봇의 정의는 공개된 적이 없으며 15개월째 갱신도 없다. 보스턴 다이내믹스의 창고 로봇은 인용 근거가 제품 페이지이고, 공개 기록상 확정된 설치 수량은 유럽 유통업체 한 곳의 22대뿐이다. 자동차 공장 사례로 든 휴머노이드는 양쪽 회사가 모두 단수로 적는 한 대였고, 집기 작업 하나를 10개월 동안 했다.
규모를 한 줄로 세우면 이렇다. 국제로봇연맹 공식 통계로 2025년 산업용 로봇 설치는 60만 3,307대이고, 같은 통계에서 풀사이즈 휴머노이드 판매는 7,000대다. 86대 대 1대다. 그 7,000대를 174개 제조사가 나눠 만들었으니 회사당 40대꼴이다. 같은 연맹이 휴머노이드를 두고 "실험실에서 파일럿으로 넘어가는 문턱에 아직 서 있다"고 적었다. 감사받은 숫자를 찾으면 더 작아진다. 어질리티 로보틱스의 2025 회계연도 총매출은 증권 제출 서류 기준 178만 달러이고, 테슬라의 분기 설비능력 표에서 옵티머스 연간 설치능력 칸은 줄표로 비어 있다.
한 가지 구조적 성질이 여기 깔려 있다. 출시 발표는 영구히 검색되고, 조용한 종료는 검색되지 않는다. 아마존이 대표작으로 공개한 로봇 작업 셀은 넉 달 뒤 편집자 주로 "더는 사용하지 않는다"고 표시됐다. 웹 검색으로 로봇 능력을 모으는 방법에는 이 비대칭이 구조적으로 깔린다. 다만 그 사례가 이 데이터셋에 실제로 들어갔는지는 수집 시점과의 선후를 확인하지 못했으므로, 여기서 확인된 것은 구조뿐이다.
그런데 이 설치 실적으로 "74%가 틀렸다"를 말하면 안 된다. 74% 가운데 50%포인트는 공장 전용 환경을 전제한 칸이고, 도로 같은 환경의 칸은 물리 작업의 2%다. 그리고 이 연구의 짝 수치, 그러니까 비용 경쟁력 있는 작업이 0.3%이고 그것이 10%에 닿기까지 약 40년이 걸린다는 추정이 위의 설치 실적과 정확히 맞는다. 어긋나는 것은 연구가 아니라 그 수치만 옮긴 요약이다.
2085년과 2050년 사이
두 날짜는 같은 연구에서 나왔다. 둘을 가르는 것은 세계관이 아니라 두 개의 숫자다. 가격이 얼마나 빨리 떨어지는가, 그리고 로봇이 못 하던 일을 얼마나 빨리 하게 되는가. 두 숫자 모두 근거가 공개돼 있어, 그 근거가 어디까지 버티는지 확인할 수 있다.
5.1두 날짜는 가격 하락과 역량 확장을 함께 돌린 값이다
2085년은 "가격이 해마다 3%씩 떨어질 때"의 값이 아니다. 본문의 해당 문단은 역량 확장을 먼저 깔고 가격 하락을 더한다. 1977년에 로봇이 못 하던 물리 작업이 62%였는데 오늘의 로봇은 그중 대부분을 하게 됐고, 평균을 내면 해마다 2%씩 새로 할 수 있게 된 셈이다. 저자들의 문장은 "여기에 연 3%의 비용 하락을 더하면" 물리 작업 절반이 비용 경쟁력에 닿는 해가 2085년이라는 것이다. 급속 시나리오는 그 두 축을 같이 올린다. 품질을 보정한 비용이 최대 네 배 빨리 떨어지고, 로봇이 새 작업을 할 수 있게 되는 속도가 두 배 빨라지는 경우다.
| 가정 | 기준 시나리오 | 급속 시나리오 |
|---|---|---|
| 비용 하락 | 총 배치비용 연 3% | 하드웨어 연 12%, 나머지 연 6% |
| 역량 확장 | 미노출 작업이 해마다 2%포인트씩 노출로 | 해마다 4%포인트씩 |
| 작업 10%가 경쟁력에 도달 | 2060년대 (본문 표현으로 "약 40년") | 약 2040년 |
| 물리 작업 절반 | 2085년 | 2050년 |
| 청소·관리직 | 2095년 | 2050년대 |
부록 E와 본문에서 옮긴 값이다. 급속 시나리오에서도 오늘의 물리 작업 90%를 자동화하는 데는 53년이 걸린다고 본문이 적는다.
공개된 보조 계산은 그대로 재현된다. 연 3% 하락으로 20% 하락에 닿기까지 약 7년, 70% 하락까지 약 40년이라는 값은 단순 복리식으로 정확히 나온다. 재현되지 않는 것은 두 도달 연도 쪽이다. 작업마다 로봇 비용과 인건비의 격차가 어떻게 분포하는지, 그리고 역량 확장이 어느 작업을 먼저 집어 가는지가 공개되지 않았기 때문이다. 이 글은 공표값을 그대로 쓰되, 독립 재현이 안 된다는 사실을 함께 적는다.
저자들도 이 지점에 단서를 달았다. 시나리오가 모든 작업에 같은 하락률과 같은 역량 증가율을 일률로 적용하므로, 작업들은 오늘의 비용 순위 그대로 경쟁력을 얻는다는 것이다. 그리고 현실은 그렇지 않을 수 있다는 비유를 직접 든다. 휴머노이드 시연은 가사노동을 보여 주는데 제조사는 자기 공장에 쓸모 있는 작업을 먼저 고를 수 있다는 것, AI 회사들이 코딩 에이전트를 먼저 챙긴 것처럼 말이다.
그 단서 바로 다음 문장이 두 시나리오를 한 줄로 묶는다. 급속 쪽을 어떤 조건으로 읽어야 하는지가 거기 적혀 있다.
두 가지가 이 문장에 들어 있다. 급속 시나리오가 요구하는 가격 하락을 저자들 스스로 "기록적"이라 불렀다는 것이 하나다. 그 근거를 아래에서 하나씩 열어 보기 전에 그 표현부터 옮겨 두는 편이 공정하다. 다른 하나는 비용 전망이 선호와 규제와 임금 되먹임을 빼고 돌아간다는 고백이다. 규제에 걸린 작업이 14%라고 적은 연구가, 도달 연도를 낼 때는 그 14%를 셈에 넣지 않았다.
5.2연 12%를 떠받치는 기둥은 하나다
아래에 나오는 반론의 재료는 전부 저자들이 각주에 써 둔 것이다. 숨긴 것이 없다. 논점은 그 각주가 기사 머리에서 사라졌다는 데 있다.
2050년은 하드웨어 가격이 해마다 12%씩 떨어진다는 가정 하나에 매달려 있다. 그 가정의 역사적 근거로 부록 각주 49가 든 것은 국제로봇연맹이 1990년부터 2005년까지 만든 품질조정 가격지수, 단 하나다. 그 지수에는 다섯 겹의 단서가 붙는다.
| # | 단서 | 확인된 내용 |
|---|---|---|
| 1 | 지수가 끊겼다 | 정가 기반 가격지수는 2005년에 멈췄고 다시 만들어지지 않았다. 지난 21년 동안 이 가정을 확인하거나 반증할 지수가 없다 |
| 2 | 기준연도 3년에 절반이 움직인다 | 1990~2005년은 연 10.2% 하락인데, 앤트로픽이 인용한 그 논문 본문이 1993~2005년으로 좁히면 하락폭이 15년 동안 50% 안팎이라고 적는다. 연율로 바꾸면 5.6%다 |
| 3 | 품질의 20%가 컴퓨터다 | 연맹의 품질조정 방법은 로봇 한계비용의 20%를 제어장치, 곧 컴퓨터로 본다. 각주 47에서 "로봇은 컴퓨터보다 자동차에 가깝다"며 배제한 바로 그 곡선이 급속 시나리오의 근거 지수 안에 가중치 20%로 들어 있다 |
| 4 | 표본이 작고 정가다 | 해마다 10개 모델을 추적한 값이고, 모은 것은 실제 거래가가 아니라 정가이며, 대상국은 여섯 나라다 |
| 5 | 같은 기간 다른 지수는 다르게 말한다 | 각주 49 자신이 적는다. 일본은행의 품질조정 지수는 같은 기간에 연 3%만 떨어졌다 |
1·2·4번은 앤트로픽이 인용한 그래츠·마이클스 논문의 본문과 온라인 부록에서, 3번은 연맹의 방법론 해설에서, 5번은 앤트로픽 각주 49 자체에서 확인했다. 두 번째 줄의 연율은 논문 축자에서 역산한 값이다.
다섯째 줄을 다시 읽어 보자. 같은 기간, 같은 종류의 기계를 잰 두 지수가 연 10.2%와 연 3%로 갈린다. 앤트로픽은 큰 쪽을 골랐고, 그 선택을 각주에 밝혔다. 밝혔다는 점은 평가할 대목이고, 급속 시나리오 전체가 그 선택 위에 서 있다는 점은 짚을 대목이다. 한 회사 안에서 두 시나리오가 서로 다른 답을 깔고 있다는 사실도 함께 봐야 한다. 기준 시나리오의 연 3%는 "로봇은 컴퓨터보다 자동차에 가깝다"는 판단에서 나왔고, 급속 시나리오의 연 12%는 품질의 5분의 1을 컴퓨터 물가에서 가져오는 지수에서 나왔다. 모순이라 부를 일은 아니다. 시나리오는 원래 다른 세계를 그린다. 다만 두 시나리오는 로봇이 어떤 종류의 재화인지에 서로 다른 답을 깔고 있고, 저자들은 기준 쪽에만 그 답을 적어 뒀다.
5.3연 3%는 이미 "로봇이 태양광만큼 잘 배운다"는 값이다
가격이 떨어지는 이유를 학습곡선으로 보면 두 시나리오의 거리가 더 선명해진다. 누적 생산량이 두 배가 될 때마다 단가가 일정 비율 떨어진다는 경험칙인데, 태양광 모듈이 그 비율을 20% 안팎으로 보여 준 대표 사례다. 이 연구 발표 엿새 전에 나온 국제로봇연맹의 2026년 집계로 전 세계 산업용 로봇 가동 대수는 507만 9,000대로 1년 사이 9% 늘었고, 연간 설치는 60만 3,307대로 11.2% 늘었다.
이 둘을 학습곡선 식에 넣어 보면 결과가 흥미롭다. 태양광급 학습률 20%를 실제 물량 증가율 9%에 얹으면 연 2.7% 하락이 나온다. 거의 정확히 기준 시나리오의 3%다. 다시 말해 연 3%는 보수적인 숫자가 아니라 이미 "로봇 산업이 태양광만큼 잘 배운다"를 가정한 값이다. 그렇다면 연 12%를 유지하려면 무엇이 필요한가. 학습률 20%에서는 누적 물량이 해마다 48.7%씩, 가장 관대한 35%를 잡아도 22.8%씩 늘어야 한다. 실제는 9%이고, 연맹 자신의 2029년 전망도 연 7.2%다. 연 12%를 24년 유지하면 하드웨어 값은 21분의 1이 된다.
전례가 아예 없지는 않다. 태양광 모듈, 반도체, 배터리에는 있었다. 공통 조건은 모듈화된 동일 제품의 대량생산과 누적 물량의 복리 증가다. 반면 신차 가격은 품질을 보정해도 1990년부터 2019년까지 거의 평평했다. 그리고 태양광조차 매끈하지 않았다. 2005년부터 2009년까지 정체했고, 2021년부터 2023년까지는 오히려 올랐다. "50년 평균 연 10% 하락"은 두 번의 정체와 한 번의 역주행을 뭉갠 값이다.
가장 최근의 실측은 반대 방향을 가리킨다. 북미 자동화 협회 집계로 2025년 로봇 주문은 3만 6,766대에 22억 5,000만 달러로, 대수는 6.6% 늘고 금액은 10.1% 늘었다. 대당 평균 단가가 3.3% 오른 셈이다. 앤트로픽 각주 47도 "최근 몇 년 사이 가격이 올랐다"고 스스로 적는다. 다만 이 수치는 품질을 보정한 지수가 아니므로 연 12%의 반증으로 쓸 수는 없다. 이 수치가 말해 주는 것은 연 12%를 뒷받침할 최근 측정이 없다는 사실뿐이다.
5.42050년까지 가는 전망만 추리면 숫자가 모인다
각주 49는 투자은행 전망 셋을 근거로 든다. 앤트로픽이 그것을 "시장 전망의 빠른 쪽 끝"이라고 적은 것은 맞다. 문제는 다른 데 있다. 그 셋을 도달 시점별로 갈라 놓으면 모양이 달라진다.
| 전망 | 연 하락률 | 전망이 닿는 지평 |
|---|---|---|
| 뱅크오브아메리카 | 13.5% → 9.4% | 2030년, 길어야 2035년에서 끝난다. 부품 원가 기준이고 중국 생산을 전제한다 |
| UBS | 5.8% | 2045~2050년 (1차 확인 실패, 보도 경유) |
| 모건스탠리 | 5.2% | 2050년 (1차 확인 실패, 보도 경유) |
| 앤트로픽 급속 시나리오 | 12.0% | 2050년 |
뱅크오브아메리카 값은 2026년 3월 보고서 원문에서 확인했다. 앤트로픽 각주가 인용한 것은 같은 기관의 2025년 문서이고 그쪽은 이미지 전용 파일이라 열지 못했으므로, 확인된 사실은 2026년 3월 보고서의 수치가 각주의 "약 13%·약 9%"를 재현한다는 데까지다. UBS와 모건스탠리 값은 1차 문서를 확인하지 못해 전망으로만 적는다.
2050년까지 닿는 두 전망이 말하는 값은 연 5.2%에서 5.8% 사이다. 앤트로픽 가정의 절반이 채 안 된다. 연 12%에 닿는 유일한 전망은 2035년에서 끝나고 그 안에서도 감속한다. 그리고 조용한 수렴점이 하나 있다. 앞 절에서 기준연도를 세 해 옮겨 다시 잰 값인 연 5.6%가, 2050년까지 가는 두 전망의 구간과 같은 자리에서 만난다.
그러니까 여기서 "2050년은 불가능하다"는 결론이 나오지는 않는다. 2050년은 로봇이 지난 35년 동안 한 번도 보여 준 적 없는 종류의 재화로 변신한다는 가정 위에 서 있고, 그 가정의 유일한 역사적 근거는 21년 전에 끊긴 지수 하나다. 그 뱅크오브아메리카 보고서가 같은 문서에 실은 걸림돌 여섯 가지 가운데 둘은 이 가정에 바로 부딪힌다. 지금의 휴머노이드는 24시간 돌아가는 산업 환경에 쓰기엔 너무 약하고 정비가 많이 든다는 것, 그리고 수리비가 비싸다는 것이다.
5.5비용 가정 네 개도 공장의 세계에서 왔다
비용 쪽 가정은 네 개다. 자본비용 8%, 내구연한 10~12년, 하드웨어가 총비용의 3분의 1, 기술자 한 명이 로봇 다섯 대분을 감독. 먼저 공정하게 적을 것이 있다. 이 넷은 전역 상수로 제시된 것이 아니라 정육 로봇 한 사례의 수치로 나왔고, 외부 근거가 붙은 것은 하드웨어 비중 하나뿐이며, 감독 비율은 부록이 "클로드의 추정"이라고 명시한다. 그리고 계산 자체는 맞는다. 선행투자 28만 5,000달러를 자본비용 8%와 12년으로 연부상환하면 3만 7,818달러가 나와 본문의 "약 3만 8,000달러"와 일치한다.
외부 자료와 맞대 보면 네 가정은 통설에서 크게 벗어나지 않는다. 자본비용 8%는 상장 기계업의 가중평균자본비용 7.7%와 거의 같다. 다만 포장과 정육과 청소를 고용하는 쪽은 상장 대기업이 아니라 중소 사업체이고, 그쪽의 자본비용은 10~15%, 설비대출 금리는 8~18%다. 이 방향은 로봇 비용을 낮게 잡는 쪽이다. 하드웨어 3분의 1은 업계 통설 분포의 한가운데에 있다.
갈리는 것은 내구연한이다. 10~12년은 국제로봇연맹이 가동 대수를 셀 때 쓰는 12년과 맞고, 공장 안의 고정형 로봇에게는 오히려 보수적일 수 있다. 그런데 이 연구가 새로 말하는 칸으로 가면 반대가 된다. 상용 청소 로봇의 수명은 벤더 자료로 5년 안팎이고, 모건스탠리의 휴머노이드 모델은 교체 주기를 6년으로 잡는다. 앤트로픽은 그 모델에서 가격 경로는 가져오고 수명 가정은 가져오지 않았으며, 그 방향 또한 로봇 비용을 낮추는 쪽이다.
그러니 이 연구의 비용 추정을 엉터리로 몰 일은 아니다. 가정들은 산업용 고정 로봇의 세계에서 왔고 그 세계에서는 잘 맞는다. 이 연구가 새로 말하는 것은 창고와 도로인데, 거기서는 같은 가정이 반대 방향으로 틀어진다. 4절의 "검증된 것은 공장 안"과 정확히 같은 이야기다.
페블러스 관심의 이유
여기까지의 이야기는 하나의 모양으로 모인다. 피지컬 AI의 미래를 재려고 최고 수준의 모델에 65만 번 웹 검색을 시켰는데, 결론의 핵심 불확실성은 모델의 추론력이 아니라 입력의 성질에서 나왔다. 페블러스가 이 보고서를 오래 들여다본 이유가 거기 있다.
6.1병목이 데이터라는 명제의 흔적
이 연구는 피지컬 AI의 병목이 데이터라는 명제를 주장으로 말하지 않는다. 그 병목을 재려는 시도가 남긴 흔적으로 보여 준다. 로봇이 현장에서 몇 번 성공하고 몇 번 사람을 불렀는지 센 기록이 없으니, 벤더가 자기 제품을 소개한 문장이 그 자리를 메웠다. 정돈되지 않은 환경의 칸이 물리 작업의 2%에 머무는 것도 같은 자리의 결과로 읽을 수 있다. 그 환경에서 모은 데이터가 적으면 그 환경에서 하는 일을 보여 줄 로봇도 적다.
6.2근거의 등급은 기록했고 판정의 안정성은 기록하지 않았다
데이터 품질 쪽에서 이 연구에서 배울 것은 비판이 아니라 등급 표기다. 저자들은 배치와 상업 주장과 시연을 갈라 기록했고, 비슷한 작업에 기댄 판정에는 그 사유를 따로 적는 칸을 뒀고, 원격조작 여부를 남겼고, 프롬프트 전문과 데이터셋을 공개했다. 그래서 외부에서 민감도를 다시 셀 수 있었고, 심지어 그들이 실제로 쓴 부등호까지 특정할 수 있었다. 근거의 등급을 스키마에 박아 둔 것, 이것이 이 연구의 가장 좋은 부분이다.
한계도 거기 있다. 인용문이 앞 다섯 낱말에서 잘려 독자가 검증할 수 있는 것은 출처의 문장이 아니라 그 문장을 요약한 모델의 주장이다. 판정의 기준선은 간헐 지원과 연속 조작 사이에 그어져 있는데 공개된 칸은 그 선의 어느 쪽인지를 말해 주지 않는다. 프롬프트는 인간 검토자의 감사를 세 번 약속했지만 일치도도 반복 실행의 분산도 보고되지 않았다. 근거의 등급은 기록했고, 판정의 안정성은 기록하지 않았다. 모델이 만든 추정치를 지표로 쓰려면 둘 다 필요하다.
그리고 그 교훈에는 가격표가 붙어 있다. 앤트로픽이 자기 부록 각주에 인용한 논문이 답을 내놨다. 모델이 만든 라벨을 추정에 쓰려면 전체의 5%만 사람이 다시 달아도 신뢰구간이 제자리로 돌아온다. 물리 작업 7,594개의 5%는 약 380개다. 같은 장르에서 피어리뷰를 통과한 연구는 모델을 최소 둘 쓰고 모델 간 합의도를 보고하라는 권고 문장까지 적어 두었다. AI 학습에 쓸 수 있는 데이터의 구체적인 조건이 여기 있다. 모델이 만든 라벨에는 그 라벨의 오차를 잴 작은 사람 표본이 함께 붙어 있어야 한다. 그게 없으면 라벨이 아무리 많아도 하류 추론이 서지 않는다.
6.3내년에 받을 제안서에 물어야 할 세 가지
제조와 물류와 건설 쪽 고객이 내년에 받을 자료는 이 연구의 숫자를 인용할 것이다. "로봇이 우리 작업의 74%를 할 수 있다"는 문장이 내부 보고서에 들어가는 순간 실무자가 물어야 할 것은 세 가지다. 그 74%는 어느 환경을 전제한 수인가, 그리고 우리 작업장을 실제로 다시 지을 계획이 있는가. 그 판정의 근거는 우리 현장에 깔린 로봇인가, 비슷한 작업을 하는 다른 로봇인가. "할 수 있다"가 "우리 라인에서 받아들일 품질로 반복한다"와 같은 뜻인가. 세 질문 모두 이 연구가 자기 부록에 이미 적어 둔 것이고, 데이터 인수 조건을 쓸 때 쓰는 질문과 같은 꼴이다.
6.4비어 있는 자리
구도를 한 줄로 적으면 이렇다. 로봇을 만드는 쪽은 자기 제품이 무엇을 할 수 있는지 적는다. 모델을 만드는 쪽은 그 적힌 글을 읽어 경제를 추정한다. 양쪽 다 성실하게 일했는데, 그 사이에 현장에서 센 값을 넣는 자리가 비어 있다. 통제되지 않은 환경에서 모은 데이터와, 그 데이터가 쓸 만한지 판정하는 기준. 페블러스가 서 있는 자리가 거기다. 비어 있는 자리를 독자가 스스로 보게 하는 편이 결론을 파는 것보다 낫다고 생각해 이 글을 이렇게 썼다.
아직 아무도 하지 않은 일이 하나 남아 있다. 지금까지 채점자 재현성을 잰 연구 다섯 편은 전부 언어모델 노출 지표에 관한 것이고, 로봇 환경 등급 판정을 두 모델로 돌려 본 연구는 확인되지 않았다. 데이터셋 1만 8,796행과 프롬프트 전문이 공개돼 있으니 물리 작업 7,594개의 일부를 다른 모델로 다시 채점해 일치율을 내는 일은 실제로 가능하다. 페블러스가 하겠다는 공표는 아니다. 공개돼 있으니 누구든 할 수 있는 일이 남아 있다는 관찰이다. 통제되지 않은 현장에서 모은 데이터가 왜 다른 종류의 자산인지는 보행보조차 주행 데이터를 다룬 글에서 한 번 정리한 적이 있다.
1절부터 5절까지는 공개된 보고서 본문과 부록, 그리고 공개 데이터셋에서 확인한 것이고, 이 6절은 그 문서들이 하지 않은 이야기다. 나눠서 읽어 주시기 바란다. 본문의 축자 인용은 보고서 본문 PDF와 부록 PDF 원문에서 직접 대조했고, 페블러스가 다시 셌다고 밝힌 값은 공개 데이터셋을 직접 집계한 결과다. 74%와 34%는 고용 가중값이라 공개 파일만으로는 재현되지 않았고, 그 사실을 본문에 함께 적었다. 발표 사흘째인 2026년 10월 3일 현재 이 보고서에 대한 학술적 반박은 확인되지 않았다. 긴 글 읽어 주셔서 감사하다.
참고문헌
출처의 등급이 갈리므로 묶어서 적는다. 첫 묶음은 이 글이 대상으로 삼은 보고서의 1차 자료이고, 본문의 축자 인용과 수치는 전부 여기서 직접 대조했다. 둘째 묶음은 그 보고서가 외부에서 가져온 공공 데이터다. 셋째 묶음은 1차 원문의 본문이나 표를 직접 열어 확인한 학술 문헌이다. 넷째 묶음의 업계 자료는 1차 확인에 성공한 것과 보도를 거친 것을 줄마다 갈라 적었다. "페블러스가 세어 보면"으로 시작하는 본문의 값은 모두 1-4번 데이터셋을 직접 집계한 결과다.
대상 보고서 (1차 원문 대조)
- 1.Russell Legate-Yang, Maxim Massenkoff. "What work can robots do?" Anthropic, 2026년 9월 30일. anthropic.com — 학술지 논문이 아니라 자사 연구 보고서다. arXiv 번호와 DOI, 피어리뷰가 없고 저자들이 제시한 인용 형식도 온라인 문서용이다. 이 글에서 "논문"이 아니라 "보고서"로 부른 이유다.
- 2.같은 연구 본문 PDF(45쪽). 수치 네 개와 등급 비중, 백테스트 결과, 두 시나리오의 도달 연도, 각주 43·46·47·49를 여기서 옮겼다.
- 3.같은 연구 부록 PDF(57쪽, A~F). 이 글 논지의 대부분이 여기 있다. 수행 조건 세 가지와 상한·반사실 규칙은 부록 F, 가중 다수결 식은 A.3, 전이 제외 민감도는 A.4, 42%포인트는 C.2, 백테스트 단서는 B.3, 비용 가정은 D.1이다.
- 4.Anthropic. EconomicIndex / robot_exposure 데이터셋, CC BY 4.0. Hugging Face — 작업 1만 8,796행과 직업 923행. 물리 작업 7,594개, 인용 출처 56,933건, E3 105개, 부등호 재현, 전이 제외 재계산(66.5%→49.3%), 도메인 집계(30.8%), 결정 근거의 원격조작·불명 비중(23.6%)이 전부 이 파일에서 나왔다.
보고서가 쓴 외부 공공 데이터
- 5.O*NET 29.3 Database, 미국 노동부 고용훈련청 / BLS 직업별 고용·임금 통계(OEWS 2025) / BLS 고용주 보수비용 조사(ECEC 2026) / 미국 인구조사국 아메리칸 커뮤니티 서베이 2020~2024 / BLS 직업요건조사(ORS 2023·2025) — 마지막 것이 부록 A.2의 분류 검증 대조 자료다.
교차 확인한 학술 문헌
- 6.Mingyu Yin, Hieu Vu, Claudia Persico. "How (un)Stable Are LLM Occupational Exposure Scores? Evidence from Multi-Model Replication." NBER Working Paper 35110, 2026년 4월. DOI 10.3386/w35110 — 3절의 모델 간 일치율 56.9~73%, 직업 평균 3.6배 격차, 하류 회귀 부호 반전은 초록과 본문에서, 모델 내 반복 90.8~99.0%는 부록 표 A2에서 확인했다. 쓰인 모델은 클로드 4.5이고 이 보고서가 쓴 것은 오푸스 5다.
- 7.Jens Ludwig, Sendhil Mullainathan, Ashesh Rambachan. NBER Working Paper 33344, 2025년 1월(2025년 12월 개정). DOI 10.3386/w33344 — 앤트로픽 부록 각주 10이 인용한 바로 그 논문이다. 예측 문제와 추정 문제의 조건을 가르는 구분과, 라벨의 5%를 사람이 다시 달면 신뢰구간 피복률이 회복된다는 모의실험 결과는 Table 3에서 옮겼다.
- 8.Tyna Eloundou, Sam Manning, Pamela Mishkin, Daniel Rock. "GPTs are GPTs." arXiv:2303.10130 / Science 384(6702), 1306–1308 (2024). DOI 10.1126/science.adj0998 — 인간과 모델의 일치율 65.6~82.1%와 채점표 문구 변경 시 24% 반전은 Table 2에서, 인간 주석을 주 결과로 삼았다는 서술은 3.4.2절에서 확인했다. ⚠️ 판본 주의: 워킹페이퍼 초록의 대표 수치는 모델 라벨 기준이고 게재본 초록은 인간 라벨 기준이다.
- 9.Emilio Colombo, Fabio Mercorio, Mario Mezzanzanica, Antonio Serino. IJCAI 2025, art. 1066 / arXiv:2407.19204 v3 — 오픈 가중치 모델 셋과 사람 세 명으로 검증한 피어리뷰 통과 사례. 모델 선택 이유를 재현 가능성으로 밝힌 축자도 여기서 왔다.
- 10.Schaal. arXiv:2510.13369 (2025) — 모델 간 상관 0.60~0.81. ⚠️ 같은 수준의 수치를 이 연구는 "견고하다"로, 6번 논문은 "취약하다"로 해석한다. 학계가 모델 채점자를 못 믿는 것이 아니라 숫자를 내고 논쟁한다는 쪽이 정확하다.
- 11.Carl Frey, Michael Osborne. Technological Forecasting and Social Change 114, 254–280 (2017). DOI 10.1016/j.techfore.2016.08.019 / Michael Webb. "The Impact of Artificial Intelligence on the Labor Market." Stanford Working Paper (2020) — 3절 계보표의 두 항목이다. 뒤의 것은 저널 게재가 확인되지 않았다.
- 12.Daron Acemoglu, Pascual Restrepo. "Robots and Jobs." Journal of Political Economy 128(6), 2188–2244 (2020). DOI 10.1086/705716 — 4절의 0.2%포인트·0.42%는 게재본 값이며 선행 워킹페이퍼 값과 다르다. 자동 창고 보관·반출 설비가 집계에서 빠진다는 제외 규정은 워킹페이퍼 각주에서 확인했다.
- 13.NIST SP 1011-II-1.0(ALFUS, 2007) · ISO 8373:2021 · SAE J3016 APR2021 · RLBench 등 조작 벤치마크 — 3.6절의 반례들이다. 셋 다 설계 의도 분류이지 성능 분류가 아니고, 숫자가 들어간 유일한 선례가 2007년 문서의 "운용자 입력 약 50% 의존"이다.
- 14.Rivière, Denain. Epoch AI (2026년 2월) — 로봇이 사람보다 3~10배 느리다는 분석. 앤트로픽이 세 번 인용했고, 본문 각주 43은 청소 로봇이 사람보다 최대 10배 느리다고 적는다.
업계·통계 자료
- 15.Georg Graetz, Guy Michaels. "Robots at Work." Review of Economics and Statistics (2018). 본문과 온라인 부록 — 5절의 두 축자가 여기서 나왔다. 정가 기반 가격지수가 2005년에 멈춘다는 문장과, 1993~2005년으로 좁혀도 하락폭이 50% 안팎이라는 문장이다.
- 16.International Federation of Robotics. World Robotics (2006) 부속서 C 방법론 — 로봇 한계비용의 20%가 제어장치라는 품질조정 근거. 15번의 부록이 옮겨 적은 형태로 확인했다.
- 17.International Federation of Robotics. World Robotics 2026, 2026년 9월 24일 발표. ifr.org — 가동 507만 9,000대(+9%), 연간 설치 60만 3,307대(+11.2%), 풀사이즈 휴머노이드 7,000대와 174개 제조사, 그리고 휴머노이드가 아직 실험실과 파일럿 사이에 있다는 축자.
- 18.BofA Institute. Transformation — Physical AI, part 2: Humanoid robots, 2026년 3월 12일 — 부품 원가 기준 연 13.5%에서 9.4%로의 감속과 걸림돌 여섯 가지. ⚠️ 앤트로픽 각주 49가 인용한 것은 같은 기관의 2025년 문서이고 그 파일은 이미지 전용이라 열지 못했다. 확인된 사실은 이 후속 문서의 수치가 각주의 "약 13%·약 9%"를 재현한다는 데까지다.
- 19.UBS(2025)·모건스탠리(2025) 휴머노이드 가격 전망 — ⚠️ 1차 문서 확인에 실패해 보도와 요약을 거쳤다. 연 5.2~5.8%라는 값은 단정하지 않고 전망으로만 적었다. 모건스탠리 모델의 교체 주기 6년도 같은 등급이다.
- 20.A3(Association for Advancing Automation) 북미 2025년 로봇 주문 3만 6,766대·22억 5,000만 달러 / Agility Robotics SEC Form S-4/A(FY2025 감사 총매출 178만 달러) / Tesla SEC 10-Q(2026년 2분기 설비능력 표) / Damodaran 산업별 자본비용 — ⚠️ A3 수치는 품질조정 지수가 아니므로 연 12%의 반증으로 쓰지 않았다.
2차 보도
- 21.Michael B. Kelley. Yahoo Finance, 2026년 10월 1일. finance.yahoo.com — 1절에서 "보도가 옮긴 것과 뺀 것"을 가른 대상 기사다. 2085년, E0~E3 등급, 부록의 전이 제외 민감도, 42%포인트, 규제 14%가 빠져 있다.
페블러스 블로그 인접 글
- 22.에이전트 위임 가능성의 직업 지도(1절) — 같은 직업 데이터베이스 위의 지표이지만 대상이 텍스트 작업이다. AI 사용 측정의 독립 코퍼스 대조(2절) — 같은 회사의 지표를 외부에서 되짚은 선례다. 보행보조차 주행 데이터(6절) — 통제되지 않은 현장에서 모은 데이터가 왜 다른 종류의 자산인지를 다뤘다.