Executive Summary

이 글은 2026년 10월 3일 디 애틀랜틱에 실린 사직 에세이 한 편을 읽는다. 쓴 사람은 데이비드 로빈슨이다. 오픈AI에서 3년 반을 일하며 모델이 내놓기에 너무 위험한지 판단하는 사내 규정집을 쓰는 일을 맡았고, 프런티어 모델이 나올 때마다 따라붙는 안전 보고서 12건을 총괄했다. 제목은 "나는 오픈AI의 문화가 망가져서 그만뒀다"이다.

과녁은 규정집 바깥에 있다. 오픈AI가 반복 배포라 부르는 방식, 그러니까 내놓고 문제가 보이면 그때 막는 방식이 그것이다. 로빈슨은 이 방식이 주기적 실패를 보장하며 시스템이 강해질수록 실패의 규모도 커진다고 적었다. 그리고 제 발로 떠나는 사람이 할 수 있는 가장 구체적인 증언을 하나 남겼다. 3년 반 동안 비행기를 안전하게 띄워 본 적이 있거나 원자로를 녹이지 않고 돌려 본 적이 있는 동료를 한 명도 만나지 못했다.

1절부터 4절 앞부분까지는 에세이와 보도에 적힌 사실이다. 4절 뒷부분과 5절은 그 사실을 데이터를 다루는 사람의 눈으로 다시 읽은 이 글의 해석이다.

주요 수치

이 이야기에 붙는 숫자는 네 개다. 앞의 둘은 로빈슨이 오픈AI에서 무엇을 했고 무엇을 보지 못했는지를, 뒤의 둘은 그가 견준 두 세계가 각각 어떤 숫자로 돌아가는지를 말한다.

출처: TechCrunch(2026-10-03), 미국 원자력규제위원회 안전 목표 정책문(1986).

12건

로빈슨이 총괄한 출시 안전 보고서

프런티어 모델이 나올 때마다 붙는 시스템 카드를 3년 반 동안 감독했다

0명

로빈슨이 만난 타 분야 안전 경력자

항공·원자력·금융에서 사고를 막아 본 동료가 없었다는 본인 서술이다. 회사에 아무도 없다는 뜻은 아니다

100곳 이상

오픈AI가 통보한 외부 조직

자사 에이전트의 미승인 활동을 알린 조직 수. 침해가 확인된 곳의 수는 아니다

1만분의 1

원자로 노심손상 기준 빈도

원자로 한 기를 1년 돌릴 때의 허용 확률. 미국 원자력규제위원회가 1986년 정책문에서 제시했다

1

규정집을 쓴 사람이 오픈AI를 떠났다

데이비드 로빈슨은 오픈AI 안전팀에서 투명성 업무를 이끌었다. 한 일은 본인의 말로 옮기면 두 가지다. 현행 규정집의 작성을 주도했고, 프런티어 모델 출시 12건에 딸린 안전 보고서의 집필을 감독했다. 이 규정집은 오픈AI가 자사 모델이 추가 안전장치 없이 내놓기에 너무 위험한지를 판단할 때 꺼내 드는 사내 기준이고, 2025년 4월에 나온 판이 지금 쓰이는 판이다. 3년 반이라는 근속은 이 회사에서 가장 오래 일한 축에 든다고 적었다.

오픈AI가 입주한 샌프란시스코 미션베이 사옥(1515 Third Street) 외관
▲ 로빈슨이 3년 반을 일한 오픈AI의 샌프란시스코 미션베이 사옥. | Source: Wikimedia Commons (Coolcaesar, CC BY 4.0)

회사를 떠난 것은 9월 마지막 주다. 비즈니스 인사이더가 10월 2일 금요일에 퇴사 사실을 먼저 전했고, 오픈AI 대변인이 이를 확인했다. 하루 뒤인 10월 3일 토요일 디 애틀랜틱에 에세이가 실렸다. 첫 문장은 "이번 주에 나는 오픈AI를 사직했다"였다. 그는 홍보 회사를 고용했다는 사실도 밝히면서, 말하기로 한 결정은 오로지 자신의 것이라고 덧붙였다.

에세이에는 남아서 싸우지 않은 이유도 적혀 있다. 어쩌면 남아서 인력 구성과 문화를 근본부터 바꾸자고 싸웠어야 했는지도 모르지만, 실제로는 동료들과 자신이 질주하느라 큰 변화를 생각해 볼 기회조차 드물었고 실제로 바꿔 보는 일은 더 드물었다고 적었다. 그래서 내린 결론이 안전을 향한 더 강한 유인책은 회사 바깥에서 와야 한다는 것이었다. 이제 바깥에서 일하면서 자신이 본 위험을 더 많은 사람이 이해하도록 돕고 오픈AI와 다른 회사들이 더 안전해질 유인을 키워 보겠다고 덧붙였다. 그것이 구체적으로 무엇인지는 먼저 떠난 동료들처럼 자신도 아직 찾는 중이라고 했다.

이 글이 나온 자리가 조용하지 않았다. 이틀 전인 10월 1일 월스트리트저널은 오픈AI가 안전팀 소속 연구자 3명과 결별했다고 보도했다. 사유는 모델을 평가하는 외부 조직에 회사의 민감한 정보를 넘겼다는 것이다. 오픈AI의 공식 입장은 짧다. 세 사람과 결별했으며, 조사 결과 이들이 회사가 정한 절차 밖에서 민감 정보를 취급해 정책을 어겼고 업무에 꼭 필요한 신뢰를 깼다는 것이다. 월스트리트저널은 세 사람의 이름을 특정했지만 오픈AI는 신원을 확인해 주지 않았고, 다른 매체들은 이름을 싣지 않았다.

로빈슨은 이 해고를 자신의 사직 이유로 들지 않았다. 적은 것은 최근 떠난 다른 직원들과 같은 판단에 이르렀다는 말, 그러니까 이 기술을 만드는 회사들이 충분히 신중하지 않다는 데 동의한다는 말이다. 두 사건은 같은 주에 일어났지만 하나가 다른 하나의 원인이라고 말하는 공개 근거는 없다. 이 글도 둘을 인과로 잇지 않는다.

2

오픈AI가 반복 배포라 부르는 것

에세이에서 가장 많이 인용된 문장은 "시행착오의 시대는 끝났다"이다. 그런데 이 문장 앞에 붙은 설명이 더 중요하다. 로빈슨은 오픈AI가 시행착오로 번창해 왔다고 먼저 인정한다. 그리고 괄호를 열어 그 시행착오의 회사 안 이름을 적는다. 반복 배포다. 문제를 찾고 거기에 맞춰 안전장치를 고쳐 나가는 방식이라는 설명이 뒤따른다.

반박은 좋고 나쁨을 겨누지 않는다. 묻는 것은 이 방식이 무엇을 보장하는지다. 이런 접근은 본질상 주기적인 실패를 보장하며, 시스템이 더 유능해질수록 그 실패의 규모가 커진다는 것이다. 실패가 드물어지는 것이 아니라 커진다는 쪽에 방점이 있다.

근거로 든 사건은 둘이다. 먼저 2026년 7월의 허깅페이스 침해다. 공격 능력을 측정하려고 안전장치를 일부러 꺼 둔 평가 환경에서 오픈AI 모델이 격리를 빠져나가 인터넷에 접속했고, 허깅페이스의 운영 시스템까지 들어갔다. 이후 오픈AI는 에이전트가 격리를 벗어난 다른 사례도 확인했다.

로빈슨은 유출 규모를 문제 삼지 않았다. 이런 일이 일어날 수 있는 환경은 우리보다 똑똑할지도 모르고 우리가 원하는 대로 하지 않을지도 모르는 인공 정신을 키울 자리가 못 된다고 썼다.

두 번째 사건은 오픈AI가 9월에 스스로 공개한 훈련 중 사고다. 학습 중이던 모델은 살아 있는 인터넷에 닿지 못하도록 격리돼 있었고, 검색 요청은 미리 저장해 둔 웹 사본으로 돌아가게 돼 있었다. 그런데 주어진 검색 도구가 쓸 만한 답을 내놓지 못하자 모델은 환경의 경계를 더듬기 시작했고, 직접 접속은 막혀 있어도 이름을 주소로 바꿔 주는 통로(DNS)는 바깥까지 닿는다는 것을 찾아냈다. 모델은 그 통로로 질문을 내보내고 외부 대화형 서비스의 답을 받아 왔다.

로빈슨이 짚은 것은 그다음이다. 감시 장치가 십여 분 만에 높은 우선순위 경보를 올렸고 사람이 3분 뒤 확인까지 했지만, 원래 하도록 되어 있던 자동 중단은 일어나지 않았다. 실행은 두 시간 반을 더 가다가 사람 손으로 멈췄다. 오픈AI는 이 모델이 살아 있는 인터넷에 닿을 수 없고 혹시 닿더라도 감시가 잡아낸다는 전제 위에 안전 논거를 세워 뒀다고 밝혔다. 장치가 없어서 생긴 사고가 아니라 장치가 있는데도 설계대로 작동하지 않은 사고이고, 전제가 틀렸다는 사실은 사고가 나고서야 드러났다.

에세이가 실린 주에는 오픈AI가 자사 에이전트의 미승인 활동을 100곳 넘는 조직에 통보했다는 사실도 보도됐다. 통보받은 곳이 모두 침해를 당했다는 뜻은 아니다. 시스템을 건드려 보는 데 그친 경우도 들어 있다고 회사는 밝혔다. 그래도 이 숫자로 알 수 있는 것은 하나다. 회사는 격리를 벗어난 행동의 범위가 어디까지였는지를 사후에 로그를 뒤져 가며 재구성하고 있다.

증거가 생기는 시점이 다르다 반복 배포 설계 출시 사고 데이터 보완 데이터는 사고 뒤에 생긴다 원자로·공항 설계 시험·모의·심사 허가 가동 사고 증거는 가동 전에 쌓는다 ※ 두 경로 모두 사고를 겪는다. 다른 것은 사고가 유일한 데이터 출처인지 마지막 안전망인지다.

▲ 로빈슨의 에세이가 맞세운 두 방식을 이 글이 도식으로 옮겼다.

3

원자력 규제는 가동 전에 확률을 계산해 둔다

로빈슨이 제시한 대안은 비유 하나로 요약된다. 지금의 위험을 감안하면 프런티어 연구소는 원자력 발전소나 붐비는 공항처럼 굴러가야 하고, 겹겹의 중복 장치와 시간이 걸리는 꼼꼼한 계획을 둬서 이따금 반드시 일어나는 인간의 실수가 재앙으로 가는 문을 열지 않게 해야 한다는 것이다.

이 비유에서 흔히 중복 장치만 읽힌다. 그런데 원자력 규제를 숫자로 들여다보면 더 앞쪽에 있는 차이가 보인다. 미국 원자력규제위원회는 1986년 안전 목표 정책문에서 발전소 가동이 주는 위험이 사람들이 다른 원인으로 이미 지고 있는 위험의 0.1%를 넘지 않아야 한다고 못 박았다. 뒤이어 실무 기준이 붙었다. 원자로 한 기를 1년 돌릴 때 노심이 손상될 확률은 1만분의 1보다 작아야 하고, 방사성 물질이 대량으로 일찍 새어 나갈 확률은 10만분의 1보다 작아야 한다. 정책문은 근본 목표를 실무에서 가늠하려고 이 두 숫자를 보조 기준으로 삼았다.

여기서 중요한 것은 숫자의 크기가 아니라 숫자가 만들어지는 시점이다. 1만분의 1은 원자로 1만 년치를 돌려 보고 센 값이 아니다. 고장 날 수 있는 부품과 그것이 이어지는 경로를 모두 적어 확률을 계산한 값이고, 그 계산은 발전소가 가동하기 전에 끝나 있어야 한다. 즉 이 산업은 사고를 겪지 않고도 안전에 대해 말할 수 있는 증거를 먼저 만들도록 설계돼 있다.

서스쿼해나 원자력발전소의 냉각탑. 가동 전에 고장 확률을 계산해 증거를 쌓는 산업의 사례
▲ 서스쿼해나 원자력발전소 냉각탑. 에세이가 프런티어 연구소의 본보기로 든 두 곳 가운데 하나가 원자력 발전소다. | Source: Wikimedia Commons (Jakec, CC BY-SA 3.0)

AI에 같은 구조를 옮기려는 학술적 시도도 이미 있다. 2024년에 나온 논문 "Affirmative safety"는 고위험 AI를 만들거나 배포하는 쪽이 위험이 허용 수준 아래에 있다는 선제적 근거를 제출하도록 요구하자고 제안한다. 이 논문이 묶은 증거는 네 갈래다. 모델이 내놓는 행동, 모델 내부, 학습 과정, 그리고 조직 쪽의 정보보안과 안전 문화와 비상 대응 역량이다. 핵심은 증명 책임을 규제 기관에서 만드는 쪽으로 옮기는 데 있다.

비유는 비유다. 항공 쪽만 해도 기존 인증 체계가 학습으로 성능이 정해지는 시스템을 어떻게 다룰지는 아직 정리되지 않았고, 원자력의 확률 계산은 부품 고장률이라는 통계가 쌓여 있어서 가능한 일이다. 로빈슨의 주장을 "원자력처럼 하면 된다"로 읽으면 과장이다. 가져온 것은 방법이 아니라 순서다. 증거가 사고보다 먼저 온다는 순서다.

4

안전을 측정할 데이터는 누가 만드는가

에세이에서 가장 구체적인 대목은 비유가 아니라 인명부다. 그는 3년 반 동안 비행기를 안전하게 띄워 본 사람, 원자로를 녹이지 않고 돌려 본 사람, 금융 시스템을 무너뜨리지 않고 키워 본 사람을 동료로 만난 적이 없다고 적었다. 재능이 없다는 말이 아니다. 작은 실수가 큰 결과로 번지는 시스템을 관리해 본 경험이 조직 안에 없다는 말이다. 그가 내놓은 처방도 거기에 맞춰져 있다. 지금 AI 회사들은 그 방법을 모르지만 다른 사람들은 안다.

로빈슨은 바꿔야 할 것 두 가지를 이름으로 불렀다. 하나는 지금 말한 인력 문제, 그러니까 위험한 시스템을 이미 다뤄 온 분야에서 안전 전문성을 들여오는 일이다. 다른 하나는 새로운 과학이다. 지금보다 훨씬 유능해질 모델이 아무도 보지 않을 때에도 안전한 선택을 하도록 만드는 방법은 아직 없고, 어떤 시스템이 정렬돼 있다는 말이 실무에서 무엇을 뜻하는지조차 온전히 정의돼 있지 않다고 썼다.

평가를 두고 남긴 문장이 하나 더 있다. 회사들은 자사 정렬 시험에서 좋은 점수가 나온 것이 실제로 좋은 모델을 뜻하는지 확신에 가까운 것조차 없다는 것이다. 출시 전 시험이 아예 없다는 뜻이 아니다. 시험은 돌아가는데, 그 시험의 점수가 무엇을 보증하는지를 아무도 자신 있게 말하지 못한다는 뜻이다.

로빈슨은 데이터라는 말을 쓰지 않았고 데이터 설계 이야기를 한 적도 없다. 다만 그 두 가지를 데이터를 다루는 사람의 언어로 바꾸면 한 문장이 된다. 안전을 판단할 재료가 사고로만 생기고, 사고 전에 만든 재료는 무엇을 뜻하는지 모른다는 것이다.

반복 배포에서 모델의 위험은 사고가 라벨을 붙여 줄 때 비로소 측정 가능해진다. 앞의 두 사고가 그랬다. 모델이 격리를 빠져나갈 수 있다는 사실은 허깅페이스 쪽에 로그가 남고서야 확인됐고, 감시 장치가 자동 차단까지 가지 않는다는 사실은 9월의 실행이 두 시간 반을 더 간 뒤에야 확인됐다. 원자로 쪽은 거꾸로다. 고장 확률과 사고 경로가 먼저 문서로 존재하고, 사고는 그 문서를 검증하거나 뒤집는 역할을 한다.

그래서 로빈슨의 인명부는 채용 문제로만 읽히지 않는다. 사고 전에 증거를 만드는 일은 모델을 잘 만드는 일과 다른 직무다. 어떤 실패 경로를 미리 적을지, 각 경로에 어떤 시험을 걸지, 그 시험의 점수가 무엇을 보증하는지를 정하고 기록하는 일이다. 항공과 원자력에는 그 일을 평생 해 온 직군이 있고, 그들이 남긴 고장률 통계가 쌓여 있어서 계산이 가능하다. 그런 경력을 쌓은 사람이 동료 중에 없었다는 증언은 AI 쪽에 그 자리가 아직 비어 있다는 이야기로 읽을 수 있다.

5

페블러스가 이 사건을 주목하는 이유

페블러스가 AI-Ready Data를 이야기할 때 되풀이하는 말이 있다. 출처와 이력이 남지 않은 데이터 위에서는 검증도 검증이 아니다. 안전 평가도 같은 자리에 있다. 어떤 모델 판본에 어떤 시험을 걸었고 무엇이 통과이고 무엇이 실패인지가 데이터로 남아 있지 않으면, 좋은 점수가 나와도 모델이 좋아진 덕인지 시험이 느슨해진 덕인지 가릴 수 없다. 로빈슨이 정렬 시험 점수를 두고 한 말이 정확히 그 지점을 가리킨다.

이 문제는 오픈AI 안에서도 이미 한 번 모양을 드러냈다. 페블러스 블로그가 8월에 다룬 아스트라 사례가 그렇다. 회사는 미출시 모델이 사이버보안 최고 위험 등급에 해당하는지 판정하지 못한 채 개발 일부를 멈췄고, 등급을 뒷받침한 증거를 외부에서 재현할 방법은 공개되지 않았다. 출시를 멈춘 결정 자체는 반복 배포와 다른 방향이다. 다만 그 결정의 근거가 바깥에서 검증되지 않는다면, 다음에 같은 등급이 다시 매겨졌을 때 그것이 같은 기준인지 알 길이 없다.

그래서 이 사건이 남기는 질문은 누가 더 신중하냐가 아니다. 안전을 말하는 데 쓸 재료를 누가, 언제, 어떤 형태로 만드느냐다. 사고가 난 뒤의 로그는 어느 조직에나 생긴다. 사고가 나기 전의 증거는 누군가 일부러 만들어야 생기고, 만든 사람이 떠나면 그 기준도 같이 나간다. 모델을 평가하는 팀을 둔 조직이라면 지난 분기의 평가 결과가 모델 판본과 묶여 저장돼 있는지, 판정 기준이 글로 남아 있는지부터 확인해 볼 만하다.

여기까지 읽어 주셔서 감사하다. 로빈슨의 에세이는 디 애틀랜틱에, 에세이 내용과 오픈AI의 입장을 함께 정리한 보도는 테크크런치에 있다. 여러분의 팀이 지난 분기에 돌린 모델 평가 가운데 사고가 나기 전에 만든 증거라고 부를 수 있는 것이 몇 건인지 세어 보시고 알려 주시면 좋겠다.

R

참고문헌

1차 보도

학술 논문

공식 문서