Executive Summary
스탠퍼드 의대 연구진이 만든 Paper2Agent가 9월 16일 네이처에 실렸다. 논문의 본문과 코드, 데이터를 한 서버에 올려 두면 여러 AI가 그 코드를 직접 돌려 보면서 실제로 작동하는 것만 도구로 추려 낸다. 그렇게 완성된 논문은 질문에 답하고 자기 방법을 남의 데이터에 적용해 주는 대화 상대가 된다. 이 글은 그 변환이 어디까지 되고 어디서 멈추는지를 본다.
눈길이 오래 머무는 수치는 성공 쪽이 아니라 실패 쪽에 있다. 연구진이 계산생물학 논문 100편에 이 도구를 돌렸을 때 에이전트가 된 것은 74편이었다. 남은 26편이 멈춘 곳은 모델이 아니라 자료였다. 코드가 온전하지 않거나, 설명이 붙어 있지 않거나, 옛 실행 환경을 다시 세울 수 없었다. 저자들은 이 실패를 결함으로만 두지 않고 그 연구의 재현성을 가늠하는 측정값으로 읽는다.
3절까지는 논문과 보도에 적힌 것을 따라간다. 4절에서 이 결과를 데이터 인수인계의 문제로 옮겨 읽은 것은 논문에 없는 이 글의 해석이다.
주요 수치
출처: 네이처 뉴스 기사와 스탠퍼드 리포트, 그리고 저자들의 프리프린트. 수치마다 어디서 온 것인지는 본문에 걸어 두었다.
100편 중 74편
에이전트가 된 논문
계산생물학 논문 100편에 도구를 돌린 결과다. 막힌 26편은 코드와 문서, 실행 환경에서 걸렸다
22개
알파지놈 논문에서 나온 도구
사람이 손대지 않고 만들어졌다. 네이처 뉴스 기사는 45분과 14달러가 들었다고 적었는데, 프리프린트의 수치는 이와 다르다
209개 중 1개
ADHD 후보에서 추려 낸 변이
두 논문의 서버를 한 AI에 나란히 물려 유전자 자리 39곳을 두 시간 안에 훑었다. 실험 검증은 아직 남아 있다
100편 이상
지금까지 만들어진 논문 에이전트
알파지놈과 단일세포 분석 도구 등 일부는 서버 주소가 공개돼 누구나 붙여 쓸 수 있다
논문 한 편은 어떻게 대화 상대가 되나
연구를 이끈 제임스 조우 교수는 스탠퍼드 리포트에 사람이 지식을 다뤄 온 방식을 이렇게 정리했다. 옛날에는 돌에 새겼고 지금은 종이 위에 글자로 찍는데, 종이도 돌보다 그리 낫지는 않다는 것이다. 어느 쪽이든 읽는 사람이 다가가야만 열리는 수동적인 물건이다. 정적인 기록을 지식이 살아 움직이는 형태로 바꿔 보자는 제안이 거기서 나왔다.
이 변환의 중심에는 MCP라는 규격이 놓인다. 조우는 이것을 논문 PDF를 에이전트가 찾아 쓰기 좋은 형태로 정리해 둔 서류함에 비유했다. 서론과 방법, 결과, 결론이 각각 다른 칸에 들어가고 그 칸들이 논문이라는 하나의 상자에 담긴다.
서류함에 들어가는 것은 세 종류다. 논문의 방법을 실행 가능한 함수로 감싼 도구, 원고와 코드와 보충 자료를 표준 형식으로 정리해 둔 자료, 그리고 여러 단계를 어떤 순서로 밟아야 하는지 적어 둔 절차. 마지막 것이 눈에 띈다. 단일세포 분석 도구의 서버에는 품질 관리에서 정규화, 특징 선택, 차원 축소, 군집화, 세포 유형 지정으로 이어지는 순서가 통째로 들어가 있는데, 저자들은 이 순서를 사람이 따로 적어 준 것이 아니라 논문과 코드에서 뽑아냈다고 밝혔다.
서류함을 채우는 일은 AI 여러 대가 나눠 맡는다. 코드 저장소를 찾아 내려받고, 실행 환경을 세우고, 튜토리얼에서 핵심 기능을 뽑아 도구로 감싼다. 그다음이 이 도구의 성격을 정한다. 만든 도구마다 시험을 짜서 돌려 보고, 실패하면 원인을 읽고 고친다. 고쳐도 계속 실패하는 함수는 목록에서 빼 버린다. 논문에 적힌 대로 실제로 돌아가는 것만 남기겠다는 설계다.
재료를 어디서 가져오는지가 이 절차의 전제를 드러낸다. 도구로 감싸는 바탕은 논문의 방법 코드 전부가 아니라 저장소에 들어 있는 튜토리얼이다. 담당 AI는 저장소를 훑어 진짜 튜토리얼과 그 밖의 파일을 갈라내고, 고른 튜토리얼을 예제 데이터로 끝까지 돌려 보면서 입력과 출력, 그림, 실행 조건을 받아 적는다. 프리프린트는 이 단계에서 겉으로 드러나지 않은 전제까지 명시적으로 기록한다고 적었다. 시험에 쓰는 것도 그 튜토리얼이 들고 있는 예제뿐이다. 통과한 도구는 그 상태로 잠그고, 도구마다 원 논문 코드의 어디서 온 것인지를 함께 붙인다. AI가 그럴듯한 코드를 지어내 틀린 결과를 내놓는 일을 막으려는 설계다.
완성된 서버는 허깅페이스 같은 곳에 올려 두고, 쓰는 사람은 자기가 쓰는 챗 에이전트에 주소를 붙이기만 하면 된다. 네이처 뉴스 기사는 이렇게 만들어진 상대를 가상의 교신저자라고 불렀다. 궁금한 것을 물으면 답하고, 자기 논문의 방법을 새 데이터에 적용해 주고, 다른 논문의 에이전트와 직접 이야기도 한다. 스탠퍼드 리포트에 따르면 지금까지 만들어진 논문 에이전트는 100편이 넘는다. 코드와 사용법은 공개돼 있고, 알파지놈과 단일세포 분석 도구로 만든 서버는 주소만 붙이면 바로 쓸 수 있다.
이런 시도가 처음은 아니다. 프리프린트는 앞선 흐름을 스스로 짚어 둔다. 실행 가능한 논문을 내걸었던 출판사 공모, 주피터 노트북을 본문에 얹은 출판, 논문과 코드 저장소를 이어 준 Papers with Code까지. 재현성은 그때마다 올라갔지만 넘어야 할 턱은 남았다는 것이 저자들의 평가다. 코드를 찾기는 쉬워졌어도 깔고 돌리는 일은 여전히 읽는 사람 몫이었다.
알파지놈 논문은 어디까지 답했나
연구진이 먼저 붙여 본 것은 딥마인드의 알파지놈 논문이다. DNA 염기 하나가 바뀌었을 때 그것이 유전자 발현에 어떤 영향을 주는지 예측하는 모델인데, 쓰려면 환경을 깔고 모듈을 여럿 불러오고 API 키로 클라이언트를 만들고 입력 규격을 맞춰야 한다. 생물학자가 혼자 넘기에는 턱이 제법 높다.
이 논문에서 사람 손을 타지 않고 도구 22개가 나왔다. 네이처 뉴스 기사는 걸린 시간을 약 45분, 필요한 계산 비용을 14달러로 전한다. 다만 저자들이 지난해 공개한 프리프린트에는 같은 22개를 두고 개인 노트북에서 약 3시간이라고 적혀 있고, 45분은 단일세포 분석 도구에서 도구 7개를 만든 시간으로 나온다. 최종판 본문은 유료라 어느 쪽으로 정리됐는지 이 글은 확인하지 못했다.
정확도는 프리프린트의 숫자가 구체적이다. 알파지놈 튜토리얼에서 뽑은 질문 15개와 튜토리얼에 없는 새 질문 15개를 던졌더니 이 에이전트는 양쪽 모두 맞혔다. 같은 코드 저장소를 통째로 쥐여 준 범용 코딩 에이전트 클로드는 각각 9개와 12개를, 수십 개 데이터베이스를 끌어 쓰는 생의학 에이전트 바이옴니는 6개와 9개를 맞혔다. 네이처 뉴스 기사는 이 결과를 거의 완벽한 정확도로 요약했다.
에이전트가 원 논문과 다른 답을 내놓기도 했다. 나쁜 콜레스테롤 수치와 연관된 염기 변이 하나를 두고 어느 유전자가 원인이냐고 묻자, 에이전트는 SORT1을 가장 유력하게 꼽았다. 알파지놈 논문이 강조한 유전자는 CELSR2와 PSRC1이었다. 에이전트가 댄 근거는 둘이다. 간 조직에서 SORT1의 발현에 미치는 영향이 크게 예측됐다는 것, 그리고 SORT1이 만드는 단백질이 나쁜 콜레스테롤의 분비에 직접 관여한다는 것. 다만 프리프린트에 적힌 점수만 놓고 보면 알파지놈이 매긴 값 자체는 CELSR2와 PSRC1이 근소하게 더 높았다. 저자들이 공개 데이터를 직접 확인해 보니 세 유전자 모두 간 조직에서 유의한 신호를 보였다. 여러 유전자가 나란히 걸리는 자리에서 원인을 하나로 지목하기란 원래 어렵다는 것이 프리프린트의 정리다. 조우는 오히려 이 점을 장점으로 들었다. 새 실험을 설계하지 않고도 이미 발표된 결론을 다시 검토해 볼 수 있기 때문이다.
연구진은 논문 두 편을 한자리에 붙여 봤다. 알파지놈 논문과 ADHD 전장유전체 연구 논문을 각각 서버로 만들어 한 AI에 나란히 물렸더니, 이 AI가 검토해 볼 가설을 먼저 몇 개 내놨다. 뇌의 특정 세포에서 조절 활성이 달라진다는 것, 통계로 좁혀 놓은 후보 안에서 인과 변이를 추려 낼 수 있다는 것, FOXP 계열 유전자 자리에서 전사인자 결합이 깨진다는 것. 이 가운데 두 번째를 골라 실행하라고 지시한 쪽은 사람이다. 그다음부터는 AI가 분석 계획을 스스로 짜서 유전자 자리 39곳을 훑었다. 걸린 시간은 두 시간 안쪽이다. 후보 변이 209개 가운데 rs1626703 하나가 인과 변이로 올라왔고, 이 변이가 MPHOSPH9 유전자의 엑손 하나를 더 자주 포함시켜 흥분성 신경세포에서 발현을 높인다는 경로가 제시됐다. 조우는 전에 보고된 적 없는 연결이라고 했다. 계산이 가리킨 후보이지 실험으로 확인된 발견은 아니다.
에이전트가 되지 못한 26편이 가리키는 곳
사례가 잘 풀렸다고 해서 아무 논문에나 통하지는 않는다. 연구진은 계산생물학 논문 100편을 모아 놓고 변환을 시도했고, 그중 74편에서 작동하는 에이전트가 나왔다. 실패한 26편은 세 갈래로 나뉜다. 코드가 불완전했거나, 문서가 없었거나, 소프트웨어 환경을 끝내 되살리지 못했다. 이 시험의 수치는 최종판 본문에 실려 있고 그 본문은 유료라, 이 글은 보도를 통해 확인했다.
한계는 저자들이 프리프린트에 직접 써 두었다. 원래 코드가 불완전하거나 문서화가 부실하거나 풀리지 않은 오류를 품고 있으면 이 도구는 그것을 작동하는 도구로 안정적으로 내놓을 수 없다는 문장이다. 바꿔 말하면 모델을 더 좋은 것으로 갈아 끼워도 없는 코드가 생겨나지는 않는다.
3.1자동화가 고쳐 주는 자리와 못 고치는 자리
고칠 수 있는 고장도 많다. 깨진 의존성이나 어긋난 파일 경로, 낡은 API 호출처럼 흔한 문제는 작업을 맡은 AI가 진단하고 손본다. 시험을 돌려 보고 실패를 읽고 다시 고치는 고리가 그 일을 한다. 넘지 못하는 선은 그 앞에 있다. 애초에 공개되지 않은 코드와 데이터는 복원할 대상 자체가 없다.
논문이 얼마나 쉽게 에이전트로 바뀌는지가 그 연구의 재현성과 엄밀성을 가늠하는 실용적인 척도가 될 수 있다고 저자들은 본다. 이어지는 전망은 더 직접적이다. 학계가 데이터와 코드 공개를 당연하게 기대하게 된 것처럼, 연구 기여를 에이전트로 옮기기 쉬운 형태로 구조화하기를 기대하는 것이 그다음 순서가 되리라고 저자들은 적었다.
칸 하나가 더 생기리라고도 내다본다. 지금 많은 학술지가 데이터와 코드를 어디서 받을 수 있는지 밝히라고 요구하듯, 그 연구가 에이전트로 만들어져 있는지와 어디에 붙어 있는지를 적는 자리다. 프리프린트 자체가 그 칸을 이미 달고 있다. 알파지놈 에이전트가 올라간 주소가 논문 끝에 적혀 있다.
지금까지 다룬 것은 방법론 논문이다. 알고리즘이나 모델, 계산 절차를 내놓는 논문이라 옮길 대상이 분명하기 때문이라고 저자들은 설명한다. 데이터 자원을 내놓는 논문이나 발견을 보고하는 논문으로 넓히는 일은 앞으로의 과제로 남겨 두었는데, 그런 논문에서는 에이전트가 할 일이 계산에서 해석과 정리로 옮겨 가리라고 본다.
3.2원고에 남지 않는 것
변환이 잘된 논문에도 칸 하나는 빈 채로 남는다. 스탠퍼드 리포트는 원고가 실패한 실험이나 실험 설계 뒤의 판단까지는 담지 않는다고 짚었다. 그래서 사람 저자가 자기 논문으로 만든 에이전트와 대화하며 그 맥락을 채워 넣어야 한다. 에이전트가 저자에게 논문에 관해 되묻고 저자가 답하는 동안 비어 있던 칸이 메워진다.
이 대목이 도구의 경계를 그린다. 자동화가 옮길 수 있는 것은 기록된 것뿐이다. 어떤 방법을 먼저 해 봤다가 버렸는지, 왜 이 임계값을 골랐는지, 어떤 데이터를 무슨 이유로 뺐는지는 대개 원고에 적히지 않는다. 적히지 않은 것은 어떤 모델도 읽어 낼 수 없다.
페블러스가 이 소식을 주목하는 이유
우리가 AI-Ready Data를 말할 때 늘 붙드는 구별이 있다. 자료가 있다는 것과 쓸 수 있게 준비됐다는 것은 다른 상태라는 이야기다. 이번 결과는 그 구별에 눈금을 하나 붙여 준다. 같은 도구를 같은 방식으로 돌렸는데 74편은 되고 26편은 안 됐다면, 차이를 만든 것은 도구가 아니라 각 연구실이 남긴 자료의 상태다. 더 좁혀 말하면 남이 따라 할 수 있게 써 둔 예제가 있었느냐다. 이 도구가 재료로 삼는 것이 바로 저장소의 튜토리얼이기 때문이다.
이 블로그는 6월에 비슷한 장면을 한 번 다뤘다. 공개된 논문 코드를 AI 에이전트가 직접 돌려 본 실험에서 성공률이 54.1%에 그쳤고, 막힌 곳은 실행 환경과 의존성, 데이터 정합이었다는 이야기였다. 이번 연구는 같은 벽을 반대쪽에서 다시 확인한 셈이다. 공개와 실행 가능은 다른 일이고, 실행 가능과 설명 가능은 또 다른 일이다.
논문을 에이전트로 바꾸는 성공률은 사실상 그 연구실의 기록 습관을 측정한 값이다. 모델 성능이 오르면 변환의 난이도는 내려가겠지만, 애초에 남기지 않은 코드와 적지 않은 판단이 채워지지는 않는다. 자동화가 닿는 경계를 정하는 쪽은 도구가 아니라 자료다.
회사 일로 옮기면 인수인계 문서가 같은 자리에 선다. 데이터셋을 다른 팀이나 외부 공급사에 넘길 때 스키마와 파일, 라벨 규칙은 대체로 함께 간다. 왜 이 기준으로 잘랐는지, 어떤 라벨 정의를 해 봤다가 왜 접었는지, 어떤 샘플을 무슨 이유로 뺐는지는 담당자 머릿속에 남는다. 그 담당자가 팀을 옮기면 데이터는 그대로인데 판단의 근거만 사라진다. 다음 사람은 같은 시행착오를 처음부터 되풀이한다.
네 가지를 확인해 보면 우리 자료가 지금 어느 쪽에 서 있는지 대략 드러난다.
- 새로 온 사람이 문서만 보고 환경을 세워 파이프라인을 끝까지 돌릴 수 있는가. 못 돌린다면 그 파이프라인은 아직 자산이 아니라 담당자의 기억이다.
- 지금의 규칙을 고르기 전에 무엇을 해 봤다가 접었는지가 어딘가에 적혀 있는가. 실패한 시도가 한 줄도 없는 기록은 대개 기록이 덜 된 것이다.
- 라벨 정의가 애매한 사례를 만났을 때 참고할 판정 예시가 남아 있는가. 애매한 사례 열 개가 분류 체계 열 장보다 낫다.
- 담당자가 내일 자리를 비워도 이 데이터로 무엇을 판단하려 했는지가 문서에서 읽히는가.
논문이 스스로 답하는 시대가 오면 재현은 분명 쉬워진다. 다만 쉬워지는 쪽은 이미 잘 남겨 둔 연구부터다. 도구가 좋아질수록 잘 정리된 자료와 그렇지 않은 자료의 거리는 오히려 멀어진다.
여기까지 읽어 주셔서 감사하다. 이 글이 인용한 수치와 문장은 네이처 뉴스 기사와 스탠퍼드 리포트, 저자들이 공개한 프리프린트에서 누구나 확인할 수 있다. 여러분이 최근에 넘긴 데이터 인수인계 문서에는 실패한 시도가 적혀 있었는지, 적지 못했다면 무엇이 그것을 막았는지 나눠 주시면 좋겠다.
참고문헌
학술 논문
- 1.Miao, J. & Zou, J. (2026). "Reimagining research papers as interactive and reliable AI agents." Nature.
- 2.Miao, J. & Zou, J. (2025). "Paper2Agent: Reimagining Research Papers As Interactive and Reliable AI Agents." arXiv:2509.06917.
보도
- 3.Glickman, K. (2026). "AI tool turns any paper into an 'agent' that reproduces its own results." Nature News.
- 4.Armitage, H. (2026). "AI agents built from scientific papers surface new discoveries." Stanford Report.
- 5.Stanford Medicine. (2026). "Manuscripts-turned AI agents can now 'talk' to each other, Stanford Medicine-led study shows."
도구·코드
- 6.Miao, J. et al. "jmiao24/Paper2Agent." GitHub.