Executive Summary

이 글은 연구에 실제로 영감을 준 논문을 AI가 찾아낼 수 있는지 따로 떼어 잰 시험을 본다. 10월 1일 arXiv에 올라온 ScholarCatalyst이고, 스탠퍼드와 서울대와 카네기멜런과 워싱턴대와 앨런 AI 연구소와 MIT 연구진이 함께 냈다. 남다른 것은 정답지를 만든 사람이다. 논문을 쓴 당사자 184명이 자기 프로젝트 207건을 돌아보며 어떤 선행 연구가 실제로 도움이 됐는지 직접 표시했고, 왜 도움이 됐는지 이유까지 함께 적었다.

결과는 기대와 어긋났다. 190,896편 후보 가운데 그 논문을 찾는 시험에서, 검색 도구를 직접 불러 쓰는 에이전트형 탐색이 Recall@20 0.42로 같은 도구를 한 번 돌린 임베딩 검색 0.48보다 낮았다. 병목은 모델의 이해력이 아니라 후보군이었다. 에이전트에게 원 논문의 참고문헌 목록을 통째로 주자 같은 지표가 0.39에서 0.74로 올라갔다.

4절까지는 논문이 실제로 잰 것과 저자들이 달아 둔 유보를 따라간다. 5절에서 평가 데이터 설계 쪽으로 옮기는 대목은 논문에 없는 이 글의 해석이다.

주요 수치

출처: Kim 외, ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research arXiv:2610.02202v1(2026-10-01) 본문 및 표

0.42

검색 도구를 직접 쓴 에이전트의 Recall@20

같은 검색기를 한 번만 돌린 임베딩 검색은 0.48이다. 도구를 직접 다루면 오히려 내려간다

0.39→0.74

참고문헌 목록을 쥐여 줬을 때의 변화

핵심 연구 질문 기준 Recall@20. 찾을 범위를 알려 주면 점수가 거의 두 배가 된다

43.6%

인용조차 되지 않은 정답 논문의 비율

하위분야 질문 기준. 인용 기록만 따라가면 영감의 절반 가까이가 보이지 않는다

43~60%

공저자 라벨이 제1저자 라벨과 겹친 비율

저자들이 예비 실험으로 직접 확인해 적어 둔 숫자다. 정답지에도 사람 사이의 이견이 있다

1

완성되기 전 시점으로 되돌린 질문

논문 검색 도구를 평가하는 흔한 방법은 이미 나온 논문의 초록이나 제목을 질의로 주고 비슷한 논문이 올라오는지 보는 것이다. 이 방식은 연구가 끝난 뒤의 모습을 기준으로 삼는다. ScholarCatalyst는 기준점을 앞으로 당긴다. 연구가 아직 완성되지 않았을 때 저자가 품고 있던 질문을 재구성하고, 그 시점에 어떤 선행 논문이 실제로 도움이 됐거나 도움이 될 수 있었는지를 묻는다.

질문은 두 층으로 나뉜다. 핵심 연구 질문은 프로젝트의 중심 물음 하나를 담고 207개다. 하위분야 질문은 같은 프로젝트를 더 좁은 주제 쪽에서 다시 물은 것으로 687개다. 둘을 합치면 894개이고, 핵심 연구 질문은 평균 131.8토큰으로 길고 정답 논문이 평균 3.19편, 하위분야 질문은 평균 63.5토큰으로 짧고 정답 논문이 평균 6.09편이다. 검색 대상은 원 논문들이 인용한 문헌에 2020년부터 2024년까지의 컴퓨터과학 arXiv 논문 18만여 편을 더한 190,896편이다.

질문은 두 층으로 나뉜다 ScholarCatalyst 질문 894개의 구조 핵심 연구 질문(CoreQ) 207개 평균 131.8토큰 · 평균 정답 3.19편 프로젝트의 중심 질문 하나 질문이 길고 정답은 좁게 모인다 하위분야 질문(SubQ) 687개 평균 63.5토큰 · 평균 정답 6.09편 같은 프로젝트를 좁은 주제로 재질문 질문이 짧고 정답은 넓게 흩어진다 두 질문을 합치면 894개 검색 대상 코퍼스 190,896편(인용 문헌 + 2020–2024 CS arXiv)
▲ 페블러스 원본 도식 | 출처: Kim 외(2026), arXiv:2610.02202v1 3.1절·Table 2 재구성

기존 문헌 검색 벤치마크와 무엇이 다른지는 논문이 표 하나로 정리해 두었다. SciFact, DORIS-MAE, ScholarQABench, LitSearch, MIR 가운데 세 조건을 동시에 만족한 것은 없다. 출간 전 시점의 질문인가, 저자 본인이 라벨을 달았는가, 인용되지 않았어도 영감을 줬으면 정답으로 인정하는가. ScholarCatalyst가 셋을 처음으로 함께 채운다. 소스 논문 100편 넘는 수가 2025년과 2026년 ICLR, ICML, NeurIPS, ACL, CVPR, CoLM, CoRL의 구두 발표나 스포트라이트나 수상 논문이다.

2

정답지를 만든 사람이 그 연구의 당사자다

정답지는 두 단계로 만들어진다. 앞 단계는 기계가 맡는다. 소스 논문의 arXiv 식별자 하나만 있으면 인용 그래프를 해석해 후보를 모으고, Gemini 3.1 Pro가 그 논문이 답하려던 질문을 먼저 써 본다. 인용되지 않은 논문까지 끌어오기 위해 BM25와 Qwen3-Embedding-8B로 코퍼스를 한 번 더 훑고, Gemini 3.6 Flash가 재순위화해 질의마다 후보 열 편으로 줄인다.

뒷 단계가 이 벤치마크의 성격을 정한다. 제1저자나 교신저자가 웹 인터페이스에서 그 후보 열 편을 하나씩 열어 보고, 자기 연구에 영감을 줬는지 또는 그때 알았다면 도움이 됐을지를 표시한다. 표시만으로 끝나지 않고 왜 그런지 이유를 글로 적는다. 기계가 먼저 써 준 질문도 저자가 고칠 수 있다. 894개 질문 가운데 764개, 그러니까 85.5%는 저자 검증을 거치고도 수정 없이 그대로 남았다.

기계가 후보를 좁히고, 저자가 정답을 정한다 ScholarCatalyst 정답지 제작 흐름 1단계 · 기계 arXiv 식별자 하나로 시작 인용 그래프 해석 · 질문 생성 BM25 + 임베딩 검색 + 재순위화 질의당 후보 10편 인용된 논문과 인용되지 않은 논문이 함께 올라온다 2단계 · 저자 184명 후보를 검증하고 고쳐 쓴다 영감 여부를 직접 표시한다 왜 도움이 됐는지 이유를 적는다 완성된 정답지 프로젝트 207건 · 질문 894개(핵심 207 + 하위분야 687) · 코퍼스 190,896편 기계가 써 준 질문의 85.5%는 저자 검증 뒤에도 그대로 남았다 나머지는 저자가 고쳐 쓰거나 다시 썼다
▲ 페블러스 원본 도식 | 출처: Kim 외(2026), arXiv:2610.02202v1 3.2절·3.3절 재구성

이 설계가 무엇을 바꿨는지는 인용 여부를 세어 보면 드러난다. 핵심 연구 질문의 정답 논문은 95.5%가 실제로 소스 논문에 인용되어 있다. 하위분야 질문으로 내려가면 그 비율이 56.4%로 떨어지고, 나머지 43.6%는 인용된 적이 없다. 저자가 그때는 몰랐지만 알았다면 도움이 됐을 논문, 또는 읽었지만 인용할 자리가 없었던 논문이 거기 들어 있다. 인용 관계만으로 정답지를 만드는 방식으로는 이 절반 가까이가 처음부터 보이지 않는다.

3

비슷한 논문과 영감을 준 논문은 다르다

저자가 후보 열 편 가운데 일부를 거부했다는 사실은 그 자체로 쓸모 있는 재료다. 거부된 논문은 같은 검색기가 상위로 올린 것이니 주제상으로는 가까울 수밖에 없다. 저자들은 그 거부 논문과 인정 논문을 어휘 유사도와 임베딩 코사인 유사도 양쪽으로 다시 재 봤다. 거부된 쪽이 인정된 쪽만큼은 유사했다. 적어도 이 두 잣대로는 둘을 가를 수 없다는 뜻이다.

그렇다면 저자들은 무엇을 보고 인정한 것인가. 핵심 영감 사례 663건을 아홉 가지 유형으로 분류한 결과가 답을 준다. 가장 많이 꼽힌 이유는 기법을 변형해 가져온 경우, 자기 방향을 뒷받침하는 실증 근거가 된 경우, 새로운 세팅으로 일반화한 경우, 그리고 어떤 한계를 지적해 새 접근을 촉발한 경우다. 한 논문이 두 유형 이상에 걸친 사례가 55.8%다. 유사도는 두 논문이 같은 주제를 다루는지를 말할 뿐이고, 이 아홉 가지는 한 논문이 다른 연구에 어떤 역할을 했는지를 말한다. 축이 다르다.

유사도로는 안 갈린다, 역할로 갈린다 거부 논문 vs 인정 논문 · 핵심 영감 사례 663건 유사도는 거의 같다 어휘 유사도 거부 인정 임베딩 코사인 유사도 거부 인정 두 잣대로는 구분이 안 된다 갈라낸 것은 역할이다 가장 많이 꼽힌 네 가지 기법 변형 · 실증 근거 새 세팅 일반화 한계 지적이 촉발한 접근 55.8%는 두 유형 이상에 해당 유사도는 주제가 같은지를, 역할은 무엇을 밀어줬는지를 말한다 두 축은 서로 다르다
▲ 페블러스 원본 도식 | 출처: Kim 외(2026), arXiv:2610.02202v1 4.3절 재구성

인용 기록도 이 역할을 대신 가리키지 못한다. 인용된 정답 논문 가운데 쓰거나 확장했다는 뜻의 인용 의도 라벨이 붙은 것은 핵심 연구 질문에서 46.2%, 하위분야 질문에서 34.0%뿐이다. 정답 논문의 49.5%는 아예 그 프로젝트의 주제 영역 바깥에서 왔다. 영감은 옆 분야에서 건너오는 일이 절반 가까이 된다는 말이다.

소스 논문 전문과 참고문헌 목록을 통째로 넣어 주고 Gemini 3.1 Pro에게 영감을 준 논문을 짚어 보라고 시킨 실험도 있다. 핵심 연구 질문의 정답 논문 가운데 평균 32.2%만 맞았고, 28.0%의 사례에서는 핵심 영감 논문을 하나도 짚지 못했다. 완성된 논문을 다 읽고 그 논문이 인용한 목록까지 본 뒤에도 그렇다.

4

검색 도구를 직접 다뤄도 더 못 찾는다

시험에는 검색기 단독 방식과 에이전트 방식이 함께 올랐다. 검색기 단독은 질의를 한 번 던져 상위 문서를 받는다. 에이전트는 같은 검색기를 도구로 삼아 여러 번 호출하면서 중간 결과를 보고 다음 질의를 정한다. 상식적으로는 뒤쪽이 유리하다. 결과는 반대로 나왔다.

아래 표의 R@20은 저자가 인정한 정답 논문 가운데 검색 결과 상위 20위 안에 들어온 비율이다. 심층 탐색 에이전트는 질문을 하위 질문 여러 개로 쪼갠 뒤 탐색을 반복한다. 제목·초록 정규식 탐색은 임베딩을 쓰지 않고 코퍼스의 제목과 초록을 정규식으로 직접 훑는다.

방식 핵심 연구 질문 R@20 하위분야 질문 R@20
임베딩 검색 (모델별 최고값) 0.39 0.51
심층 탐색 에이전트 (o3) 0.33 0.38
어휘 검색 (BM25) 0.23 0.33
제목·초록 정규식 탐색 (GPT-4.1) 0.06 0.09

임베딩 최고값은 핵심 연구 질문에서 Qwen3-Embedding-4B, 하위분야 질문에서 Qwen3-Embedding-8B가 냈다. 두 질문 유형을 개수로 가중평균하면 임베딩 검색이 0.48, 같은 검색기를 도구로 호출한 GPT-4.1 에이전트가 0.42다. 출처: arXiv:2610.02202v1 표 3.

표 맨 아래 줄이 병목의 성격을 먼저 드러낸다. 논문은 각 에이전트가 탐색 과정에서 정답 논문을 한 번이라도 마주친 비율을 따로 셌다. 정규식 탐색은 8%였고, 같은 검색기를 도구로 쓴 에이전트는 46%였다. 정규식 쪽은 순위를 잘못 매긴 것이 아니라 정답을 아예 만나지 못한 것이다. 그리고 46%를 마주치고도 최종 상위 20위에 올린 것은 41%였다. 어느 경우든 점수의 상한을 정하는 것은 눈앞에 올라온 후보의 범위다.

과학 문헌 전용으로 학습한 모델이 유리할 것 같지만 그쪽도 아니다. SPECTER2와 OpenScholar는 범용 임베딩 모델보다 핵심 연구 질문에서 적어도 16점, 하위분야 질문에서 적어도 27점 낮다. 참고용으로 표에 따로 표기된 기록도 있다. Claude Fable 5.1을 백본으로 쓴 심층 탐색 에이전트가 0.51을 냈는데, 지식 컷오프 이후 공개된 소스 논문을 학습에서 봤을 가능성이 있어 공정한 비교가 아니라고 저자들이 선을 그었다. 그 조건에서도 절반 가까이를 놓친다.

도구를 더 많이 쓰고도 왜 덜 찾아내는지는 에이전트가 할 수 있는 일을 따져 보면 간단하다. 에이전트가 부를 수 있는 도구는 결국 같은 유사도 기반 검색기다. 질의를 바꿔 가며 여러 번 불러도 그 검색기가 애초에 상위로 올리지 않는 논문은 에이전트 앞에 한 번도 나타나지 않는다. 논문은 이 병목을 후보 포괄성이라고 부른다. 백본 모델을 키우면 조금씩 나아지기는 한다. 에이전트의 recall은 백본의 일반 지능 점수와 스피어만 상관 0.67로 움직인다. 다만 가장 강한 모델도 검색기 단독 성능에 겨우 닿는 수준에서 멈춘다.

부족한 것은 이해력이 아니라 후보군이다 핵심 연구 질문 Recall@20 · 같은 에이전트, 다른 입력 검색기만 도구로 줬을 때 질의를 바꿔 가며 여러 번 호출한다 검색기가 올리지 않는 논문은 끝내 눈앞에 나타나지 않는다 0.39 참고문헌 목록까지 줬을 때 원 논문이 인용한 목록을 그대로 입력에 넣어 준다 볼 문헌이 먼저 정해진다 0.74 모델도 도구도 그대로, 바뀐 것은 입력뿐 읽고 판단하는 능력보다 어느 문헌을 볼지가 더 모자란다 질의 재작성과 HyDE로는 같은 폭의 개선이 나오지 않았고, HyDE는 오히려 recall을 깎았다
▲ 페블러스 원본 도식 | 출처: Kim 외(2026), arXiv:2610.02202v1 표 4·표 5 재구성

결정적인 대조 실험은 입력 하나만 바꾼 것이다. 원 논문의 인용 목록을 그대로 에이전트 앞에 놓자 핵심 연구 질문 Recall@20이 0.39에서 0.74로 올라갔다. 모델도 도구도 그대로다. 어디를 봐야 하는지가 주어졌을 뿐이다. 반대 방향의 처방은 효과가 없었다. 질의를 LLM으로 다시 쓰거나 여러 개로 늘려도 유의미한 개선이 나오지 않았고, 가상의 답변 문서를 먼저 지어 검색하는 HyDE는 recall을 오히려 크게 깎았다. 질문을 아무리 잘 다듬어도 후보군 밖에 있는 논문은 들어오지 않는다.

다만 이 대조에는 저자들이 달아 둔 단서가 있다. 원 논문의 참고문헌 목록에는 핵심 연구 질문 정답 논문의 95%가 이미 들어 있다. 거의 정답지를 건네준 셈이라 0.74를 도달 가능한 목표로 읽을 수는 없고, 같은 조건에서 하위분야 질문은 0.47에서 0.57로 오르는 데 그쳤다. 그래도 대조가 가리키는 방향은 바뀌지 않는다. 소스 논문의 제목과 초록만 준 경우에는 핵심 연구 질문이 0.11 오르는 데 머물렀으니, 점수를 끌어올린 것은 읽을 거리의 양이 아니라 후보 목록 자체다.

5

정답지는 누가, 어떤 근거로 만드는가

저자들은 자기 정답지를 완벽하다고 말하지 않는다. 논문 한 건을 골라 공저자 세 명에게 독립적으로 라벨을 달게 해 본 예비 실험이 5절에 적혀 있다. 공저자들이 표시한 정답 논문 가운데 제1저자의 라벨과 겹친 것은 43%에서 60% 사이였고, 정밀도는 84%에서 88% 사이였다. 같은 연구를 함께한 사람들끼리도 무엇이 영감이었는지에 대해 절반 남짓만 동의한다는 뜻이다. 라벨 자체가 저자 본인의 사후 회고이므로 시간이 지나 다시 보면 바뀔 수 있다는 점도 논문에 함께 적혀 있다.

그렇다고 저자들이 이 수치를 기계 쪽에 유리한 근거로 넘기지는 않는다. 같은 대목에서 43%에서 60%라는 그 겹침조차 최고 성능 시스템의 R@5 0.24보다 한참 위라고 짚는다. 사람끼리 절반쯤만 합의하는 과제인데 기계는 그 합의 수준 근처에도 가지 못한다. 그래서 저자들은 이 예비 실험을 정답지가 흔들린다는 증거가 아니라 아직 올라갈 자리가 많이 남았다는 증거로 읽는다.

이 시험이 덮는 범위에도 한계가 있다. 대상은 2025년과 2026년의 컴퓨터과학 프로젝트에 한정되고, 다른 분야를 대표한다고 보기 어렵다. 코퍼스도 190,896편이다. Semantic Scholar 전체가 2억 2,500만 편이니 실제 문제는 이 시험이 재는 것보다 훨씬 크다. 저자들은 1986년 스완슨이 말한 발견되지 않은 공개 지식, 그러니까 이미 공개되어 있는데 아무도 연결 짓지 못한 지식의 문제와 이 과제를 같은 줄에 놓는다. 이들이 내다보는 쓸모도 거기에 있다. 한 사람이 따라갈 수 있는 분야의 폭에는 한계가 있으니, 여러 분야를 가로질러 전문가 수준의 판단을 하는 시스템이 나온다면 뻔히 공개되어 있는데도 아무도 잇지 못한 진전을 풀어낼 수 있으리라는 것이다. 연구자를 묶는 것도 판단하는 능력이라기보다 그동안 본 것의 폭일 수 있다고 저자들은 조심스럽게 덧붙인다.

그럼에도 이 정답지에서 읽히는 설계 원칙은 분명하다. 첫째, 누가 라벨을 다는가를 바꿨다. 주제가 가까운지 판단하는 일은 외부 작업자도 할 수 있지만, 무엇이 자기 연구를 밀어 줬는지는 그 연구를 한 사람만 안다. 둘째, 라벨에 이유를 붙였다. 아홉 가지 역할 분류는 사후에 만들어진 것이 아니라 저자들이 적어 둔 이유에서 나왔다. 셋째, 정답의 조건을 기록에서 떼어 냈다. 인용되지 않았어도 영감을 줬으면 정답으로 센다는 결정 하나가 하위분야 질문 정답의 43.6%를 살려 냈다.

평가 데이터를 만드는 자리에서는 이 세 가지가 그대로 질문이 된다. 우리가 AI에게 시키는 일의 정답지는 누가 만들고 있는가. 그 사람은 정답을 판정할 자격이 있는 사람인가, 아니면 판정하기 편한 자리에 있던 사람인가. 그리고 왜 그것이 정답인지가 라벨 옆에 남아 있는가. 평가 데이터 설계를 다루는 글은 채점자를 따로 세우는 문제에서도 이어 볼 수 있고, 벤치마크 점수가 무엇에 붙은 점수인지 되묻는 사례는 증거가 바뀌어도 선택이 제자리인 비전언어모델 시험에 있다.

Editor's Note

페블러스가 데이터 품질을 들여다볼 때 자주 되묻는 물음이 라벨의 출처다. 이 라벨은 누가 달았고, 그 사람은 왜 그렇게 달았는지가 남아 있는가. ScholarCatalyst는 두 물음에 모두 답을 남긴 드문 사례이고, 그러면서도 사람끼리 43%에서 60%만 겹친다는 사실을 함께 공개했다. 좋은 평가 데이터가 완벽한 데이터라는 뜻은 아니라는 것, 다만 어디까지 믿을 수 있는지를 함께 적어 둔 데이터라는 것을 이 벤치마크가 보여 준다. 이 연결은 논문의 주장이 아니라 이 글의 해석이다.

여기까지 읽어 주셔서 감사하다. 원문은 arXiv:2610.02202에서 전문을 볼 수 있고, 코드와 데이터셋은 각각 GitHub와 Hugging Face에 공개되어 있다. 이 글의 수치는 본문과 표에서 직접 확인했다. 평가 데이터를 직접 만들어 본 팀이 있다면 라벨에 이유를 남기는 일을 어떻게 설계했는지 나눠 주시면 좋겠다.

(주)페블러스 데이터 커뮤니케이션팀
2026년 10월 3일

참고문헌

  • 1.Kim, S., Lee, Y., Liu, B., Ko, D., Shao, R., Kim, S., Neubig, G., Koh, P. W., Chowdhery, A., Asai, A., Khattab, O., Choi, Y., Kim, G., & Finn, C. (2026). ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research. arXiv:2610.02202
  • 2.Stanford IRIS Lab. (2026). ScholarCatalyst (code repository). GitHub
  • 3.ScholarCatalyst. (2026). ScholarCatalyst (dataset). Hugging Face Datasets