Executive Summary

이 글은 벤치마크 하나를 뜯어보는 글이 아니라, 4년 8개월 동안 arXiv에 올라온 평가 자료 논문 14,767편이 저마다 어떤 설계를 골랐는지 그 분포를 읽는다. 요즘 누구나 하는 말이 있다. 이제 AI가 시험 문제를 내고, AI가 그 답을 채점한다는 것이다. 이 글은 그 말을 주장하지 않는다. 저자가 코드와 데이터까지 통째로 공개한 덕에, 그 말이 얼마나 맞는지를 세어 볼 수 있게 됐다.

세어 보니 채점석에서는 실제로 교대가 일어났다. 사람이 미리 써 둔 정답과 맞춰 보던 방식이 물러나고, 모델이 답을 읽고 점수를 매기는 방식과 코드를 돌려 결과로 판정하는 방식이 올라왔다. 그런데 출제석에서는 같은 일이 일어나지 않았다. 모델이 문항을 만드는 비율은 2022년 이후 가파르게 올라 절반에 닿은 뒤, 그 자리에서 움직이지 않는다. 두 역할은 하나의 자동화 눈금으로 묶이지 않는다. 이것이 이 연구의 진짜 발견이다.

그렇다면 통념이 가리키는 시험, 그러니까 문항도 모델이 만들고 채점도 모델이 하며 그 밖에 사람도 정답지도 실행 검사도 전혀 없는 설계는 얼마나 될까. 저자가 함께 올린 데이터 파일을 열어 세어 보면 많아야 마흔에 하나다. 많아야라고 적는 이유는, 문항을 만든 모델과 채점한 모델이 같은 모델인지를 논문 단위 라벨로는 가릴 수 없기 때문이다. 그리고 이 숫자들을 논문마다 붙인 것도 한 대의 모델이었고, 그 라벨이 맞는지는 끝내 측정되지 않았다. 저자는 그 사실을 숨기지 않고 함께 공개했다. 그래서 이 글이 남기려는 물음은 하나다. 우리가 인용하는 AI 성적표는 누구의 잣대로 매겨졌나.

25.8% → 40.3%

모델이 답을 읽고 점수를 매긴 논문 비중

2024년과 2026년 1~8월을 맞춰 비교한 값. 5% 라벨 오류를 가정해도 방향이 바뀌지 않는다

9.8% → 4.7%

사람이 직접 점수를 매긴 논문 비중

비중은 반 토막이지만 편수는 165편에서 268편으로 늘었다. 줄어든 것은 몫이지 총량이 아니다

49.5% → 51.3%

모델이 만든 자료가 들어간 논문 비중

같은 오차 가정에서 부호가 뒤집힌다. 올랐다고 말할 수 있는 값이 아니다

많아야 2.4%

문항도 채점도 모델뿐이고 다른 검사가 없는 설계

유효 14,763편 중 359편. 두 역할을 같은 모델이 맡았는지는 가릴 수 없어 상한이다

1

성적표에 안 적히는 일곱 칸

AI 모델의 점수를 이야기할 때 우리는 보통 점수만 본다. 어느 시험에서 몇 점을 받았고, 지난 모델보다 몇 점 올랐는지. 그런데 점수가 나오려면 먼저 시험지가 있어야 하고, 시험지에는 만든 사람이 있다. 문항을 누가 썼고, 정답을 누가 정했고, 점수를 누가 매겼는지. 이 세 가지는 모델의 성질이 아니라 평가 자료의 성질이다. 다시 말해 평가는 모델을 재는 자이기 이전에 그 자체로 하나의 데이터셋이고, 데이터셋에는 품질 이력이 있어야 한다.

학습 데이터에는 우리가 이미 그 질문을 한다. 어디서 왔나, 누가 라벨을 붙였나, 무엇에서 파생됐나. 그런데 같은 질문을 평가셋에는 거의 하지 않는다. 독립 연구자 차오 왕이 2026년 9월 15일 arXiv에 올린 프리프린트 한 편이 바로 그 질문을 양식으로 만들었다. 이 연구는 평가 자료를 새로 내놓거나 갱신한 논문을 모아, 각 논문이 어떤 설계를 골랐는지를 일곱 개의 칸에 적었다.

1.1설계를 적는 일곱 칸

일곱 칸은 아래와 같다. 각 칸이 무엇을 기록하는지는 논문 부록의 표 하나에 정의돼 있고, 그 정의가 이 연구의 모든 수치를 떠받친다. 뒤에서 다룰 두 칸은 다섯 번째와 여섯 번째, 그러니까 자료 출처와 채점원이다.

칸 무엇을 적는가
대상 시스템답을 내는 모델, 도구와 환경을 다루는 에이전트, 몸을 제어하는 시스템 중 어느 것인지. 제출된 코드를 채점하려고 돌려 보는 것만으로는 에이전트가 되지 않는다
평가 분야실제로 시험한 지식·응용 분야. 논문의 배경 설정이 아니라 시험 내용 기준
평가 조건문항이 고정돼 있는가, 실행 중에 만들어지는가, 행동에 따라 되먹임이 오는가
양식입력과 채점 대상 출력의 형태. 글·이미지·영상·음성·코드·구조화 데이터
자료 출처평가 내용이 어디서 왔는가. 사람이 쓰거나 실세계에서 기록한 것, 생성 모델이 만든 것, 프로그램이나 시뮬레이터가 만든 것
채점원문항 하나의 점수를 누가 내는가. 참조·메트릭, 실행·환경 결과, 사람 심판, LLM 심판, 그 밖의 학습된 채점자
과제 언어실제 문항·지시·요구 응답에 쓰인 자연어. 논문이 쓰인 언어가 아니다

일곱 개의 코딩 필드(논문 표 1). 굵게 표시한 두 칸이 이 글의 주인공이다. 채점원 칸의 정의에는 단서가 하나 붙어 있다. 문항 하나의 점수를 무엇이 만들어 내는지를 세는 것이지, 그 점수들을 어떻게 평균 내는지를 세는 것이 아니다.

1.2115만 건에서 14,767편으로

이 연구는 arXiv의 모든 논문을 하나씩 다 읽은 것이 아니다. 단계마다 걸러 내는 선별 파이프라인이고, 그 사실을 저자 본인이 논문에 적었다. "This selective pipeline may miss eligible papers before full-text assessment." 저장소에 함께 올린 방법 기록에는 더 분명하게 적혀 있다. 상위 15%라는 기준은 "보수적인 개발 선택이지 모집단 재현율 보장이 아니다"라는 것이다.

1,153,355건 arXiv 메타데이터 수확 전체 ↓ 로컬 분류기가 월별 상위 15%만 다음 단계로 보낸다. 980,323건은 초록도 읽히지 않았다 173,032건 초록 심사 대상 ↓ 명시 제외 131,525건. 판단이 불확실한 25,079건은 본문으로 아예 보내지 않았다 16,428건 전문 심사 후보 ↓ 원문 확보 실패 52건, 심사 후 제외 1,424건, 미해결 185건 14,767편 최종 포함 이 글의 모든 비율이 깔고 있는 모집단이다. 처음 프레임의 1.3%에 해당한다

저자가 공개한 흐름 기록(flow.json)과 논문 그림 1의 값. 막대 길이는 눈금이 아니라 단계 표시용이다. 실제 감소 폭은 각 단계에 적힌 수로 읽어야 한다.

여기에 단서가 둘 걸린다. 첫째, 14,767이라는 수는 논문 레코드의 수이지 서로 다른 벤치마크의 수가 아니다. 논문은 이 점을 문장으로 못 박는다. 같은 벤치마크 계열의 후속 논문은 따로 한 건씩 들어간다. 둘째, 이 분포는 채택률이 아니다. 인용수나 인기, 실제 사용량으로 가중치를 주지 않았다고 저자가 명시한다. 그러니 뒤에 나올 40.3%를 "업계가 쓰는 시험의 40%"로 읽으면 틀린다. 제안된 설계 가운데 그만큼이 그 방식을 골랐다는 뜻이다.

가중치를 주지 않은 것은 빠뜨린 것이 아니라 고른 것이다. 저자가 서론에 이유를 적었다. 어떤 평가 자료는 뒤이은 실험에 거의 등장하지 않더라도 모델이 무엇을 할 수 있어야 하는가에 관한 제안을 기록으로 남긴다는 것이다. "Its value as evidence of a research proposal is therefore distinct from its influence as a measurement tool." 연구 제안의 증거로서 갖는 값은 측정 도구로서 갖는 영향력과 별개라는 뜻이다. 그러니 이 코퍼스는 업계가 무엇을 쓰는지의 기록이 아니라 연구자들이 무엇을 요구했는지의 기록이고, 이 글이 세는 비율은 전부 요구의 분포다.

무엇이 이 코퍼스에 들어오는지에도 조건이 붙는다. 점수를 받는 쪽이 LLM이어야 한다. 코딩 지침의 문장이 분명하다. "A model used only to create data, annotate, embed, judge, or process material is not the benchmark target." 자료를 만들거나 주석을 달거나 채점만 하는 모델은 이 시험의 대상이 아니라는 것이다. 이름에 벤치마크가 붙었다는 것, 코드가 공개돼 있다는 것, 비교 대상이 여럿이라는 것도 그것만으로는 자격이 되지 않는다.

그리고 선별의 한계에는 방향이 하나 붙는다. 저자는 월별 라우팅과 분류기의 옛 학습 목표, 선별적인 초록 심사가 이른 시기의 용어나 다른 기여와 함께 발표된 자료를 유독 많이 놓칠 수 있다고 적고, 그래서 "differences across years or domains may partly reflect selection"이라고 잇는다. 연도나 분야 사이의 차이 가운데 일부는 실제 변화가 아니라 걸러 내는 방식이 만들어 낸 것일 수 있다는 뜻이다. 아래에 나오는 모든 추세에 이 단서가 함께 걸린다.

범위의 한계도 하나 있다. 이 코퍼스는 공개된 arXiv 제안만 담는다. 저자는 "not all public or private evaluation resources"라고 적었다. 기업이 사내에서만 쓰는 평가셋은 애초에 여기 없다. 그리고 이 연구가 보는 것은 설계이지, 그 시험이 표방한 개념을 실제로 재는지가 아니다. 저자는 한계 절에서 그 물음을 다른 연구에 넘기는데, 이 블로그가 열흘 전에 다룬 AI 편향 검사, 정작 재는 건 추론 실력이 바로 그 넘겨받은 쪽의 연구다. 이번 글은 시험지의 설계를 묻고, 그 글은 그 시험지에 붙은 이름이 맞는지를 묻는다.

2

채점석에서 일어난 교대

이 연구에서 가장 확실한 변화는 점수를 누가 내는가라는 칸에 있다. 최근 두 해 사이에 뚜렷한 자리바꿈이 일어났다. 아래 그림은 1월부터 8월까지만 잘라 해마다 조건을 맞춘 코호트에서, 다섯 가지 채점원이 각각 몇 퍼센트의 논문에 등장했는지를 보여 준다. 한 논문이 여러 채점원을 함께 쓸 수 있으므로 한 해의 다섯 값을 더하면 100%를 넘는다.

2024 2025 2026 (1~8월) LLM 심판 25.8% 35.5% 40.3% 참조·메트릭 72.6% 68.2% 59.6% 실행·환경 결과 16.9% 20.0% 28.4% 사람 심판 9.8% 7.0% 4.7% 그 밖의 학습 채점자 10.8% 8.9% 7.0% 0% 50%

채점원 다섯 종류의 등장 비율. 분모는 채점원 칸이 유효한 논문 수로, 2024년 1,681편, 2025년 3,283편, 2026년 1~8월 5,734편이다. 채점원은 서로 배타적이지 않아 한 논문에 여러 라벨이 붙으며, 따라서 한 해의 합은 100%를 넘는다. 저자는 이 움직임이 "대체가 일어났다거나 채점 품질이 달라졌다는 것을 확립하지 않는다"고 적었다.

세 코호트를 나란히 놓으면 오른 것이 둘, 내린 것이 셋이다. 모델이 답을 읽고 점수를 매기는 방식은 25.8%에서 40.3%로, 코드나 환경을 돌려 결과로 판정하는 방식은 16.9%에서 28.4%로 올랐다. 반대로 사람이 미리 써 둔 정답과 맞춰 보는 방식은 72.6%에서 59.6%로 내렸다. 여전히 가장 흔한 방식이긴 하지만, 두 해 만에 13%p를 내준 셈이다.

그림이 2024년에서 시작하는 것은 분모가 큰 코호트만 나란히 놓기 위해서다. 같은 1~8월 기준으로 더 뒤로 물리면 폭이 훨씬 벌어진다. 모델 채점은 2022년 0.0%에서 2023년 13.6%를 거쳐 40.3%에 닿았고, 참조·메트릭은 88.4%에서 59.6%로 내려왔다. 다만 2022년의 0.0%에는 저자가 직접 단서를 달았다. 이 선별된 코퍼스에 대한 관찰이지 그런 채점이 당시 학계 전체에 없었다는 증거가 아니라는 것이다. 실행·환경 채점은 오히려 세 해 동안 17.4%, 16.0%, 16.9%로 붙박이였다가 최근 두 해에만 28.4%로 뛰었다.

한 논문에 채점원 라벨이 여럿 붙는다는 것은 답 하나를 여러 심판이 함께 본다는 뜻이 아니다. 저자가 든 예가 WebArena다. 이 평가는 어떤 과제에서는 웹사이트의 상태를 프로그램으로 확인하고, 다른 과제에서는 참조 답안과 뜻이 같은지를 GPT-4에게 묻는다. "Multiple scoring labels can therefore describe different tasks within one benchmark, rather than multiple judges assessing every response." 라벨이 둘이라는 것은 대개 한 시험 안에서 과제마다 채점 방식이 다르다는 뜻이지, 같은 응답을 두 번 검사한다는 뜻이 아니다. 4절에서 혼합 설계를 읽을 때 이 구분이 결정적으로 중요해진다.

내림세 쪽에도 단서가 붙는다. 참조·메트릭이 13%p를 내준 것을 그 방식이 버려지는 중이라고만 읽으면 조금 지나치다. 코딩 지침은 실행이나 상호작용 상태를 확인하는 단정문은 결정론적 비교를 쓰더라도 실행·환경 쪽으로 세라고 지시하고, 이어서 못 박는다. "do not count that same checker again as reference_or_metric." 같은 검사기를 양쪽에 두 번 세지 말라는 것이다. 그러니 실행 채점이 16.9%에서 28.4%로 오르는 동안 참조·메트릭이 내준 몫의 일부는 검사가 사라진 것이 아니라 같은 검사가 다른 칸으로 옮겨 간 것일 수 있다.

이 움직임이 특별히 단단한 이유가 하나 있다. 저자는 해마다 라벨의 5%가 틀렸다고 가정하는 최악의 시나리오를 따로 돌려 두었다. 그 가정 아래서도 LLM 채점의 변화는 +4.53%p에서 +24.49%p 사이에 머문다. 폭은 넓지만 부호는 바뀌지 않는다. 뒤에 나올 자료 출처 쪽과 대비되는 지점이 정확히 여기다.

성격이 다른 두 번째 시나리오도 있다. 라벨을 뒤집는 대신, 자격이 없었을 수 있는 논문을 해마다 5%까지 덜어 내되 가장 불리한 쪽으로 몰아서 덜어 내는 경우다. 그래도 LLM 채점의 증가는 +10.02%p 아래로 내려가지 않는다. 저자는 두 시나리오를 합쳐서 돌린 것이 아니고 애초에 놓친 논문은 어느 쪽도 다루지 못한다고 적는다. 그래도 서로 다른 방식으로 흔들어 본 결과가 같은 방향이었다는 것은 기록해 둘 만하다.

2.1사람은 밀려난 것이 아니라 자리를 옮겼다

사람 심판이 9.8%에서 4.7%로 내려간 것을 보고 사람이 평가에서 손을 뗀다고 읽기 쉽다. 그 독해는 두 군데서 어긋난다.

첫째, 이 칸이 세는 것은 직접 채점뿐이다. 코딩 지침이 명시한다. "Human creation or review of references is not human judging." 사람이 정답을 써 두거나 참조 답안을 검수한 경우는 사람 심판이 아니라 참조·메트릭 쪽으로 들어가고, 그 자료 자체는 사람·실세계 자료로 잡힌다. 그 두 값은 2026년에도 각각 59.6%와 79.0%다. 사람의 손은 채점석에서 출제석과 정답지로 옮겨 앉았을 뿐, 어느 쪽에서도 다수를 내주지 않았다.

둘째, 줄어든 것은 몫이지 총량이 아니다. 사람이 직접 채점한 논문은 165편에서 268편으로 62% 늘었다. 같은 기간 코퍼스 자체가 세 배 넘게 불어나는 바람에 비중이 반 토막으로 보이는 것이다. 가장 널리 인용되는 공개 리더보드인 LMArena도 지금까지 사람 투표로 순위를 매긴다. 다만 리더보드의 투표 건수와 이 연구의 논문 비중은 세는 단위가 완전히 다르므로, 두 숫자를 나란히 놓고 어느 쪽이 더 많다고 말할 수는 없다.

2.2에이전트가 늘어서 생긴 일이 아니다

LLM 채점이 늘어난 이유로 가장 먼저 떠오르는 설명은 에이전트다. 도구를 쓰고 환경을 돌아다니는 시스템은 정답을 하나로 적어 둘 수 없으니 심판이 필요하고, 그런 평가가 늘었으니 심판도 늘었다는 것이다. 저자는 이 설명을 숫자로 떼어 냈다. 에이전트를 다루는 논문 안에서 LLM 채점은 26.3%에서 44.0%로 올랐고, 에이전트가 아닌 논문 안에서도 25.7%에서 38.8%로 올랐다. 두 집단 모두에서 오른 것이다.

전체 14.51%p의 변화를 둘로 쪼개면 그림이 더 분명해진다. 에이전트 논문의 비중 자체가 커진 몫은 0.56%p뿐이고, 나머지 13.95%p는 각 집단 안에서 일어난 변화다. 다만 이 분해는 인과 분석이 아니라 산술 배분이다. 저자도 주장 대장에 "a symmetric arithmetic allocation under this grouping, not a causal effect"라고 적었다. 정확히 말하면 이렇다. 에이전트 평가가 늘어난 것으로 설명되는 몫은 0.56점밖에 되지 않는다.

이 결론이 한 쌍의 연도에만 기대고 있지 않다는 것은 저장소에 함께 실린 표에서 확인된다. 저자는 같은 분해를 열 개의 창에서 돌렸고, 모든 창에서 구성비 몫이 1점을 넘지 않는다. 가장 긴 창인 2022년 1~8월부터 2026년 1~8월까지를 보면 총 변화 40.27%p 가운데 구성비 몫은 0.69%p이고 나머지 39.58%p가 집단 안의 변화다. 그 4년 8개월 사이에 에이전트를 다루는 논문의 비중 자체는 1.4%에서 28.3%로 스무 배가 됐다. 판이 그만큼 뒤바뀌었는데도 그것으로 설명되는 몫이 1점을 넘지 않는다.

2.3열세 분야 가운데 열둘

분야별로 쪼개도 방향은 거의 같다. 저자가 나눈 13개 분야 가운데 12개에서 LLM 채점 비중이 올랐고, 오른 폭은 9%p에서 25%p 사이에 걸쳐 있다. 의료·바이오가 28.3%에서 53.4%로 25.1%p 올라 가장 컸고, 언어·커뮤니케이션이 23.7%p, 자연과학이 21.0%p로 뒤를 이었다. 의료 쪽에서는 이제 평가 논문 둘 중 하나가 모델에게 채점을 맡긴다는 뜻이다.

방향이 다른 분야는 공학 하나다. 32.8%에서 30.5%로 2.3%p 내렸다. 이 한 건을 유별난 예외로 부풀리지 않는 편이 정확하다. 공학의 2024년 셀은 61편으로 작고, 무엇보다 여기서 읽을 것은 열둘이 함께 오르는 가운데 하나만 반대로 갔다는 사실이다. 공학에서 코드를 직접 돌려 채점하는 방식이 이미 자리를 잡고 있었다는 설명이 가능하지만, 이 연구의 자료만으로 그 이유를 가릴 수는 없다.

저자의 오차 시나리오가 이 신중함을 뒷받침한다. 해마다 3%의 라벨이 틀렸다고 가정하면, 13개 분야 가운데 감소가 음수로 남는 것은 일반·범용과 언어·커뮤니케이션 둘뿐이다. 공학의 −2.3%p는 그 가정 아래서 부호를 지키지 못한다. 방향이 다른 분야가 하나 있었다고는 말할 수 있지만, 공학에서 모델 채점이 실제로 줄었다고는 이 자료로 말할 수 없다.

3

출제석은 절반에서 멈춰 있다

평가 내용을 누가 만들었는가. 이 칸에서는 채점석에서 본 것과 같은 일이 일어나지 않는다. 그런데 "일어나지 않았다"를 "AI가 문제를 만드는 일은 아직 드물다"로 읽으면 사실과 정반대가 된다. 실제로는 이미 벌어질 만큼 벌어진 뒤였다.

50% 0% 15.6% 2022 37.6% 2023 49.5% 2024 52.5% 2025 51.3% 2026 1~8월 3년 만에 세 배 넘게 그 뒤로는 절반 언저리

모델이 만든 자료가 들어간 논문의 비율. 2022년부터 2025년까지는 그해 전체 기준이고, 맨 오른쪽 막대만 2026년 1~8월 값이다. 같은 축에 올렸지만 마지막 막대의 관측 기간이 짧다는 점을 감안해 읽어야 한다. 저자도 미완성 연도를 앞선 온전한 연도들과 성장률로 직접 비교하지 말라고 적었다.

2022년에는 일곱에 하나였다. 2024년에는 둘에 하나가 됐다. 3년 만에 세 배 넘게 뛴 것이다. 그리고 거기서 멈췄다. 저자의 표현이 정확하다. "an early expansion of model involvement in material creation coexists with a much less pronounced recent change." 이른 확장이 먼저 있었고, 최근의 변화는 그에 비하면 훨씬 덜 뚜렷하다는 뜻이다. 부재가 아니라 포화다.

3.1오르는지조차 말할 수 없는 값

2024년과 2026년의 1~8월 코호트를 맞춰 비교하면 이 칸의 변화는 +1.81%p다. 작지만 양수이니 조금은 올랐다고 쓰고 싶어진다. 그런데 앞 절에서 본 그 오차 시나리오를 여기에도 걸면 범위가 −8.17%p에서 +11.79%p가 된다. 부호가 뒤집힌다. 저자의 문장은 이렇다. 네 개의 큰 증가는 그 가정 아래서도 양수로 남지만, "smaller material, fixed-collection, and English-only differences can change direction under the same scenario."

그러니 이 글의 뼈대가 되는 비대칭은 이렇게 적는 것이 정확하다. 채점 쪽은 오르는 것이 확실하고, 자료 쪽은 오르는지조차 말할 수 없다. 두 역할을 하나의 자동화 눈금에 올려놓고 함께 올라간다고 말할 수 없는 이유가 여기 있다.

혹시 정의가 느슨해서 51.3%가 부풀려진 것은 아닐까. 반대다. 코딩 지침은 생성 모델이 평가 내용을 "만들거나 실질적으로 고쳐 쓴" 경우만 이 라벨을 붙이라고 지시한다. 그리고 못 박는다. "Faithful copying, extraction, OCR or transcription of existing content is not generative authorship, even if an LLM performs it." 모델이 옮겨 적기만 했으면 세지 않는다는 것이다. 규칙이나 생성 프롬프트를 사람이 설계한 것, 생성된 문항을 사람이 고르고 고친 것도 그것만으로는 사람 자료로 치지 않는다. 즉 51.3%는 넉넉히 센 값이 아니라 오히려 하한에 가깝다.

아예 세지 않는 것도 있다. 코딩 지침은 학습용 데이터와 제작 지시문, 그리고 심판에게 주는 프롬프트를 이 칸 바깥에 둔다고 명시한다. 그러니 채점 기준표를 모델이 썼더라도 자료 출처 칸은 꿈쩍하지 않는다. 문항이 아니라 잣대 쪽에서 일어난 모델 참여는 이 51.3%에 한 건도 들어 있지 않다는 뜻이다. 이 글이 뒤에서 다룰 위험의 상당 부분이 하필 그 잣대 쪽에 있다.

3.2문항은 여전히 미리 만들어 둔다

출제 자동화를 가장 극적으로 보여 줄 만한 설계는 따로 있다. 시험을 치르는 도중에 문항을 새로 만들어 내는 방식이다. 그 비율은 2024년 6.7%, 2025년 7.0%, 2026년 7.5%다. 세 해 연속 열에 하나에도 못 미친다. 반대로 문항을 미리 정해 두는 설계는 95.7%, 95.3%, 95.0%로 사실상 꿈쩍하지 않는다. 사람이 쓰거나 실세계에서 기록한 자료도 86.3%에서 79.0%로 줄긴 했지만 여전히 압도적 다수다.

흔한 오독이 하나 있다. 같은 기간 상호작용을 요구하는 평가는 9.5%에서 28.2%로 세 배가 됐다. 고정 문항이 95%로 붙박이인데 상호작용이 늘었다는 것이 모순처럼 보이지만, 두 값은 동시에 참이다. 코딩 지침이 두 라벨을 독립적으로 판정하라고 지시하기 때문이다. 미리 만들어 둔 과제 묶음이 닫힌 되먹임 상호작용을 요구할 수 있다. 그러니 정적 평가의 시대가 끝나고 상호작용의 시대가 왔다는 식의 서사는 이 데이터에서 나오지 않는다. 바뀐 것은 문항을 푸는 방식이지 문항을 만드는 시점이 아니다.

저자가 실례를 하나 든다. Asuka-Bench는 웹 개발 과제 50개를 미리 정해 두지만, 코드 에이전트가 브라우저에서 돌아간 결과와 되먹임을 받아 자기 구현을 고쳐 나가게 한다. 과제 묶음은 고정이고 과제를 푸는 과정은 상호작용이다. 실제로 두 라벨이 함께 붙은 논문은 2024년 1~8월 7.8%에서 2026년 같은 기간 25.1%로 늘었다. 고정 문항이 95%로 붙박인 채, 그 안쪽에서 푸는 방식만 바뀐 것이다.

모델이 만든 시험지를 쓰는 것 자체가 문제라는 말은 아니다. 합성 데이터로 만든 평가셋이 어떤 조건에서 쓸 만하고 어떤 조건에서 무너지는지는 따로 재야 할 물음이고, 이 블로그도 AI 에이전트를 채점하는 합성 데이터와 그 품질에서 한 번 다뤘다. 이 절이 말하는 것은 그보다 앞선 사실 하나다. 그 방식은 이미 절반에 닿았고, 최근 몇 해 동안 더 오르지 않았다.

4

모델만 남은 시험을 세어 보면

앞의 두 절은 각 칸을 따로 봤다. 그런데 통념이 말하는 장면은 두 칸이 겹칠 때 생긴다. 문항도 모델이 만들고 점수도 모델이 매기는 시험이 실제로 얼마나 되는가.

4.1둘 다 쓰는 논문은 다섯에 하나

2022년 1월부터 2026년 8월까지 두 칸이 모두 유효한 논문 14,763편 가운데, 모델이 만든 자료와 LLM 채점이 함께 있는 논문은 3,272편이다. 22.2%, 다섯에 하나꼴이다. 숫자만 보면 통념이 맞는 것처럼 보인다.

그런데 그 3,272편의 속을 열면 사정이 다르다. 그중 2,530편은 사람이 쓰거나 실세계에서 기록한 자료도 함께 쓴다. 2,020편은 LLM 말고 다른 채점 방식도 함께 쓴다. 비율로는 77.3%와 61.7%이고, 두 집단은 서로 겹친다. 저자의 판정은 짧다. 이 조합은 "완전히 자율적인 평가라기보다 혼합 설계로 부르는 편이 낫다." 그리고 한 문장을 덧붙인다. 섞여 있다는 것만으로 감독이 있다거나 타당하다는 것이 확립되지는 않는다고.

그 61.7%가 실제로 무엇인지는 저자가 올린 집계 파일에 라벨 조합별로 적혀 있다. 원자료에서 다시 세어 보니 값이 일치했다.

LLM 채점과 함께 쓴 채점 방식 논문 수 3,272편 대비
참조·메트릭1,56547.8%
실행·환경 결과40112.3%
그 밖의 학습된 채점자2999.1%
사람 심판2266.9%
함께 쓴 것이 없음 (LLM 채점뿐)1,25238.3%

저자 저장소 roles.json의 조합별 집계를 원자료에서 재계산한 값이다. 한 논문이 여러 방식을 함께 쓸 수 있어 위 네 줄의 합은 2,020편보다 크다. 굵게 표시한 줄이 이 표에서 가장 눈여겨볼 값이다.

함께 쓰는 쪽에서 가장 흔한 것은 참조 답안이나 메트릭이고, 사람 심판이 함께 있는 논문은 226편으로 이 묶음의 6.9%다. 열다섯에 하나다. 자료 쪽도 쏠려 있다. 3,272편 가운데 모델 자료와 사람 자료를 함께 쓰는 논문이 2,163편으로 3분의 2를 차지하고, 프로그램이나 시뮬레이터까지 함께 쓰는 논문이 367편이다. 저자가 말한 혼합 설계의 전형은 사람이 안으로 들어와 함께 채점하는 모습이 아니라, 모델이 만든 문항과 사람이 쓴 문항이 섞인 시험지를 모델 심판과 정답표가 나눠 채점하는 모습에 가깝다.

채점자 쪽을 조금 넓게 잡으면 수가 는다. 임베딩 기반 채점처럼 LLM 심판이 아닌 학습된 채점자까지 포함하면 모델 자료와 겹치는 논문은 3,272편에서 3,696편으로, 22.2%에서 25.0%로 는다. 저자가 계산 코드에 같이 넣어 둔 두 번째 자다.

4.2다시 걸러 내면 359편

그러면 혼합이 아닌 것만 남기면 어떻게 될까. 자료 출처가 정확히 생성 모델 하나뿐이고, 채점원도 정확히 LLM 심판 하나뿐인 논문. 사람 자료도 없고, 프로그램이나 시뮬레이터도 없고, 참조 답안도 없고, 실행 검사도 없고, 사람 심판도 없는 설계다. 이 값은 논문 본문에는 나오지 않는다. 저자가 저장소에 함께 올린 집계 파일과 그 계산 코드를 열어야 나온다.

14,763편 자료 출처와 채점원 두 칸이 모두 유효한 논문 (2022-01~2026-08 전체 창) 3,272편 · 22.2% 모델이 만든 자료와 LLM 채점이 함께 있는 논문 587편 자료가 모델뿐 사람 자료도 프로그램도 없음 1,252편 채점이 LLM뿐 참조도 실행도 사람도 없음 359편 · 많아야 2.4% 두 조건을 모두 만족하는 논문 두 역할을 같은 모델이 맡았는지는 논문 단위 라벨로 가릴 수 없다

저자 저장소의 집계 파일 roles.json과 계산 코드 roles_code.py에서 직접 확인한 값이며, 359편은 논문 본문에 실리지 않았다. 마지막 단계를 상한으로 적는 이유는 그림 아래 줄에 적은 그대로다.

359편. 전체 14,763편의 2.43%이고, 두 칸이 겹치는 3,272편 안에서도 10.97%다. 백에 둘, 겹치는 쪽에서 세어도 열에 하나다. 그리고 이 2.4%조차 상한이다. 논문의 문장이 이유를 댄다. "Paper-level labels do not identify the same model, component, or item across roles and therefore do not establish a self-evaluation loop." 359편 안에서도 출제한 모델과 채점한 모델이 같은 모델인지는 알 수 없다. 그러니 이 수를 자기평가 루프의 규모로 읽으면 안 되고, 본문에서도 언제나 많아야 2.4%라고 적는다.

이 수가 어떻게 만들어졌는지를 보면 성격이 다른 단서가 하나 더 붙는다. 359편은 자료 출처 칸이 정확히 생성 모델 하나이고 채점원 칸이 정확히 LLM 심판 하나인 논문을 센 값이다. 계산 코드에 문자 그대로 그렇게 적혀 있다. 그런데 이 두 칸은 라벨이 여럿 붙을 수 있는 칸이고, 저자는 라벨이 선택되지 않았다는 것이 그 성질의 부재를 뜻하지 않는다고 거듭 적었다. 논문 본문과 부록, 데이터 사전, 방법 문서, 그리고 코딩 지침 안에까지다. 코딩 지침의 자료 출처 항목은 이렇게 끝난다. "Select supported origins; an unselected origin is not proof of its absence."

359라는 수는 칸이 비어 있다는 것을 근거로 센 값이다. 그리고 칸이 비어 있다는 것은 그 논문이 그렇게 읽혔다는 뜻이지, 그 시험에 사람 자료나 정답지가 실제로 없었다는 확인이 아니다. 앞의 단서가 이 수를 위에서 누른다면 이 단서는 양쪽으로 흔든다. 같은 이유로 앞뒤의 모든 비율에는 저자가 붙인 같은 경고가 따라온다. 선택되지 않은 라벨은 없음의 증거가 아니다.

4.3두 역할은 서로 반대로 움직인다

두 칸의 조합을 네 갈래로 나눠 보면 이 글의 비대칭이 가장 깔끔하게 드러난다. 각 논문은 네 칸 중 정확히 하나에 들어가므로 이번에는 합이 100%다.

둘 다 없음 생성 자료만 LLM 채점만 둘 다 2024 41.6% 32.6% 8.9 16.8% 2025 34.7% 29.8% 12.2 23.3% 2026 33.7% 26.0% 15.0 25.3% 2026년은 1~8월. 각 해의 네 값을 더하면 100%가 된다

1~8월 정합 코호트. 분모는 2024년 1,681편, 2025년 3,282편, 2026년 5,734편이다. 반올림으로 각 해 합이 0.1%p 안팎으로 어긋날 수 있다.

생성 자료만 쓰는 논문은 32.6%에서 26.0%로 줄었고, LLM 채점만 쓰는 논문은 8.9%에서 15.0%로 늘었다. 두 역할이 서로 반대 방향으로 갔다는 가장 단순한 증거다. 그리고 모델이 두 역할 어디에도 들어가지 않은 논문이 아직 셋에 하나, 33.7%로 남아 있다.

4.4결합은 조여지지 않았다

둘 다 쓰는 논문의 비율은 16.8%에서 25.3%로 늘었다. 그러면 두 역할이 점점 더 붙어 다닌다고 말해도 될까. 저자는 그 해석을 미리 막아 두었다. 각 칸이 저마다 흔해지면 둘이 아무 관계 없이 우연히 겹칠 확률도 함께 오른다. 그 우연히 기대되는 양에 견줘 실제 겹침이 몇 배인지를 보면, 2024년 1.32배에서 2025년 1.23배, 2026년 1.22배로 내려간다. 같이 나타나는 일은 늘었지만 둘이 서로를 끌어당기는 힘은 오히려 약해졌다는 뜻이다.

이 하락은 창을 바꿔도 남는다. 1~8월로 맞춘 창에서 1.32, 1.24, 1.22로 내려가고, 그해 전체로 세는 창에서도 2023년 1.39, 2024년 1.31, 2025년 1.25로 내려간다. 그리고 저자는 같이 나타나는 비율이 늘어난 것 자체의 대부분이 두 라벨이 각자 흔해지면서 기저선이 올라간 결과라고 적는다. 겹침이 늘어난 것은 맞지만 늘어난 이유의 대부분은 우연이 커진 데 있다.

놀라운 것은 저자가 이 사실을 어떻게 기록했는가다. 저장소에는 claim_ledger.csv라는 파일이 있다. 자기가 낼 수 있는 주장과 낼 수 없는 주장을 기계가 읽을 수 있는 표로 만들어 등급을 매겨 둔 것이다. 그 표의 C06 행에 붙은 상태값이 stronger_interpretation_not_supported다. "Joint prevalence increases, but lift changes from 1.32 to 1.22; an increasingly strong association is not established." 이 글이 검증하려던 통념, 그러니까 AI가 만들고 AI가 채점하는 고리가 점점 굳어진다는 해석에, 저자가 직접 근거 없음 딱지를 붙여 놓은 셈이다.

이 리포트는 같은 물음을 다른 자로 한 번 더 재 봤다. 저자가 공개한 원자료에서 359편을 연도별로 나누고 분모를 붙였다. 건수만 보면 2023년 12편에서 2026년 1~8월 160편으로 급증한 것처럼 보인다. 그런데 같은 기간 그해 유효 논문 수가 861편에서 5,734편으로 불었다. 분모를 붙이면 전체 대비 비율은 1.39%에서 2.79%로, 3년에 두 배가 되지만 여전히 3%에 못 미친다. 그리고 두 칸이 겹치는 논문들 안에서만 보면 2023년 14.81%, 2024년 11.11%, 2025년 10.59%, 2026년 11.03%로 아예 제자리다.

서로 다른 두 개의 자가 같은 방향을 가리킨다. 저자의 배수는 1.32에서 1.22로 내려갔고, 이 리포트의 재계산에서는 겹치는 논문 중 다른 검사가 하나도 없는 비율이 네 해째 11% 언저리에 머물렀다. 모델이 만든 자료와 모델 채점을 둘 다 쓰는 연구자들이, 그 밖의 검사를 점점 더 생략하고 있지는 않다는 뜻이다. 통념이 그리는 고리는 존재하되 조여지지 않았다.

4.5그런데도 왜 문제인가

여기까지만 읽으면 별일 아니라는 결론으로 갈 수 있다. 그 결론은 이르다. 359편이라는 수는 두 역할이 이름 위에서 분리돼 있는지를 센 것이지, 그 판단이 서로 독립인지를 센 것이 아니다. 저자가 위험을 제기하는 자리가 정확히 여기다. "nominally separate model roles need not provide independent judgments." 이름상 분리된 역할이 독립적인 판단을 준다는 보장은 없다는 것이다.

저자가 근거로 든 실험이 있다. 리 등이 2025년에 내놓고 ICLR 2026에 채택된 선호 누출 연구다. 주 논문이 아직 프리프린트인 것과 달리 이쪽은 피어리뷰를 거쳤다. 이 연구는 학습 데이터를 만든 모델과 채점하는 심판 모델이 서로 관련돼 있을 때 어떤 일이 생기는지를 통제 실험으로 잰다. 세 가지 관련을 정의한다. 같은 모델인 경우, 상속 관계인 경우, 같은 계열인 경우.

가장 또렷한 장면은 부록의 한 표에 있다. 똑같은 답 한 쌍을 두 심판에게 보여 준 결과다.

심판 GPT-4o가 만든 데이터로 배운 학생의 승률 Gemini가 만든 데이터로 배운 학생의 승률
GPT-4o 심판55.1%44.9%
Gemini-1.5 심판36.8%63.2%

선호 누출 연구(arXiv:2502.01534v3, ICLR 2026) 부록 C.2의 표를 옮겼다. 비교 대상이 되는 답의 쌍은 두 행에서 동일하다. 심판만 바뀌었는데 같은 답의 승률이 55.1%와 36.8%로 갈린다.

같은 답인데 심판이 누구냐에 따라 승자가 뒤집힌다. 각 심판이 자기 계열에서 나온 데이터로 배운 쪽을 고른 것이다. 이 연구는 그 정도를 하나의 점수로도 낸다. GPT-4o와 Gemini-1.5를 짝지으면 학생 모델 두 종류에서 각각 23.6%와 27.9%가 나왔다. 그리고 여기서 반드시 함께 적어야 할 단서가 있다. GPT-4o와 LLaMA-3.3을 짝지은 경우에는 −0.1%, 즉 누출이 관측되지 않았다. 모든 짝에서 일어나는 일이 아니다. 이 단서를 빼면 이 글이 스스로 금지한 과장을 저지르게 된다.

저자는 여기서 한 걸음 더 나간다. 메세리와 크로켓이 2024년 네이처에 실은 글을 인용하면서, AI 도구에 널리 기대는 일이 과학의 질문과 방법과 관점을 좁힐 수 있다는 경고를 평가 쪽으로 옮겨 놓는다. 그렇게 옮기면 조건부 위험이 된다. 모델이 쉽게 만들고 쉽게 채점할 수 있는 과제가 관심을 유독 많이 받고, 그렇게 나온 점수가 다시 모델 선택과 최적화를 이끈다면, 선호되던 행동이 강화될 수 있다는 것이다. 다만 저자는 그 되먹임이 실제로 일어나고 있음을 자기 연구가 확립하지는 않는다고 곧바로 선을 긋고, 대신 무엇을 확인하라는 쪽으로 넘어간다. 그 처방이 6절에서 볼 세 가지다.

LLM 심판을 싸잡아 깎는 이야기도 아니다. MT-Bench 연구는 강한 심판이 사람들 사이의 일치도와 같은 수준인 80% 이상의 일치를 낸다고 보고했다. 문제는 일관성이 아니라 독립성이다. 같은 연구가 위치 편향, 장황함 편향과 함께 자기선호 편향을 이름 붙여 놓았고, 선호 누출은 그 위에 한 겹을 더 얹는다. 심판 설계의 사소한 선택이 점수를 어떻게 만들어 내는지는 이 블로그의 채점 척도의 바닥이 만들어 낸 LLM 판정 편향에서, 데이터를 만든 모델과 채점하는 모델이 같을 때 생기는 후한 점수는 AI를 채점하는 정답표, 그것도 AI가 만들었다에서 각각 다뤘다.

정리하면 이렇다. 완전히 닫힌 설계는 많아야 2.4%이고 그 비율도 굳어지지 않았다. 그러나 나머지가 곧 독립적인 증거라는 뜻은 아니다. 두 칸이 함께 나타나는 22.2%의 혼합 설계 안에서도 자료를 만든 모델과 점수를 내는 모델이 같은 계열일 수 있고, 논문 단위 라벨은 그것을 가려 주지 않는다. 세어서 알아낸 것은 규모이고, 세어서 알 수 없는 것이 독립성이다.

5

이 숫자를 붙인 것도 모델이다

지금까지 옮긴 모든 비율에는 앞 단계가 하나 있다. 논문 14,767편의 일곱 칸을 누군가 채워야 했다는 것이다. 사람이 채우지 않았다. 한 대의 모델이 채웠다. AI 성적표가 누구의 잣대로 매겨졌는지를 묻는 글이라면, 그 물음을 이 글의 근거에도 걸어야 한다.

5.1한 대의 모델이 본문을 읽고 칸을 채웠다

분류를 맡은 모델은 GLM-5.3-Flash다. 초록 심사와 본문 코딩 두 단계 모두 같은 모델을 썼다. 저자는 설정까지 적었다. 추론 강도를 높게, 샘플링은 끄고, 출력은 정해진 형식의 JSON으로, 출력 상한은 3,200토큰. 그리고 입력에 관한 제약이 하나 더 있다. 모델은 페이지 이미지가 아니라 추출된 텍스트를 받는다. 저자도 한계 절에서 인정한다. PDF 텍스트 추출은 "표와 수식, 배치 정보를 잃을 수 있다."

그런데 그 모델이 읽은 것부터가 이미 걸러진 뒤였고, 거르는 쪽은 모델이라 부를 만한 것도 아니었다. 1절에서 본 로컬 분류기는 문자 단위 TF-IDF에 가중 로지스틱 회귀를 얹은 1.5메가바이트짜리 파일이다. 저자가 남긴 동결 기록에 그 정체가 적혀 있다. 동결에 든 API 호출은 0회로 적혀 있고 GPU도 쓰지 않았다. 115만 건 가운데 98만 건을 초록도 읽히지 않은 채 떨어뜨린 관문이 그것이다.

상위 15%라는 선의 근거도 같은 파일에 있다. 개발 단계에서 손으로 라벨을 붙인 222건이 있었고 그중 확실한 적격이 83건이었는데, 이 분류기가 상위 10%만으로 83건을 전부 건졌다. 저자는 거기에 5%포인트의 여유를 얹어 15%로 정했다고 적는다. 1절에서 옮긴 단서, 그러니까 이 값이 모집단 재현율의 보장이 아니라는 문장이 바로 이 기록에 붙어 있다. 근거가 되는 표본은 석 달치 홀드아웃에서 뽑은 222건이 전부다.

게다가 관문과 본심사가 서로 다른 정의를 들고 있었다. 이 분류기의 학습 목표는 "주된 기여 또는 지배적 기여가 벤치마크인 논문"이었는데, 최종 자격 기준은 반대로 논문의 기여에 순위를 매기지 말라고, 벤치마크가 곁다리로 함께 나온 것도 자격이 있다고 지시한다. 저자는 그 어긋남이 재현율에 영향을 줄 수 있고 뒤의 전문 심사로는 교정되지 않는다고 적었다. 관문이 잘못 떨어뜨린 논문은 그다음 어느 단계에서도 돌아오지 못한다.

이 사실은 저자를 깎는 근거가 아니다. 단독 저자가 소속 기관 없이 4년 8개월치 코퍼스를 손으로 코딩하는 것은 가능한 일이 아니다. 그다음이 중요하다. 저자는 이 방식으로 만든 라벨이 어디까지 검증됐는지를 스스로 표로 만들어 공개했다.

5.2검증한 것과 검증하지 않은 것

저자는 파이프라인의 네 지점에서 표본을 뽑아 다시 읽었다. 결과는 부록의 표 하나에 담겨 있다.

표본을 뽑은 곳 모집단 다시 읽은 수 적격 판정
로컬 분류기가 걸러 낸 쪽980,3232000
초록 심사에서 판단 보류된 쪽25,0791001
초록 심사에서 명시 제외된 쪽131,525500
최종 포함된 쪽14,76710099

논문 부록 표 C4. 최종 포함된 100편을 다시 읽었더니 99편이 적격으로 확인됐고, 판단이 보류돼 본문을 읽지 않았던 쪽에서 100건을 뽑았더니 1건이 들어갔어야 할 논문이었다.

여기서 계산 하나를 하고 싶어진다. 보류된 25,079건 중 100건에 1건이라면 250편쯤이 빠졌겠다는 식이다. 저자가 그 계산을 명시적으로 막았다. 표본이 성글고 다른 이탈 지점은 다루지 않았으며, "모집단 추정을 하려면 기록된 표집 가중치가 필요하다"고 적는다. 이 글도 100건을 다시 읽었더니 1건이 들어갔어야 했다는 사실까지만 옮긴다.

그러면 그 추정은 어떻게 해야 하는가. 저자가 답을 이미 적어 두었다. 다만 실행하지는 않았다. 분류기 동결 기록의 필요한 검증 항목이 절차를 통째로 명시한다. 2024년 6월 한 달은 모델 개발에 일절 쓰지 않은 채로 남겨 둘 것, 그 달에서 분류기가 건진 논문 전부와 더불어 경계 부근 500건, 그리고 떨어뜨린 것 가운데 무작위 2,000건을 동결된 초록 심사에 통과시킬 것, 그러고 나서 낮은 경로에서 살아남은 것을 전부 본문까지 읽을 것. 같은 파일의 주장의 경계 항목은 한 줄이다. 모집단 재현율은 그 손대지 않은 한 달에 확률 표집 감사를 돌리기 전까지 알 수 없다.

공개 저장소를 내려받아 뒤져도 그 감사의 결과가 담긴 파일은 나오지 않는다. 계획은 기록됐고 실행은 되지 않은 채로 공개된 것이다. 이것을 결함으로 읽을 수도 있다. 그런데 무엇을 아직 모르는지를, 그것도 남이 대신 실행할 수 있는 절차의 형태로 적어 둔 연구를 우리는 자주 보지 못한다. 모르는 자리에 이름과 방법이 붙어 있으면 다음 사람이 거기서 시작할 수 있다.

그리고 이 표에서 정작 중요한 쪽은 표에 없다. 저자의 문장이 그대로 말한다. "These checks assess eligibility, not the accuracy of the seven design fields." 다시 읽어서 확인한 것은 이 논문이 코퍼스에 들어갈 자격이 있는가였지, 그 논문의 채점원 칸에 붙은 라벨이 맞는가가 아니었다. 40.3%와 51.3%와 2.4%는 모두 그 라벨 위에 서 있고, 그 라벨의 정확도는 끝내 측정되지 않았다.

왜 사후에 확인할 수 없는지는 코딩 프롬프트를 보면 안다. 프롬프트의 마지막 줄이 모델에게 이렇게 지시한다. "Do not return a decision summary, benchmark name, evidence, citations, quotations, reasons, confidence, markdown, or extra keys." 어떤 논문이 왜 LLM 심판으로 분류됐는지, 모델이 본문의 어느 문장을 근거로 삼았는지는 아무 데도 남지 않았다. 데이터 사전도 같은 말을 한다. 공개된 결과 파일에는 "PDF 텍스트도 모델의 추론도" 들어 있지 않다.

5.3계산은 재현되고 라벨은 재현되지 않는다

재현 가능성의 경계가 여기서 갈린다. 저자가 올린 저장소는 명령 한 줄로 모든 표와 그림을 다시 만들어 낸다. 문서의 표현대로 "의존성을 설치한 뒤에는 LLM API 키도, 유료 호출도, PDF 내려받기도, 네트워크 연결도 필요 없다." 그러니 359편 같은 값은 누구나 자기 컴퓨터에서 확인할 수 있고, 이 리포트도 그렇게 확인했다.

다만 그 재현이 무엇의 재현인지는 좁게 적어야 한다. "Deterministic reproducibility concerns analysis of archived outputs." 보관된 출력을 가지고 하는 분석이 결정론적이라는 뜻이다. 라벨 자체를 다시 만들어 보는 일은 여기 들어 있지 않고, 들어 있을 수도 없다. 같은 기록이 이유를 댄다. API 식별자는 제공자의 가중치를 동결하지도, 앞으로 같은 응답이 나온다고 보장하지도 않는다. 논문 한 편에 요청은 보통 한 번이고, 마음에 드는 답을 고르려고 같은 논문을 여러 번 돌리지 않았다고도 적혀 있다. 판정은 한 편에 한 번씩 났고, 그 한 번을 되돌릴 방법은 지금 없다.

그런데 같은 저장소의 검증 파일에는 "no_independent_semantic_accuracy_claim": true라는 키가 들어 있다. 상태값은 "계산 검사 통과"이고, 단서에는 "비무작위 선별과 모델 코딩 오류는 산술 품질검사로 교정되지 않는다"고 적혀 있다. 숫자가 맞게 더해졌는지는 누구나 재현할 수 있지만, 라벨이 맞는지는 아무도 재현할 수 없다. 이 한 문장이 이 절의 결론이다.

분석의 지위도 저자가 먼저 밝혀 둔다. 이 연구의 모든 비교는 자료를 들여다본 뒤에 설계됐고, 사전에 등록한 확증 가설 검정이 아니다. 저자는 이 말을 논문 방법 절과 부록, 저장소 문서에 세 번 적는다. 통계적 유의성으로 결과를 고르지도 않았다고 덧붙인다. 그러니 앞에서 본 비대칭은 미리 세운 가설이 검정을 통과한 결과가 아니라, 자료에서 눈에 띈 모양을 여러 창과 여러 가정으로 흔들어 본 뒤에도 남은 모양이다. 두 가지는 무게가 다르고, 저자가 그 차이를 스스로 적었으니 옮기는 쪽도 적는 것이 맞다.

저자가 발견한 오류도 감추지 않았다. 개발 중에 상호작용 라벨을 겨냥해 다시 확인한 다섯 건과 언어 라벨 스무 건의 기록이 진단 폴더에 남아 있다. 그중 2026년 코호트에서 누락이 확인된 것이 두 건이고, 그 라벨을 더해도 해당 코호트의 비율은 약 0.035%p 움직인다고 논문이 적는다. 저자 본인은 이 기록을 "드러난 선별적 AI 보조 확인이지 새로운 독립 표본이나 모집단 정확도 추정이 아니다"라고 규정한다.

이 리포트가 원자료에서 하나를 더 재 봤다. 코호트는 논문이 처음 올라온 날로 묶는데 라벨은 그 논문의 읽힌 판본을 서술한다고 저자가 적어 두었으므로, 두 날짜가 다른 해에 걸치는 논문이 얼마나 되는지를 셌다. 14,767편 가운데 2,527편, 17.1%다. 그런데 그 비율은 코호트마다 다르다. 2022년 36.2%, 2023년 41.1%, 2024년 32.4%, 2025년 23.3%, 그리고 2026년은 0%다. 관측 창이 2026년 8월에서 끝나니 2026년 논문에는 더 뒤의 판본이 있을 수가 없다.

이 치우침이 향하는 쪽은 이 글의 결론과 반대다. 이 글이 비교한 2024년 1~8월 코호트에서는 366편, 21.7%가 나중 해의 판본으로 읽혔다. 그 논문들이 개정되면서 모델 채점을 뒤늦게 들였다면 2024년 값이 실제보다 높게 잡히고, 2024년에서 2026년으로 가는 변화는 실제보다 작게 측정된다. 저자가 돌려 둔 검사가 그 방향과 맞는다. 처음 제출과 읽힌 판본이 같은 해인 논문만 남기면 변화가 14.51%p에서 14.64%p로 오히려 커진다. 원자료로 두 값을 모두 재현했고, 그 0.13%p의 차이가 2024년 코호트에서 366편이 빠지며 그해 비율이 25.76%에서 25.63%로 내려간 데서 나온다는 것까지 확인했다. 판본이 어긋나는 문제는 남아 있지만, 적어도 그 비대칭을 부풀리는 쪽으로 작용하지는 않는다.

4절에서 한 줄만 꺼내 본 주장 대장은 일곱 줄이다. 줄마다 주장과 근거 파일, 그 값을 다시 뽑을 수 있는 선택 조건, 그리고 단서가 함께 적혀 있다. 등급은 네 가지로 갈린다.

저자가 적은 주장 저자가 매긴 등급
14,767편은 독립된 벤치마크 계열 14,767개가 아니다서술로 뒷받침됨
LLM 채점이 25.8%에서 40.3%로 올랐다서술로 뒷받침됨
14.51%p 가운데 구성비 0.56, 집단 내 13.95산술로 뒷받침되나 인과 아님
전체 창에서 22.2%가 두 칸을 함께 쓴다서술로 뒷받침됨
그 안에서 77.3%가 사람 자료, 61.7%가 다른 채점을 함께 쓴다서술로 뒷받침됨
같이 나타나는 일은 늘었으나 배수는 1.32에서 1.22로 내렸다더 센 해석은 뒷받침되지 않음
영어 전용 코딩이 79.4%에서 82.5%로 바뀌었다부차적 결과, 민감도와 함께 읽을 것

저자 저장소 claim_ledger.csv 일곱 줄 전부. 이 글이 옮긴 수치는 모두 이 표 안에 있고, 표 바깥의 해석은 이 글의 몫이다.

이 절을 고발로 읽지 않기를 바란다. 이 연구는 단독 저자의 프리프린트이고 저장소는 공개 당일 별이 하나도 없었지만, 저자는 모델 이름과 설정, 프롬프트 전문, 스키마, 계산 코드, 오차 시나리오, 그리고 자기가 낼 수 없는 주장의 목록까지 전부 올려 두었다. 라벨의 의미 정확도를 측정하지 못했다는 사실을 스스로 파일에 박아 넣은 연구를 우리는 거의 본 적이 없다. 이 글이 이 연구의 숫자를 인용할 수 있는 이유가 바로 그 정직함이다.

6

성적표를 받으면 어디부터 볼 것인가

지금까지가 이 연구가 잰 것이다. 이제 실무로 옮긴다. 다만 여기서 낼 처방은 이 리포트가 지어낸 것이 아니라 저자가 논문 끝에 직접 적은 것을 옮기는 쪽에 가깝다. 출처를 밝히고 쓰는 편이 낫다.

6.1저자가 권한 세 개의 닻

저자는 자기 연구가 되먹임 과정을 확립하지 못한다고 먼저 선을 긋는다. "Our mapping does not establish these feedback processes." 그 대신 무엇을 하라고 적는다. 모델이 매개한 시험이 원래 재려던 요구에 여전히 매여 있는지를 세 가지로 확인하라는 것이다. 검증된 실행 결과, 외부 과제 성적, 그리고 도메인 전문성.

셋 다 성격이 같다. 모델의 판단 바깥에 있는 무언가에 점수를 묶어 두라는 것이다. 코드가 실제로 돌아갔는가, 이 시험과 무관하게 만들어진 다른 과제에서도 같은 순서가 나오는가, 그 분야를 아는 사람이 이 문항을 보고 고개를 끄덕이는가. 이 셋 중 하나도 걸려 있지 않은 점수라면, 그 점수는 모델의 선호를 다시 확인한 것일 수 있다.

6.2일곱 칸을 질문으로 바꾸면

1절에서 본 일곱 칸은 연구자가 논문을 분류하려고 만든 양식이지만, 그대로 뒤집으면 점수를 받아 보는 쪽이 물을 수 있는 질문이 된다. 벤더가 점수표를 내밀었을 때 채워지는 칸과 비어 있는 칸을 표시해 보면 된다.

물어볼 것 어느 칸인가 답이 갈리는 지점
무엇을 시켰나대상 시스템답만 내게 했나, 도구를 쓰게 했나, 몸을 움직이게 했나
어느 분야인가평가 분야우리가 쓸 분야와 같은가
문항이 고정인가평가 조건미리 정해 둔 문항인가, 실행 중에 만들어지는가
무엇을 주고 무엇을 받았나양식입력과 채점 대상 출력의 형태
그 문항은 누가 만들었나자료 출처사람이 썼나, 모델이 만들었나, 프로그램이 생성했나
점수는 누가 매겼나채점원정답지, 실행 결과, 사람 심판, 모델 심판
어느 언어로 봤나과제 언어우리가 쓸 언어가 그 안에 있었나

논문의 일곱 필드를 그대로 뒤집어 질문으로 바꾼 것. 굵게 표시한 두 줄이 이 글이 다룬 칸이고, 실무에서 가장 자주 비어 있는 칸이기도 하다.

일곱 칸 가운데 다섯은 보통 어떻게든 답을 얻을 수 있다. 벤더 문서에 적혀 있거나, 적혀 있지 않더라도 물으면 답이 온다. 문제는 굵게 표시한 나머지 두 칸이다. 그 문항을 누가 만들었고 점수를 누가 매겼는지는 어디에도 거의 적히지 않는다. 그리고 이 글이 보인 대로, 이 연구가 잰 기간에 가장 크게 움직인 칸이 하필 그 둘이다.

답은 오지만 그 답이 문제인 칸도 하나 있다. 한국어로 이 글을 읽는 쪽에는 마지막 칸이 그렇다. 과제 언어가 영어 하나로만 코딩된 논문은 2026년 1~8월에 82.5%다. 2024년에는 79.4%였다. 다만 저자는 이 값을 부차적 결과로 분류하고 단서를 붙인다. 영어 전용이란 코딩된 언어 목록에서 영어만 확인됐다는 뜻이지 다른 언어가 지원되지 않는다고 확인한 것이 아니다. 그 단서를 감안해도 물어야 할 것은 남는다. 우리가 인용하려는 그 시험의 문항이 우리가 쓸 언어로 되어 있었는가.

점검표에 한 줄을 더 붙인다면 문항 자체의 품질이다. 시험지의 정답이 틀려 있으면 채점원이 누구든 점수가 무의미해지고, 공개 성적이 우리 환경에서 재현되지 않으면 순위는 남의 이야기가 된다. 이 블로그는 두 물음을 각각 AI가 물리를 못 푸는 걸까, 문제가 틀린 걸까?와 우리 회사 코드에서도 AI가 그 점수를 낼까?에서 다뤘다. 일곱 칸은 그 두 물음 앞에 오는 질문이다.

6.3제도는 아직 그 칸을 묻지 않는다

이 점검표가 왜 지금 독자의 몫인지는 규정을 열어 보면 안다. EU 인공지능법은 체계적 위험이 있는 범용 AI 모델의 제공자에게 평가 의무를 지운다. 제55조 1항 (a)는 두 가지를 요구한다. 최신 기술을 반영한 "standardised protocols and tools"에 따라 모델 평가를 수행하고, 체계적 위험을 식별하고 완화하기 위한 적대적 시험을 "conducting and documenting"하라는 것이다.

평가를 하라고 하고 문서로 남기라고는 한다. 그런데 그 점수를 누가 또는 무엇이 산출했는지를 공개하라는 요구는 이 조문에 없다. 문항을 모델이 만들었는지, 채점을 모델이 했는지, 그 모델이 평가 대상과 같은 계열인지는 조문이 묻지 않는 것이다. 이것은 규제를 비판하려고 적는 문장이 아니다. 지금 시점에 그 칸을 채워 달라고 요구할 주체가 조달하는 쪽과 도입하는 쪽밖에 없다는 사실을 확인하는 문장이다. 같은 법의 제55조 2항이 행동강령이나 조화표준으로 의무를 갈음할 수 있게 열어 두었으므로, 그쪽 문서가 더 나아가는지는 이 리포트가 확인하지 못했다. 확인하지 못한 것을 없다고 적지는 않는다.

7

페블러스 관심의 이유

페블러스는 모델의 신뢰도가 학습 데이터의 품질 이력에서 온다고 말해 왔다. 그런데 모델을 재는 자도 데이터셋이다. 문항과 정답과 채점 기준으로 이루어져 있고, 어디서 왔는지가 있고, 누가 만졌는지가 있다. 학습 데이터에는 꼬박꼬박 묻던 계보 질문을 평가셋에는 거의 묻지 않았다. 이 연구가 한 일은 그 질문을 일곱 칸의 양식으로 만들어 4년 8개월에 실제로 적용해 보인 것이다. DataClinic이 데이터셋에 하는 일을, 이 논문은 평가셋에 했다.

7.1라벨은 남았고 근거는 남지 않았다

이 연구가 공개한 것과 공개하지 못한 것의 경계가, 페블러스가 품질 이력을 말할 때 가리키는 바로 그 지점에 놓여 있다. 숫자가 맞게 더해졌는지는 누구나 재현할 수 있다. 명령 한 줄이면 되고 API 키도 네트워크도 필요 없다. 그런데 라벨이 맞는지는 아무도 재현할 수 없다. 코딩 프롬프트가 모델에게 근거와 인용과 확신도를 반환하지 말라고 지시했기 때문이다.

계산 무결성과 의미 정확도는 다른 것이고, 앞쪽이 아무리 단단해도 뒤쪽을 대신하지 못한다. 그리고 이것은 나중에 보완할 수 있는 종류의 누락이 아니다. 판정의 근거를 그 순간에 함께 적어 두지 않으면, 라벨을 다시 확인하는 유일한 길은 처음부터 다시 읽는 것뿐이다. 14,767편을 다시 읽는 비용은 처음 읽는 비용과 같다. 품질 이력에서 판정 근거를 함께 보관하는 일이 왜 사후 복구가 안 되는 결정인지, 이보다 선명한 교본을 찾기 어렵다.

우리 쪽으로 옮겨 오면 이렇게 된다. 데이터 품질 진단을 자동화할 때 남길 것은 등급만이 아니다. 이 열을 왜 결측으로 판정했는지, 이 라벨을 왜 불일치로 봤는지, 그 판단의 근거가 되는 문장과 행이 함께 남아야 한다. 등급만 남기면 나중에 이의가 제기됐을 때 다시 돌리는 것 말고 할 수 있는 일이 없다.

7.2요구할 수 있는 질문에 이름이 생겼다

"이 모델 좋아요?"라는 물음에 벤더가 내미는 성적표를, 이제 일곱 칸으로 되물을 수 있다. 이름이 붙은 질문은 요구하기 쉽고, 요구된 질문은 다음 문서에 칸으로 생긴다. 이번 글에서 벤더 문서를 직접 열어 그 칸이 실제로 채워져 있는지 확인하지는 못했으므로, 여기서는 점검표만 남기고 실태 판정은 하지 않는다. 확인하지 않은 것을 확인한 것처럼 적을 수는 없다.

다만 방향은 분명하다. 이 연구가 보여 준 것은 두 칸에서 변화가 크게 일어났다는 사실이고, 6절이 보여 준 것은 그 두 칸을 아직 아무도 공식적으로 요구하지 않는다는 사실이다. 변화는 일어났는데 그것을 적을 칸은 없다. 데이터 품질 쪽에서 우리가 여러 번 본 모양이다.

7.3이 글이 서는 자리

이 글은 제품 이야기로 끝맺지 않는다. 남기려는 것은 공백의 모양이다. 채점석에서는 교대가 일어났고, 출제석은 절반에서 멈췄고, 완전히 닫힌 설계는 많아야 2.4%이며 그 비율마저 굳어지지 않았다. 여기까지가 세어서 알 수 있는 것이다. 세어서 알 수 없는 것은 두 역할에 모델이 함께 들어간 나머지 설계에서 자료를 만든 모델과 점수를 낸 모델이 서로 얼마나 가까운가이고, 그 물음에 답할 라벨은 지금 어디에도 기록되지 않는다. 이 논문의 한국어 해설은 이 글이 쓰이는 시점까지 확인되지 않았다. 먼저 한국어로 정리하는 쪽에 서는 것으로 이 글의 몫은 충분하다.

본문의 수치와 축자 인용은 arXiv 공개본 전문과 저자가 함께 올린 저장소 파일에서 직접 대조했다. 359편과 연도별 분포, 4.1절의 조합별 집계, 5.3절의 판본 연도 집계는 논문 본문에 없는 값이라 공개 데이터와 계산 코드를 내려받아 이 리포트가 다시 계산했고, 저자의 집계 파일과 대조할 수 있는 값은 전부 일치함을 확인했다. 1절부터 6절까지는 저자가 잰 것과 이 리포트가 1차 문서에서 확인한 것을 옮긴 것이고, 이 7절은 이 논문이 하지 않은 일이다. 나눠서 읽어 주시기 바란다. 긴 글 읽어 주셔서 감사하다.

R

참고문헌

본문의 수치는 세 갈래다. 1번 논문의 본문·부록 값은 arXiv 전문에서 직접 옮겼고, 2번 저장소의 집계 파일과 계산 코드는 내려받아 값을 재현했다. 3번부터 7번까지는 1번 논문이 근거로 든 선행 연구이며 본문에 실은 인용은 각 원문에서 확인했다. 8번부터 10번까지는 1번 논문이 예로 들었을 뿐 이 리포트가 원문을 열지 않은 문헌이라 따로 묶었다. 11번은 이 리포트가 직접 열어 본 규정이다.

이 보고서의 뼈대 (1차 원문 대조)

  • 1.Chao Wang. "What Do We Expect from LLMs? Mapping the Design of LLM Benchmarks." arXiv:2609.19182v1, 2026년 9월 15일 제출. arXiv: 2609.19182 — 소속 기관 없는 독립 연구자의 단독 저자 논문이며 피어리뷰를 거치지 않은 프리프린트다. 선별 흐름은 §2.3, 일곱 필드 정의는 표 1, 채점원과 자료 출처 수치는 §3.3·§3.4, 동시 출현과 결합 강도는 §3.5와 부록 B.6, 오차 시나리오는 §3.6과 부록 표 B3, 표본 재검토는 §2.5와 부록 표 C4에서 옮겼다.
  • 2.공개 저장소 github.com/xxcg322/LLM-Bench-Map (코드 MIT, 데이터 CC BY 4.0) — 359편, 587편, 1,252편은 논문 본문에 없고 이 저장소의 data/roles.json과 계산 코드 data/inputs/roles_code.py에만 있다. 4.4절의 연도별 재계산은 data/papers.csv 원자료에서 이 리포트가 직접 집계했으며, 유효 14,763편·닫힌 설계 359편·동시 출현 3,272편이 저자의 집계값과 일치하는 것을 확인했다. 주장 대장 claim_ledger.csv와 검증 기록 validation.json, 코딩 프롬프트 methods/fulltext_prompt.md의 축자도 이 저장소에서 가져왔다. 5.1절의 분류기 정체·상위 15% 근거·서로 다른 학습 목표와 5.2절의 미실행 감사 절차는 methods/m0_freeze.json에 있다. 4.1절의 채점·자료 조합별 집계는 data/roles.json의 조합 목록을 원자료로 재계산한 값이고, 5.3절의 판본 연도 집계(17.1%, 2024년 코호트 366편)와 14.51 대 14.64의 대조는 이 리포트가 data/papers.csv에서 직접 계산해 저자의 발표값과 대조한 것이다.

메커니즘과 선행 연구 (축자 대조)

  • 3.Dawei Li, Renliang Sun, Yue Huang, Ming Zhong, Bohan Jiang, Jiawei Han, Xiangliang Zhang, Wei Wang, Huan Liu. "Preference Leakage: A Contamination Problem in LLM-as-a-judge." arXiv:2502.01534v3, ICLR 2026 채택. arXiv: 2502.01534 — 4.5절의 표는 부록 C.2의 승률 비교이고, 선호 누출 점수 23.6%·27.9%와 누출이 관측되지 않은 −0.1% 쌍은 본문 표 1에서 옮겼다. 1번 논문과 달리 피어리뷰를 거쳤다.
  • 4.Lianmin Zheng 외. "Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena." NeurIPS 2023 Datasets & Benchmarks (arXiv:2306.05685v4). arXiv: 2306.05685 — 4.5절의 80% 일치도 수치와, 위치·장황함·자기선호 세 편향의 명명이 여기서 나왔다.
  • 5.LMArena(구 Chatbot Arena) 공식 안내 페이지 및 Wei-Lin Chiang 외, "Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference" (arXiv:2403.04132, 2024년 3월) — 2.1절에서 사람이 직접 채점하는 대표 사례로 든 곳이다. 원 논문이 보고한 24만 건 이상의 쌍 비교는 투표 건수이고 1번 논문의 4.7%는 논문 편수 비중이므로, 두 수를 같은 축에 놓고 비교할 수 없다.
  • 6.Evelyn M. Kitagawa. "Components of a difference between two rates." Journal of the American Statistical Association 50(272), 1168–1194 (1955). doi:10.1080/01621459.1955.10501299 — 2.2절에서 14.51%p를 구성비 몫 0.56과 집단 내 몫 13.95로 나눈 분해의 원전이다.
  • 7.Andrew M. Bean 외. "Measuring what matters: Construct validity in large language model benchmarks." NeurIPS 2025 Datasets & Benchmarks. doi:10.52202/085713-0590 — 1번 논문이 한계 절 §5.2에서 "일곱 필드는 넓은 설계 선택을 기술할 뿐 세밀한 능력이나 채택, 구인 타당도를 기술하지 않는다"며 넘긴 자리의 연구다. 이 블로그가 2026년 9월 16일에 다룬 논문이기도 하다.

1번 논문이 예로 든 문헌 (원문 미대조)

아래 셋은 1번 논문이 자기 논지의 실례나 근거로 든 문헌이다. 이 리포트는 원문을 따로 열어 보지 않았고, 본문에 옮긴 것은 1번 논문이 이들을 어떻게 서술했는가까지다. 그 서술의 축자는 1번 논문에서 확인했다.

  • 8.X. Wang 외. "Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement." arXiv:2606.05920 (2026). arXiv: 2606.05920 — 3.2절에서 고정 과제 묶음과 상호작용이 한 시험 안에 공존하는 실례로 들었다. 1번 논문 §4.1의 서술이다.
  • 9.S. Zhou 외. "WebArena: A Realistic Web Environment for Building Autonomous Agents." arXiv:2307.13854v4 (2023, 2024년 개정). arXiv: 2307.13854 — 2절에서 채점원 라벨이 여럿 붙는다는 것이 무슨 뜻인지를 보이는 실례로 들었다. 1번 논문 §4.3의 서술이다.
  • 10.L. Messeri, M. J. Crockett. "Artificial intelligence and illusions of understanding in scientific research." Nature 627, 49–58 (2024). doi:10.1038/s41586-024-07146-0 — 4.5절의 조건부 위험은 1번 논문 §4.3이 이 글을 인용하며 평가 쪽으로 옮겨 놓은 대목이다. 네이처 원문은 이 리포트가 확인하지 않았으므로, 옮긴 것은 1번 논문의 요약까지다.

규정

  • 11.Regulation (EU) 2024/1689 (인공지능법) 제55조 1항 (a) — 6.3절의 축자는 이 조항 전문이다. 체계적 위험이 있는 범용 AI 모델 제공자에게 표준화된 규약과 도구에 따른 모델 평가, 그리고 적대적 시험의 수행과 문서화를 요구한다. 점수를 누가 또는 무엇이 산출했는지에 대한 공시 요구는 이 조문에 없다. 같은 조 2항이 행동강령·조화표준으로 갈음할 수 있게 열어 두었으나, 그 문서들이 더 나아가는지는 이 리포트가 확인하지 않았다.

페블러스 블로그 인접 글