Executive Summary

이 글은 2026년 10월 7일 arXiv에 올라온 논문 한 편을 읽는다. 펜실베이니아대와 하소플라트너연구소 연구진이 연구 참가자 모집 플랫폼 Prolific의 제출 기록 712,930건을, 참가자들이 직접 기증한 ChatGPT 대화 기록과 같은 시간축 위에 놓고 맞춰 봤다. 설문으로 물어보거나 글만 보고 판정하는 탐지기를 돌린 것이 아니라, 실제로 챗봇을 연 흔적과 제출 시각을 대조한 관측이다.

그 결과 AI 보조가 확인된 제출은 1.00%였고, 2022년 12월부터 2026년 2월까지 3년이 넘는 기간 동안 늘어나는 추세는 잡히지 않았다. 다만 저자들이 더 무겁게 적은 대목은 그 비율이 아니다. AI 사용을 지침에서 명시적으로 금지한 연구에서도 지급 결정이 내려진 60건이 한 건도 빠짐없이 승인·지급됐다는 것이다.

1절부터 4절까지는 논문과 Prolific 공식 안내 문서에 적힌 사실이다. 5절은 그 사실을 사람이 만든 데이터를 사다 쓰는 쪽의 눈으로 다시 읽은 이 글의 해석이다.

주요 수치

논문에서 네 숫자를 뽑았다. 앞의 둘은 AI 보조가 얼마나 드물고 또 얼마나 몰려 있는지를 말하고, 뒤의 둘은 그 제출이 품질 관리 단계를 어떻게 통과했는지를 말한다.

출처: Sehgal et al., "AI-Assisted Submissions in Online Research Are Rare and Highly Concentrated but Routinely Approved", arXiv:2610.09279 (2026-10-07).

1.00%

AI 보조가 확인된 제출 비율

712,930건 가운데 7,100건이고, 3년 넘는 기간에 증가 추세는 잡히지 않았다

64.1%

상위 5% 참가자가 차지한 몫

이들을 빼면 전체 비율이 1.00%에서 0.40%로 내려간다

99.6% 대 99.70%

AI 사용·미사용 제출의 승인율

AI를 썼는지는 승인 여부를 가르지 않았다

60건 전부

금지 조항이 있는 연구에서 승인된 건수

지급 결정이 기록된 60건이 모두 승인·지급됐다

1

71만 건의 제출 기록을 ChatGPT 대화와 맞춰 봤다

온라인 연구 플랫폼에서 AI가 얼마나 쓰이는지를 재려는 시도는 전에도 있었다. 방법은 둘 중 하나였다. 참가자에게 직접 물어보거나, 제출된 글을 기계에 넣어 AI가 썼는지 판정하게 하거나. 앞의 방법은 솔직하게 답할 이유가 없는 사람에게 묻는 것이고, 뒤의 방법은 글의 문체만 보고 거꾸로 추측하는 것이다. 둘 다 실제로 챗봇을 열었는지는 모른 채로 숫자를 낸다.

이번 연구는 그 흔적 자체를 받아 왔다. 앞선 다른 연구에서 ChatGPT 대화 기록을 기증한 사람들 가운데 주 1회 이상 ChatGPT를 쓰고 Prolific 과제를 10건 넘게 완료한 767명을 추려 다시 연락했고, 그중 425명이 자기 Prolific 제출 기록을 내려받아 올렸다. 양쪽 기록이 겹치는 구간을 가진 최종 408명의 자료가 분석에 들어갔다. 여기서 나온 제출물이 712,930건, 연구 수로는 12만 7천여 개이고 기간은 2022년 12월부터 2026년 2월까지다. 연구 수는 정확한 집계가 아니다. Prolific 제출 기록에는 연구 고유 번호가 없어서 게시자 이름과 연구 제목의 조합으로 셌고, 같은 이름과 제목을 단 다른 연구는 하나로 묶여 들어갔다.

판정 규칙은 시간이다. 과제의 시작과 완료 시각 사이에 ChatGPT 대화가 들어가 있어야 하고, 그 과제 구간이 해당 참가자의 첫 메시지와 마지막 메시지 사이에 온전히 들어와야 한다. 기록이 보이지 않는 구간의 과제를 실수로 "깨끗하다"고 세지 않기 위한 조건이다. 두 시간을 넘는 과제는 우연히 겹칠 확률이 커서 제외했다. 이렇게 걸러 시간이 겹친 과제가 12,564건으로 전체의 1.76%였고, 여기에 분류기를 걸어 그 대화가 과제와 관련이 있는지까지 따진 끝에 7,100건이 남았다. 분류는 GPT-5.6 Luna가 맡았다. 판정이 미더운지는 저자 한 사람이 100건을 직접 손으로 매겨 맞춰 보는 방식으로 쟀고, 제출 단위로 AI 보조 여부가 일치한 정도가 카파 0.76이었다.

사람으로 한 번, 제출물로 한 번 좁혔다 참가자 767명 재연락 대상 425명 제출 기록 업로드 408명 분석 대상 제출물 712,930건 12만 7천여 개 연구 2022.12 ~ 2026.02 12,564건 대화 시간이 겹침 전체의 1.76% 7,100건 과제 관련성까지 확인 전체의 1.00% 시간이 겹친 1.76%에서 분류기가 과제와 무관한 대화를 걷어내고 1.00%가 남았다.

▲ 페블러스 원본 도식. Source: Sehgal et al., arXiv:2610.09279 (2026-10-07).

이 방법이 재지 못하는 것도 분명하다. 받아 온 기록은 ChatGPT뿐인데, 기증자의 76.5%는 다른 AI 서비스도 한 달에 한 번 넘게 쓴다고 답했다. 챗봇을 열었다는 사실과 그 답을 실제로 제출문에 옮겨 적었는지도 별개다. 그렇다고 1.00%를 그냥 바닥값으로 읽어서도 안 된다. 분석에 들어간 408명 자체가 챗봇을 자주 쓰는 사람 중에서 추린 표본이라, 같은 수치가 Prolific 전체보다 오히려 높게 나왔을 수도 있다. 빠진 서비스는 수치를 낮추는 쪽으로, 추려진 표본은 올리는 쪽으로 당긴다. 논문은 두 힘을 나란히 적고 치우침이 어느 쪽인지는 알 수 없다고 결론을 미뤄 둔다. 다만 제출 기록을 올리지 않은 342명과 올린 425명의 평소 ChatGPT 사용량이 비슷했다는 점은 따로 확인해 두었다.

2

AI를 쓴 제출은 100건에 1건꼴이다

7,100건은 전체의 1.00%다. 신뢰구간은 0.72%에서 1.32% 사이이고, 3년이 넘는 관측 기간 동안 비율이 올라가는 추세는 통계적으로 잡히지 않았다. ChatGPT가 세상에 나온 직후부터 지금까지를 덮는 구간인데도 그렇다. 논문이 논의 절에서 "AI 보조가 지금 온라인 연구에 존재론적 위협이 된다는 견해를 우리 결과는 뒷받침하지 않는다"라고 적는 이유가 여기에 있다.

사람 단위로 세면 그림이 달라진다. 관측된 408명 가운데 68.4%는 한 번이라도 ChatGPT를 제출에 썼다. 거의 셋에 둘이다. 반면 같은 플랫폼에서 아무 조건 없이 모은 워커 2,500명에게 물었을 때는 수가 한참 낮았다. 이 설문은 묻는 방식을 둘로 갈라 돌렸다. 대놓고 물은 504명 가운데 11.31%가 써 봤다고 답했고, 개인의 답이 드러나지 않도록 문항 수만 세게 한 나머지 1,996명에서는 14.24%로 추정됐다. 두 값의 차이는 통계적으로 유의하지 않았다. 익명을 보장하면 숨겨 둔 사용이 더 나오리라는 예상이 빗나간 셈이다.

그렇다고 68.4%와 11.31%를 바로 맞세워 "자기 보고가 여섯 배 축소한다"고 읽으면 안 된다. 408명은 애초에 주 1회 이상 ChatGPT를 쓰는 사람만 골라 모은 집단이고, 2,500명은 그런 조건 없이 모은 집단이다. 사는 동네가 다르다.

관측값은 자기 보고값보다 훨씬 높다 관측 (408명 중) 68.4% 자기 보고 · 직접 질문 (504명) 11.31% 자기 보고 · 목록 실험 (1,996명) 14.24% 두 자기 보고 방식(직접 질문·목록 실험)의 차이는 통계적으로 유의하지 않았다. 표본 집단이 달라 68.4%와 자기 보고값을 "여섯 배 축소"처럼 직접 비교할 수는 없다.

▲ 페블러스 원본 도식. Source: Sehgal et al., arXiv:2610.09279.

그래도 두 수를 나란히 놓으면 보이는 것이 있다. 해 본 사람은 많은데 자주 하는 사람은 적다는 구도다. 408명 중 자기 제출물의 2% 이상에서 AI가 확인된 사람은 13.5%에 그쳤다. 나머지 다수는 어쩌다 한 번 썼다. 쓰는 방식도 가볍다. 그 7,100건 가운데 40%는 대화를 단 한 번 주고받은 경우였고, 나머지 60%에서도 그 대화의 첫 메시지와 마지막 메시지 사이가 과제 전체 시간의 29%(중앙값)에 머물렀다. 과제를 통째로 챗봇에 맡긴 것이 아니라 막히는 문항에서 잠깐 불러낸 쪽에 가깝다.

무엇을 대신 답하게 했는지도 갈라 놓았다. AI 보조 제출의 55.1%에는 태도나 선호, 평가처럼 그 사람에게만 물을 수 있는 응답이 들어 있었고, 52.2%에는 사실 기억이나 독해, 추론처럼 맞고 틀림이 정해진 응답이, 11.9%에는 창작물이 들어 있었다. 한 제출에 여러 종류가 섞일 수 있어 합이 100%를 넘는다. 가볍게 썼다는 말과 별개로, 설문이 재려던 것이 그 사람의 생각 자체였던 경우가 절반을 넘는다.

그래서 1%가 연구 결과를 얼마나 흔드는지는 따로 물어야 한다. 논문이 끌어온 선행 모의실험 둘은 서로 다른 쪽을 가리킨다. 하나는 보조가 10%일 때 처치 효과가 0.40에서 0.36 표준편차로 줄어든다고 봤고, 다른 하나는 4.4%일 때 추정치가 2.3%포인트 부풀려진다고 봤다. 관측된 1%는 두 모의실험이 가정한 비율의 4분의 1에도 못 미친다. 다만 논문은 치우침의 방향과 크기가 과제와 측정 대상에 따라 달라진다고 적으면서, 특정 과제에서 나온 비율을 온라인 연구 전체로 넓혀 읽지 말라고 덧붙인다.

3

참가자 5%가 AI 사용 제출의 64%를 차지한다

1%라는 비율은 전체 참가자에게 고르게 퍼져 있지 않다. AI 사용이 많은 순서로 줄을 세웠을 때 상위 5%가 전체 AI 보조 제출의 64.1%를 냈고, 상위 10%까지 넓히면 78.2%가 된다. 불평등의 정도를 재는 지니계수로는 0.856이다. 소득 분포에 갖다 대면 극단적인 쏠림에 해당하는 값이다. 물론 과제를 많이 하는 사람과 적게 하는 사람이 따로 있으니 제출 자체도 고르게 퍼지지는 않는다. 그 쏠림의 지니계수가 0.575인데, AI 보조 제출의 0.856은 그보다 한참 가파르다. 누가 과제를 많이 했느냐만으로는 설명되지 않는 몫이 남는다는 뜻이다.

AI 보조 제출 7,100건은 누구에게서 나왔나 상위 5% 참가자 64.1% 상위 10% 참가자 78.2% 나머지 90% 21.8% 상위 5%를 걸러내면 전체 AI 보조 제출 비율은 1.00%에서 0.40%로 내려간다. 논문은 이를 상대적으로 59.4% 줄어든 것이라고 적는다.

▲ 페블러스 원본 도식. 지니계수 0.856(95% CI 0.819~0.880). Source: Sehgal et al., arXiv:2610.09279.

그 소수가 누구인지도 어느 정도 드러났다. 하루 ChatGPT 사용량이 표준편차 1만큼 많은 사람일수록 제출 단위로 AI 보조가 확인될 가능성이 2.09배 높았다. 보상이 큰 과제(P=.003)와 오래 걸리는 과제(P<.001)에서 더 자주 나타났다. 평소에 챗봇을 많이 쓰는 사람이 품이 많이 드는 과제에서 챗봇을 부른다는, 이상할 것 없는 그림이다.

쏠림이 심하다는 것은 대응 비용이 낮다는 뜻이기도 하다. 상위 5%에 해당하는 스무 명 남짓을 걸러내면 AI 보조 제출의 64.1%가 사라진다. 논문은 여기에 단서를 하나 붙인다. 그 스무 명을 미리 가려낼 수 있을 때의 이야기다. 사후에 기록을 맞춰 보고서야 누구였는지 아는 것과, 과제를 내주기 전에 아는 것은 다른 일이다. 논문이 제언으로 내놓은 것도 제출물 하나하나를 검사하는 방식에 더해 여러 연구에 걸쳐 품질 신호를 사람 단위로 모으는 장치다. 그런 장치가 플랫폼에 아예 없지는 않다. 문제는 그 장치에 무엇이 입력되느냐이고, 다음 절이 그 자리를 보여준다.

4

AI를 금지한 연구에서 결정이 난 60건, 거절은 한 건도 없었다

Prolific에서 참가자가 과제를 끝내면 연구자가 제출물을 보고 승인하거나 거절한다. 승인되면 보상이 나가고 참가자의 승인율 기록이 올라간다. 품질 관리가 실제로 작동하는 지점이 여기다. 그래서 AI 보조가 확인된 제출이 이 관문에서 어떤 대접을 받았는지가 중요하다.

결과는 아무 대접도 받지 않았다는 쪽이다. AI 보조가 확인된 제출의 승인율은 99.6%였고, 그렇지 않은 제출은 99.70%였다. 논문은 이 차이를 통계적으로 구분되지 않는 수준으로 본다. 응답 형식으로 갈라도 마찬가지여서 선택형이 들어간 제출은 99.7%, 자유서술형이 들어간 제출은 99.5%가 승인됐다. 보상 금액과 소요 시간, 시기, 그 사람의 평소 ChatGPT 사용량과 제출량까지 보정한 뒤에도 거절 여부와 AI 보조 사이에서 연관은 나오지 않았다.

금지 조항이 걸린 연구만 떼어 보면 더 선명해진다. AI 보조가 확인된 제출 가운데 연구 지침이 AI 사용을 명시적으로 금지한 것으로 분류된 건이 73건이었고, 저자들이 그 73건의 지침을 직접 열어 읽어 61건을 확인했다. 그중 지급 결정이 기록으로 남은 60건은 전부 승인·지급됐다. 거절은 없었다.

이 60이라는 수를 "AI 금지 연구에서 들킨 사람이 60명"으로 읽으면 과장이 된다. 연구 지침을 들여다볼 수 있었던 범위에서 금지 조항이 확인되고 지급 결정까지 기록된 것이 그 수다. 논문도 연구별 정책을 대개 알 수 없었다고 적으면서 금지된 사용의 전체 규모는 추정할 수 없다고 못 박는다. 60건에서 확실한 것은 비율이 아니라 결과의 방향이다. 들여다본 건 가운데 제동이 걸린 것이 없었다.

왜 제동이 걸리지 않았는지는 탐지 범위에서 설명된다. Prolific은 연구자가 선택해서 켜는 LLM 탐지 기능을 제공하는데, 이 기능은 자유서술형 문항만 본다. 복사해 붙여 넣었는지, 탭을 오갔는지 같은 행동 신호를 찾는 방식이고, 적힌 낱말 자체는 보지 않는다고 안내 문서가 밝힌다. 켤 수 있는 자리도 제한돼 있어, 지금은 Qualtrics나 Prolific의 자체 과제 빌더로 만든 연구에서만 쓸 수 있고 다른 도구는 지원 예정으로 남아 있다. 사정권 안에서의 성적은 나쁘지 않다. 플랫폼은 자체 시험에서 정밀도 98.7%, 재현율 78.9%가 나왔다고 밝힌다. 걸러야 할 응답 다섯 중 넷은 잡는다는 뜻이다. 그런데 AI 보조 제출의 52.6%에는 객관식이나 평점, 정답이 정해진 문항처럼 고르거나 적어 넣기만 하면 되는 응답이 들어 있었다. 애초에 기능의 사정권 밖이다.

거절이라는 행위 자체가 플랫폼에서 무겁게 다뤄진다는 사정도 겹친다. 거절은 참가자 기록에 불이익으로 남고 쌓이면 플랫폼에서 내보내지기 때문에, 거절 기준을 적은 안내 문서는 거절을 최소로 하라고 당부하면서 유효한 사유를 다섯 가지로 한정해 열거한다. 필수 문항을 건너뛴 경우, 주의 집중 검사에 걸린 경우, 요구된 분량 대신 몇 단어나 아무 말이나 적은 명백한 저노력, 평균보다 표준편차 3만큼 빠른 통계적 이상치에 해당하는 초고속 완료, 그리고 진본성 검사에 걸린 경우다. AI를 썼을 것 같다는 심증은 목록에 없고, 플랫폼이 권하는 설계 기법들에 대해서도 문서는 "더 깨끗한 데이터를 얻기 위한 지침이지 그 자체로 거절의 근거는 아니다"라고 적어 둔다. 결국 AI를 이유로 돈을 쥐어 주지 않으려면 진본성 검사가 깃발을 올려 주어야 하는데, 그 검사가 보는 자리가 앞 문단에서 본 자유서술 문항이다.

AI 보조가 확인된 제출에 들어 있던 응답 형식 플랫폼 탐지기의 사정권 안 57.5% 자유서술형 응답 복사·붙여넣기, 탭 전환 같은 행동 신호를 본다 사정권 밖 52.6% 선택형 응답 객관식·평점·정답형 문항은 검사 대상이 아니다 두 비율의 합이 100%를 넘는 것은 한 제출에 두 형식이 함께 들어갈 수 있기 때문이다. 탐지 기능은 연구자가 직접 켜야 작동하는 선택 사항이다.

▲ 페블러스 원본 도식. Source: Sehgal et al., arXiv:2610.09279; Prolific 연구자 안내 문서.

규칙이 없어서 생긴 공백이 아니다. 금지 조항은 지침에 적혀 있었고, 탐지 도구도 플랫폼에 있었고, 거절 사유를 정한 문서도 있었다. 사람 단위로 품질 점수를 매겨 두는 장치까지 플랫폼 문서가 설명한다. 다만 그 점수를 움직이는 입력이 연구자의 승인과 거절, 신고다. 승인율 99.6%라는 수는 그 입력이 거의 언제나 "승인"으로 들어갔다는 말이고, 그러면 사람 단위 기록에도 아무 일 없었다고 적힌다. 앞 절에서 본 쏠림을 미리 가려내려면 바로 그 기록이 필요한데, 기록을 채워야 할 자리가 비어 있는 셈이다. 논문의 초록을 닫는 문장이 "그 위협이 현실이 될 경우 플랫폼이 제대로 준비되어 있지 않다"로 끝나는 근거가 이 어긋남이다.

5

페블러스가 이 연구를 주목하는 이유

이 논문이 다룬 것은 학술 설문이지만, 같은 구조가 데이터를 사고파는 자리에도 그대로 있다. 라벨링 작업물, 선호도 비교 데이터, 평가용 정답지, 설문 기반 벤치마크는 모두 "사람이 만들었다"는 표기를 달고 거래된다. 그 표기가 참인지를 구매자가 직접 확인하는 경우는 드물다. 대개는 벤더가 그렇게 적었으니 그런 것으로 친다.

겹치는 자리는 형식만이 아니다. AI가 답을 댄 제출의 절반 이상에서 그 대상이 태도나 선호, 평가였다. 사람의 판단을 사겠다며 돈을 치르는 데이터가 정확히 그 종류다.

이 연구가 값진 이유는 그 표기를 실제 사용 기록으로 맞춰 본, 흔치 않은 대조이기 때문이다. 그리고 거기서 나온 결론이 "오염이 심각하다"가 아니라 "오염을 확인할 절차가 비어 있다"였다는 점이 더 중요하다. 비율이 낮다는 사실과 막을 장치가 있다는 사실은 서로 다른 이야기다. 지금 1%인 것은 아직 많은 사람이 그렇게 하지 않기로 했기 때문이지, 하려는 사람을 걸러냈기 때문이 아니다.

그래서 사람이 만든 데이터를 사다 쓰는 쪽이 벤더에게 물어볼 것이 세 가지로 정리된다. 이 논문이 공백을 발견한 자리가 그대로 질문이 된다.

  • 검사 범위가 응답 형식 전체를 덮는가. 자유서술형만 보는 검사라면 고르거나 점수를 매기는 문항은 통째로 비어 있다.
  • 금지 조항이 지급 단계에서 실제로 작동하는가. 계약서에 적힌 금지와 대금을 지급할 때 걸리는 금지는 다른 것이다.
  • 작업자 단위로 이력이 쌓이는가. 몇 사람에게 몰린 문제는 작업물 하나하나를 보는 방식으로는 잘 안 잡히고, 같은 사람의 여러 작업을 가로질러 봐야 드러난다. 쌓인다는 답이 돌아오면 무엇이 그 이력을 바꾸는지까지 물어야 한다. 검수에서 전부 통과시키고 있다면 이력에는 아무 일도 적히지 않는다.

세 질문 모두 데이터를 받은 뒤에는 답하기 어렵다. 제출 시각과 작업 이력이 남아 있지 않으면 사후에 견줘 볼 대상 자체가 없기 때문이다. 이 논문이 가능했던 것도 Prolific이 제출 시각을 기록으로 남겼고 참가자들이 자기 대화 기록을 내려받을 수 있었던 덕분이다. 어떤 기록을 남길지는 데이터를 모으기 전에 정해지는 문제다.

여기까지 읽어 주셔서 감사하다. 이 글의 관측 수치는 arXiv 논문 원문에서 확인했고, 탐지 기능의 적용 범위와 성능은 Prolific 공식 안내 문서에서 따로 읽었다. 여러분의 팀은 사람이 만들었다고 적힌 데이터를 받을 때 무엇으로 그 표기를 확인하는지 나눠 주시면 좋겠다.

R

참고문헌