Executive Summary
9월 21일 arXiv에 올라온 논문 한 편이 웹에 적힌 질문을 통째로 세어 봤다. 2013년부터 2025년까지 웹 문서 묶음 110개에서 물음표로 끝난 문장 134억 건을 뽑아, 그 문장이 어떤 종류의 페이지에 적혀 있었는지 분류한 연구다. 웹에서 긁어 온 질문은 그동안 사람이 무엇을 알고 싶어 하는지를 보여 주는 대리 자료로 쓰여 왔다. 질의응답 학습셋도, 검색 성능을 재는 벤치마크도, 콘텐츠 기획도 그 가정 위에 서 있다. 이 글은 그 가정을 실제로 재어 본 결과를 본다.
가장 조용한 숫자는 1.9%다. 2025년 웹에서 질문이 등장한 횟수 가운데, 사람이 직접 글을 남기는 자리에서 나온 몫이다. 포럼이나 게시판 같은 곳이다. 2013년에는 9.3%였다. 다만 12년 사이 크롤 자체의 구성이 크게 바뀌었으므로 이 낙폭을 그대로 읽으면 안 된다. 연구진은 내내 살아 있던 호스트만 따로 추려 다시 재고, 크롤 크기 효과를 회귀로 걷어 내는 두 가지 보정을 걸었다. 그러고도 남는 감소폭이 절반 가까이다. 같은 기간 질문 자체도 짧아졌고, 앞뒤에 사정을 덧붙인 질문의 비율도 함께 내려갔다.
1절부터 4절까지는 논문에 적힌 것을 따라간다. 4절 끝의 이해관계 이야기와 5절의 데이터 품질 해석은 논문에 없는 이 글의 읽기다. 논문 전문은 arXiv에 공개돼 있어 수치는 누구나 대조할 수 있다.
주요 수치
출처: Zhou, McCloskey, Srinivasan, "You Can Tell Who's Asking", arXiv:2609.24106 (2026-09-21).
134억 건
세어 본 질문 등장 횟수
2013~2025년 스냅숏 110개에서 뽑았다. 한 건의 평균 길이는 12.8 토큰이다
93.2%
가장 많이 등장한 질문 1,000개 중 복제 문구
2024년 값이다. 2015년에는 71.7%였다. 서로 다른 질문으로 세면 같은 부류는 3~4%뿐이다
9.3% → 1.9%
사람이 직접 남긴 질문의 등장 비중
12년 사이 79% 줄었다. 크롤 구성을 보정하면 42~56% 감소이고, 연구진의 최선 추정은 약 45%다
0.725 → 0.554
생김새만으로 출처를 가려낸 정확도(AUC)
앞은 복제 문구 상대, 뒤는 쇼핑몰 FAQ 상대다. 0.5는 동전 던지기와 같다
질문 134억 건에 출처 딱지를 붙이는 법
재료는 FineWeb이다. 커먼 크롤이 긁어 온 웹 문서에서 영어 본문만 남기고 품질 필터를 통과시킨 공개 코퍼스이고, 요즘 대형 모델의 사전학습 데이터로 널리 쓰인다. 연구진은 2013년치부터 2025년치까지 스냅숏 110개를 받아, 그 안의 문장 가운데 물음표로 끝나고 길이가 5~100단어이며 의문사로 시작하거나 의문 표현을 담은 것만 골라냈다. 유니코드 정규화와 대소문자 통일을 거친 뒤 남은 것이 134억 건이다.
세는 단위가 이 연구의 절반이다. 연구진이 센 것은 서로 다른 질문의 가짓수가 아니라 질문이 페이지에 등장한 횟수다. 똑같은 문장이 100개 페이지에 박혀 있으면 100건으로 센다. 웹에서 질문을 긁어 쓰는 쪽은 대개 이 값을 수요의 크기로 읽어 왔다. 많이 보이면 그만큼 많이 궁금해한다고 본 것이다. 논문이 처음부터 못 박는 지점이 여기다. 등장 횟수는 그 문장이 몇 번 게시됐는지를 재는 값이지 몇 번 물어졌는지를 재는 값이 아니다.
그래서 질문마다 어디에 적혀 있었는지를 딱지로 붙였다. 다섯 갈래이고, 먼저 걸리는 조건이 이긴다.
- 사람이 남긴 것 — 포럼·게시판으로 분류된 호스트이거나 주소에 /forum, /thread, /topic, /community 같은 경로가 들어간 페이지.
- 찍어 낸 것 — 위에 안 걸리면서, 똑같은 문장이 서로 다른 도메인 두 곳 이상에 글자 그대로 올라와 있는 경우.
- 상업용 FAQ — 쇼핑몰이나 고객지원 페이지로 분류된 호스트.
- 매체 — 뉴스·블로그·매거진으로 분류된 호스트.
- 미분류 — 넷 중 어디에도 안 걸린 나머지.
분류 규칙을 읽어 두면 뒤의 숫자를 과하게 읽지 않게 된다. 찍어 낸 것이라는 딱지는 기계가 썼다는 판정이 아니다. 여러 사이트에 글자까지 똑같이 복제돼 있다는 관찰일 뿐이다. 논문은 기계 생성 텍스트 탐지기를 아예 쓰지 않았다고 밝힌다. 질문 문장이 평균 열두 단어 남짓이라 그 길이에서는 탐지기를 믿을 수 없어서다.
약한 자리도 논문이 먼저 말한다. 넷 중 아무 데도 안 걸린 미분류 몫이 61%에서 73%로 늘었고, 연구진은 이것이 자기 분류 체계에서 가장 약한 부분이라고 적었다. 사람 주석자를 붙여 대조한 결과도 함께 공개했다. 출처가 무엇인지에 관한 주석자 간 일치도는 κ 0.52로 그럭저럭 맞았지만, 이 질문을 사람이 진짜로 궁금해서 물었는지에 관한 일치도는 κ 0.23까지 떨어졌다. 사람끼리도 합의가 안 된다는 뜻이다. 그래서 논문은 진짜인지 가짜인지를 주장하지 않고, 어디에 적혀 있었는지만 주장한다.
많이 등장한 질문일수록 사람 손을 덜 탄다
연구진은 2015년, 2020년, 2024년 세 시점에서 그해 웹에 가장 자주 등장한 질문 1,000개를 뽑아 딱지를 세어 봤다. 찍어 낸 것, 곧 복제 문구의 몫은 2015년에 이미 71.7%였고, 2020년 86.8%를 거쳐 2024년 93.2%가 됐다. 같은 해 서로 다른 질문 전체에서 복제 문구는 3~4%에 불과하다. 웹 전체로 보면 드문 부류인데, 순위표 꼭대기에는 거의 전부가 그 부류다.
반대편도 같은 속도로 비었다. 상위 1,000개 가운데 사람이 남긴 자리에서 나온 질문은 2015년 6.3%였다가 2020년 0.3%로 내려앉았고, 2024년에도 그대로다. 상위 1,000개라는 자리 자체가 사람의 궁금증과는 다른 논리로 채워지는 칸이 된 것이다.
꼭대기에 무엇이 앉아 있는지는 문장을 직접 보면 빨라진다. 2020년 한 해에 가장 많이 복제된 질문은 "what are you waiting for"였고 72,331번 등장했다. 그다음은 "how can we help you"다. 둘 다 누군가 답을 알고 싶어 던진 문장이 아니라, 배너와 상담 창에 박아 넣는 상투구다. 질문의 꼴을 하고 있을 뿐이다.
진짜 궁금증 쪽 분포는 애초에 뾰족하지 않다. 서로 다른 질문의 97%는 전체 기간에 걸쳐 한 번이나 두 번만 등장한다. 상위 1,000개를 다 합쳐도 전체 등장 횟수의 3%가 안 된다. 사람의 물음은 길게 누운 꼬리에 흩어져 있고, 봉우리는 복사·붙여넣기가 만든다.
봉우리를 만드는 주체가 소수의 스팸 농장일 것이라는 짐작은 데이터가 받쳐 주지 않는다. 상위 1,000개 질문에서 상위 100개 호스트가 차지한 몫은 11.7%에서 2.8%로 오히려 줄었다. 몇몇 대형 사이트가 같은 문구를 대량으로 찍어 내는 그림이 아니라, 아주 많은 사이트가 저마다 같은 문구를 조금씩 얹는 그림이다. 검색엔진을 겨냥해 질문 꼴의 문구를 페이지에 넣는 일이 업계의 기본 관행이 됐다는 뜻으로 읽힌다.
이 대목이 실무에 바로 닿는다. 웹에서 질문을 모아 만든 공개 데이터셋은 이미 여럿이고, 논문 부록이 그 계열을 한 표에 모아 놓았다. CCQA는 페이지에 박힌 schema.org 질문 표기를 긁어 모았고, WebFAQ는 그중 FAQ 표기만 추렸다. GooAQ는 검색창 자동완성에서 질문을 받아 왔고, PAQ는 처음부터 기계로 만들었다고 밝힌 묶음이다. 논문은 앞의 두 데이터셋을 두고 표기가 붙어 있으면 자연스럽게 물어진 질문으로 여긴 경우라고 적었다.
이 연구가 센 쪽은 그런 표기가 붙지 않은 채 본문에 적힌 질문이고, 수로는 그쪽이 다수다. 질문 단위로 출처와 시간 변화를 함께 본 선행 연구는 없다는 것이 연구진의 설명이다. 웹에서 긁어 온 질문을 쓰면서 등장 빈도로 가중치를 주거나 자주 나오는 질문부터 학습·평가에 넣으면, 사람의 관심사를 우선 반영하는 것이 아니라 복제 문구를 우선 반영하게 된다. 논문이 뒤집은 것은 어느 데이터셋의 품질이 아니라, 빈도를 수요로 읽는 습관 자체다.
포럼이 줄어든 자리를 무엇이 채웠나
시계열은 다섯 시기로 끊었다. 2013~2015년 기준선, 2016~2019년 검색 최적화기, 2020년부터의 코로나기, 챗GPT가 나온 2022년 말부터의 초기 AI기, 그리고 2024~2025년이다. 이 구간을 따라 사람이 남긴 질문의 등장 비중은 9.3%에서 1.9%로 내려갔다. 낙폭으로는 79%다. 같은 기간 복제 문구의 몫은 25.9% 늘었고, 상업용 FAQ는 시작점이 작았던 만큼 두 배가 됐다.
이 연구가 믿을 만해지는 대목이 여기다. 12년 동안 크롤 자체가 커지고 대상이 바뀌었으니, 몫의 변화가 웹의 변화인지 크롤의 변화인지부터 갈라야 한다. 연구진은 두 갈래로 확인했다. 하나는 크롤 크기를 회귀로 통제하는 것이고, 다른 하나는 전체 스냅숏의 90% 이상에 살아 있던 호스트 79,826개만 남긴 고정 패널로 다시 재는 것이다.
결과를 연구진은 자기 주장을 깎는 쪽으로 정리했다. 복제 문구가 점유율로 늘었다는 주장은 보정 뒤 살아남지 못했다. 회귀 계수는 오히려 −2.0%였고 p값은 0.49다. 반면 페이지 한 장당 몇 건이 실리는지로 보면 13.3% 증가가 남았고 p값은 0.006이다. 그래서 논문은 제조된 질문층이 커졌다는 주장을 비율로만 하고 점유율로는 하지 않는다고 스스로 못 박았다.
사람이 남긴 질문의 감소에도 같은 잣대를 댔다. 고정 패널에서는 포럼의 감소폭이 42~56%로 줄어든다. 두 갈래 보정이 대략 45%로 모였고, 연구진은 이 값을 최선의 추정으로 적으면서 크롤 전체 기준의 79%는 상한으로 봐야 한다고 밝혔다. 방향은 바뀌지 않지만 크기는 절반쯤이다.
비어 가는 쪽 말고 채워지는 쪽도 다른 자료가 받친다. 주소에 /faq나 /questions-and-answers 같은 경로가 들어간 페이지의 비율은 0.82%에서 1.42%로 올랐고, 가장 가팔랐던 구간이 2017~2019년이다. 검색 결과에 FAQ를 접어 보여 주는 구조화 표기가 퍼진 시기와 겹친다. 질문을 페이지에 넣으면 검색에서 자리를 얻는다. 그 셈법이 서면서 질문 꼴의 문구가 늘었고, 두 갈래 자료가 같은 방향을 가리킨다.
AI가 이 흐름을 만들었다고 읽고 싶어지는 자리에서, 논문은 브레이크를 건다. 제조된 질문을 잡아내는 근거인 도메인 간 축자 중복률은 2021년 3월 스냅숏에서 21.6%로 정점을 찍고 내려와 AI 시기에는 18.3%다. 정점은 챗GPT 공개보다 스무 달 앞선다. 논문은 어떤 질문이 모델이 쓴 문장이라고 귀속할 수 없다고 적었다. 웹의 질문을 기계용으로 바꿔 놓은 힘은 생성 모델보다 먼저 와 있었다. 논문이 그 구간에 붙여 둔 이름 자체가 검색 최적화기다.
형태로 걸러지는 것과 끝내 걸러지지 않는 것
논문 제목은 누가 묻는지 알아볼 수 있다고 말한다. 무엇을 보고 알아본다는 것인가. 연구진은 표본 220만 건에 품사 분석과 정규식을 걸어 질문의 생김새를 재고, 그 특징만으로 출처를 맞힐 수 있는지 시험했다.
먼저 빗나간 예상이 있다. 의문사로 시작하는지 예·아니오로 답하는 꼴인지는 출처를 거의 가려내지 못했다. 연관 강도가 0.03으로, 사전에 등록한 다섯 가설 가운데 유일하게 기각됐다. 대신 힘을 낸 것은 길이다. 사람이 남긴 질문은 평균 12.9 토큰, 복제 문구는 8.5 토큰이다. 앞뒤에 설명 문장이 붙어 있는 비율은 7.3%와 3.9%로 갈리고, 나·우리 같은 1인칭 표현이 들어간 비율은 29.7%와 21.4%다. 길고, 앞뒤 사정이 붙어 있고, 자기 이야기가 들어간 문장이 사람 쪽이다.
이 세 신호를 넣은 모형은 사람이 남긴 질문과 복제 문구를 AUC 0.725로 갈랐다. 쓸 만하지만 완벽과는 거리가 있는 값이다. 그리고 상대를 상업용 FAQ로 바꾸면 0.554로 내려앉는다. 동전 던지기가 0.5이니 사실상 못 가린다는 뜻이다. 논문의 결론은 여기서 정직하다. 생김새가 잡아내는 쪽은 대충 찍어 낸 질문 농장이고, 사람이 공들여 쓴 상업용 FAQ는 겉모습만으로 가려지지 않는다.
같은 신호를 12년 시계열에 대 보면 웹의 질문 자체가 어느 쪽으로 움직였는지 보인다. 갈래를 나누지 않고 질문 전체를 놓고 보면, 평균 길이가 13.41 토큰에서 11.85 토큰으로 11.6% 짧아졌다. 앞뒤에 설명 문장이 붙은 비율도 9.95%에서 6.12%로, 38.5% 줄었다. 논문은 이 변화를 질문 주위의 사람이 줄어드는 일이라고 적었다. 배경을 한 줄 덧붙이거나 자기 사정을 밝히는 부분이 먼저 사라진다.
질문이 홀로 서 있는 정도도 같은 표본에서 쟀다. 품사 규칙으로 갈라 보면 절반 남짓은 문장 하나로 완결되고, 38%는 대화의 조각이며, 12%는 무엇을 가리키는지 앞을 봐야 알 수 있는 말을 달고 있다. 시간을 따라가면 앞뒤 문맥이 있어야 풀리는 몫이 14.0%에서 8.6%로 줄었다. 반대쪽, 그러니까 완결된 문장의 몫이 늘었다는 결과는 통계적으로 유의하지 않아 논문은 주장하지 않았다.
맥락 쪽 분석은 데이터 정제를 하는 쪽에 특히 불편한 결과를 준다. 사람이 남긴 질문은 앞뒤 문맥이 있어야 뜻이 서는 비율이 19%로 가장 높고, 상업용 FAQ는 문장 하나로 완결된 비율이 59%로 가장 높다. 깨끗하고 자족적인 질문만 남기는 필터를 돌리면 사람 쪽이 먼저 잘려 나가고 제조된 쪽이 더 많이 살아남는다. 품질 필터가 품질을 낮추는 방향으로 작동할 수 있다는 이야기다. 다만 이 맥락 분류는 사람 검증 정확도가 63%에 그쳐, 논문 자신이 탐색적 분석이라고 부른다.
4.1탐지 방법은 회피 방법이기도 하다
논문 뒤쪽에 이해관계 공시가 붙어 있다. 저자 전원이 보디움랩스 소속이며, 이 회사는 생성엔진 최적화 상업 제품을 만들고 연구비도 이 회사가 댔다고 적혀 있다. 생성엔진 최적화는 AI 답변에 자기 페이지가 인용되도록 콘텐츠를 다듬는 일이다. 웹의 질문이 기계용으로 제조된다는 것을 실측한 팀이, 바로 그 제조를 돕는 제품을 파는 회사에 있다.
연구진은 이 긴장을 감추지 않고 이중 용도라고 적었다. 사람이 남긴 질문과 제조된 질문을 가르는 분류기는 데이터를 걸러 내는 쪽에도 쓰이지만, 분류기에 걸리지 않는 문구를 만드는 쪽에도 그대로 쓰인다. 4절 앞부분의 신호를 뒤집어 읽으면 그대로 회피 설명서가 된다. 문장을 길게 쓰고, 앞뒤에 사정을 붙이고, 1인칭을 섞으면 된다.
공시를 읽는 방법은 두 가지다. 하나는 이해가 걸린 쪽이 낸 결과이니 할인해서 읽는 것이고, 다른 하나는 이 업계 안쪽 사람이라 이런 데이터를 이런 각도로 볼 수 있었다고 읽는 것이다. 수치와 코드가 공개돼 있으니 앞쪽 걱정은 재현으로 줄일 수 있다. 줄지 않는 것은 뒤쪽이다. 데이터 품질을 실증하는 연구와 그 품질을 떨어뜨리는 산업 사이의 거리가 생각보다 가깝다. 이 단락은 논문의 주장이 아니라 이 글의 읽기다.
페블러스가 이 연구를 주목하는 이유
이 논문에서 가장 오래 남을 문장은 수치가 아니라 1절의 정의다. 웹에서 센 것은 게시된 횟수였지 물어진 횟수가 아니었다. 데이터를 다루는 자리에서 같은 문장을 다른 낱말로 바꿔 쓸 수 있다. 양은 출처를 대신하지 못한다.
학습 데이터의 품질을 말할 때 우리는 대개 크기부터 센다. 몇 억 건인지, 몇 테라바이트인지, 중복을 얼마나 걷어 냈는지가 먼저 나온다. 그런데 이 연구가 보여 준 것은 같은 코퍼스 안에서 가장 자주 나오는 문장일수록 사람과 멀다는 사실이다. 빈도로 가중치를 주는 관행, 자주 나오는 것을 대표로 뽑는 관행이 그 자체로 편향을 만든다. 무엇이 얼마나 많은가로는 이 편향이 보이지 않고, 각각이 어디서 왔는가를 따로 세어야 보인다.
페블러스가 AI-Ready Data를 말할 때 출처를 함께 말하는 이유가 여기에 있다. 그래서 이 논문을 읽고 우리 데이터에 되돌려 물을 것은 하나다. 우리가 학습과 검증에 쓰는 코퍼스에서 진짜 사람이 남긴 것의 비중을, 우리는 지금 셀 수 있는가. 아래 네 가지는 논문에 있는 항목이 아니라 그 방법을 우리 업무로 옮겨 세운 물음이다.
- 수집한 문서가 어느 호스트에서 왔는지 지금 조회할 수 있는가. 출처 분류는 이 기록이 남아 있을 때만 가능하다.
- 같은 문장이 서로 다른 도메인에 몇 번 나타나는지 세어 봤는가. 도메인 간 중복은 문서 단위 중복 제거를 통과하고도 남는다.
- 품질 필터가 무엇을 먼저 버리고 있는가. 짧고 맥락 의존적인 문장을 걷어 내는 규칙은 사람이 쓴 쪽을 먼저 버릴 수 있다.
- 빈도를 중요도로 쓰는 자리가 어디에 있는가. 샘플링 가중치, 평가셋 선정, 자주 묻는 질문 목록이 모두 그 자리다.
네 가지 모두 새 모델이나 새 도구를 요구하지 않는다. 수집 시점에 무엇을 함께 적어 두었는지를 묻는 항목들이다. 수집 단계에서 출처를 갈라 적어 두는 문제는 학습 데이터 출처 분리를 다룬 앞선 글에서 데이터 감사 쪽으로 따로 짚었다. 출처는 나중에 복원되지 않는다. 문서를 받아 오는 순간 함께 적지 않으면, 그 코퍼스에서 사람의 몫을 세는 일은 영영 추정으로만 남는다.
여기까지 읽어 주셔서 감사하다. 이 글이 인용한 수치는 arXiv:2609.24106 전문에서 누구나 확인할 수 있다. 여러분이 다루는 데이터에서는 출처를 어디까지 적어 두고 있는지 궁금하다. 세어 보려 했지만 기록이 없어 못 셌던 항목이 있다면 나눠 주시면 좋겠다.
참고문헌
1차 자료
- 1.Zhou, C., McCloskey, V., & Srinivasan, K. (2026). "You Can Tell Who's Asking: What the Web's Questions Are Made Of, and Where They Come From." arXiv:2609.24106 [cs.CL].
데이터셋
- 2.Penedo, G. 외. (2024). "FineWeb." Hugging Face. 이 연구가 스냅숏 110개를 받아 쓴 코퍼스.
- 3.Common Crawl Foundation. "Common Crawl." FineWeb의 원본 크롤.