Executive Summary

이 글은 마케팅 분석 회사 Graphite가 Claude Opus 5.5에 같은 잣대를 다시 댄 후속 연구를 1차 출처와 그들이 공개한 원자료로 되짚는다. 가장 많이 인용된 대목은 줄표가 99% 사라졌다는 문장이다. 1,000단어당 2.92개에서 0.015개로 내려갔다. 같은 연구가 바로 다음 줄에 적은 수는 2,548이다. 낱말과 구절과 틀을 단위로 센 'AI 티'의 가짓수이고, 직전 판보다 4% 적다. 한쪽은 절벽이고 한쪽은 거의 평지인데, 두 수는 애초에 다른 것을 센다. 앞의 것은 피처 하나의 빈도이고 뒤의 것은 임계값이 정한 집합의 크기다.

공개 원자료를 열면 본문에 적히지 않은 수가 하나 더 나온다. 같은 코퍼스에서 사람 글의 줄표 비율은 1,000단어당 3.14개다. 그러면 Opus 5.5는 사람의 약 205분의 1을 쓴다. 현행 모델 넷은 예외 없이 사람보다 줄표를 적게 쓴다. 그런데 같은 표에서 GPT-4.1과 GPT-5는 사람의 두 배를 넘는다. 줄표가 AI의 표지라는 통념이 만들어지던 무렵 그 통념은 실제로 맞았고, 지금은 방향이 반대다. 여기까지는 연구와 원자료에 적힌 사실이다.

해석은 이렇다. 탐지는 두 분포를 맞대는 일이다. 이 연구에서 기계 쪽 분포는 판이 바뀔 때마다 통째로 움직인다. 반면 사람 쪽 분포는 챗GPT가 나오기 전에 발행된 웹 기사 1만 편에 고정돼 있고 갱신할 방법이 없다. 그 이후의 웹에는 이미 양쪽이 섞여 있어서, 기준선을 새로 뜨려는 순간 기준선 자체가 오염된다. 더 눈여겨볼 것은 그 고정이 이 연구 한 편의 사정이 아니라는 점이다. 탐지기가 세대 교체에도 잘 버틴다는 것을 보인 평가들을 열어 보면, 비교 대상으로 삼은 사람 글이 하나같이 2022년 이전 것이다.

한쪽만 움직이고 다른 쪽은 멈춰 있는데 고칠 수도 없다면, 그 사이에서 나온 '사람 글'과 'AI 글'이라는 라벨에 유효기간이 생기는 것은 구조의 결과다. 그리고 신호가 죽는 것보다 부호가 뒤집히는 쪽이 데이터 품질에는 더 나쁘다. 죽은 신호는 정확도가 떨어져 눈에 띄지만, 뒤집힌 신호는 확신에 찬 채로 조용히 틀린 라벨을 계속 만든다. 이 글은 AI 글을 가려내는 요령을 알려 주는 글이 아니라, 이미 붙은 라벨을 어떻게 보관할 것인가에 관한 글이다.

1/205

Opus 5.5의 줄표 사용률, 사람 대비

1,000단어당 0.015개다. 같은 코퍼스에서 사람은 3.14개를 쓴다

2.27배

GPT-4.1의 줄표 사용률, 사람 대비

통념이 생기던 무렵엔 사람보다 많이 썼다. 같은 코퍼스에서 잰 값이다

2,548

Opus 5.5의 AI 티 가짓수

직전 판보다 4% 적다. 임계값이 정한 집합의 크기다

6% 감소

알려진 tell 11종 평균 강도, Opus 5 대비

Cohen's d로 잰 평균 강도다. Opus 4 대비로는 53% 낮다

1

통념이 생기던 무렵, GPT는 사람의 두 배를 썼다

Graphite는 콘텐츠 마케팅 성장 대행사다. 2026년 9월에 이 회사가 낸 'AI Tells'는 챗GPT가 나오기 전에 발행된 웹 기사 1만 편과, 그 기사들과 같은 주제를 모델에게 쓰게 한 AI 기사 9만 편을 맞대 어떤 낱말과 구절이 어느 쪽에 유난히 많은지를 셌다. 2026년 10월 1일에 나온 후속 연구는 거기에 Claude Opus 5.5와 GPT-6 Astra를 더했다. 이 조사의 등급은 4절에서 따로 짚는다. 피처별 수치가 담긴 원자료는 CC BY 4.0으로 공개돼 있다. 이 글의 수치는 그 원자료를 직접 열어 확인한 것이다.

가장 널리 옮겨진 대목은 줄표다. 영어로 em dash라 부르는, 하이픈보다 긴 '—' 이 부호를 말한다. 후속 연구는 Opus 5.5의 줄표 사용량이 1,000단어당 2.92개에서 0.015개로 내려갔다고 적었다. 본문이 적지 않은 것은 비교 기준이다. 같은 측정에서 사람 글은 1,000단어당 3.137847개를 쓴다. 원자료에 그 값이 들어 있다. 그 기준을 세워 놓고 열한 줄을 한 표에 늘어놓으면, 널리 인용된 문장과는 다른 그림이 나온다.

모델 줄표 / 1,000단어 사람(3.14개) 대비
GPT-4.17.1319362.27배
GPT-56.9213652.21배
사람 (2022-11-30 이전 발행)3.137847기준
Claude Opus 52.9242420.93배
Gemini 2.5 Pro1.4301182.2분의 1
Claude Opus 40.6611134.7분의 1
GPT-6 Astra0.3689048.5분의 1
GPT-5.6 Sol0.30551410.3분의 1
Claude Opus 4.60.20280815.5분의 1
Claude Opus 5.50.015347204.5분의 1
Gemini 3.1 Pro0.013723228.7분의 1

출처: Graphite가 공개한 ai_tells_features.csv.gz의 layer1__punct_emdash_per1k 행. 정렬 토픽 9,974개 기준. 같은 파일에 정의가 다른 줄표 피처가 하나 더 있으나, 본문의 2.92와 맞는 쪽은 이 행이다. 사람 행을 가운데 두고 위아래로 가르면 위에 둘, 아래에 여덟이 선다.

표의 위쪽 두 줄이 이 글의 출발점이다. 사람들이 줄표를 AI의 표지로 익히던 시기에 그 자리에 있던 모델은 GPT-4.1과 GPT-5였고, 두 모델은 실제로 사람의 두 배를 넘게 썼다. 통념은 배울 당시엔 참이었다. 그리고 지금 쓰이는 모델 넷은 전부 사람 아래로 내려갔다. Claude Opus 5.5와 Gemini 3.1 Pro, GPT-6 Astra와 GPT-5.6 Sol이 그 넷이다. 신호가 흐려진 것이 아니라 가리키는 방향이 반대로 돌아섰다는 뜻이다. Graphite 자신도 한 판 전에 과잉 교정을 의심한 적이 있다. 다만 그때 지목된 쪽은 GPT와 제미나이였고, 클로드 Opus 5는 사람과 비슷한 수준에 있었다. 한 판 만에 클로드가 그 둘보다 더 아래로 내려갔다.

"클로드 Opus 4.6은 Opus 4보다 줄표를 적게 쓰지만, Opus 5는 다시 사람과 비슷한 수준으로 되돌린다. GPT와 제미나이는 이 잘 알려진 tell에 과잉 교정했을 수 있다. 두 계열의 최신 판은 사람 필자보다 줄표를 훨씬 적게 쓴다." Graphite, AI Tells (2026-09-16). 후속 연구는 같은 말을 클로드에 붙이지 않고, Opus 5.5와 Astra 둘 다 "챗GPT 이전 사람 글보다 줄표 사용률이 훨씬 낮다"고만 적는다.

1.1이 수치가 참인 조건은 넷이다

위 표를 혼자 떼어 옮기면 금방 거짓이 된다. 조건 넷이 함께 가야 한다. 첫째, 비교 대상인 사람 글은 2022년 11월 30일 이전에 발행된 웹 기사다. 2026년에 사람이 쓴 글이 아니다. 둘째, AI 글은 프롬프트 하나로 생성한 SEO형 웹 기사다. 셋째, 모델 버전이 한정돼 있다. 표의 이름이 바뀌면 값도 바뀐다.

넷째가 가장 자주 빠진다. 이 값들은 이 코퍼스에서 잰 값이다. 독자가 줄표를 AI 신호로 익힌 자리는 대개 대화창인데, 이 연구는 대화를 재지 않았다. Graphite도 한계 절에 같은 단서를 달았다. 모델과 나눈 대화 같은 다른 맥락에서는 tell이 다를 수 있다는 것이다. 따라서 이 표는 "챗봇이 줄표를 안 쓴다"는 문장으로 옮길 수 없다. 그 차이가 얼마나 큰지는 바로 아래에서 숫자로 드러난다.

1.2같은 모델을 세 곳이 측정했더니 기준선이 다섯 배 달랐다

Opus 5.5의 줄표 붕괴 자체는 독립적으로 재현됐다. 방향은 세 곳이 같다. 그런데 직전 판인 Opus 5의 절대값은 측정 주체마다 크게 다르다. 아래 세 측정은 모델에게 쓰게 한 글의 종류가 서로 다르다.

측정 주체 무엇을 쓰게 했나 Opus 5 Opus 5.5
Graphite단일 프롬프트, SEO형 웹 기사2.920.015
ArenaText Arena 고추론 실사용 응답15.20.8
Arize리서치 브리프 20종, 5장르 × 5도메인12.90.05
(사람 기준선, Graphite)2022-11-30 이전 웹 기사3.14·

단위는 모두 1,000단어당 줄표 개수다. Arena 수치는 BleepingComputer가 2026년 9월 26일에 전한 집계이고, Arize 수치는 같은 달 자체 재현 평가에서 나왔다. 세 측정은 모순이 아니다. 무엇을 쓰게 하고 쟀느냐가 다르다.

Graphite의 코퍼스에서 Opus 5는 사람보다 줄표를 적게 썼다. 같은 모델이 Arena와 Arize의 코퍼스에서는 사람의 네댓 배를 썼다. 그러니 1절 표의 역전은 여전히 성립하되, 뒤집힌 것은 "모든 맥락의 모델"이 아니라 이 코퍼스에서 잰 모델이다. 독립 재현은 글을 깎지 않고 오히려 세운다. 같은 모델, 같은 피처인데 무엇과 비교해 쟀느냐에 따라 값이 다섯 배 달라진다는 사실 자체가 이 글이 6절에서 할 이야기의 가장 짧은 예시다.

Arena 쪽에는 덧붙일 것이 더 있다. 그 측정은 세미콜론도 함께 셌고, 같은 구간에서 6.10에서 1.64로 내려갔다. 줄표만 사라진 것이 아니라 눈에 잘 띄는 구두점 신호가 같이 억제됐다는 뜻이고, Graphite의 '과잉 교정' 해석을 거든다. 다만 전면적인 개선으로 읽으면 곤란하다. 같은 집계에서 평균 답변 길이는 453단어에서 481단어로 오히려 늘었다. Arize의 결론 문장은 중립적이고 정확하다. "'고쳤다'는 너무 세고, '훨씬 나아졌다'가 공정하다."

2

99%와 4%는 다른 것을 센다

같은 연구에서 나온 두 수가 나란히 돌아다닌다. 99%는 거의 전부가 사라졌다고 말하고 4%는 거의 그대로라고 말한다. 둘을 같은 줄에 놓으면 연구가 자가당착에 빠진 것처럼 보이지만, 두 수는 애초에 다른 대상을 센다.

99%는 피처 하나의 빈도가 줄어든 비율이다. 줄표라는 한 가지 특징을 1,000단어당 몇 번 쓰는지 세어 직전 판과 나눈 값이고, 0.015347을 2.924242로 나누면 99.5% 감소가 나온다. 4%는 집합의 크기가 변한 비율이다. Graphite는 길이를 맞춘 뒤 사람보다 두 배 이상 많이 쓰이면서 최소 등장 글 수 조건을 넘긴 낱말과 구절과 틀을 모아 그 글에서 tell이라 부른다. 조건은 유니그램 500편, 바이그램 250편, 트라이그램 100편, 틀 120편이다. 그렇게 추린 목록의 크기가 Opus 5의 2,666개에서 Opus 5.5의 2,548개가 됐다. 임계값을 조금만 옮기면 달라지는 수다.

그래서 두 수로 배수를 만들면 안 된다. 99를 4로 나눈 값은 아무것도 가리키지 않는다. 분모와 분자가 다른 세계에 있다. 아래 도식은 같은 가로축 위에 그 두 세계를 겹쳐 놓은 것이다. 위는 Claude 네 판의 줄표 사용률이고 아래는 같은 네 판의 tell 가짓수다. 위에 그은 점선이 사람 기준선 3.14개다.

줄표 사용률 (1,000단어당) 사람 3.14개 0.66 0.20 2.92 0.015 Opus 4 Opus 4.6 Opus 5 Opus 5.5 AI 티 가짓수 (임계값을 넘긴 낱말·구절·틀) 3,746 3,059 2,666 2,548 Opus 4 Opus 4.6 Opus 5 Opus 5.5

두 세로축은 단위가 다르므로 높이를 서로 견주면 안 된다. 읽을 것은 기울기의 모양이다. 위는 Opus 5에서 사람 기준선 가까이 올라섰다가 다음 판에서 바닥으로 떨어지는 절벽이고, 아래는 네 판에 걸쳐 완만하게 내려가는 비탈이다.

2.1두 수 사이에 세 번째 수가 있다

99%와 4% 사이에 놓고 읽어야 할 수치가 또 있다. 후속 연구는 원 연구와 똑같이 '알려진 tell 11종'을 따로 추적한다. 줄표와 delve 같은, 이미 널리 알려져 사람들이 AI 신호로 쓰던 것들이다. 그 열한 가지의 평균 강도를 Cohen's d로 재면 Opus 5.5는 Opus 5보다 6% 낮고 Opus 4보다 53% 낮다. 열한 가지의 세부 목록은 공개돼 있지 않다.

이 6%가 이 글에서 가장 강한 대비의 한쪽이다. 줄표 하나는 99% 빠졌는데, 같은 범주에 든 열한 가지 전체는 한 판 사이에 6%밖에 내려가지 않았다. 가장 유명한 신호 하나만 극적으로 빠졌고 나머지는 거의 그대로다. 널리 알려진 tell을 지우는 작업이 실제로 있었다면, 그 작업은 범주 전체가 아니라 가장 눈에 띄는 한 가지를 겨냥한 모양이다.

2.2GPT는 반대로 간다

"AI 글이 사람 글에 가까워지고 있다"는 문장을 주어 'AI'로 쓰면 거짓이 된다. 모델군마다 방향이 다르기 때문이다. Claude 계열은 사람 글과의 거리가 좁아졌고, GPT 계열은 멀어졌다. 원자료를 직접 집계하면 GPT 쪽 tell 총수는 2,491개에서 3,681개로 47.8% 늘었다. 같은 기간 Claude 쪽은 2,666개에서 2,548개로 줄었다. 공개된 tell 목록을 모두 합치면 9개 모델에서 12,877개이고, 현세대 세 모델만 모으면 약 7,000개다.

모델군 사이의 닮음을 말할 때도 원문의 유보를 함께 옮겨야 한다. 모든 모델이 같은 프롬프트를 받았으므로 닮음의 일부는 모델이 아니라 과제에서 왔을 수 있다는 것이 Graphite의 문장이다. 이 단서를 떼고 "모든 모델이 서로 닮았다"로 줄이면 연구가 하지 않은 주장을 하는 셈이 된다.

2.3역전은 줄표만의 일이 아니다

줄표 하나만 뒤집혔다면 우연으로 치울 수 있다. 그래서 어휘 쪽에도 같은 질문을 대 봤다. 원 연구가 '잘 알려진 tell'의 예시로 든 delve와 landscape를 포함해, 흔히 LLM 어휘로 지목되는 여덟 낱말을 원자료에서 직접 더해 봤다. delve, tapestry, nuance, crucial, landscape, foster, stakeholder, realm이다. 이 합산은 Graphite의 공식 지표가 아니라 공개 원자료에서 이 글이 구성한 집계다.

모델 여덟 낱말 합계 / 1,000단어 사람 대비 Cohen's d
사람0.439665기준
GPT-4.1 / Opus 4 / Gemini 2.5 Pro2.62 안팎+1.04 ~ +1.13 (사람보다 훨씬 많이)
Claude Opus 50.443966+0.004 (거의 동률)
GPT-5.6 Sol / GPT-6 Astra / Claude Opus 5.50.31 안팎−0.111 / −0.115 / −0.124 (사람보다 적게)

같은 원자료에서 여덟 낱말의 1,000단어당 사용률을 더해 사람 값과 견준 것이다. Graphite가 발표한 지표가 아니라 이 글의 집계다.

결과는 줄표와 같은 모양이다. 널리 알려진 신호가 알려진 뒤 한 세대 안에 사람 아래로 내려가는 일이 어휘 쪽에서도 똑같이 벌어졌다. 1절의 역전은 구두점 하나에 생긴 사고가 아니다. 사람이 눈으로 쓰는 규칙은 알려질수록 빨리 낡고, 낡는 방식은 희미해지는 쪽이 아니라 반대로 돌아서는 쪽이다.

3

빈자리를 'this matters'가 메웠다

tell 가짓수가 2,666개에서 2,548개로 줄었다는 말은 목록의 길이가 조금 짧아졌다는 뜻일 뿐이다. 같은 목록에서 118개가 빠지고 나머지가 그대로 남았다는 뜻이 아니다. 후속 연구가 흥미로운 지점은 여기다. 빠진 자리에 다른 것이 들어왔고, 들어온 것들은 서로 닮은 구석이 있어 범주 이름이 붙었다. 가장 두드러진 것은 Graphite가 'Flagging Importance'라 부른 범주다. 지금 읽고 있는 것이 중요하다고 독자에게 알려 주는 표현들이다. 두 번째 범주는 'Contrastive Phrasing'이다. "A가 아니라 B다" 꼴로 앞을 물리고 뒤를 세우는 틀인데, 그중 가장 높은 "is more than a _ it"은 사람의 98배까지 간다.

범주 구절 사람 대비
Flagging Importance
중요하다고 알리기
this matters116배
why _ matters92배
just as important13배
matters most12배
Contrastive Phrasing
맞세워 말하기
is more than a _ it98배
rather than simply32배
not only about13배
instead it8배
그 밖에looking ahead the40배
adds another layer27배
what comes next24배
dependable23배
in practice7배

사람 글 대비 사용 빈도의 배수다. 일부 보도가 dependable을 Opus 5.5의 최대 tell로 옮겼으나 1차 출처는 그렇게 적지 않는다. 그 낱말은 'Evaluative Adjectives' 범주의 예시 넷 중 하나이고 배수는 23배다. 이 모델에서 가장 높은 배수는 this matters의 116배다. 덧붙이면 dependable은 원 연구에서 Astra의 tell이었고 그때 배수는 59배였다.

줄표가 쓸모를 잃은 자리를 메운 것이 바로 이런 구절들이다. 줄표는 글자 하나라서 세기도 쉽고 지우기도 쉽다. 반면 "this matters"는 낱말 두 개짜리 틀이고, 지우려면 모델이 문장을 어떻게 맺을지를 바꿔야 한다. 신호가 눈에 덜 띄는 층으로 내려갔다는 뜻이고, 그만큼 사람이 눈으로 거르기 어려워졌다는 뜻이기도 하다.

"tell이 줄고 있는 것은 아니다. 가장 잘 알려진 tell은 없애는 데 성공하고 있지만, 다른 것들이 튀어나온다. 그리고 모델 판마다 자기 것이 따로 있다." Graphite 최고 AI 책임자 Greg Druck, TechCrunch (2026-10-01) 인터뷰

3.1판마다 목록의 절반 넘게 갈린다

Druck의 말은 수치로도 확인된다. 공개 원자료로 연속한 두 판의 tell 목록이 얼마나 겹치는지를 세어 보면, 공유율은 구간에 따라 18.7%에서 45.5% 사이다. 어느 구간에서든 절반에 한참 못 미친다. 나머지는 한쪽 판에만 있는 목록이다. 같은 회사의 연속한 두 판 사이에서 이 정도가 갈린다.

모델군 단위로 보면 조금 다르다. 한 모델군에만 나타나는 tell의 비율은 65%이고, 같은 회사의 Astra와 Sol은 45%를 공유한다. 회사가 모델을 만드는 방식에 남는 지문 같은 것이 있다는 뜻이지만, 그 지문도 판이 바뀔 때마다 절반 넘게 다시 그려진다.

무엇이 바뀌는지는 구절 단위로 볼 때 더 또렷하다. Opus 5.5가 직전 판보다 더 쓰는 것은 "can help you"(8배), "is especially helpful"(12배), "makes it easier"(6배)다. 반대로 Opus 5가 더 쓰던 것은 "is genuinely"(26배), "matters enormously"(15배)다. 같은 회사의 한 판 차이인데 목록이 이렇게 갈린다.

3.2모델군마다 버릇이 다르다

Opus 5.5와 GPT-6 Astra를 맞대면 두 모델이 서로 반대쪽으로 기운다. Opus 5.5는 최상급 쪽이다. "one of the best _ about"이 Astra의 79배, "the most popular"가 45배다. Astra는 유보 쪽이다. "does not establish"가 Opus 5.5의 275배, "may provide"가 18배다. 한쪽은 무언가를 치켜세우는 데 기울고 다른 쪽은 선을 긋는 데 기운다.

이 대목에서도 2차 보도가 자릿수를 한 번 흘렸다. Astra의 '교정하는 말투'가 사람의 100배 이상이라고 옮긴 기사가 있으나, 1차 출처의 합성 지표는 12배다. 100배를 넘는 것은 그 범주를 이루는 개별 구절이다. "not simply"가 157배, "the _ is not simply"가 576배다. 범주의 합성 지표와 그 안의 개별 구절은 자릿수가 다르니 나눠 적어야 한다.

두 모델 사이의 차이가 어느 품사에서 오는지도 측정돼 있다. 명사, 동사, 형용사, 부사를 합치면 Astra와 Opus 5.5 사이 격차의 약 79%를 설명한다. 이 79%는 사람과 AI 사이 격차의 비율이 아니라 두 모델 사이 격차의 품사별 기여도다. 두 수치를 섞으면 전혀 다른 이야기가 된다.

4

문체 점수를 잰 잣대는 앤트로픽이 만들었다

후속 연구에는 낱말을 세는 지표만 있는 것이 아니다. 문체 전반을 점수로 매기는 지표가 따로 하나 있다. Graphite는 그것을 'mannered prose'라 부르고, 직설적으로 말할 자리에 비유와 수식을 대신 집어넣는 산문이라고 정의한다. 그런데 그 정의는 Graphite가 만든 것이 아니다.

"Mannered prose는 직설적인 진술 자리에 비유와 장식을 대신 넣는다. 우리는 앤트로픽의 정의를 채점 프롬프트에 축자 그대로 싣는다. 채점에는 Claude Opus 5를 쓰며, 주제를 맞춘 1,000편의 부분표본으로 각 기사의 mannered prose를 0에서 100 사이로 매긴다." Graphite, AI Tells: Opus 5.5 Update (2026-10-01)

Opus 5가 16.75점, Opus 5.5가 10.57점으로 한 판 사이에 37% 내려갔다. 같은 잣대로 잰 사람 글은 6.65점이다. 그러니 Opus 5.5는 여전히 사람의 약 1.6배이고, Astra는 1.2배다. 줄표처럼 바닥까지 내려간 것은 아니지만 분명히 줄었다.

4.1세 겹이 한자리에 포개져 있다

위 인용을 셋으로 갈라 읽어야 한다. 첫째, 모델을 만든 회사가 자기 모델의 문체 결함에 이름을 붙이고 그것을 억제하는 지시문을 공개 문서로 배포했다. 둘째, 외부 연구가 그 정의를 축자 그대로 빌려 와 같은 회사의 모델을 채점했다. 셋째, 채점자는 직전 판인 Claude Opus 5이고, 채점 대상 안에는 후속 판인 Opus 5.5가 들어 있다.

한 겹이 더 있다. 그 정의가 실린 앤트로픽 문서는 Claude Fable 5.1용 프롬프팅 안내서의 한 절이고, Fable은 이 연구의 측정 대상이 아니다. 한 모델 계열을 위해 쓰인 문체 처방이 다른 계열을 채점하는 잣대가 된 셈이다. Graphite 쪽 사람도 그 지시문을 일상적으로 쓴다고 말한다. 요즘 모델에게 mannered prose를 하지 말라고 자주 이른다는 것이고, 꽤 잘 듣는 지시라는 평가도 함께다.

네 겹이 한 계열 안에서 돈다 ① 앤트로픽 Fable 5.1 안내서에 mannered prose 정의 ② Graphite 정의를 축자 그대로 채점 프롬프트에 사용 ③ Claude Opus 5 채점자로 투입 (앤트로픽 모델) ④ Opus 5.5 채점 대상 (같은 계열 후속판) ②~④ 모두 ①이 만든 정의와 ①이 만든 모델 안에서 돈다

페블러스 원본 도식 (본문 4.1절 재해석). 네 겹 각각은 사실이다. 문제는 넷을 한 문장에 모았을 때 생기는 순환이다 — 정의도 앤트로픽, 채점자도 앤트로픽 모델, 채점 대상도 같은 계열의 후속판이다.

4.2그렇다고 못 믿을 수치라는 뜻은 아니다

"클로드가 클로드를 채점했으니 못 믿는다"로 넘어가면 그 또한 이 연구가 하지 않은 말을 하는 것이 된다. Graphite는 한계 절에 평가자 편향 가능성을 스스로 적었고, 약 2,000편을 구절 추출 방식으로 따로 채점해 교차 검증했다. 두 방식의 순위 상관은 스피어만 0.75다. 채점은 블라인드로 돌렸다. 기준을 그 정도로 밝힌 지표를 통째로 버릴 이유는 없다.

쓸 수 있는 문장은 신뢰도가 아니라 잣대의 출처에 관한 것이다. 이 연구의 다른 지표들은 낱말을 세는 일이라 누가 세든 같은 답이 나온다. 그러나 mannered prose 점수만은 측정 대상과 같은 계열의 모델이, 그 계열을 만든 회사가 쓴 정의로 매긴 값이다. 그 한 칸만은 나머지와 독립이 아니다. 이 연구의 파이프라인은 모든 입력 기사를 GPT-4.1로 한 번 요약한 뒤 특징을 뽑는다. 어느 쪽이든 잣대의 일부가 측정 대상과 같은 종류의 물건이라는 사정은 남는다.

연구의 등급도 한 번은 짚어 둘 필요가 있다. 이것은 동료 심사를 거친 논문이 아니라 콘텐츠 마케팅 회사가 자기 블로그에 올린 조사다. 다만 저자 셋 중 둘이 기계학습과 자연어처리 이력을 공개한 박사이고, 방법과 한계를 본문에 서술했으며, 피처 수치를 담은 원자료를 공개했다. 회사 대표의 말대로 다른 사람이 같은 자료를 열어 다른 패턴을 찾아볼 수 있다. 이 글이 1절과 2절에서 본문에 없는 수치를 끌어 쓸 수 있었던 것도 그 공개 덕분이다.

4.3줄표를 공개적으로 거론한 쪽은 오픈AI다

그러면 앤트로픽이 일부러 줄표를 없앤 것일까. 공개된 문서로는 확인되지 않는다. Opus 5.5 발표문에도, 릴리스 노트에도, 프롬프팅 문서에도 줄표를 가리키는 표현이 한 번도 나오지 않는다. 발표문이 문체를 두고 적은 내용은 가장 중요한 정보를 앞에 두고, 전문 용어나 특이한 표현을 덜 쓰며, 사용자가 준 작문 규칙을 따른다는 것이다. 테스터의 말로는 "내가 쓰는 방식대로 쓴다"가 인용돼 있다. 줄표는 그 어디에도 없다.

대비되는 쪽은 오픈AI다. 2025년 11월 샘 알트먼이 직접 줄표를 거명했다. 커스텀 지침에 줄표를 쓰지 말라고 적으면 챗GPT가 드디어 그 말을 듣는다는 내용이었다. 다만 이것도 기본값에서 줄표를 없앴다는 선언이 아니라 사용자 지시를 더 잘 따르게 됐다는 이야기다. 그런데 Graphite가 측정한 감소폭은 거명하지 않은 쪽이 더 컸다. 공표된 의도와 측정된 변화가 나란하지 않다는 것까지가 확인되는 사실이고, 분모가 다른 두 수치이므로 어느 쪽이 더 잘 지웠다는 비교로 옮길 수는 없다.

의도를 묻는 질문에 가장 가까운 답도 추측의 형식으로만 존재한다. Graphite 본문은 이 감소가 tell을 없애려는 AI 회사들의 의도적 노력을 반영한 것일 수도 있다고 적는다. 측정을 수행한 당사자의 말도 같은 형식이다. 연구소들이 표적을 정한 평가를 돌려 특정한 것들을 지우려 하는 것 같다는 자기 추측이라고 그는 못 박았다.

4.41차 출처는 탐지기를 부정하지 않는다

이 연구를 옮긴 글 중에는 "당신의 AI 탐지기는 이미 낡았다"는 제목을 단 것도 있다. 전통적 탐지 방법이 자리를 잡기도 전에 쓸모를 잃는다는 문장이 본문에 있다. 그런데 그 글은 Graphite 한계 절의 마지막 줄을 인용하지 않는다. 거기에는 정반대가 적혀 있다.

"우리는 개별 tell을 근거로 저작자를 분류하는 것을 권하지 않는다. 그 일에는 AI 탐지기를 쓰기를 권한다." Graphite, AI Tells 한계 절

이 글도 같은 선을 넘지 않는다. Graphite는 탐지기를 부정한 적이 없고, 이 글의 논지는 Graphite 한 편만으로 서지 않는다. 5절에서 독립 학술 문헌을 가져오는 이유가 그것이다. 그리고 1차 출처가 직접 반대로 적은 문장을 지우고 제목을 다는 일이 실제로 벌어졌다는 사실 자체가, 이 주제에서 조심할 자리가 어디인지를 보여 준다.

5

사람 쪽 기준선은 2022년 11월에 멈춰 있다

지금까지는 기계 쪽 이야기였다. 이 절은 반대쪽을 본다. 어떤 글이 AI 티가 난다고 말하려면 "사람 글은 보통 이렇다"는 기준이 있어야 한다. 이 연구에서 그 기준은 챗GPT가 공개된 2022년 11월 30일 이전에 발행된 커먼크롤 기사 1만 편이다. 날짜를 그렇게 자른 이유는 분명하다. 그 뒤의 웹에는 AI가 쓴 글이 섞여 있어, 사람 글의 기준으로 쓰면 기준 자체가 오염된다. Graphite 자매 연구는 2026년 1분기 온라인 기사의 약 절반이 AI 생성이라고 보고한다. 웹에 AI 글이 얼마나 쌓였는지는 도메인별로 비율이 갈리는 양상을 다룬 선행 글에서 따로 다뤘다.

날짜를 자른 쪽도 그 대가를 알고 있다. 한계 절에 이렇게 적혀 있다.

"AI 기사는 더 새로운 모델이 생성했으므로, 2022년 이후 글쓰기 양식의 변화가 AI tell로 잘못 식별될 수 있다." Graphite, AI Tells 한계 절. 같은 절은 정제 뒤에도 남을 수 있는 오염이 "우리가 식별하는 tell에 영향을 줄 수 있다"고도 적는다.

5.1한쪽만 움직이고 다른 쪽은 고칠 수가 없다

여기에 비대칭이 둘 있다. 3절에서 본 대로 연속한 두 판이 공유하는 tell은 18.7%에서 45.5% 사이다. 기계 쪽은 그만큼 자주 자리를 바꾼다. 사람 쪽은 2022년 11월 한 지점에 묶여 있다. 그리고 갱신할 방법이 없다. 새로 뜨려면 2026년에 사람이 쓴 글을 모아야 하는데, 그 글들이 사람이 썼음을 확인할 방법이 바로 지금 만들려는 그 도구다. 순환이다.

한쪽은 고정, 한쪽은 판마다 재배치 사람 기준선 2022-11-30 고정, 갱신 불가 Opus 4 Opus 4.6 Opus 5 Opus 5.5 AI 쪽 tell 목록 — 연속한 두 판도 18.7~45.5%만 겹친다 지금 (2026) 4년 — 그 사이 사람도, 기계도 계속 바뀌었다

페블러스 원본 도식 (본문 5.1절 재해석). 가로축은 시간이다. 사람 기준선은 점으로 고정돼 움직이지 않고, AI 모델 쪽 선은 판마다 오르내린다. 둘 사이의 거리가 그대로 라벨의 유효기간이다.

사람 쪽이 아예 가만히 있는 것도 아니다. 측정을 수행한 사람이 전한 일화가 하나 있다. 사람들이 AI처럼 들리지 않으려고 자기 글쓰기 습관을 바꾸고 있다는 이야기다. 본인이 일화라고 못 박았으니 근거로 삼을 수는 없다. 다만 방향은 분명하다. 2022년에 뜬 기준선과 지금 사람이 쓰는 글 사이의 거리는 가만히 있어도 벌어지고, AI를 피하려는 움직임이 있다면 더 빨리 벌어진다.

고칠 수단이 없는 비대칭이라 누구를 탓할 자리가 아니다. 여기서 물을 것은 그 사이에서 나온 판정의 유효기간이 얼마나 되느냐다.

5.2탐지기는 방금 나온 모델에 약하다

Graphite는 낱말을 셌을 뿐 탐지기 성능을 재지 않았다. 그래서 여기서부터는 학술 문헌을 가져온다. 2026년에 나온 논문 두 편에서 수치 셋을 끌어왔다. 하나는 새 모델이 나온 직후 상용 탐지기가 그 모델의 글을 얼마나 놓치는지를 보여 준다. 하나는 그 반대 방향, 곧 사람이 쓴 글을 기계로 판정할 때 그 판정이 얼마나 확신에 차 있는지를 잰다. 나머지 하나는 같은 추정기를 연도가 다른 사람 글에 댔을 때 추정치가 얼마나 벌어지는지를 따진다.

무엇을 보여 주나 수치 조건
기계 쪽이 움직인다 상용 탐지기 Pangram의 AI recall 34.0%
AI가 쓴 글의 66%를 사람이 썼다고 판정
GPT 5.4 출시 직후, arXiv 초록을 대상으로. 같은 탐지기가 구형 모델에는 거의 완벽하다 (arXiv 2606.25152)
오탐의 방향 사람이 쓴 글의 60.4%를 p≥0.95로 '기계'로 판정
예측의 99.4%가 극단 확신 구간에 몰린다
MAGE 벤치마크, 도메인 하나를 빼고 학습하는 설정, 파인튜닝 RoBERTa. 원문 표현은 "그 확신은 종종 잘못 놓여 있다" (arXiv 2607.03680)
사람 쪽이 낡는다 같은 추정기가 2010년 글에서 2.3%, 2020년 글에서 15.1%를 LLM 생성으로 추정 유병률 추정기이지 이진 분류기가 아니다. 문장 단위. 2010년 이후 LLM이 보급됐다고 가정한 시뮬레이션 설정. 두 해 모두 참값은 0에 가깝다 (arXiv 2606.25152)

2020년은 챗GPT 공개 2년 전이다. 그 해의 글에서 15.1%가 LLM 생성으로 추정됐다는 것은 추정기가 시간이 흐르며 달라진 사람 문체를 기계 쪽으로 읽는다는 뜻이다. 비교 대조군은 같은 추정기가 2010년 글에 대해 낸 2.3%다.

보조 수치도 같은 방향을 가리킨다. 학습에서 빼 둔 생성기를 만나면 RoBERTa 기반 탐지기의 정확도가 99.26%에서 60.30%로 내려간다. 도메인을 고정하고 생성기만 바꿔도 95% 이상에서 60% 미만으로 떨어지는 벤치마크가 있다. 다른 조건을 다 묶어 두고 어느 모델이 썼는가만 바꿔도 이만큼 흔들린다.

다만 여기서 한 가지를 분리해 둔다. 이 글이 다루는 것은 세대 교체로 생기는 드리프트이지 사람이 일부러 탐지를 피하려 손대는 경우가 아니다. 후자에는 공격자가 있고 전자에는 없다. 한국어 문장을 손봐 탐지를 피하는 도구들이 실제로 어떻게 작동하는지는 그 도구를 뜯어 본 선행 글에서 다뤘다. 탐지기의 오탐이 통계적으로 왜 줄기 어려운지도 다른 축에서 다룬 글이 있다. 이 글의 실패 축은 오탐의 구조가 아니라 참조 분포의 노후화다.

5.3탐지기가 잘 버틴다는 증거도 성실히 찾았다

위 수치만 모아 놓으면 "AI 탐지기는 이제 못 쓴다"로 가기 쉽다. 그래서 반대쪽을 따로 뒤졌다. 있었다. 셋이다.

  • Epoch AI가 2026년 7월에 낸 평가에서, 당대 프런티어 모델 세 종이 기본 프롬프트로 생성한 글 297편을 Pangram이 하나도 놓치지 않았다. 같은 평가에서 사람 글 495편에 대한 오탐도 없었다.
  • 브뤼셀자유대학 연구진이 2026년 6월 학술지에 실은 동료 심사 논문에서, GPT-4o 딥리서치가 전부 생성한 석사 논문 40편 중 97.5%를 Pangram이 적발했다. 같은 묶음을 Turnitin은 40편 전부 "AI 0~20%"로 채점했다.
  • 전미경제연구소 워킹페이퍼는 오탐률을 0.5% 이하로 묶는 제약 아래서도 Pangram의 탐지력이 떨어지지 않았다고 보고한다.

그러므로 이 글은 탐지기 무용론을 쓸 수 없다. 1차 출처의 주장이 아닐 뿐 아니라 학술 문헌과도 어긋난다. 탐지기를 만드는 쪽은 애초에 구두점 휴리스틱에 기대지 않는다. GPTZero는 2023년 가을에 딥러닝으로 전환하며 perplexity와 burstiness 사용을 중단했다. 줄표 같은 눈에 보이는 신호가 뒤집혔다고 해서 신경망 탐지기가 곧바로 무력해지는 것은 아니다. 두 층은 다른 층이다.

5.4사람 쪽 표본을 보면 네 건이 같은 컷오프를 쓴다

반증을 찾으러 갔다가 확인한 것은 다른 것이다. 위 세 평가가 "사람이 쓴 글"로 쓴 표본이 언제 쓰인 글인지를 한 표에 모으면 모양이 하나로 보인다. 이 글의 1차 출처까지 같은 줄에 넣었다.

연구 사람 쪽 표본 시점
Epoch AI (2026-07)저자 99명의 글 495편2022년 이전. 2022년 이전 발행분이 충분한 저자만 고르고 웨이백머신으로 시점을 확인했다
브뤼셀자유대학 (2026-06, 동료 심사)석사 논문 40편2019년 이전 작성
Pangram 4 (벤더 자체 문서)오탐 벤치마크 200만 건2022년 이전 상업 라이선스 문서
Graphite (이 글의 1차 출처)커먼크롤 기사 1만 편2022년 11월 30일 이전

네 건은 서로 독립적이고 목적도 다르다. 학술 평가, 동료 심사 논문, 벤더 기술 문서, 마케팅 회사의 조사다. 그런데 "사람이 썼음이 확실한 글"을 고르는 대목에서 넷이 같은 선택을 했다.

이 분야에서 "사람이 썼음이 확실한 글"의 실무적 정의가 사실상 "2022년 이전에 발행된 글"이 되어 있다는 뜻이다. Pangram 기술 문서는 그 컷오프의 이유를 설명조차 하지 않는다. 설명이 필요 없을 만큼 당연해졌다는 신호로 읽힌다.

그러므로 정직한 답은 이렇다. 탐지기가 버틴다는 증거는 있다. 다만 그 증거가 보고하는 낮은 오탐률은 전부 2022년 이전 사람 글에 대한 오탐률이다. 2026년에 사람이 쓴 글에 대한 오탐률을 보고한 연구는 이 조사에서 찾지 못했다. 연구자들이 게을러서가 아니라 그 수치를 낼 깨끗한 현재 사람 코퍼스가 없기 때문이다. 긍정 증거와 이 글의 논지는 충돌하지 않는다. 같은 구조의 양면이다. 탐지기는 잘 작동한다. 2022년에 얼어붙은 기준선을 기준으로.

같은 제품의 수치가 조건에 따라 어디까지 흩어지는지도 이제 읽을 수 있다. Pangram은 프런티어 모델 세 종의 기본 프롬프트 생성물을 하나도 놓치지 않았고, 같은 제품이 출시 직후의 GPT 5.4 앞에서는 AI가 쓴 글의 66%를 사람 것으로 판정했다. 미탐률 0%와 66%가 같은 제품의 수치다. 탐지기는 따라잡은 모델에 강하고 방금 나온 모델에 약하다. 유효기간의 실체가 이것이다.

반대 방향의 보고도 함께 적어 둔다. 독일어 저자 판별 벤치마크 하나는 AI 시대인 2023년부터 2025년까지가 저자 판별에 체계적 분포 이동을 일으켰다는 증거를 찾지 못했다고 보고한다. 다만 같은 논문이 시간 드리프트는 가장 강한 열화 요인이라고도 보고한다. 리뷰 장르에서 10년 시차를 두면 F1이 0.21 내려간다. 저자들이 직접 단 한계도 분명하다. 그 코퍼스는 AI 보조 작성 여부가 표시돼 있지 않아 AI가 얼마나 섞였는지를 측정할 수 없는 설계다. 그리고 과제가 AI 탐지가 아니라 저자 판별이고 언어도 독일어다. 문헌의 현재 상태를 정직하게 적으면, 시간 드리프트는 확실하고 AI 시대 효과를 독립적으로 분리해 낸 연구는 아직 없다.

5.5왜 하필 줄표가 가장 먼저 깨졌는가

남는 질문이 하나 있다. tell이 수천 개인데 왜 하필 가장 유명한 것이 가장 먼저, 가장 크게 무너졌는가. 설명 가능 인공지능 기법으로 탐지기를 해부한 2026년 논문이 일반 법칙을 하나 제시한다. 같은 도메인 안에서 가장 변별력이 높은 피처가 도메인이 바뀔 때 가장 취약한 피처이기도 하다는 것이다. 변별력과 취약성이 같은 원인에서 나온다.

줄표에 그 법칙을 대면 이야기가 맞아떨어진다. 가장 잘 드는 신호였기 때문에 가장 널리 알려졌고, 널리 알려졌기 때문에 가장 먼저 교정의 표적이 됐다. 다만 선을 분명히 해 둔다. 줄표 자체의 탐지 기여도를 측정한 논문은 없다. 위 법칙은 일반 법칙이고, 줄표가 먼저 깨졌다는 것은 Graphite의 관측이다. 둘을 이어 읽을 수는 있어도 "논문이 줄표를 측정했다"고 적을 수는 없다. 그리고 그 교차 도메인 하락 자체도 방향에 따라 비대칭이라, 한쪽 방향만 인용하면 과장이 된다.

6

죽은 신호보다 뒤집힌 신호가 위험하다

신호가 낡는 데에는 두 가지 방식이 있다. 하나는 죽는 것이고 다른 하나는 뒤집히는 것이다. 데이터 품질에서 두 사고는 전혀 다르다. 신호가 죽으면 정확도가 떨어지고, 정확도가 떨어지면 지표에 잡힌다. 누군가 이상하다고 말한다. 반면 신호가 뒤집히면 정확도가 떨어지는 것이 아니라 답이 반대로 나온다. 그리고 그 답은 확신에 차 있다.

5절에서 본 수치가 그 모양을 보여 준다. 사람이 쓴 글의 60.4%를 0.95 이상의 확률로 기계라고 판정한 그 탐지기는, 전체 예측의 99.4%를 극단 확신 구간에 몰아넣었다. 원문의 표현을 빌리면 그 확신은 종종 잘못 놓여 있다. 머뭇거리는 오답은 걸러지지만 단호한 오답은 그대로 통과한다. 뒤집힌 신호는 조용히, 꾸준히, 틀린 라벨을 만든다.

6.1지금 돌아가고 있는 규칙 하나

추상적인 이야기가 아니다. 사내 콘텐츠 규정이나 편집 지침에 "줄표가 많으면 AI 초안으로 본다"는 줄을 넣어 둔 조직이 적지 않다. 그 규칙을 아직 돌리고 있다면 지금은 정확히 반대로 틀린 규칙을 돌리는 중이다. 현행 모델은 이 연구의 조건에서 전부 사람보다 줄표를 적게 쓰므로, 그 규칙은 사람이 쓴 글을 AI로 지목하는 쪽으로 기운다. 규칙 자체는 한 글자도 바뀌지 않았는데 규칙이 하는 일이 바뀌었다.

학습 데이터를 사고파는 자리에도 같은 질문이 돌아온다. "사람이 쓴 글"이라는 보증은 이미 가격에 반영된다. 다음 단계는 그 보증이 무엇에 근거해 붙었는지를 묻는 일이다. 어느 판별기인가, 언제 돌렸는가, 어떤 기준 코퍼스와 비교했는가. Opus 5.5는 판 번호를 올려 공표된 교체라 적어도 "언제부터 달라졌는지"를 알 수 있다. 판 번호를 올리지 않고 바뀌는 경우에는 드리프트가 시작된 시점조차 알 수 없다.

6.2네 규격 모두 판정을 적는 칸이 없다

그러면 그 조건들을 어디에 적어 두어야 하는가. 출처와 내력을 기록하도록 설계된 규격이 이미 여럿 있으니 거기 적으면 될 것 같다. 네 개를 열어 보았다. 국제 콘텐츠 출처 규격인 C2PA 2.4, 유럽연합 인공지능법 50조와 그 행동강령, 허깅페이스 데이터셋 카드와 Croissant 메타데이터, 그리고 데이터·신뢰 연합이 낸 데이터 출처 표준 1.0.0이다. 공백의 모양이 넷에서 똑같았다.

규격 AI 여부를 적는 칸 판정 시점 판정 기준 판정기 버전 기준 코퍼스 시점
C2PA 2.4digitalSourceType없음없음없음없음
EU AI Act 50조기계판독 표시 + 전부 AI 생성 / AI 보조없음없음없음없음
HF 데이터셋 카드 / Croissant자유 텍스트 서술없음산문으로없음없음
D&TA 데이터 출처 표준 1.0.0Method (machine-generated 등)없음없음없음없음

C2PA의 when은 콘텐츠가 생성된 시각이고 softwareAgent.version은 생성 도구의 판 번호다. 둘 다 판정에 관한 값이 아니다. EU 50조에서 날짜가 남는 유일한 자리는 편집 면제를 받을 때의 사람 개입 기록이다. D&TA 표준의 세 날짜 필드는 모두 데이터 자체의 시점을 가리킨다.

공백이 생긴 이유는 납득할 만하다. C2PA는 선언 규격이지 탐지 규격이 아니다. 실무 가이드는 사용자 화면에 "AI 탐지됨"이라고 쓰지 말라고 명시한다. 만든 쪽이 스스로 밝힌 것만 적으라는 설계다. EU 50조도 의무의 방향이 제공자가 자기 출력물에 표시하는 쪽이다. 넷 다 "누가 만들었나"를 적도록 설계됐고 "누가 어떻게 판정했나"를 적도록 설계되지 않았다.

문제는 선언이 붙은 자료가 극소수라는 점이다. 나머지 전부는 결국 누군가의 판정이다. 그리고 저장소에는 판정 결과만 남고 판정의 조건은 남지 않는다. 가장 날카로운 장면은 D&TA 표준에 있다. 22개 필드 가운데 "데이터가 언제 만들어졌는가"에 세 칸을 할애하면서, "그 데이터에 붙은 사람 또는 AI 판정은 언제 어떤 잣대로 내려졌는가"에는 한 칸도 두지 않는다. C2PA 2.4는 ISO/DIS 22144로 국제 표준 패스트트랙에 올라 있다. 이 공백이 곧 표준으로 굳는다는 뜻이다.

그래서 저장소에 남길 것은 판정 자체가 아니라 판정이 선 조건이다. 판정 시점, 판정 기준, 판정기 버전, 기준 코퍼스의 시점. 네 항목이 왜 라벨과 함께 가야 하는지는 의료 영상 라벨을 두고 같은 질문을 던진 선행 글에서 이미 한 번 다뤘다. EU 50조가 표기 의무를 어디까지 지우는지도 따로 정리해 두었다. 이 글이 보태는 것은 그 네 항목이 적힐 칸이 현행 규격 어디에도 없다는 확인이다.

6.3지금 할 수 있는 일은 네 가지다

비관으로 닫을 자리가 아니다. 드리프트를 다룬 2026년 문헌에는 실측 근거가 붙은 완화책이 넷 있다. 순서는 즉시 적용 가능한 쪽부터다.

  • 입력 쪽 분포 이동을 먼저 본다. 탐지기 성능을 다시 재지 않고도, 들어오는 글의 언어 피처 분포가 얼마나 움직였는지를 보면 라벨 신뢰도 하락을 미리 감지할 수 있다. 과거시제 동사 분포의 변화량과 교차 모델 일반화 정확도의 상관이 0.416으로 보고됐다. 새 모델이 나왔는지를 기다리지 않아도 된다는 점에서 가장 실무적인 처방이다.
  • 소량 재보정으로 상당 부분 회복된다. 클래스당 10개 레이블 샘플만으로 오탐률 1% 지점의 탐지율이 0.588에서 0.690으로 올랐다. 완전 재학습이 아니다. 다만 원래 분포 안에서의 수준에는 미치지 못한다. 완화이지 해결이 아니다.
  • 학습 생성기를 여러 세대로 섞어 둔다. 학습에 쓴 생성기의 다양성이 높을수록 처음 보는 생성기에 대한 일반화가 좋아진다. "최신 모델 하나를 더 넣기"가 아니라 "여러 세대를 섞어 두기"가 답이라는 뜻이다.
  • 어휘가 아니라 생성 과정의 성질을 재는 접근을 본다. 사람 글의 예측불가능성 변동 폭이나 생성 후반부의 변동 감쇠처럼, 특정 모델의 어휘 취향에 기대지 않는 신호를 쓰는 연구가 있다. 새 모델이 나와도 원리적으로 덜 닳는다. 다만 보고된 수치는 조건을 확인하지 못해 방향으로만 적는다.

네 가지 모두 "탐지를 더 잘하는 법"이 아니라 "판정이 낡는 속도를 관리하는 법"이다. 그 차이가 이 글의 결론이다. 라벨은 관측된 사실이 아니라 두 분포를 맞대 내린 판정이고, 판정은 비교 대상이 움직이면 같이 움직인다. 그러니 라벨만 저장하는 파이프라인은 유통기한을 지운 채 식품을 쌓아 두는 창고와 같다.

7

페블러스 관심의 이유

1절부터 6절까지는 Graphite의 두 연구와 공개 원자료, 그리고 거기서 뻗어 나간 학술 문헌에서 확인한 것이다. 이 절은 그 문서들이 하지 않은 이야기이고, 페블러스가 왜 이 조사를 오래 들여다봤는지에 관한 것이다.

7.1우리가 다루는 것이 바로 그 라벨이다

페블러스의 일은 데이터가 학습에 들어가기 전에 그 상태를 묻는 것이다. 데이터클리닉은 데이터셋의 상태를 진단하고, AI-Ready Data는 학습 전 정리를 다루며, 데이터 계보는 무엇이 어디서 왔는지를 기록한다. 이 조사가 건드린 것은 그중 출처 라벨이다. 지금 대부분의 학습 데이터 큐레이션은 '사람이 쓴 글'과 'AI가 쓴 글'이라는 두 칸짜리 라벨 위에서 돈다. 합성 데이터를 걸러내고, 사람 글에 가중치를 주고, 계약서의 출처 조항을 지키는 일이 전부 그 두 칸에 기댄다. 이 조사가 보여 주는 것은 그 라벨을 붙이는 데 쓰이던 신호가 한 판 만에 부호까지 바뀌었다는 사실이다.

7.2라벨은 그대로인데 라벨의 뜻이 변한다

데이터 품질 논의는 보통 값의 결측과 중복과 범위를 다룬다. 여기서 드러나는 것은 다른 종류의 결함이다. '사람 글'이라고 적힌 칸을 아무도 건드리지 않았는데, 그 칸을 채울 때 맞대 본 기준선이 그사이 낡았다. 결측도 아니고 중복도 아니고 범위 이탈도 아니라서 기존 품질 점검으로는 잡히지 않는다. 그런데 그 라벨을 믿고 가중치를 준 학습은 이미 돌아갔다.

남의 이야기가 아니라는 점을 적어 두는 편이 정직하다. 페블러스는 두 달 전 생의학 논문 119만 편에서 LLM 선호 낱말의 초과 사용량으로 AI 보조 작성 비율을 추정한 연구를 소개했다. 그 방법의 전제는 LLM이 손대면 마커 어휘가 사람 평소 수준보다 늘어난다는 것이다. 그런데 2절에서 본 대로 현행 세대 모델은 바로 그 계열 어휘를 사람보다 적게 쓴다. 두 측정은 코퍼스도 낱말 목록도 프롬프트 조건도 달라서 그 추정이 틀렸다고 말할 수는 없다. 쓸 수 있는 문장은 조건부다. 마커 어휘의 초과량으로 재는 방법은 그 어휘를 과용하던 세대의 모델을 전제로 하고, 현행 세대가 그 어휘를 사람보다 적게 쓴다면 같은 잣대를 그대로 댔을 때 덜 세는 쪽으로 틀릴 수 있다.

7.3진단 항목이 하나 늘어난다

데이터셋을 진단할 때 지금까지 묻던 것은 값의 상태였다. 여기에 한 줄이 붙는다. 이 데이터셋에 붙은 출처 라벨은 언제, 무엇으로, 어떤 기준과 비교해 붙었는가. 6절에서 본 대로 그 네 항목을 적을 칸이 현행 규격 어디에도 없으므로, 지금 그것을 기록하려면 데이터셋 카드의 자유 서술란에 손으로 적는 수밖에 없다. 거꾸로 말하면 그 칸을 규격으로 세우는 자리가 비어 있다는 뜻이다. 그리고 독립 코퍼스로 AI 사용률을 재는 쪽에서 이미 같은 종류의 질문이 나온 적이 있다.

7.4표기한 다음의 문제

출처 표기 논의는 지금까지 표기할 것이냐 말 것이냐로 쓰였다. 워터마크를 심을 것인가, C2PA를 붙일 것인가, 유럽연합 인공지능법 50조를 어떻게 맞출 것인가. 이 조사가 던지는 질문은 표기를 마친 뒤에야 생긴다. 붙인 라벨이 얼마나 오래 참인가. 페블러스는 이 질문을 한국어로 먼저 언어화하는 자리에 설 수 있다. 페블러스 자신의 발행 파이프라인도 AI 문체를 빈도로 재는 잣대를 쓰고 있어서, 그것이 같은 이유로 닳는다는 사실을 자기 기록으로 말할 수 있다. 그 자기 적용 기록은 선행 글에서 이미 다뤘으므로 여기서는 한 줄로 그친다.

본문의 축자 인용과 수치는 Graphite의 두 연구 본문, 그리고 그들이 CC BY 4.0으로 공개한 원자료 파일에서 직접 대조했다. 1절과 2절의 표에 쓴 값은 원자료를 다시 열어 전부 재확인한 것이다. 2차 보도를 거친 수치는 쓰지 않았고, 인용만 출처를 밝혀 썼다. 1절부터 6절까지는 확인한 것이고 7절은 그 문서들이 하지 않은 이야기이니 나눠서 읽어 주시기 바란다. 긴 글 읽어 주셔서 감사하다.

R

참고문헌

출처의 등급이 갈리므로 묶어서 적는다. 첫 묶음은 이 글이 대상으로 삼은 조사와 그들이 공개한 원자료이고, 본문의 수치는 전부 여기서 대조했다. 둘째 묶음은 규격과 회사 발표 문서다. 셋째 묶음은 보도를 거친 자료이고, 본문에서 쓸 때마다 귀속을 문장 안에 밝혔다. 넷째 묶음은 5절과 6절의 근거가 된 학술 문헌이다.

대상 조사와 공개 원자료 (1차)

  • 1.Graphite. AI Tells: Opus 5.5 Update. 2026년 10월 1일. graphite.io · 줄표 2.92에서 0.015, tell 2,548개, 알려진 tell 11종 평균 강도 6% 감소, mannered prose 16.75에서 10.57, 범주별 구절 배수, 판 사이 교체 구절이 여기서 왔다.
  • 2.Graphite. AI Tells. 2026년 9월 16일. graphite.io · 방법론(사람 기사 1만 편·2022-11-30 컷오프·임계 조건·GPT-4.1 요약 단계), 한계 절 축자, 전체 tell 합집합 12,877개가 여기서 왔다.
  • 3.Graphite. AI Tells 공개 원자료 (CC BY 4.0). ai_tells_features.csv.gz · ai_tells_tells_vs_human.csv.gz · 1절의 11개 모델 줄표 수치, 사람 기준선 3.137847, 2절의 여덟 낱말 합산, 3절의 공유율 18.7~45.5%가 여기서 나왔다. 지정 인용 문구: Graphite, "AI Tells" (2026).
  • 4.Graphite. More Articles Are Now Created by AI Than Humans. graphite.io · 2026년 1분기 온라인 기사의 약 절반이 AI 생성이라는 집계.

규격·회사 발표 문서 (1차)

  • 5.Anthropic. Claude Fable 5.1 프롬프팅 문서, "Writing density" 절 · mannered prose의 정의가 여기 있고, Graphite가 채점 프롬프트에 축자 그대로 실었다.
  • 6.Anthropic. Claude Opus 5.5 발표문. 2026년 9월 22일 · Communication 절의 문체 서술. 발표문·릴리스 노트·프롬프팅 문서 전체에 줄표를 가리키는 표현이 없다는 확인도 여기서 했다.
  • 7.Sam Altman (OpenAI). X 게시물. 2025년 11월 14일 · 커스텀 지침으로 줄표를 끄는 기능이 제대로 듣게 됐다는 발표.
  • 8.C2PA Technical Specification 2.4 및 Guidance for AI and ML 2.4. spec.c2pa.org · digitalSourceType, when, softwareAgent.version의 의미, 사용자 화면에 "AI 탐지됨"이라 쓰지 말라는 실무 지침. ISO/DIS 22144 패스트트랙 상태.
  • 9.EU AI Act 50조 · AI 생성 콘텐츠 투명성 행동강령(AI Office, 2026년 6월 10일) 및 집행위 가이드라인(2026년 7월 20일).
  • 10.Data & Trust Alliance. Data Provenance Standards v1.0.0 · 22개 필드. 세 날짜 필드가 모두 데이터 자체의 시점을 가리킨다는 확인은 필드 정의에서 했다.
  • 11.Hugging Face 데이터셋 카드 규격 및 Croissant(Responsible AI 확장 포함) · rai:dataCollection 등이 자유 텍스트라는 확인.

보도·독립 재현 (귀속 명시해 사용)

  • 12.Russell Brandom, TechCrunch. 2026년 10월 1일. techcrunch.com · ⚠️ Greg Druck 인용의 유일한 출처라 인용만 가져다 썼다. 수치는 하나도 쓰지 않았다. 이 기사에는 1차 출처와 어긋나는 수치가 여럿 있다. 12,877을 "13,000개 이상"으로, 23배인 dependable을 최대 tell로, 12배인 합성 지표를 "100배 이상"으로 적었고, Graphite에 없는 모델명도 등장한다.
  • 13.VentureBeat. 2026년 9월 30일~10월 1일 · Druck과 Ethan Smith 인용. 수치는 1차와 일치한다.
  • 14.Mayank Parmar, BleepingComputer. 2026년 9월 26일 · Text Arena 실사용 응답 집계(Opus 5 15.2, Opus 5.5 0.8, 세미콜론 6.10에서 1.64, 평균 답변 길이 453에서 481단어).
  • 15.Jim Bennett, Arize AI. 2026년 9월 · 리서치 브리프 20종 기반 독립 재현(Opus 5 12.9, Opus 5.5 0.05). 결론 문장 "'고쳤다'는 너무 세고 '훨씬 나아졌다'가 공정하다"가 여기서 왔다.

학술 문헌 (5절·6절)

  • 16.Ren, Raghavan & Garg. Hitting a Moving Target: Test-Time Adaptation for AI Text Detection under Continual Distribution Shift. arXiv:2606.25152, 2026년 6월 23일 · Pangram의 GPT 5.4 recall 34.0%, 2010년 2.3%에서 2020년 15.1%로의 유병률 추정.
  • 17.Shen, Wang, Zou & Bu. Rethinking AI-Generated Text Detection: A Strong Baseline and the Distribution-Shift Problem That Remains. arXiv:2607.03680, 2026년 7월 4일 · 사람 글 60.4%가 p≥0.95로 기계 판정, 예측의 99.4%가 극단 확신 구간, 클래스당 10개 샘플 재보정으로 0.588에서 0.690.
  • 18.Pudasaini, Miralles-Pechuán, Lillis & Llorens Salvador. Why AI-Generated Text Detection Fails: Evidence from Explainable AI Beyond Benchmark Accuracy. arXiv:2603.23146 v2, 2026년 4월 22일 · 변별력이 높은 피처가 도메인 이동에 가장 취약하다는 일반 법칙. 교차 도메인 하락이 방향에 따라 비대칭이라는 단서도 여기서 왔다.
  • 19.Xia, Stańczak & Roth. Explaining Generalization of AI-Generated Text Detectors Through Linguistic Analysis. arXiv:2601.07974 v2, EACL 2026 · 입력 피처 분포 이동으로 일반화 성능을 사전 예측, 상관 0.416.
  • 20.Pu et al. Breaking the Generator Barrier. arXiv:2604.13692, 2026년 4월 15일 · 학습 생성기 다양성과 미지 생성기 일반화.
  • 21.Kiefer et al. When Writing Style Drifts: Benchmarking Authorship Verification under Distribution Shifts in Genre, Time and the AI-Era. arXiv:2608.17979, 2026년 8월 18일 · 시간 드리프트 F1 −0.21, AI 시대 효과 미검출. ⚠️ 과제가 저자 판별이고 언어가 독일어라 AI 탐지기 성능으로 읽으면 안 된다.
  • 22.Wang et al. M4GT-Bench. arXiv:2402.11175 v2, 2024 · 미지 생성기에서 99.26%에서 60.30%로. / Dugan et al. RAID. arXiv:2405.07940 v2, 2024 · 도메인 고정·생성기 교체 시 95% 이상에서 60% 미만으로.
  • 23.Basani & Chen. Diversity Boosts AI-Generated Text Detection. arXiv:2509.18880 v3, TMLR 2026 · ⚠️ 수치 조건을 확인하지 못해 방향으로만 인용했다. / Sun, Bao, Cui & Zhang. When AI Settles Down. arXiv:2601.04833, 2026년 1월 8일 · 생성 후반부의 변동 감쇠.
  • 24.Epoch AI. AI detectors rarely flag human writing. 2026년 7월 15일 · 프런티어 3종 297편 미탐 0%, 사람 글 495편 오탐 0%, 표본이 2022년 이전 발행분이라는 선정 기준. / Van Vlasselaer, Van Droogenbroeck & Spruyt. International Journal for Educational Integrity 22(16), DOI 10.1007/s40979-026-00226-w, 2026년 6월 29일 · 동료 심사 완료, 2019년 이전 석사 논문 40편. / Jabarian & Imas. Artificial Writing and Automated Detection. NBER WP 34223, 2025 · 오탐률 상한 제약 아래 탐지력.

페블러스 블로그 인접 글