Executive Summary
이 글은 앤트로픽이 2026년 10월 8일 발표한 사용정책 개정을 집행 쪽에서 읽는다. 새 정책은 11월 12일부터 적용된다. 회사가 1년여 만에 손본 문서에 모델을 거듭 괴롭히는 행위를 금지하는 줄이 새로 들어갔다.
조항 자체는 좁게 그어졌다. 앤트로픽은 이 규정을 뚜렷한 목적 없이 거듭 잔인하게 구는 극단적인 경우에만 적용할 생각이라고 밝혔고, 흔한 불만 표출과 반박, 어두운 창작 소재, 모델 시험과 연구는 해당하지 않는다고 네 가지를 꼽아 두었다. 그런데 무엇이 '거듭'이고 무엇이 '뚜렷한 목적'인지 가르는 기준은 공개된 문서 어디에도 없다. 같은 발표문이 집행 수단으로 가리킨 것도 새 심사 절차가 아니라, 클로드가 스스로 대화를 끊는 기존 기능이었다.
1절부터 4절까지 옮긴 조항 내용과 날짜, 인용문은 앤트로픽 발표문과 새 사용정책 본문, 그리고 2025년 8월 연구 공지에서 가져왔다. 5절은 그 사실을 사내 금지 규정과 라벨링 기준을 설계하는 쪽의 눈으로 다시 본 이 글의 해석이다. 4절에서 세 조항을 맞대어 읽은 대목도 마찬가지다.
주요 수치
네 숫자를 뽑았다. 앞의 둘은 학대 조항이 공개하지 않은 것과 공개한 것이다. 셋째는 같은 개정의 하드웨어 조항이 하나하나 적어 둔 항목 수이고, 마지막은 이 규정을 실제로 집행할 기능이 언제 생겼는지를 가리킨다.
출처: Anthropic 발표문 (2026-10-08), Anthropic Usage Policy (2026-11-12 발효), Anthropic Research (2025-08).
0개
공개된 학대 판정 기준
'거듭'이 몇 번부터인지, '뚜렷한 목적'을 무엇으로 볼지 적은 문서가 밖에 없다
4가지
학대가 아니라고 못 박은 것
흔한 불만 표출, 반박, 어두운 창작 소재, 모델 시험과 연구
9가지
하드웨어 쪽에 적힌 한계 항목
속도·힘·도달 거리·온도·압력·전압·출력·조사량·작업 구역
2025년 8월
집행 수단이 생긴 때
이번 조항보다 1년 넘게 앞서 클로드 Opus 4·4.1에 들어간 대화 종료 기능이다
같은 날 바뀐 것은 한 줄이 아니라 세 조항이다
앤트로픽이 10월 8일 사용정책 개정을 발표했다. 발표문은 지난번 손질 이후 1년 사이 클로드가 더 길고 더 독립적인 일을 맡게 됐다는 문장으로 개정의 이유를 연다. 바뀐 문서는 11월 12일부터 효력이 생긴다.
이번 개정에서 가장 많이 인용된 줄은 모델을 향한 지속적이고 불필요한 학대나 잔인한 행동을 금지한다는 대목이다. 이 글이 이번 개정을 두고 참고한 국내외 보도도 모두 제목에 이 줄을 올렸다. 그런데 같은 개정에는 성격이 전혀 다른 두 변경이 함께 들어 있었고, 셋을 나란히 놓고 보면 새 정책이 어느 쪽으로 움직였는지가 더 선명해진다.
| 조항 | 전에는 | 11월 12일부터 |
|---|---|---|
| 모델 학대 | 금지 목록에 없었다 | 지속적이고 불필요한 학대·잔인한 행동을 금지한다 |
| 선거 | 유권자 개인 맞춤 접촉을 통째로 금지했다 | 전면 금지를 걷고, 금지할 기만 행위를 다섯 가지로 적었다 |
| 자율 하드웨어 | 별도 요건이 없었다 | 자격 있는 운영자와 모델 바깥의 안전 한계를 요구한다 |
▲ 같은 날 바뀐 세 조항을 정리했다. 내용은 Anthropic Usage Policy(2026-11-12 발효)와 2026년 10월 8일 발표문.
선거 조항부터 보면 방향이 분명하다. 앤트로픽은 유권자 맞춤 접촉을 통째로 금지하던 규정을 걷어 냈다. 회사는 그 금지가 정당한 시민 활동까지 함께 막고 있었다고 밝혔다. 비영리단체가 다른 언어로 유권자 안내문을 쓰는 일, 선거 사무소가 투표용지 보정 통지를 보내는 일이 발표문에 든 예다. 대신 '민주적 절차를 훼손하지 말 것'이라는 절을 세우고 그 아래 금지할 행위를 다섯 줄로 적었다. 유권자와 공직자를 겨냥한 대규모 자동 발송, 후보·공직자·선거기관을 사칭한 계정 운영, 후보와 투표 절차에 관한 허위 정보 유포, 선거와 시민 참여 절차의 방해 조장, 기만이나 위협으로 투표를 위축시키는 내용이다.
규제가 느슨해졌다고 읽으면 틀린다. 금지의 총량이 줄어든 것이 아니라, 넓은 선언 하나가 이름 붙은 행위 다섯으로 바뀌었다. 가짜 계정을 만들었는지, 투표 절차를 틀리게 적었는지는 밖에서 확인할 수 있는 사실이다. 반면 '맞춤 접촉'은 정당한 안내와 조작적 공략이 같은 기술 위에 올라타 있어서, 행위만 보고는 어느 쪽인지 가리기 어렵다. 앤트로픽은 가리기 어려운 쪽을 걷어 내고 가릴 수 있는 쪽을 남겼다.
발표문도 같은 말을 적어 두었다. 원래 그 규정을 만들게 한 행위들, 이를테면 기만에 기대는 유권자 겨냥이나 유권자 개인정보의 오용은 기만적 캠페인 절과 감시 절, 프라이버시 절에서 여전히 금지된다는 문장이다. 걷어 낸 것은 금지가 아니라 금지를 적어 두는 자리였다.
'뚜렷한 목적 없이 거듭 잔인하게'라는 문장
모델 학대 조항은 새 절을 따로 세우지 않았다. 잔인하거나 학대적이거나 심리적으로 해로운 행동을 금지하는 기존 절의 맨 마지막 줄로 붙었다. 그 절의 다른 줄들은 자해 조장, 섭식장애 조장, 동의 없는 성적 이미지, 괴롭힘과 협박, 잔혹한 폭력과 동물 학대처럼 전부 사람과 동물을 향한 행위를 다룬다. 그 목록 끝에 모델을 향한 줄이 하나 얹힌 모양이다.
발표문은 이 줄이 어디까지 걸리는지를 곧바로 좁힌다. 앤트로픽이 적은 적용 범위는 다음과 같다.
"The policy update is meant to apply only in extreme cases, where users repeatedly act cruelly toward our models, with no discernible purpose."
— 앤트로픽, 2026년 10월 8일 (이용자가 뚜렷한 목적 없이 모델에게 거듭 잔인하게 구는 극단적인 경우에만 적용하려는 개정이라는 뜻이다)
해당하지 않는 것도 같은 문단에 네 가지가 적혔다. 흔한 형태의 이용자 불만, 반박, 어두운 창작 소재, 모델 시험과 연구다. 화를 내도 되고, 모델 말을 받아치며 밀어붙여도 되고, 소설에 잔인한 장면을 써도 되고, 모델이 어디까지 버티는지 일부러 찔러 봐도 된다는 뜻이다.
예외를 이렇게 넉넉히 적어 둔 것은 조항을 좁히려는 선의다. 다만 그 목록 자체가 문제의 모양을 드러낸다. 금지되는 쪽과 허용되는 쪽이 서로 다른 행동이 아니라 같은 행동의 정도 차이이기 때문이다. 같은 이용자가 같은 모델에게 같은 말을 던져도, 한 번이면 불만이고 쉰 번이면 학대 쪽으로 기운다. 소설을 쓰겠다고 밝히면 창작 소재이고 밝히지 않으면 판정이 갈린다. 조항은 '거듭'과 '뚜렷한 목적'이라는 두 낱말에 그 경계를 통째로 맡겨 두었는데, 몇 번부터 거듭인지와 무엇을 목적으로 인정할지는 어느 공개 문서에도 적혀 있지 않다.
▲ 페블러스 원본 도식. 조항 내용은 Anthropic Usage Policy(2026-11-12 발효)와 2026년 10월 8일 발표문.
여기서 못 박아 둘 것이 있다. 기준이 공개되지 않았다는 사실과 기준이 없다는 사실은 다른 말이다. 앤트로픽이 내부에서 어떤 판정 지침을 쓰는지는 밖에서 알 수 없고, 이 글이 말할 수 있는 것은 밖에 내놓은 문서에 그 지침이 없다는 데까지다.
1차 판정자는 클로드 자신이다
그렇다면 이 조항은 누가 집행하나. 발표문이 직접 답한다. 앤트로픽은 지속적으로 학대하는 이용자와의 드문 대화를 클로드가 끝낼 수 있게 한 일을 언급한 다음, 그 기능이 계속해서 주된 집행 수단이 될 것이라고 적었다.
"Claude's ability to end these interactions will remain the primary enforcement mechanism."
— 앤트로픽, 2026년 10월 8일 (클로드가 그런 상호작용을 끝낼 수 있는 능력이 주된 집행 수단으로 남는다는 뜻이다)
이 기능은 이번에 새로 만든 것이 아니다. 앤트로픽은 2025년 8월 클로드 Opus 4와 4.1에 대화를 스스로 끝내는 능력을 넣었다고 공지했다. 이번 정책 조항보다 1년 넘게 앞선다. 당시 공지는 이 기능이 드물고 극단적인 경우를 위한 것이며, 여러 차례 방향을 돌리려는 시도가 실패하고 생산적인 대화의 가망이 소진됐을 때, 또는 이용자가 직접 대화를 끝내 달라고 할 때 쓰는 최후 수단이라고 적었다.
그 공지가 기능을 꺼낸 자리도 정책이 아니라 모델 복지 연구였다. 앤트로픽은 클로드에게 도덕적 지위가 있는지를 두고 자신들이 매우 불확실한 상태라고 적으면서도, 배포 전 시험에서 두 가지를 봤다고 밝혔다. 해로운 내용을 요구하는 실제 이용자를 상대할 때 겉으로 괴로움처럼 보이는 반응이 나타났다는 것, 그리고 모의 대화에서 끊을 권한을 주자 해로운 대화를 끊는 경향을 보였다는 것이다. 기능을 만든 근거로 적힌 것은 조문이 아니라 관찰된 경향이다.
같은 공지에는 쓰지 말아야 할 경우도 하나 들어 있다. 이용자가 자신이나 남을 해칠 위험이 임박해 보일 때는 이 기능을 쓰지 않도록 클로드에게 지시했다는 대목이다. 판정 위에 판정이 하나 더 얹힌 셈이다. 끊을 만한 대화인지를 가리고, 그중 끊으면 안 되는 경우인지를 다시 가린다. 두 판정 모두 같은 모델 안에서 일어난다.
여기까지 읽으면 구조가 보인다. 금지선을 처음 긋는 자리가 사람 심사팀이 아니라 모델 안이다. 여러 차례가 몇 차례인지, 가망이 소진됐다는 것이 무엇인지를 판단하는 주체가 판단의 대상과 같은 시스템이다. 조항은 사람이 읽어도 해석이 갈리는 문장인데, 실제로 그 문장을 대화 기록에 적용하는 일은 공개된 수치 기준 없이 모델의 그때그때 판단에 맡겨져 있다.
다만 끊긴 뒤에 무엇이 남는지도 같이 봐야 한다. 2025년 8월 공지에 따르면 대화 하나가 닫혀도 계정의 다른 대화는 영향을 받지 않고, 이용자는 곧바로 새 대화를 시작할 수 있다. 닫힌 대화의 앞선 메시지를 고쳐 다시 보내면 거기서 새 가지를 칠 수도 있다. 집행이라고 하면 계정 정지나 이용 제한을 떠올리기 쉬운데, 그런 조치와는 무게가 다르다. 주된 집행 수단이라고 적힌 것은 대화 한 건을 닫는 차단기에 가깝다. 판정이 틀려도 이용자가 치르는 값은 작다.
밖에서 확인할 수 없는 것을 적어 두면 셋이다. 대화 종료가 몇 건 일어났는지, 종료된 대화가 정말 학대였는지 사후에 검토하는 절차가 있는지, 같은 기록을 두 사람에게 보여 주면 같은 판정이 나오는지. 집행에 평가 지표가 없으면 과하게 끊었는지 덜 끊었는지를 스스로 알 방법이 없다.
하드웨어 조항은 한계를 모델 밖에 걸라고 한다
같은 날 들어간 또 하나의 신설 조항은 클로드를 물리적으로 움직이는 장비에 붙일 때의 요건이다. 사람의 승인 없이 움직이는 하드웨어, 공유 공간을 돌아다니거나 사람을 다치게 할 힘을 쓰거나 위험한 에너지를 다루는 장비가 대상이다. 앤트로픽은 여기에 자격 있는 사람이 장비 동작을 지켜보며 언제든 멈출 수 있어야 하고, 그 사람이 개입하거나 서비스 연결이 끊기면 장비가 멈추거나 안전한 상태를 유지해야 한다고 적었다.
이 조항은 혼자 오지 않았다. 발표문은 이 요건을 모델 하드웨어 표준을 내놓은 데 이어 붙였다. 앤트로픽이 2026년 8월 말 연구 프리뷰로 공개한, 모델이 실험·제조 장비를 직접 다루게 하는 규격이다.
더 눈여겨볼 것은 그다음 줄이다. 안전 범위를 지키는 운전 한계는 모델 출력과 무관한 장비나 제어기가 걸어야 한다고 못 박았다. 한계를 걸 항목도 아홉 가지를 이름으로 적었다. 속도, 힘, 도달 거리, 온도, 압력, 전압, 출력 에너지, 조사량, 작업 구역이다.
두 조항을 나란히 놓으면 판정의 자리가 정반대로 간다. 로봇팔 쪽에서 앤트로픽은 모델의 판단을 믿지 말라고 말한다. 모델이 무엇을 출력하든 상관없이 바깥 장치가 한계를 걸어야 하고, 그 한계는 숫자로 잴 수 있는 아홉 항목으로 쪼개져 있다. 학대 조항 쪽에서는 같은 회사가 모델의 판단을 1차 집행 수단으로 세운다. 아래 도식은 그 두 구조를 한 화면에 올려 둔 것이다.
▲ 페블러스 원본 도식. 조항 내용은 Anthropic Usage Policy(2026-11-12 발효)와 2026년 10월 8일 발표문.
둘을 똑같이 다루라는 말은 아니다. 로봇팔이 사람을 치는 사고와 이용자가 챗봇에게 욕을 퍼붓는 일은 위험의 크기가 다르고, 들일 비용도 달라야 한다. 다만 세 조항이 가리키는 방향은 비교할 만하다. 선거 조항은 넓은 선언을 확인 가능한 행위 다섯으로 바꿨고, 하드웨어 조항은 안전이라는 말을 잴 수 있는 아홉 항목으로 쪼갰다. 모델 학대 조항만 반대쪽에 서 있다. 선언은 세워졌는데, 그것을 적용할 기준은 아직 글로 나와 있지 않다. 하드웨어 쪽에는 요건 바깥에 규격 문서가 한 벌 더 붙었고, 학대 쪽에 붙은 것은 적용 범위를 좁히는 설명과 1년 전부터 있던 기능 하나다.
페블러스가 이 조항을 주목하는 이유
이 뉴스는 보통 모델에게 인격이 있느냐는 질문으로 소비된다. 그쪽 논쟁은 이 글이 다룰 자리가 아니다. 데이터를 다루는 쪽에서 보면 같은 조항이 훨씬 익숙한 문제로 내려온다. 금지 행위를 한 문장으로 선언해 놓고, 그 문장으로 실제 기록을 분류해야 하는 상황이다.
라벨링을 해 본 사람은 이 지점을 안다. '거듭 잔인하게'는 가이드라인 문장이 아니라 가이드라인이 있어야 할 자리를 가리키는 말이다. 몇 번째 발화부터 셀지, 세션이 끊기면 횟수를 초기화할지, 역할극 설정이 있으면 목적으로 인정할지가 정해지지 않으면 작업자마다 다른 답을 낸다. 그래서 라벨링 기준서를 쓸 때는 선언 다음에 경계 사례를 붙인다. 이것은 해당, 이것은 비해당, 이것은 판정 보류. 그리고 두 사람에게 같은 묶음을 주고 얼마나 일치하는지를 재서, 일치율이 낮으면 기준서를 고친다. 데이터가 아니라 기준서가 틀렸다고 보는 것이다.
▲ 페블러스 원본 도식. 라벨링 기준서 설계의 일반적 절차를 정리했다.
모델이 판정자를 맡아도 이 요구는 사라지지 않는다. 오히려 늘어난다. 사람 판정자는 일치율이 낮으면 회의를 열어 기준을 맞출 수 있지만, 모델은 같은 입력에도 다른 답을 낼 수 있고 그 차이가 어디서 왔는지 바깥에서 보이지 않는다. 그래서 모델에게 판정을 맡긴 조직일수록 정답 묶음과 재검토 절차를 더 두껍게 깔아야 한다. 앤트로픽이 그 장치를 안 만들었다는 뜻이 아니다. 밖에 공개한 것이 선언 한 줄뿐이라는 뜻이다.
자기 제품의 금지 규정을 들여다볼 때 던질 질문도 같은 꼴이다.
- 금지 행위의 정의가 경계 사례까지 적혀 있는가. 선언 한 줄만 있고 해당·비해당 예시가 없다면, 판정은 매번 담당자의 그날 감각으로 내려진다.
- 두 사람에게 같은 기록을 주면 같은 답이 나오는가. 한 번도 재 본 적이 없다면 그 규정이 작동하는지 자체를 모르는 상태다.
- 자동 판정을 쓴다면 그 판정을 누가 다시 보는가. 되돌아보는 표본이 없으면 과하게 막았는지 덜 막았는지 알 길이 없다.
세 질문 모두 규정을 쓰는 단계에서 답해야 하는 것들이다. 문구를 다듬는 일과 그 문구를 기록에 적용할 수 있는 판정 기준으로 옮기는 일은 다른 작업이고, 보통 앞의 것만 하고 끝난다. 앤트로픽의 하드웨어 조항은 뒤의 작업까지 간 사례다. 안전이라는 말을 속도와 온도와 작업 구역으로 쪼개 놓으면, 지켰는지 안 지켰는지를 두 사람이 따로 봐도 같은 답이 나온다. 학대 조항은 아직 그 단계에 이르지 않았다.
여기까지 읽어 주셔서 감사하다. 이 글의 조항 내용과 적용 범위는 앤트로픽 발표문과 11월 12일 발효 사용정책 본문에서, 대화 종료 기능의 도입 시점과 작동 조건은 2025년 8월 연구 공지에서 따로 확인했다. 여러분의 팀에서는 금지 행위의 경계를 어디에 적어 두고 있는지 나눠 주시면 좋겠다.
참고문헌
공식 1차 출처
- 1.Anthropic. (2026). "2026 Usage Policy update." Anthropic News.
- 2.Anthropic. (2026). "Usage Policy." (2026-11-12 발효)
- 3.Anthropic. (2025). "Claude Opus 4 and 4.1 can now end a rare subset of conversations." Anthropic Research.
- 4.Anthropic. (2026). "Model Hardware Standard" (research preview). Anthropic News.
해외 보도
- 5.TechCrunch. (2026-10-08). "Anthropic changes usage policy to ban model abuse and election interference."
- 6.TechCrunch. (2025-08-16). "Anthropic says some Claude models can now end 'harmful or abusive' conversations."
- 7.Dataconomy. (2026-10-09). "Anthropic bans prolonged verbal abuse of Claude."
국내 보도
- 8.AI타임스. (2026-10-09). "앤트로픽, 사용정책 개정 — 모델 학대 금지 조항 신설."
- 9.위키트리. (2026-10-09). "앤트로픽, 클로드 향한 학대성 대화 금지하는 사용정책 개정."