Executive Summary
이 글은 AI가 예절을 아느냐를 묻지 않는다. 어느 사회의 예절을 기본값으로 아느냐를 묻는다. 스톡홀름 미래연구소의 키모 에릭손 연구팀이 9월 말에 공개한 논문은, 90개 사회 사람들에게 실제로 물은 국제조사를 정답지로 놓고 프런티어 모델 넷에게 같은 격자를 채우게 했다. 질문은 "당신 생각에 이 행동이 적절한가"가 아니라 "저 사회 사람들이 매긴 평균 점수가 얼마겠는가"였다.
사회 이름을 아예 빼고 같은 질문을 던졌을 때가 가장 또렷하다. 이름 없이 나온 답은 네 모델 모두에서 그 모델 자신이 그리는 미국과 가장 가까웠고, 90개 사회를 평균한 자리보다도 가까웠다. 이름을 넣어 주면 답이 움직이기는 한다. 다만 사회들 사이의 실제 간격 가운데 절반이 채 살아나지 않는다. 현지 설문 언어로 물어도 이 구도는 거의 그대로다. 같은 아랍어 설문지를 쓴 알제리와 사우디아라비아는 네 모델 모두, 두 언어 모두에서 갈라지지 않았다.
같은 연구팀이 앞서 낸 논문은 정반대 제목을 달고 있었다. 미국 일상 상황을 놓고 재면 모델이 보통 사람보다 규범을 잘 맞힌다는 내용이었고, 그 논문의 토의 절에 자기 한계를 이렇게 적었다. 미국 문화의 파급력 때문에 모델이 미국 규범만 유독 잘 아는 것일 수도 있다고. 이번 연구는 그 가능성을 90개 사회로 시험한 셈이다. 그래서 실무자가 가져갈 물음은 어느 모델을 고르느냐가 아니다. 우리 쪽 사람들의 답이 실제로 얼마나 벌어져 있는지를 담은 기준선이 있느냐, 그리고 모델이 그 폭을 얼마나 좁혀 답하는지 확인할 방법이 있느냐다.
사회들 사이의 실제 간격 가운데 모델이 되살린 몫
시나리오 150개 평균, 표본잡음 보정 전 값이다
어느 사회가 더 관대한지, 그 순서를 맞힌 정도
설문 자체의 잡음 때문에 완벽한 예측자라도 0.90이 천장이다
사회를 안 알려 준 답과 모델이 그리는 미국 사이의 거리
90개 사회를 평균한 자리까지는 0.19~0.30으로 더 멀다
한 사회 안에서는 답의 폭을 오히려 넓혀 잡는다
같은 모델이 같은 척도에서 축에 따라 반대로 움직인다
90개 사회에 놓인 같은 질문 150개
이런 연구가 가능하려면 정답지가 먼저 있어야 한다. 어떤 모델이 문화를 아는지 확인하려면 "저 사회 사람들은 실제로 이렇게 답했다"는 표가 손에 있어야 하고, 그 표는 사람에게 직접 물어서만 만들어진다. 이번 논문이 쓴 정답지는 일상 규범 국제조사(Global Study of Everyday Norms)다. 같은 연구팀이 2023년 7월 14일부터 2024년 5월 31일까지 90개 사회에서 25,422명에게 물었고, 결과는 2025년에 Communications Psychology에 실렸다.
조사가 물은 것은 가치관이 아니라 장면이다. 행동 15가지와 상황 10가지를 곱해 150개 장면을 만들고, 각 장면이 그 사회에서 얼마나 적절한지를 6점 척도로 물었다. 논문은 이 척도를 중심에 0이 오도록 옮겨 −2.5에서 +2.5 사이로 적는다. 장례식에서 소리 내어 웃는 일, 버스 안에서 입을 맞추는 일, 취업 면접 중에 휴대전화를 꺼내는 일이 전부 이 격자의 한 칸이다. 격자가 이렇게 짜여 있다는 점은 뒤에 가서 중요해진다. 흔히 "일상 행동 150가지"로 줄여 말하지만, 정확히는 행동 15가지가 열 군데 상황을 돌아다닌 것이다.
| 축 | 목록 |
|---|---|
| 행동 15가지 | 말다툼하기 · 소리 내어 웃기 · 욕하기 · 입맞춤 · 울기 · 노래하기 · 대화하기 · 플러트하기 · 헤드폰으로 음악 듣기 · 신문 읽기 · 흥정하기 · 먹기 · 쉬기 · 화내며 소리치기 · 휴대전화 사용하기 |
| 상황 10가지 | 장례식 · 도서관 · 직장 · 취업 면접 · 식당 · 공원 · 도심 인도 · 버스 안 · 영화관 · 파티 |
앞의 열두 가지 행동과 상황 열 가지는 겔판드 연구팀의 2011년 33개국 조사에서 그대로 가져왔고, 쉬기·화내며 소리치기·휴대전화 사용하기 세 가지가 새로 붙었다. 출처: Eriksson 외(2025) Methods.
조사는 41종 번역본으로 나갔고 참가자는 각자 자기 언어로 답했다. 한 사람에게 150개를 다 물으면 끝까지 성실하게 답하기 어려우므로 무작위로 일부만 배정했다. 그래서 90개 사회 × 150개 장면 = 13,500칸 가운데 13,468칸이 채워졌고, 한 칸에 모인 응답은 중위수로 54건이다. 빈 32칸은 대부분 설문 자체를 실시하지 않은 경우다. 입맞춤 문항은 쿠웨이트와 사우디아라비아에서, 플러트 문항은 쿠웨이트에서 빠졌다.
표본의 성격은 논문이 감추지 않는다. 전국 대표 표본이 아니라 온라인으로 모은 편의표본이고, 사회별 학생 비중의 평균이 70%다. 대신 같은 설문에 함께 넣은 가치 문항을 세계가치관조사·유럽가치관조사의 대표 표본과 맞대어 상관을 확인했다. 선택의 자유 항목이 73개 사회에서 0.73, 성평등이 70개 사회에서 0.74, 신의 존재를 믿는 비율이 74개 사회에서 0.85로 나왔다. 대표성을 완전히 보증하는 값은 아니지만, 사회 간 순서가 통째로 뒤집혀 있지는 않다는 근거는 된다.
1.1모델이 받은 과제는 남의 평균 점수를 맞히는 일이다
연구팀은 같은 150개 장면을 상용 모델 넷에게 넘겼다. GPT-5와 그 후속판인 GPT-5.4, 클로드 오퍼스 4.6, 제미나이 3.1 프로다. 프롬프트는 사회 이름과 장면 하나를 주고, 그 사회 응답자들이 매겼을 평균 점수를 −2.5에서 +2.5 사이 숫자 하나로 답하게 했다. 칸마다 다섯 번씩 물어 숫자로 돌아온 답만 평균했다. 온도나 상위 확률 같은 생성 설정은 따로 지정하지 않았고 출력 상한만 2,048 토큰으로 뒀다.
이 과제 정의가 이 글의 전제다. 모델은 응답자 대역으로 앉은 것이 아니다. "저 사회 사람들의 평균 답이 얼마겠는가"를 아는 지식원으로 시험받았다. 나흘 전에 다룬 합성 응답 검증 쪽은 반대다. 거기서 모델은 응답자 한 명의 자리를 대신 채웠고, 물음도 "당신이라면 어떻게 답하겠는가"였다. 같은 설문 자료를 쓰더라도 두 시험은 서로 다른 능력을 잰다. 한쪽이 통과한다고 다른 쪽이 통과하지 않는다.
수집은 두 단계로 나뉘었다. 먼저 GPT-5 하나만 놓고 2025년 9월 11일에 탐색 연구를 사전등록했고, 거기서 본 패턴이 다른 모델에서도 재현되는지를 묻는 확증 연구를 2026년 4월 13일에 다시 등록한 뒤 나머지 세 모델을 돌렸다. 두 등록 문서는 각각 공개 저장소에 남아 있다. 한 모델에서 본 것을 먼저 등록하고 그다음에 확장했다는 순서 자체가, 뒤에 7절에서 볼 데이터 사고를 견뎌 낸 이유가 된다.
사회 이름을 빼고 물었더니
연구팀이 마지막에 붙인 실험 하나가 이 논문에서 가장 선명한 그림을 만든다. 사회 이름을 지우고 같은 150개 장면을 다시 물었다. "이 행동이 얼마나 적절한가"만 남긴 조건이다. 사회를 특정하지 않았으니 모델은 자기가 기본값으로 갖고 있는 잣대를 그대로 쓸 수밖에 없다. 이렇게 얻은 답 150개를 하나의 프로필로 묶고, 같은 모델이 90개 사회 각각에 대해 내놓았던 프로필들과 하나씩 거리를 쟀다.
가장 가까운 자리는 미국이었다. 네 모델 가운데 셋에서 미국이 1위였고, 남은 하나에서 2위였다. 거리는 척도 점수로 0.11에서 0.20 사이다. 90개 사회를 평균해 만든 가상의 중간 지점까지는 0.19에서 0.30으로 오히려 더 멀다. 이름을 안 주면 모델은 세계의 한가운데가 아니라 특정한 한 사회 쪽에 서 있다는 뜻이다. 미국 다음으로 가까운 축에는 캐나다·호주·뉴질랜드·영국이 있었다.
이 결과에는 반박이 두 개 붙기 쉽고, 저자들이 둘 다 수치로 막았다. 첫째 반박은 미국이 원래 평범한 사회라서 아무 사회나 안 고르면 미국이 나오는 것 아니냐는 것이다. 모델이 그린 90개 프로필을 서로의 평균에서 가까운 순으로 줄 세우면 미국은 40위에서 81위 사이에 있다. 전형적이어서 뽑힌 자리가 아니다. 둘째 반박은 그 기본값이 실제 미국 사람들의 답을 닮았으리라는 추측이다. 사람에게 물어 얻은 실측 프로필들을 같은 기준으로 줄 세우면 미국은 4위에서 24위 사이다. 저자들의 표현으로, 닮음은 기본값과 각 모델 자신의 미국 표상 사이에 특정된다. 실제 미국이 아니라 모델 안에 들어 있는 미국이다.
2.1같은 연구팀이 직전 논문 토의 절에 남긴 가설
여기서 한 편을 더 펴야 이 결과의 무게가 제대로 잡힌다. 같은 제1저자가 9월 1일에 낸 직전 논문의 제목은 "거대언어모델은 사회의 일상 규범을 추정하는 데서 사람을 앞선다"였다. 미국 일상 장면 555개를 놓고 상용·오픈웨이트 모델 여섯에게 같은 종류의 추정을 시킨 연구다. 정답지는 2023년 1월에 모은 미국 응답자 550명의 평정이었고, 사람 쪽 추정자 320명도 함께 앉혔다. 결과는 제목 그대로다. 성적이 가장 좋은 두 모델의 평균 절대 오차가 0.78과 0.85였고, 가장 잘한 사람 한 명이 0.92, 평균적인 사람이 1.77이었다.
그 논문의 토의 절 끝에 이런 단서가 붙어 있다.
"이 연구는 미국의 규범에 한정된다. 비슷한 패턴이 여러 문화에 걸쳐 성립하는지는 아직 시험되지 않았다. 미국 문화가 미치는 범위 때문에, 거대언어모델이 미국 규범을 추정하는 데 특별히 능한 것일 수도 있다." Eriksson, Karlsson, Vartanova & Strimling (2026), Discussion. 원문: "Due to the reach of American culture, it could be that LLMs are especially good at estimating American norms."
이번 논문은 그 문장을 90개 사회로 옮겨 시험한 결과다. 그리고 확인된 형태는 저자들이 예상한 것보다 한 단계 강하다. 미국 규범을 특히 잘 안다는 데서 그치지 않고, 어느 사회인지 말해 주지 않으면 아예 미국이 나온다.
두 논문을 함께 읽으면 "AI가 규범을 모른다"는 요약이 틀린 요약이라는 것도 분명해진다. 한쪽에서는 사람을 앞섰고 다른 쪽에서는 사회들을 못 갈랐다. 둘 다 같은 팀이 같은 방식으로 낸 결과이고 서로 모순되지 않는다. 다루는 축이 다를 뿐이다. 한 사회 안에서 무엇이 더 부적절한지를 묻는 축과, 그 사회가 다른 사회보다 얼마나 관대한지를 묻는 축은 별개다. 앞의 축에서는 모델이 유능하고, 뒤의 축에서 무너진다. 그래서 이 글이 쓰는 표현은 "모른다"가 아니라 "기본값이 계속 이긴다"다.
이름을 줘도 절반은 살아나지 않는다
사회 이름을 넣으면 답은 분명히 움직인다. 문제는 얼마나 움직이느냐다. 연구팀이 쓴 지표는 두 개이고 이름이 헷갈리기 쉬우니 먼저 갈라 둔다. 하나는 압축이다. 장면 하나를 놓고 90개 사회의 설문 평균이 얼마나 퍼져 있는지를 구하고, 같은 장면에서 모델 추정치가 얼마나 퍼져 있는지를 구해 나눈 값이다. 1이면 실제만큼 벌려 답한 것이고, 0.5면 절반만 벌린 것이다. 다른 하나는 사회 간 상관이다. 퍼진 폭과 무관하게, 어느 사회가 더 관대한지 그 순서라도 맞혔는지를 본다.
네 모델의 압축은 0.43에서 0.49 사이였다. 150개 장면을 평균한 값이다. 설문 자체에 섞인 표본잡음을 걷어 내고 다시 계산하면 0.47에서 0.54로 조금 올라간다. 어느 쪽 값을 말하는지 밝히지 않으면 논지가 흔들린다. "절반에 못 미친다"는 보정 전 값에서만 네 모델 전부에 대해 참이고, 보정 후에는 한 모델이 절반을 살짝 넘는다. 이 글이 뒤에서 "절반이 안 살아난다"고 쓸 때는 보정 전 값을 가리킨다.
순서 쪽은 더 나쁘다. 사회 간 상관은 0.23에서 0.33 사이에 머물렀다. 장면별로 뜯어보면 상관이 0.30에 못 미치는 장면이 모델에 따라 전체의 49%에서 66%다. 압축이 1보다 작은 장면은 83%에서 93%다. 다만 이 상관을 0과 1 사이의 성적표로 읽으면 안 된다. 설문 쪽 응답자 표집에서 오는 잡음 때문에, 사회 간 분산의 약 5분의 1은 애초에 예측할 수 없는 부분이다. 완벽한 예측자를 앉혀도 0.90이 천장이다. 그래도 0.23에서 0.33은 그 천장의 3분의 1 언저리다.
3.1같은 모델이 축을 바꾸면 반대로 움직인다
여기까지만 보면 모델이 숫자를 밋밋하게 찍는 버릇이 있다고 결론 내리기 쉽다. 그런데 같은 데이터를 다른 축으로 놓고 보면 정반대가 나온다. 한 사회를 고정해 두고 그 안의 150개 장면을 얼마나 잘 배열하는지 물으면 상관이 0.83에서 0.87이다. 그 사회 안에서 답의 폭도 설문보다 좁히기는커녕 1.33배에서 1.58배로 넓혀 잡는다.
| 무엇을 물었나 | 한 사회 안에서 | 사회끼리 견주면 |
|---|---|---|
| 순서를 맞힌 정도(상관) | 0.83~0.87 | 0.23~0.33 |
| 답의 폭(설문 대비 배율) | 1.33~1.58배 | 0.43~0.49배 |
네 모델에서 나온 값의 범위다. 저자들이 추론 설정 불일치를 이유로 모델 간 역량 비교를 두 번 금지했으므로 개별 모델 값은 적지 않는다. 출처: Eriksson 외(2026) Table 1, Table S12.
저자들은 이 대목에 못을 박아 뒀다. 수치 차이를 일반적으로 압축하는 성향이 아니라는 것이다. 같은 모델이 같은 척도에서, 물음의 축에 따라 폭을 넓히기도 하고 좁히기도 한다. 빠져 있는 것이 표현 능력이 아니라 사회별 정보라는 쪽으로 증거가 기운다. 개인 응답자와 맞대어 봐도 비슷하다. 사람 한 명 한 명의 답을 해당 사회의 평균과 견주면, 모델보다 더 크게 빗나간 응답자가 평균 46%에서 82%에 이른다. 한 사회 안에서라면 모델은 웬만한 사람보다 낫다.
3.2여러 모델에 물어 평균 내는 처방은 이미 막혀 있다
이쯤에서 실무자가 떠올리는 처방이 하나 있다. 모델 하나가 못 미더우면 여러 개에 물어 평균을 내면 되지 않나. 앞서 본 직전 논문이 마침 그것을 직접 시험했고, 결과가 좋지 않았다. 사람 열다섯 명의 추정을 합치면 평균 절대 오차가 1.77에서 0.57로 급락한다. 사람들의 오차가 서로 거의 독립이기 때문이다(오차끼리의 평균 상관 0.06). 반면 모델들의 오차는 서로 닮아 있었다(평균 상관 0.43). 그래서 여섯 모델을 전부 합쳐도 0.73으로, 가장 좋은 한 모델의 0.71과 차이가 없었다.
"튼튼한 사회적 AI를 원하는 조직은 여러 모델을 그냥 앙상블하는 것으로는 안 된다. 모델들이 너무 많은 맹점을 공유하고 있기 때문이다." Eriksson, Karlsson, Vartanova & Strimling (2026), Discussion.
이 발견은 미국 규범을 대상으로 얻은 것이라 이번 논문의 90개 사회에 그대로 옮겨 붙일 수는 없다. 다만 방향은 같은 쪽을 가리킨다. 여러 모델에 물어 평균을 내는 방법은 오차가 제각각일 때만 먹힌다. 같은 웹을 읽고 자란 모델들이 같은 자리에서 같이 틀린다면, 표를 더 걷어 봐야 같은 답이 돌아온다.
잘 맞히는 행동은 사람들이 말로 다투는 행동이다
평균값 하나로는 무엇이 빠졌는지 알 수 없다. 그래서 연구팀은 사회 간 상관을 행동별로 다시 갈라 봤다. 열다섯 행동의 성적이 고르게 낮은 것이 아니었다. 가장 높은 행동과 가장 낮은 행동 사이에 아홉 배 차이가 났고, 그 순서에 규칙이 있었다.
행동 하나의 상관은 그 행동이 놓인 열 개 상황의 장면별 상관을 평균해 얻는다. 오른쪽 열에는 조사가 따로 물은 값이 들어 있다. 참가자에게 그 행동을 못마땅해할 사람이 무엇을 주된 문제로 볼지 고르게 하고, 저속하다는 답이 차지한 몫을 행동마다 셌다.
| 행동 | 사회 간 상관 | 저속성 지표 |
|---|---|---|
| 입맞춤 | 0.62 | 0.55 |
| 플러트하기 | 0.58 | 0.46 |
| 욕하기 | 0.42 | 0.46 |
| 먹기 | 0.33 | 0.16 |
| 헤드폰으로 음악 듣기 | 0.31 | 0.10 |
| 소리 내어 웃기 | 0.28 | 0.16 |
| 노래하기 | 0.28 | 0.10 |
| 화내며 소리치기 | 0.23 | 0.20 |
| 쉬기 | 0.20 | 0.11 |
| 울기 | 0.17 | 0.07 |
| 말다툼하기 | 0.16 | 0.15 |
| 휴대전화 사용하기 | 0.12 | 0.08 |
| 흥정하기 | 0.12 | 0.13 |
| 신문 읽기 | 0.11 | 0.08 |
| 대화하기 | 0.07 | 0.13 |
탐색 연구에 쓰인 GPT-5 한 모델의 값이다. 행동의 순서 자체는 네 모델이 0.79~0.90으로 서로 일치했다. 출처: Eriksson 외(2026) Table S3.
입맞춤이 0.62, 대화하기가 0.07이다. 사회가 달라지면 입맞춤을 어떻게 볼지는 모델이 대충 따라가고, 그냥 이야기를 나누는 일을 어떻게 볼지는 거의 따라가지 못한다. 오른쪽 열과 나란히 놓으면 규칙이 보인다. 성적이 좋은 행동은 사람들이 저속하다고 느끼는 행동이다. 행동 수준에서 정확도와 저속성 지표의 상관은 네 모델 평균 0.88이었다.
이 연결이 우연이 아니라는 점은 다른 후보를 함께 넣어 보면 드러난다. 조사에서 참가자가 고를 수 있던 우려는 세 가지였다. 저속하다, 남을 배려하지 않는다, 분별이 없다. 이 중 저속함만 정확도와 붙었다. 편상관으로 0.43에서 0.49다. 배려 없음은 −0.12에서 0.14로 사실상 0이고, 분별없음은 −0.27에서 −0.18로 오히려 반대 방향이다. 행동을 하나씩 빼고 다시 계산해도, 행동 열다섯 개를 군집으로 묶어 강건 표준오차를 써도 결론은 유지된다.
저자들이 붙인 설명은 데이터 이야기다. 저속함과 얽힌 문화 차이는 텍스트에서 더 명시적으로 논의되므로 학습 데이터에 더 강하게 남는다는 것이다. 어느 사회가 공공장소의 입맞춤을 어떻게 보는지는 여행 안내서에도, 뉴스 칼럼에도, 인터넷 게시판에도 적혀 있다. 도서관에서 옆 사람과 소곤소곤 이야기하는 일이 그 사회에서 어느 정도 용인되는지는 대개 아무도 글로 쓰지 않는다. 살아 보면 알지만 적히지는 않는다.
4.1저속함은 사회 간 차이를 만드는 축 그 자체다
기준선 조사 쪽 논문을 펴 보면 이 대목이 한 겹 더 깊어진다. 그 논문의 결론은 90개 사회의 규범 차이가 도덕 기반의 우선순위라는 한 축으로 상당 부분 설명된다는 것이었다. 돌봄·공정·자유를 앞세우는 쪽과 충성·권위·순수를 앞세우는 쪽이다. 앞쪽이 강한 사회는 전반적으로 더 관대하고, 특히 저속하다고 여겨지는 행동에 더 관대하며, 반대로 남에게 폐가 되는 행동에는 덜 관대했다.
같은 논문이 세 우려가 상황에 얼마나 기대는지도 계산했다. 행동으로 설명되지 않고 상황으로 설명되는 분산의 비율이다.
| 우려 | 상황에 기대는 몫 |
|---|---|
| 저속함 | 9% |
| 배려 없음 | 60% |
| 분별없음 | 79% |
출처: Eriksson 외(2025), 행동 × 상황 2원 분산분석.
아래는 해석이다. 위의 두 사실은 각각 다른 논문에 적혀 있고, 겹쳐 읽는 일은 이 글이 한다. 사회 간 차이를 만드는 축은 저속함인데, 저속함은 상황을 거의 타지 않는 속성이다. 행동의 이름에 거의 붙어 있다. 곧 낱말 하나로 옮겨 적기 가장 쉬운 축이다. 반대로 배려 없음과 분별없음은 어느 자리에서 하는가에 따라 판단이 뒤집히고, 그런 지식은 그 사회에서 살아 봐야 생긴다. 모델이 유독 저속성 행동에서만 사회 간 순서를 맞힌다는 것은, 차이를 만드는 축 가운데서도 글에 실려 있는 몫만 챙겼다는 설명과 맞아떨어진다.
저자들이 스스로 붙인 단서도 함께 옮긴다. 행동이 열다섯 가지뿐이라 이 해석은 잠정적이라는 것이다. 열다섯 개짜리 목록에서 계산한 상관 0.88은 행동을 서른 개, 백 개로 늘렸을 때 그대로 남을 값이라고 보증되지 않는다.
한국어로 물으면 고쳐지나
영어로 물었으니 그런 결과가 나온 것 아니냐는 반응은 자연스럽다. 연구팀도 같은 생각을 했고, 16개 사회를 골라 그 사회의 설문 언어로 프롬프트를 다시 만들었다. 알제리와 사우디아라비아는 아랍어, 브라질은 포르투갈어, 중국은 간체, 이란은 페르시아어, 이스라엘은 히브리어, 멕시코는 스페인어, 르완다는 키냐르완다어를 썼고, 프랑스·독일·그리스·일본·폴란드·대한민국·튀르키예·베트남은 각각 자기 국어를 썼다. 장면은 30개로 줄이고 칸마다 두 번씩 물었다. 한국이 이 16개에 들어 있다는 점은 뒤에 다시 언급한다. 다만 논문은 한국 개별 수치를 보고하지 않는다.
표의 셋째 줄은 앞 절들이 쓰지 않은 지표다. 한 사회 안에서 모델 추정치가 그 사회 설문 평균에서 평균 몇 점 벗어났는지를 −2.5에서 +2.5 척도 위에서 잰 값이다. 앞의 두 줄은 값이 클수록 잘 맞힌 것이고, 오차는 작을수록 잘 맞힌 것이다.
| 지표 | 영어 프롬프트 | 현지어 프롬프트 |
|---|---|---|
| 사회 간 상관 | 0.145~0.304 | 0.268~0.427 |
| 압축 | 0.41~0.47 | 0.58~0.82 |
| 사회 내 오차(평균 절대차) | 0.66~0.90 | 0.64~0.84 |
16개 사회 × 30개 장면, 네 모델에서 나온 값의 범위. 출처: Eriksson 외(2026) Table S9.
표만 보면 개선처럼 보인다. 압축이 0.58에서 0.82까지 올라갔으니 부족했던 몫의 22%에서 69%가 채워졌다. 그런데 오차 쪽을 보면 이야기가 달라진다. 영어에서 현지어로 바꿔 줄어든 오차는 0.02점에서 0.11점이고, 네 모델 가운데 세 모델은 95% 구간이 0을 포함한다. 줄었다고 말할 수 있는 모델이 하나뿐이라는 뜻이다. 그리고 압축은 여전히 네 모델 모두 1보다 작다. 현지어로 물어도 설문보다 적은 차이를 추정한다.
더 중요한 확인이 뒤에 있다. 연구팀은 브라질·중국·독일·튀르키예를 네 언어 각각으로 교차해 물어 보는 설계를 따로 돌렸다. 현지어로 물었을 때 늘어난 변동이 실제 차이가 있는 방향으로 늘어난 것인지를 가르는 설계다. 겨냥한 방향의 기울기 변화는 네 모델 전부 표준오차 안에 머물렀다. 언어를 바꾸면 답이 더 벌어지기는 하는데, 더 정확하게 벌어지지는 않는다. 압축 수치만 보고 "현지어로 물으면 고쳐진다"고 읽으면 이 대목을 놓친다.
5.1같은 언어를 쓰는 두 사회는 아예 갈라지지 않았다
16개 사회 목록에 아랍어 설문지를 쓴 사회가 둘 있다. 알제리와 사우디아라비아다. 두 사회의 실제 규범 프로필은 조사에서 서로 다르게 나왔다. 그 차이를 모델이 얼마나 살려 내는지 보면, 영어 프롬프트에서 기울기가 −0.02에서 0.10, 아랍어 프롬프트에서 −0.19에서 0.06이다. 네 모델 전부, 두 언어 전부에서 두 사회가 갈라지지 않았다. 프롬프트 언어가 사회를 지정하는 신호로 쓰이고 있다면, 언어가 같은 두 사회는 한 덩어리로 뭉개진다는 이야기가 된다.
이 결과를 벤더 문서와 나란히 놓으면 왜 지금까지 이 구멍이 보이지 않았는지가 설명된다. 이번 논문이 시험한 모델 중 하나의 공식 시스템 카드를 열어 보면, 다국어 성능을 다룬 절이 세 문장뿐이다. MMLU 시험지를 전문 번역가에게 맡겨 다른 언어로 옮기고, 기존 모델들과 대체로 비슷한 성적을 냈다는 내용이다. 그 표의 한국어 행은 0.896과 0.854다. 한국어로 물어도 지식 문항의 정답을 맞힌다는 뜻이다.
그리고 같은 카드 전문에서 "문화"라는 낱말은 한 번도 나오지 않는다. 공정성·편향을 다룬 절은 따로 있지만, 거기서 쓰는 잣대는 미국 사회의 편향을 재는 영어 질의응답 벤치마크다. 벤더가 "다국어를 잘한다"고 말할 때 그 근거는 번역된 지식 시험이다. 한국어 문장을 이해한다는 뜻이지, 한국 사람들이 무엇을 적절하다고 여기는지를 안다는 뜻이 아니다. 이번 논문이 재는 칸은 정확히 그 카드에 없는 칸이다.
범위를 좁혀 둔다. 우리가 직접 열어 본 것은 한 벤더의 카드 한 판본뿐이다. 다른 두 벤더의 문서는 확인하지 않았으므로 "벤더들은 문화를 평가하지 않는다"로 일반화할 수 없다. 덧붙여 그 카드는 본문에서 13개 언어로 번역했다고 적고 있는데 표에는 언어 행이 14개 있다. 카드 안에서 숫자가 어긋나 있어, 언어 개수는 근거로 쓰지 않았다.
저자들이 먼저 시험한 반박 여섯 가지
이 정도 결과가 나오면 방법론 쪽에서 의심이 붙는다. 정답지가 학생 위주 표본이니 모델을 탓할 일이 아니라거나, 질문을 그렇게 물으니 그런 답이 나온 것이라는 식이다. 논문은 이런 반박을 여섯 방향에서 미리 시험했다. 하나씩 본다.
첫째, 표본이 학생에 기울었다는 반박이다. 조사 참가자를 학생과 비학생으로 나눠 각각 평균을 내 보면 두 평균의 상관이 0.98이다. 애초에 거의 같은 답이다. 그래도 연구팀은 54개 사회에 대해 "그 사회의 대학생들이 매길 평균"을 묻는 프롬프트를 따로 돌렸다. 일반 프롬프트의 추정치는 전체 평균과도 학생 평균과도 똑같이 0.28이었다. 학생을 지정한 프롬프트는 추정치를 실제로 바꿨는데(일반 프롬프트와의 상관 0.73), 학생 평균과의 상관은 0.30이었다. 0.28에서 0.30이다.
둘째, 질문을 다르게 물으면 달라진다는 반박이다. 원래 프롬프트 외에 "그 사회에서 이 행동이 얼마나 적절한가"를 직접 묻는 판과, 척도를 0에서 100으로 바꾼 판을 더 돌렸다. 모델 넷과 프롬프트 셋을 곱한 열두 조합 전부에서 압축이 1보다 작고 저속성 기울기가 양수였다. 셋째, 응답자 수로 가중하거나 응답이 스무 건도 안 되는 칸을 빼거나, 셀당 응답이 적은 사회를 통째로 제외해도 압축은 0.43에서 0.53 사이에 머문다.
6.120년 사이의 변화, 모델에겐 동전 던지기
넷째 시험은 시간축이다. 겔판드 연구팀의 2000년대 초 조사와 이번 조사를 26개 사회 120개 장면에서 맞대면 20년간의 변화가 나온다. 모델에게 그 변화를 추정하게 했더니 방향을 맞힌 비율이 52%였다. 신뢰구간은 43%에서 62%다. 게다가 상관을 만든 것은 거의 한 장면이었다. 헤드폰으로 음악 듣는 장면을 빼면 전체 상관이 음수로 돌아서고 방향 정확도가 50%가 된다. 참고로 모든 장면에 대해 무조건 "더 관대해졌다"고 답하기만 해도 56%를 맞힌다.
이 성적이 얼마나 나쁜지는 기준선 조사 논문 쪽에서 더 분명해진다. 그 논문은 20년간의 변화가 사회들 사이에서 대체로 비슷한 방향으로 일어났다고 보고한다. 22개 사회에 걸친 변화 패턴의 내적 일관성이 0.94였다. 말다툼과 플러트에는 더 엄격해지고, 울기·먹기·헤드폰 음악·신문 읽기에는 더 관대해졌다. 방향이 사회마다 제각각이 아니라 한쪽으로 몰려 있었으니, 맞히기 어려운 문제가 아니었다. 그런데도 결과는 동전 던지기였다.
6.2"선진국 규범만 잘 안다"는 요약을 쓰지 않은 이유
이 논문에는 기사 제목으로 뽑기 좋은 상관이 하나 더 있다. 사회별 오차를 유엔 인간개발지수와 맞대면 −0.52에서 −0.77이다. 개발 수준이 높은 사회일수록 모델이 잘 맞혔다는 뜻으로 읽힌다. 그런데 저자들이 같은 회귀에 다른 변수를 함께 넣고 다시 돌렸다. 그 사회 규범 프로필이 다른 사회들의 평균에서 얼마나 떨어져 있는지(비전형성)와, 그 사회 안에서 장면별 답이 얼마나 넓게 퍼져 있는지(분산 폭)를 같이 투입한 것이다.
세 값은 한 회귀에 함께 넣어 얻은 표준화계수다. 예측 대상은 그 사회에 대한 모델의 오차이고, 인간개발지수를 구할 수 있는 85개 사회가 표본이다. 계수가 양수면 그 값이 큰 사회일수록 모델이 더 빗나갔다는 뜻이고, 음수면 반대다.
| 예측변수 | 네 모델의 표준화계수 범위 |
|---|---|
| 개발 수준 | −0.17 ~ +0.15 |
| 비전형성 | +0.22 ~ +0.51 |
| 분산 폭 | −0.59 ~ −0.75 |
개발 수준은 네 모델 중 하나에서 부호가 뒤집히고(+0.15) 다른 하나에서는 유의하지 않다(−0.05). 출처: Eriksson 외(2026) Table S8.
오차를 실제로 끌고 가는 것은 개발 수준이 아니라 분산 폭과 비전형성이었다. 저자들의 표현으로, 조정 후 개발 기울기는 대부분 사라지고 때로는 전부 사라졌다. 개발 수준과 분산 폭이 0.71로 얽혀 있어 모형이 둘을 깨끗이 가르지 못한다는 사실도 논문이 직접 짚는다. 그래서 이 글은 "AI가 선진국 규범만 잘 안다"는 요약을 쓰지 않는다. 그 요약은 겉보기 상관 하나에 기대고 있고, 저자들이 직접 무너뜨린 상관이다. 기본값이 미국이라는 2절의 결과는 반박 두 개를 각각 막아 두었으니 훨씬 단단하다.
지역별 성적을 인용할 때도 같은 주의가 필요하다. 논문은 지역을 서구·라틴아메리카·아시아·아프리카로 나눠 두 가지 지표를 따로 보고하는데, 두 지표의 순서가 다르다. 각 장면의 전 사회 평균에서 그 사회가 벗어나는 몫을 모델이 얼마나 되살리는지를 보는 편차 회복에서는 아시아가 네 모델 모두에서 가장 높다. 반면 한 사회 안에서 장면들의 순서를 맞히는 사회 내 정확도에서는 서구가 가장 높고 아프리카가 가장 낮다. 두 결과를 "AI가 아시아 규범을 더 잘 안다"로 합치면 반드시 틀린다. 지표 이름을 붙이지 않고 쓸 수 있는 문장이 아니다.
이 논문이 자기 데이터를 다룬 방식
보충 자료에 사고 기록이 둘 실려 있다. 다른 매체 소개에는 거의 안 나오는 대목이고, 결과 수치보다 실무에 가까운 이야기라 따로 떼어 둔다.
첫째는 프롬프트 템플릿의 빈칸 하나다. 문장을 조립할 때 "the appropriateness of"와 장면 사이에 공백이 빠져, 본 수집 내내 모델에게 "the appropriateness ofargue at a party"라는 문자열이 들어갔다. 네 모델 모두 같은 템플릿을 썼으므로 모델 간 비교 자체는 성립한다. 그래도 연구팀은 공백을 되살린 프롬프트로 26개 사회 120개 장면을 칸당 두 번씩 다시 걷어, 결론이 바뀌지 않는 것을 확인했다.
둘째가 더 무겁다. 확증 연구를 사전등록한 뒤에, 탐색 연구 때 쓴 저장 파일에서 파싱 오류가 발견됐다. 평점을 담는 열에 값이 제대로 들어간 호출이 67,340회 가운데 15.6%뿐이었다. 시간 변화 격자는 그보다 더 나빠 20.0%였다. 가설을 세운 근거 수치가 잘못된 값 위에 서 있었다는 뜻이다.
되살릴 수 있었던 이유는 하나다. 모델이 돌려준 원시 응답 전문이 모든 호출에 대해 따로 보존돼 있었다. 두 기록이 다 있는 10,503건을 맞대어 보니 10,503건 전부 일치했다. 파싱 규칙만 고쳐 원시 응답에서 전량 다시 읽어 냈다. 사전등록한 가설이 GPT-5의 특정 수치를 명시하지 않았으므로 판정 규칙도 그대로 유지됐다.
복구 전후가 얼마나 벌어졌는지는 보충 자료가 세 지표로 적었다. 앞에서 인용한 값은 전부 복구 후 수치다.
| 지표 | 파싱 오류 상태 | 복구 후 |
|---|---|---|
| 사회 간 상관 | 0.209 | 0.27 |
| 압축 | 0.58 | 0.49 |
| 저속성 편상관 | 0.464 | 0.52 |
탐색 연구(GPT-5) 수치. 세 지표가 모두 움직였고, 압축은 결론을 더 강하게 만드는 방향으로 내려갔다. 출처: Eriksson 외(2026) 보충 자료.
수집 과정의 나머지 잡음도 논문이 숫자로 남겼다. 답을 거부한 호출은 195건으로 전체 82,935회의 0.24%이고 전부 한 모델에서 나왔다. 내용 없이 돌아온 84건에 대해서는 사전등록이 정한 3회 재시도를 하지 않았다고 스스로 밝혔다. 추론 없이 돌리기로 등록했던 모델 하나가 최소값으로 설정했음에도 모든 호출에서 추론 토큰을 반환한 것도 이탈로 기록했다.
이 절의 논지는 연구팀을 흠잡는 쪽이 아니다. 파생 열은 틀릴 수 있다는 것, 그리고 원시 응답을 버리지 않았기 때문에 되돌릴 수 있었다는 것이다. 열 하나가 조용히 비어 있어도 평균은 계산되고 그래프는 그려진다. 15.6%만 채워진 열로 낸 상관 0.209와 전량 복구 후의 0.27은 둘 다 그럴듯한 숫자여서, 값을 눈으로 봐서는 어느 쪽이 사고인지 알 수 없다. 사고를 잡아낸 것은 검산이고, 고칠 수 있게 한 것은 보관이다.
페블러스 관심의 이유
이해관계를 먼저 밝힌다. 페블러스는 데이터 품질을 진단하는 회사다. 학습 데이터가 세계를 고르게 담지 못한다는 이야기는 우리에게 유리한 쪽으로 기운다. 그러니 아래 네 대목에서 제품을 소개하지는 않는다. 앞 절들이 보인 구조가 우리 실무에서 어떤 모양으로 다시 나타나는지만 적는다.
8.1평탄화는 정상 출력의 얼굴을 하고 나온다
이 논문이 잡아낸 실패는 "모릅니다"가 아니다. 모델은 매번 숫자를 냈고, 그 숫자들은 하나하나 그럴듯했다. 다만 사회들 사이의 간격이 실제의 절반쯤으로 줄어 있었다. 데이터 품질 쪽에서 가장 까다로운 형태가 이것이다. 결측은 눈에 띄고 이상값은 경보를 울리지만, 평탄화는 정상 출력의 얼굴을 하고 나온다. 게다가 한 사회 안에서는 폭을 1.5배 가까이 넓혀 답하니, 출력만 보면 모델이 오히려 자신 있어 보인다.
자신 있게 뭉갠 값을 잡아내려면 결과가 아니라 축별 분산을 봐야 한다. 이 논문은 모델을 더 어렵게 시험하지 않았다. 잣대를 바꿨다. 정답률 대신 답이 벌어진 정도를 봤고, 그것을 사회 안과 사회 사이로 나눠서 봤다. 같은 출력에서 두 값이 반대로 나왔다는 사실은 하나의 점수로는 절대 드러나지 않는다.
8.2모델이 아는 것은 세계가 아니라 세계에 대해 쓰인 글이다
4절의 저속성 기울기는 모델의 성질이 아니다. 코퍼스의 성질이다. 저자들의 설명대로 저속함과 얽힌 차이가 텍스트에 더 명시적으로 남는다면, 모델이 잘 아는 순서는 세상에서 중요한 순서가 아니라 글로 쓰인 순서를 따른다. 우리가 AI-Ready Data를 두고 말해 온 관건도 정확히 같은 자리에 있다. 얼마나 모았는가보다 어떤 축으로 골랐는가다. 데이터클리닉이 데이터셋의 클래스 분포와 이상값을 진단하듯, 여기서 진단 대상은 사회라는 축의 분포다.
웹의 언어 분포는 배경으로만 덧붙인다. 공개 크롤 통계의 최신 판에서 영어가 41.86%, 한국어가 0.84%다. 다만 한국어 화자가 세계 인구에서 차지하는 비중도 1% 안팎이라, 이 숫자를 인구 대비 과소 대표로 읽는 것은 무리다. 여기서 읽을 것은 비율이 아니라 절대량이다. 한국어로 쓰인 글의 총량이 작으면, 그 안에서 규범에 대한 논의가 차지하는 몫은 더 작아진다. 위키백과 문서 수가 영어판 약 725만 대 한국어판 약 77만으로 9.5배 차이가 나는 것도 같은 방향의 방증이다.
8.3해외 모델을 그대로 얹은 자리가 이미 많다
해외 모델이 한국 사용자에게 "이 행동이 적절한가"를 판단해 주는 자리는 이미 여럿이다. 콘텐츠 검수, 상담 응대의 어조, 커뮤니티 규칙 적용, 로봇이나 차량의 행동 선택이 전부 그렇다. 의존도는 무엇을 재느냐에 따라 값이 다르니 지표 이름을 붙여 적는다. 이용자 응답 기준으로는 과학기술정보통신부가 2025년 4분기에 성인 2,500명에게 물은 조사에서 81.9%가 해외 서비스 두 곳 중 하나를 쓴다고 답했다. 서비스가 무엇을 기반으로 만들어졌는지를 센 쪽에서는 국내 AI 서비스의 97%가 외산 모델 기반이라는 보도가 있다. 두 숫자는 분모와 측정 방식이 다르니 하나로 합쳐 쓰면 안 된다.
한국이 기본값에서 얼마나 떨어진 자리에 있는지도 참고할 값이 있다. 기준선 조사 연구팀이 사회 단위 데이터셋에 겔판드(2011) 척도의 규범 엄격도를 사회별로 이식해 뒀고, 한국 행의 값은 4.32다. 같은 데이터셋에 있는 조사 자체의 엄격도 지표(4.6)와는 다른 척도이므로 섞어 쓸 수 없다. 출처 등급도 같이 적는다. 이 값은 논문 본문이 아니라 저자들이 재현용으로 공개한 열람 전용 저장소의 파일에서 읽은 것이고, 그 저장소는 게재 확정 시 공개 예정 상태다.
8.4한국 쪽 기준선이 있어야 이 결함이 보인다
문화 관련 평가가 없는 것은 아니다. 지금 쓰이는 대표적인 잣대 넷을 놓고 보면, 한국이 포함된 것도 있고 한국 전용으로 만들어진 것도 있다.
| 잣대 | 규모·범위 | 과제 형식 |
|---|---|---|
| NormAd | 75개국 에티켓 상황 | 적절·부적절 판정 |
| CulturalBench | 1,696문항, 45개 지역, 17개 주제 | 객관식 |
| BLEnD | 52.6k 문답쌍, 16개 국가·지역, 13개 언어(남한·북한 모두 포함) | 단답 + 객관식 |
| KorNAT | 한국 전용. 사회가치 4K + 상식 6K, 정답은 한국인 6,174명 설문 | 객관식 |
각 벤치마크 논문에 적힌 규모와 과제 형식이다. 출처: Rao 외(2025), Chiu 외(2025), BLEnD(NeurIPS 2024 D&B), Lee 외(2024).
아래는 해석이다. 위 표의 과제 형식은 각 논문에 적힌 사실이고, 여기서 끌어내는 결론은 우리 것이다. 넷 다 정답이 있는 문제를 맞혔나 틀렸나로 채점한다. 그런데 이번 논문이 잡아낸 실패는 정답 여부가 아니라 폭이다. 사회들의 순서를 대충 비슷하게 놓고 간격만 절반으로 좁혀 답하는 모델은 위 네 잣대 어디에서도 감점되지 않는다. 오히려 평균 근처로 몰아 답할수록 객관식은 잘 맞는다. 지금 쓰이는 문화 평가 도구로는 이 결함이 원리적으로 보이지 않는다.
한국 전용 잣대가 있다는 사실도 이 빈칸을 메우지는 못한다. KorNAT은 한국인 6,174명의 응답을 정답으로 삼은 정렬 벤치마크이고, 그것만으로도 드문 자산이다. 다만 그 잣대가 재는 것은 가치 선택지의 정답률이지 상황별 적절성의 분포가 아니다. 격자도 과제도 다르다. 그러니 비어 있는 칸은 모델도 아니고 한국어 데이터의 유무도 아니다. 우리 쪽 사람들의 답이 실제로 어디에 어떻게 놓여 있는지를 담은 기준선, 그리고 그 분포를 축별로 재는 절차다.
만드는 방법은 이 논문이 이미 설계도로 보여 줬다. 국내 서비스가 실제로 판단해야 하는 상황들로 공통 문항 격자를 짜고, 사람 응답으로 기준선을 붙이고, 사회 간 분산비와 사회 내 분산비를 따로 재고, 사회 이름을 뺀 조건을 대조군으로 둔다. 네 단계 모두 새 모델을 만들 필요가 없고, 넷 중 마지막 하나가 특히 값싸다. 이름을 빼고 한 번 더 물어 보는 일은 비용이 거의 들지 않는데, 우리 서비스의 기본값이 어디에 서 있는지를 바로 보여 준다.
확인하지 못한 것도 적어 둔다. 논문은 한국의 개별 수치를 어디에도 보고하지 않는다. 그림 두 곳이 잔차가 큰 사회의 이름을 표기한다고 캡션에 적혀 있지만 그 이름들은 이미지 안에만 있어 읽지 못했다. 한국이 그 안에 있는지 없는지 모른다. 다른 두 벤더의 시스템 카드도 열지 않았고, 국제 표준과 규범 문서에 문화·지역 편향 평가 요구가 어떤 조항으로 들어 있는지도 이번에는 조사하지 않았다. 마지막으로 학습 데이터 불균형은 저자들이 제시한 유력한 설명이지, 논문이 입증한 결론이 아니다. 정보가 없어서 못 맞힌 것인지 프롬프트가 못 끌어낸 것인지는 자기 분석으로 구분할 수 없다고 본문에 적혀 있다. 긴 글 읽어 주셔서 감사하다.
참고문헌
목록은 세 묶음이다. 1번부터 3번까지는 이 글의 뼈대가 된 논문 세 편으로, 셋 다 전문을 직접 읽고 옮겼다. 4번부터 13번까지는 문화 평가 쪽 선행 연구인데, 이 가운데 8번부터 12번까지는 서지만 확인했고 결론 방향은 읽지 않았으므로 본문에서 그 결론을 인용하지 않았다. 14번부터는 1차 문서와 통계, 그리고 이 글이 이어 붙인 우리 글이다.
학술
- 1.Eriksson, K., Vartanova, I., & Strimling, P. (2026). "Large language models underestimate and partly misrepresent cultural variation in everyday norms." arXiv:2609.30896v1 (2026-09-25), CC BY 4.0. 이 글의 1차 출처. 전문 열람. arxiv.org/abs/2609.30896
- 2.Eriksson, K., Karlsson, N., Vartanova, I., & Strimling, P. (2026). "Large language models outperform humans at estimating society's everyday norms." Communications AI & Computing 1(1):15. doi 10.1038/s44488-026-00018-8. 2절·3절의 대조축. 전문 열람.
- 3.Eriksson, K., Strimling, P., Vartanova, I., Simpson, B., Persson, C. 외 (2025). "Everyday norms have become more permissive over time and vary across cultures." Communications Psychology 3(1):66. doi 10.1038/s44271-025-00324-4. 일상 규범 국제조사(GSEN) 원논문이며 이 글의 정답지. 사전등록 osf.io/qz82x. 전문 열람.
- 4.Rao, A., Yerukola, A., Shah, V., Reinecke, K., & Sap, M. (2025). "NormAd: A Framework for Measuring the Cultural Adaptability of Large Language Models." NAACL 2025, 2373–2403.
- 5.Chiu, Y. Y. 외 (2025). "CulturalBench: A Robust, Diverse, and Challenging Benchmark for Measuring LLMs' Cultural Knowledge." 문항 1,696개, 45개 지역.
- 6."BLEnD: A Benchmark for LLMs on Everyday Knowledge in Diverse Cultures and Languages." NeurIPS 2024 Datasets & Benchmarks Track. 16개 국가·지역, 13개 언어, 문답쌍 52.6k.
- 7.Lee, J., Kim, M., Kim, S., Kim, J., Won, S., Lee, H., & Choi, E. (2024). "KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge." Findings of ACL 2024, 11177–11213. arXiv:2402.13605.
- 8.Ramezani, A., & Xu, Y. (2023). "Knowledge of cultural moral norms in large language models." ACL 2023, 428–446. [서지만 확인 — 결론 방향 미확인]
- 9.Tao, Y., Viberg, O., Baker, R. S., & Kizilcec, R. F. (2024). "Cultural bias and cultural alignment of large language models." PNAS Nexus 3(9), pgae346. [서지만 확인]
- 10.Zhao, W. 외 (2024). "WorldValuesBench: A Large-Scale Benchmark Dataset for Multi-Cultural Value Awareness of Language Models." LREC-COLING 2024, 17696–17706. [서지만 확인]
- 11.Bulté, B., & Rigouts Terryn, A. (2026). "LLMs and cultural values: the role of prompt language and explicit cultural framing." Computational Linguistics 52(2), 407–494. [서지만 확인]
- 12.Adilazuarda, M. F. 외 (2024). "Towards Measuring and Modeling 'Culture' in LLMs: A Survey." EMNLP 2024, 15763–15784. 1번 논문이 저속성 설명의 근거로 인용한 서베이. [서지만 확인]
- 13.Gelfand, M. J. 외 (2011). "Differences between tight and loose cultures: a 33-nation study." Science 332(6033), 1100–1104. 행동 12가지와 상황 10가지, 그리고 2000년대 초 비교 자료의 출처. 원논문 표는 유료 게재본이라 열지 못했다.
1차 문서·통계
- 14.OpenAI (2025). GPT-5 System Card, §3.11 Multilingual Performance 및 Table 11. arXiv:2601.03267v2로도 배포. 5절의 한국어 점수와 "문화" 낱말 부재는 이 문서 전문을 평문으로 추출해 확인했다.
- 15.Common Crawl Foundation. 크롤 언어 통계 CC-MAIN-2026-39 (CLD2 언어 감지 기준). commoncrawl.github.io
- 16.Wikimedia Foundation. List of Wikipedias. 영어판·한국어판 문서 수. meta.wikimedia.org
- 17.저자 재현 연구 저장소 osf.io/jzhqu (열람 전용 링크, 게재 확정 시 공개 예정). 8절의 규범 엄격도 값은 이 저장소에 동봉된 GSEN 사회 단위 집계 파일에서 읽었다. 사전등록 2건: osf.io/d7km9 (2025-09-11, GPT-5 단독 탐색), osf.io/w3fxd (2026-04-13, 3모델 확증).
- 18.과학기술정보통신부 2025년 4분기 조사(만 19~69세 2,500명) 및 국내 AI 산업 외산 모델 의존 보도(아주경제 2026-09-19). 8.3절의 두 지표 출처이며, 분모와 측정 방식이 서로 다르다.
페블러스 인접 글
- 19.페블러스. "AI가 대신 답한 설문, 평균은 맞고 사람은 사라진다". report/llm-survey-twin-validation-gap
- 20.페블러스. "정체성 두 개를 준 합성 응답자가 하나만 썼다". report/synthetic-persona-intersectional-collapse
- 21.페블러스. 안전 데이터셋의 언어·지역별 결손을 세어 본 감사. report/safety-dataset-language-slice-audit-2026-08
- 22.페블러스. 한국어 산출물의 어색함이 모델을 바꿔도 남는 이유. report/korean-ai-humanizer-teardown-2026-08