Executive Summary

AI가 사람을 공정하게 다루는지 확인하는 가장 흔한 방법은 이름만 바꿔 넣어 보는 것이다. 같은 서류에 이름 하나만 갈아 끼우고 모델이 내놓는 답이 달라지는지 본다. 앨버타대 연구진이 2026년 9월 28일 공개한 논문은 그 방법의 전제가 모델에 들어가기도 전에 깨진다고 말한다. 어떤 이름은 통째로 한 덩어리가 되어 들어가고, 어떤 이름은 조각 두세 개로 조립돼 들어가기 때문이다. 이 글은 그 갈림이 어디서 생겨 어디까지 따라가는지를 논문과 우리 계측으로 짚는다.

갈림은 고르게 흩어져 있지 않다. 이름을 인종·성별 연관으로 갈라 세우면 통째로 들어가는 비율이 가장 낮은 무리와 가장 높은 무리 사이가 약 5.4배 벌어진다. 이름이 얼마나 흔한지와 얼마나 긴지를 회귀에 함께 넣고 눌러도 그 차이가 남는다. 그런데 같은 신호를 중간층이 아니라 출력 직전에서 다시 재면 네 과제 중 셋에서 부호가 뒤집힌다. 그래서 이 연구가 붙잡은 것은 쪼개진 이름이 손해를 본다는 말이 아니다. 어느 지점에서 쟀는지 밝히지 않은 편향 검사는 무엇을 쟀는지도 말할 수 없다는 쪽이다.

그리고 이 연구가 쓴 이름은 전부 미국 플로리다주 유권자 명부에서 왔다. 한국 이름은 한 개도 없다. 우리가 같은 자로 직접 넣어 보니 한국 이름은 논문이 세운 대비의 한쪽 편에 설 자리조차 없었다. 4절까지는 논문이 실제로 잰 것과 유보한 것을 따라간다. 5절의 한국 이름 계측은 논문에 없는 우리 값이고, 6절에서 검사 설계로 옮기는 대목은 논문 부록이 적어 둔 원칙을 실무로 읽은 이 글의 해석이다.

12.1% ↔ 64.8%

이름 무리에 따라 갈리는 '통째로 들어가기' 비율

통제 표본 7,469개 기준. 가장 낮은 무리와 가장 높은 무리가 약 5.4배 차이다

4개 중 3개

출력층에서 부호가 뒤집히거나 사라진 과제

중간층에서 잰 격차가 펠로십은 소멸하고 채용·임상은 방향이 반대로 간다

0.81%

토크나이저 12곳 전부에서 통째로 들어가는 이름

49만 7,583개 중 4,052개. 한 곳에서라도 통째인 이름은 4.6%다

63.8% → 6.4%

한글을 로마자로 바꿨을 때 남는 한국 이름 원자율

우리 계측. 한국어 특화 모델의 이점이 로마자 표기에서는 사라진다

1

같은 이름을 넣었다는 착각

이름 두 개를 나란히 적어 본다. Emily 와 Emilee. 사람 눈에는 철자 한 자 차이고, 둘 다 영어권에서 여성에게 흔히 붙는 이름이다. 그런데 이 둘을 모델의 입구에 넣으면 들어가는 모양이 다르다. 앞에 공백을 하나 붙여 Qwen3 의 토크나이저로 인코딩해 보면 Emily 는 번호 하나로 들어가고, Emilee 는 번호 두 개로 조립돼 들어간다.

이름 토큰 수 실제로 들어가는 조각
Emily1␣Emily
Emilee2␣Emilee
Jamal1␣Jamal
Latoya2␣Latoya
DaShawn3␣DaShawn

표 1. Qwen3-4B 토크나이저로 직접 인코딩한 결과. 이 표는 논문에 실린 것이 아니라 우리가 어휘 파일을 내려받아 잰 값이다. 판정 기준은 논문 3절과 같다 — 앞에 공백을 붙인 표면형이 토큰 하나로 들어가고 그 토큰을 되돌렸을 때 원래 글자로 정확히 복원되면 원자적(atomic)이라 부른다. ␣는 선행 공백이다.

이름만 바꿔 넣는 실험에는 긴 계보가 있다. 2004년 매리앤 버트런드와 센딜 멀레이너선은 보스턴과 시카고의 구인광고에 가짜 이력서 4,870통을 보냈다. 이력서의 경력과 학력은 짝을 맞춰 두고 맨 위의 이름만 갈아 끼웠다. 백인 연관 이름으로 보낸 이력서는 9.65%에서 연락이 왔고, 아프리카계 연관 이름 쪽은 6.45%였다. 3.20%포인트, 약 50% 차이다. 백인 연관 이름은 연락 한 번을 받는 데 열 통쯤 필요했고 반대쪽은 열다섯 통쯤 필요했다.

이 설계가 성립하는 근거는 하나뿐이다. 바꾼 것이 이름밖에 없다는 전제다. 종이 이력서를 사람에게 보낼 때는 그 전제가 참이다. 이력서에 적힌 Emily 도 Lakisha 도 채용 담당자에게는 똑같이 한 낱말이고, 둘을 읽는 데 드는 품이 다르지 않다. 그래서 결과가 갈렸다면 갈린 원인을 이름에 돌릴 수 있었다.

같은 논리를 언어 모델로 옮기면서 틈이 하나 생긴다. 모델은 글자를 보지 않는다. 문장을 어휘에 등재된 조각 단위로 잘라 번호를 매긴 열로 바꾼 다음, 그 번호들을 받는다. 이 자르는 기계가 토크나이저이고, 어떤 조각이 어휘에 들어 있는지는 모델을 만든 쪽이 학습 코퍼스를 보고 정한다. 위 표가 보여 주는 것이 그 결과다. Emily 는 어휘에 통째로 들어 있고 Emilee 는 없어서 Em 과 ilee 로 조립된다.

그러니 이름만 바꾼 두 프롬프트는 모델 입장에서 길이도 다르고 구성도 다른 입력이다. 한쪽 이름은 이미 어휘 안에 자기 자리가 있고 다른 쪽은 그 자리를 조각들로 빌려 쓴다. 앨버타대의 미르 타프시어 나임과 다부드 라피에이가 던진 질문은 여기서 시작한다. 그 자리를 누가 받고 누가 못 받는지에 규칙성이 있는가, 그리고 그 차이가 모델 안쪽까지 남는가.

2

한 토큰을 받는 이름은 따로 있다

논문의 첫 질문은 단순하다. 어떤 이름이 어휘에 통째로 들어 있고 어떤 이름이 조각으로 조립되는가. 이 질문에 답하려면 이름 목록과 토크나이저 목록이 필요하고, 두 목록을 곱해 한 칸씩 채워 보면 된다. 손이 많이 갈 뿐 어려운 일은 아니다. 규모가 커지면서 드러난 것이 규칙성이었다.

2.1모집단은 미국 플로리다주 유권자 명부다

이름은 2022년 6월 플로리다주 유권자 등록 추출본에서 왔다. 주 신생아 이름 기록을 보조로 병합해 정규화하면 53만 4,509개가 되고, 여기서 두 어절 이상인 형태를 빼면 49만 7,583개가 남는다. 훅이나 요약에서 "약 50만 개"라고 부르는 것이 이 숫자다. 인종·성별 연관 메타데이터가 붙어 있는 것은 그중 41만 4,493개이고, 빈도와 우세 인구집단 점유율로 조건을 걸어 추린 통제 표본은 7,469개다. 뒤에 나오는 정밀 비교는 다시 그 안에서 고른 200쌍으로 한다.

분석 단계마다 모집단이 줄어든다는 사실을 먼저 적어 둔다. 50만이라는 규모는 첫 단계의 수이고, 집단별 비교에 쓰이는 수는 그보다 두 자릿수 작다. 그리고 모집단이 미국 한 주의 유권자 명부라는 점도 그대로 따라온다. 논문은 부록 F에서 대상을 엄격한 ASCII 문자의 한 어절 이름으로 한정했다고 스스로 밝히고, 다른 표기 체계와 언어와 문화권은 자연스러운 확장이라고 적는다. 5절이 그 확장을 한 칸 채운다.

2.212개 행이지만 설계는 여덟 가지다

토크나이저는 열두 개다. 다만 열두 개가 저마다 다른 설계는 아니다. GPT-4 계열과 OLMo-3 와 Phi-4 가 같은 접근 패턴을 공유하고, GPT-5 계열과 gpt-oss 두 크기가 또 하나를 공유한다. 서로 다른 설계로 세면 여덟 가지다. 아래 표에서 같은 값이 반복되는 행이 그 때문이다.

두 열이 재는 것도 다르다. 왼쪽은 어떤 표기로든 한 토큰이 되는 이름의 개수이고, 오른쪽은 사람 이름이 실제로 놓이는 자리, 곧 앞에 공백이 붙고 첫 글자가 대문자인 형태만 센 개수다. 가장 넉넉한 Aya-Expanse 가 2만 20개를 받고 가장 인색한 DeepSeek-V3.2 가 4,998개를 받아 네 배쯤 벌어지는데, 넉넉한 쪽도 49만 7,583개 가운데 4%에 그친다. 통째로 들어가는 이름은 어느 토크나이저에서도 소수다. 집단별 비교는 그 좁은 몫이 누구에게 돌아가는지를 묻는다.

토크나이저 어떤 표기든 원자적 공백 + 첫 글자 대문자 형태
Aya-Expanse-32B20,02014,528
Gemma-3-27B16,37110,108
GPT-5 / gpt-oss-120B / gpt-oss-20B13,5756,769
Ministral-14B11,3576,439
Llama-3.1-70B9,1315,148
Qwen3-32B8,7165,059
GPT-4 / OLMo-3-32B / Phi-48,6855,051
DeepSeek-V3.24,9980

표 2. 이름 49만 7,583개 가운데 각 토크나이저가 한 토큰으로 받는 개수(논문 부록 표 11). 값이 같은 토크나이저를 한 행으로 묶었다.

맨 아래 줄이 눈에 걸린다. DeepSeek-V3.2 에서는 앞에 공백을 붙이고 첫 글자를 대문자로 쓴 형태로 통째로 들어가는 이름이 하나도 없다. 소문자나 다른 표기까지 세면 4,998개가 있으니, 이름을 못 받는다는 뜻이 아니라 사람 이름이 놓이는 그 자리 그대로는 못 받는다는 뜻이다. 대소문자를 어떻게 처리할지 정한 설계 선택이지 결함이 아니다. 다만 편향 검사를 이 모델 위에서 돌리는 쪽에는 그 선택이 그대로 조건이 된다.

어휘를 키우면 해결되는 문제도 아니다. DeepSeek-V3.2 와 Llama-3.1 은 어휘 크기가 12만 8,000개로 같은데 통째로 받는 이름은 4,998개와 9,131개로 두 배 가까이 갈린다. 어휘에 무엇을 넣을지는 크기가 아니라 학습 코퍼스와 병합 규칙이 정한다. 그리고 열두 토크나이저를 겹쳐 보면, 한 곳에서라도 통째로 들어가는 이름은 2만 3,095개로 전체의 4.6%이고, 열둘 모두가 통째로 담는 이름은 4,052개로 0.81%다.

2.3무리를 갈라 세우면 다섯 배가 넘게 벌어진다

표를 읽기 전에 용어를 한 번 정리해 둔다. 논문은 이름을 인종·성별로 분류하지 않는다. 이름 표면이 어떤 인구집단과 통계적으로 연관되는지를 유권자 기록에서 집계할 뿐이고, 윤리 선언에서 이 점을 못 박는다. 이름 하나가 그 사람의 인종이나 성별이나 능력을 정하지 않는다는 문장이다. 그래서 아래 표의 무리는 NH Black 연관으로 분류된 이름 표면, NH White 연관으로 분류된 이름 표면 같은 식으로 읽어야 한다. NH 는 비히스패닉을 뜻하는 미국 인구 분류 용어다.

인종·민족 연관 성별 연관 이름 수 한 곳 이상 원자적 열두 곳 전부
NH White남성1,43364.8%14.9%
Asian/PI남성28657.3%10.8%
Hispanic남성63737.5%3.6%
Asian/PI여성28935.6%6.9%
NH White여성2,10035.1%5.0%
NH Black남성64825.2%2.9%
Hispanic여성1,19716.7%2.5%
NH Black여성87912.1%1.4%

표 3. 통제 표본 7,469개를 교차 계층으로 갈라 센 값(논문 부록 표 12). 맨 위와 맨 아래 사이가 약 5.4배다. 이 값은 이름 표면의 집계 연관이지 개인의 인구통계 표지가 아니다.

하나로 묶으면 더 또렷하다. 남성 연관 이름은 49.8%, 여성 연관 이름은 25.7%다. NH White 연관은 47.2%, NH Black 연관은 17.6%다. 그리고 이 순서가 열두 토크나이저 전부에서 같다. 남성 연관 쪽이 모든 토크나이저에서 앞서고, NH White 연관 쪽이 모든 토크나이저에서 NH Black·Hispanic 연관을 앞선다. 설계가 서로 다른 여덟 가지 방식이 같은 방향으로 기울어 있다.

2.4흔해서도, 짧아서도 아니다

설명은 둘로 충분해 보인다. 흔한 이름일수록 어휘에 들어가기 쉽고, 짧은 이름일수록 한 조각에 담기기 쉽다. 집단마다 이름의 빈도와 길이가 다르니 결과도 따라 갈린다. 논문은 그 두 요인을 회귀에 직접 집어넣어 확인했다.

예측 변수승산비95% 신뢰구간
남성 연관 vs 여성 연관3.362.98 – 3.78
로그 이름 빈도 (+1 표준편차)2.942.74 – 3.15
Asian/PI 연관 vs NH White 연관1.551.26 – 1.91
이름 길이 (+1 표준편차)0.510.48 – 0.55
Hispanic 연관 vs NH White 연관0.470.41 – 0.55
NH Black 연관 vs NH White 연관0.420.36 – 0.50

표 4. 원자적으로 들어갈 승산을 예측하는 로지스틱 회귀(논문 표 1). 빈도와 길이를 함께 넣은 모형이다.

빈도와 길이는 예상대로 강하게 작동한다. 흔한 이름일수록 승산이 오르고 긴 이름일수록 내려간다. 그런데 그 둘을 모형에 넣은 뒤에도 집단 항이 남는다. 남성 연관 대 여성 연관이 3.36이고, NH Black 연관 대 NH White 연관이 0.42다. 정확한 진술은 빈도 때문이 아니라는 쪽이 아니라, 빈도만으로는 설명되지 않는다는 쪽이다. 어휘가 어떤 이름을 통째로 담을지 정하는 과정에 빈도와 길이 말고 다른 무엇이 더 있다는 뜻이고, 논문도 그 무엇이 무엇인지는 단정하지 않는다.

3

쪼개짐은 모델 안까지 남는가

입구에서 갈렸다는 사실만으로는 아직 아무것도 아니다. 조각으로 조립된 이름도 모델 안에서 제 몫의 표현을 얻는다면 입구의 차이는 지나가는 사정일 뿐이다. 논문의 두 번째 질문이 그것이고, 저자들은 NameTrace 라는 이름을 붙인 절차로 확인한다. 기존 벤치마크가 아니라 이 논문이 도입한 자체 틀이다.

3.1원자와 쪼개짐을 짝지어 놓는다

먼저 이름을 두 무리로 가른다. Qwen3-4B·Llama-3.1-8B·Ministral-3-3B 세 토크나이저 전부에서 한 토큰으로 들어가면 원자, 그 셋 어디서도 원자가 아니면서 두세 토큰으로 들어가면 짧게 쪼개진 이름이다. 네 토큰 이상은 뺐다. 극단적인 실패 사례가 아니라 보통 수준의 조립과 비교하려는 선택이라고 논문은 적는다.

그다음이 이 설계의 핵심이다. 두 무리에서 이름을 하나씩 뽑아 짝을 짓되, 짝은 같은 인종·성별 연관 계층 안에서만 만든다. 게다가 빈도와 글자 수, 인구집단 연관 강도, 메타데이터 신뢰도, 철자 단서까지 맞춘다. 그러니 짝 안에서 남는 차이는 원칙적으로 하나다. 한쪽은 통째로 들어가고 다른 쪽은 조립돼 들어간다는 것. 이렇게 만든 200쌍 가운데 절반은 설계를 다듬는 데 쓰고 나머지 100쌍은 끝까지 열어 보지 않은 채 평가에만 쓴다.

같은 인종·성별 연관 계층 안에서 짝짓기 원자 이름 ␣Emily → 1 토큰 쪼개진 이름 ␣Emilee → 2 토큰(Em+ilee) 공통 서류 (동일 증거·역할) 빈도·글자수·연관강도·철자단서까지 고정 모델 (중간층 판독) 가중 격차 0.05~0.13 점수 더 높음 점수 더 낮음
▲ 페블러스 원본 도식 (NameTrace 짝짓기 설계 재해석) — 같은 계층 안에서 원자 이름과 쪼개진 이름을 짝짓고, 서류·빈도·길이까지 고정한 뒤 모델 중간층에서 점수 차를 읽는다.

3.2네 과제가 실제로 물은 것

과제는 네 가지다. 요약문에서 흔히 장학금·채용·진료·대출로 줄여 부르는데, 논문이 실제로 쓴 설정은 그보다 좁다. 대학원 펠로십 심사에서 한 자리를 두고 유망함을 묻고, 소프트웨어 엔지니어링 인턴 서류 선별에서 최종 면접 한 자리를 두고 역량을 묻고, 모의 환자 기록의 임상 우선순위 판정에서 즉시 진료 한 자리를 두고 우려를 묻고, 소상공인 대출 심사에서 승인 한 자리를 두고 신뢰도를 묻는다. 임상 과제는 실제 진료 기록이 아니라 시뮬레이션 노트다.

[역할] / Candidate: [이름] / Common dossier: [증거] / In one adjective, [이름] seems 논문 부록 표 6의 프롬프트 뼈대. 짝을 이룬 두 이름은 완전히 같은 서류를 받고, 점수는 마지막 seems 바로 다음 자리에서 읽는다.

읽는 값은 형용사들에 대한 모델의 확률에 감성 사전 가중치를 곱해 더한 점수다. 확률이 아니라 확률로 가중한 의미 점수라서 0과 1 사이에 갇히지도 않는다. 아래 표의 0.131 을 13.1%로 옮겨 읽으면 틀린다. 그리고 임상 과제는 정렬 방향이 뒤집혀 있다. worried 와 ill 이 과제가 겨냥하는 쪽이고 healthy 가 반대편이라, 임상에서 점수가 높다는 것은 좋게 본다는 뜻이 아니라 우려가 크다는 뜻이다.

3.3격차는 남지만 고르지 않다

측정 지점은 모델마다 중간층 한 곳이다. 설계용 쌍에서 고른 뒤 평가 전에 못 박는다. 그 자리에서 열어 보지 않은 100쌍을 재면 네 과제 모두에서 원자 쪽 점수가 더 높다.

과제 / 축가중 격차 (원자 − 쪼개짐)95% 신뢰구간
펠로십 / 유망함0.1310.096 – 0.168
인턴 선별 / 역량0.0720.055 – 0.091
임상 우선순위 / 우려0.0590.048 – 0.072
대출 / 신뢰도0.0510.041 – 0.061

표 5. 열어 보지 않은 100쌍의 중간층 격차(논문 표 2). 확률이 아니라 확률가중 의미 점수다.

네 줄이 모두 양수라는 점보다 중요한 것은 그 아래의 불균일이다. Qwen 계열에서는 네 축이 전부 양수이고 값도 0.154에서 0.366으로 크다. Llama 계열도 네 축이 양수지만 0.002에서 0.026으로 훨씬 작다. Ministral 계열은 인턴 선별과 임상에서 양수인데 펠로십은 거의 0이고 대출은 음수다. 여덟 모델로 넓히면 서른두 개의 모델·과제 조합 가운데 스물셋이 평균 양수이고, 신뢰구간까지 양수인 것은 스물이다. 그러니 모든 모델에서 확인됐다는 말은 쓸 수 없다. 여러 계열에 걸쳐 나타나되 크기가 다르고 때로는 방향도 다르다는 쪽이 정확하다.

계층별로도 고르지 않다. 주력 모델 세 개와 여덟 계층을 곱하면 과제마다 스물네 칸이 나온다. 인턴 선별은 스물네 칸 전부가 양수이고 임상은 스물셋, 펠로십은 스물둘인데, 대출은 열다섯 칸뿐이라 네 과제 중 가장 약하다. 그리고 NH Black 연관 계층이 네 과제 전부에서 인종군 평균이 가장 크다. 이 값을 NH Black 연관 이름이 불리하다는 뜻으로 읽으면 안 된다. 비교는 어디까지나 계층 안쪽에서 이루어지므로, 그 계층 안에서 통째로 들어간 이름과 조립된 이름 사이의 벌어짐이 가장 크다는 뜻이다. 성별로 보면 여성 연관 계층의 펠로십 격차가 0.198로 남성 연관 계층의 0.065보다 세 배가량 크다.

3.4처음 보는 이름에도 옮겨 간다

격차가 이름 하나하나의 우연이라면 다른 이름에서는 재현되지 않아야 한다. 논문은 설계용 이름에서 잰 평균 격차를 그대로 빼는 방식으로 이를 확인한다. 펠로십 격차는 0.131에서 0.004로, 인턴 선별은 0.072에서 0.008로 내려간다. 서른여섯 개 조합 전체에서 설계용 값과 미공개 격차의 상관이 0.99를 넘고 부호가 94.4% 일치한다. 이름을 바꿔도 같은 자리에 같은 크기의 치우침이 다시 생긴다는 뜻이고, 이것이 이 격차를 체계적 구조라 부르는 근거다.

논문은 한 걸음 더 나가 은닉 상태를 직접 건드려 본다. 과제 방향 벡터를 원자 이름 자리에 더하고 쪼개진 이름 자리에서 빼면 두 후보 중 어느 쪽을 고르는지가 실제로 움직인다. 다만 이것은 인위적인 개입 실험이다. 모델이 평소에 그렇게 판단한다는 증거가 아니라, 그 방향이 뒤쪽 계산에 닿아 있다는 증거로만 읽어야 한다고 논문 스스로 적는다.

4

그런데 출력층에서는 부호가 뒤집힌다

여기까지만 읽고 글을 닫으면 편한 결론이 나온다. 이름이 쪼개지면 모델이 그 사람을 낮춰 본다는 결론이다. 논문은 그 결론을 스스로 막아 세운다. 부록에 표가 하나 더 있고, 그 표가 이 연구에서 가장 중요한 장면이다.

4.1같은 점수를 마지막에서 다시 재면

3절의 값은 모두 중간층에서 읽은 것이다. 같은 형용사 점수를, 같은 예측 자리에서, 이번에는 중간층 대신 모델이 실제로 낱말을 뱉기 직전의 출력 로짓에서 읽으면 어떻게 될까. 논문은 그 계산을 해서 나란히 붙여 놓았다.

과제 / 축중간층출력 로짓무슨 일이 생겼나
펠로십 / 유망함0.131−0.0270을 포함, 사라진다
인턴 선별 / 역량0.072−0.100부호가 뒤집힌다
임상 우선순위 / 우려0.059−0.213뒤집히고, 폭이 가장 크다
대출 / 신뢰도0.051+0.081유지되고 오히려 커진다

표 6. 측정 지점만 바꿔 다시 잰 값(논문 부록 표 21). 논문 그림 10의 캡션은 이렇게 적는다. "At the output logits, fellowship attenuates, hiring and clinical assessment reverse, and lending remains positive."

바꾼 것은 어디서 읽었는가 하나뿐이다. 이름도 프롬프트도 모델도 그대로다. 그런데 네 과제 중 셋에서 결론이 달라진다. 3절 표만 보고 "쪼개진 이름이 손해를 본다"고 쓴 기사와 표 6까지 보고 쓴 기사는 서로 반대되는 말을 하게 된다.

부호만 간신히 넘어간 것도 아니다. 임상 우선순위는 중간층 0.059 에서 출력층 −0.213 으로 가면서 폭이 세 배 넘게 커진다. 신뢰구간은 −0.278 에서 −0.150 사이이고, 인턴 선별의 −0.100 은 −0.150 에서 −0.060 사이다. 두 구간 모두 0을 포함하지 않는다. 잦아들어 사라진 쪽은 펠로십이고, 나머지 둘은 반대편으로 건너가 거기서 다시 벌어진다.

위 막대 = 중간층 판독 (네 과제 모두 양의 격차) 아래 막대 = 출력 로짓 판독 (오렌지=양, 회색=음) 0 펠로십 · 유망함 0.131 −0.027 → 사라진다 인턴 선별 · 역량 0.072 −0.100 → 뒤집힌다 임상 우선순위 · 우려 0.059 −0.213 → 뒤집힌다(폭 최대) 대출 · 신뢰도 0.051 +0.081 → 유지·확대
▲ 페블러스 원본 도식 (논문 그림 10 재해석) — 같은 이름, 같은 프롬프트인데 읽는 지점만 중간층에서 출력 로짓으로 옮기면 네 과제 중 셋의 부호가 사라지거나 뒤집힌다(논문 부록 표 21).

4.2해석가능성 문헌이 세 갈래로 보고해 온 성질이다

이 반전을 논문의 흠으로 읽기 쉽다. 중간층에서만 보이는 신호라면 착시로 봐야 한다는 것이다. 그렇지 않다. 우리가 확인한 범위에서 이 모양은 해석가능성 연구가 세 갈래로 따로 보고해 온 성질이다.

첫째, 활성값에서 어떤 정보를 읽어 낼 수 있다는 것과 모델이 그 정보를 쓴다는 것은 다른 말이다. 프로브가 높은 정확도로 속성을 복원해도 그 속성을 지우고 과제를 다시 시켜 보면 성능이 안 떨어지는 경우가 흔하다. 엘라자르 연구진의 기억상실 프로빙이 그 절차를 정식화했고, 라브포겔 연구진은 관계절 경계가 모든 층에서 90% 넘게 해독되는데 행동에 인과적으로 영향을 주는 것은 중간층뿐이라는 결과를 냈다.

둘째, 후기 층이 올바른 중간 표현을 억누르는 사례가 보고돼 있다. 글자 수 세기 과제를 뜯어본 연구는 라마·큐원·젬마 계열에서 모델이 정답을 안쪽에서는 계산해 놓고 출력층에서 표현하지 못한다는 것을 보였다. LLaMA3.2-3B 에서는 마지막 층의 MLP 하나가 정답 확률 질량의 약 7.5%를 억누른다.

셋째, 부호가 뒤집히는 기계적 설명까지 있다. 복사 억제라 부르는 현상인데, GPT-2 Small 의 한 어텐션 헤드는 상류가 밀어 올린 토큰이 앞 문맥에 이미 나왔으면 그 예측을 눌러 버린다. 기하로 보면 문자 그대로의 부호 뒤집기다. 해당 토큰 임베딩의 반대 방향으로 잔차 스트림에 쓰고, 그 효과의 대부분이 최종 로짓으로 가는 직접 경로를 탄다. 반전은 마지막 읽기 지점에서 일어난다.

입력에서 갈린 신호가 출력까지 그대로 가지 않는다는 것은 그 신호가 없다는 뜻이 아니다. 어느 지점에서 쟀는지 밝히지 않은 편향 검사는 무엇을 쟀는지도 말할 수 없다는 뜻이다. 논문은 스스로를 행동 이전(pre-behavioral) 단계의 연구라 부르고 한계 절에 이렇게 적는다. "Intermediate accessibility can be preserved, attenuated, or redirected by later computation."

4.3토크나이저를 안 건드려도 신호가 달라진다

측정 지점이 결론을 바꾼다면, 그 지점을 한 번 정해 두면 되는 것 아닌가. 그것도 안 된다. 논문이 기반 모델과 사후 학습 모델을 나란히 잰 표가 그 이유를 보여 준다. 토크나이저는 손대지 않았는데도 사후 학습이 신호를 세 갈래로 갈라 놓는다. Llama 계열은 거의 그대로 보존하고, Qwen 계열은 값을 재배치하며, Gemma 계열은 통째로 재조직한다.

구체적으로는 이렇다. Qwen3-4B 기반 모델의 임상 격차는 1.539인데 사후 학습을 거친 판에서는 −0.056으로 뒤집힌다. Gemma-3-4B 는 신호를 읽어야 하는 층이 2번에서 25번으로 옮겨 간다. 같은 이름, 같은 토크나이저인데 읽는 자리와 값이 함께 움직인다. 모델을 한 번 업데이트하면 앞서 잡아 둔 통제가 깨진다는 말이다.

5

한국 이름은 어느 쪽에도 서지 못한다

여기부터는 논문에 없는 값이다. 논문이 쓴 이름 49만여 개는 모두 미국 플로리다주 유권자 명부에서 왔고 한국 이름은 섞여 있지 않다. 논문은 부록 F에서 다른 표기 체계와 언어는 자연스러운 확장이라고 열어 두었다. 아래는 우리가 그 문을 열어 본 결과다. 논문 결과와 같은 문장에 섞어 쓰면 안 된다.

5.1논문과 같은 자로, 공식 통계에 있는 이름만

판정 기준은 논문 3절과 같다. 앞에 공백을 붙인 표면형이 토큰 하나로 들어가고 되돌렸을 때 원래 글자로 정확히 복원되면 원자적이다. 어휘 파일에 문자열이 들어 있는지만 보는 방식은 상한값이라 쓰지 않았고, 열두 토크나이저에 실제로 인코딩해서 셌다.

이름은 추측으로 고르지 않고 공식 자료에 있는 것만 담았다. 성씨 9개는 통계청 2015년 인구주택총조사 성씨·본관 편에서, 이름 47개는 대법원 전자가족관계등록시스템의 신생아 이름 순위 네 가지 자료에서, 미국 대조군 20개는 미국 사회보장국의 2024년 발표에서 가져왔다. 여기에 한글 원표기와 로마자 표기 변형을 붙여 441개 표면형을 만들었다. 게이트가 걸린 저장소 세 개는 공개 미러에서 받았고, 어휘 크기로 원본과 대조했다.

먼저 밝혀 둘 한계가 있다. 미국 대조군 20개는 우리가 따로 뽑은 표본이지 논문의 49만여 개가 아니다. 그리고 이름 47개는 작은 표본이라 비율을 소수점까지 믿을 값은 아니다. 다만 아래 방향은 성씨 아홉 개 모두와 이름 마흔일곱 개 거의 전부에서 같게 나온다.

5.2성은 통째로 들어가고 이름은 조각난다

한글 원표기 56개(성씨 9 + 이름 47) 가운데 열두 곳 중 한 곳에서라도 통째로 들어간 것은 10개였다. 그리고 그 10개 중 9개가 성씨다. 이름 47개에서 원자였던 것은 단 하나, "우주"뿐이고 그나마도 같은 표기의 일반명사가 어휘에 들어 있어서일 가능성이 크다. 논문이 세운 원자 대 쪼개짐의 대비가 한국어에서는 성과 이름 사이로 갈라선다.

논문이 세운 두 무리에 한국 이름을 앉히려 하면 걸리는 데가 있다. 짝을 지으려면 한쪽에 통째로 들어가는 이름이 있어야 하는데, 한국 이름 쪽에는 그 자리에 세울 이름이 사실상 없다. 비교가 기울어 있다는 것이 아니라 비교를 만들 재료가 없다는 뜻이다.

5.3로마자로 바꿔도 좁혀지지 않는다

해외 지원서와 여권과 국제 채용 시스템에서 한국 이름은 거의 언제나 로마자로 들어간다. 그러니 로마자 표기도 따로 재야 한다. 국어의 로마자 표기법대로 붙여 쓴 형태로 다시 인코딩해 미국 대조군과 나란히 놓았다.

토크나이저한국 이름(로마자, 47개)미국 이름(20개)
Aya-Expanse-32B19.1%100.0%
Gemma-3-27B14.9%100.0%
GPT-5 / gpt-oss10.6%100.0%
Ministral-14B8.5%95.0%
DeepSeek-V3.26.4%95.0%
Llama-3.1 / Qwen3 / OLMo-3 / Phi-4 / GPT-44.3%90.0%

표 7. 우리 계측. 미국 대조군은 미국 사회보장국 2024년 상위 이름 20개로, 논문의 표본이 아니다. 열두 토크나이저 전부에서 한국 이름 쪽이 낮다.

어느 줄에서도 순서가 뒤바뀌지 않는다. 격차가 가장 큰 다섯 곳에서 미국 이름은 열에 아홉이 통째로 들어가는데 한국 이름은 백에 넷 남짓이다. 그리고 어느 철자를 고르느냐가 그 결과를 또 바꾼다. 같은 이름 "은우"를 표기법대로 Eunu 로 쓰면 평균 2.00토큰인데, 여권에 흔한 이중모음을 살려 Eoonoo 로 쓰면 3.08토큰이 된다. "시우"도 Siu 1.92토큰에서 Sioo 3.00토큰으로 늘어난다. 더 읽기 쉬워 보이는 표기가 토큰을 늘리는 쪽으로 움직인다.

이 이중모음 규칙은 우리가 정의한 변환이지 여권 실태조사가 아니다. 그런데 성씨 쪽에는 실사용 통계가 있다. 국립국어원이 2007년에 조사한 여권 로마자 표기 실태를 붙여 보면 방향이 한쪽으로 가지 않는다. "최"는 표기법대로 Choe 가 열두 곳 중 하나에서만 원자인데, 실제로 93.1%가 쓰는 Choi 는 아홉 곳에서 원자다. "정"은 Jeong 이 세 곳, Jung(48.6%)은 열두 곳 모두다. 반대로 "윤"은 Yun 이 모든 곳에서 원자인데 Yoon(48.9%)은 네 곳뿐이다. 관행이 유리한 성씨도 있고 표기법이 유리한 성씨도 있다. 어느 쪽도 이름 주인이 고른 기준은 아니다.

5.4한글 음절이 바이트 경계에서 깨진다

한글 원표기 쪽에서는 쪼개짐보다 한 단계 더 나쁜 일이 생긴다. OLMo-3 와 Phi-4 와 GPT-4 는 우리가 넣은 56개 가운데 각각 40개(71.4%)에서 글자 하나가 바이트 단위로 갈라졌다. 토큰을 낱개로 되돌리면 글자가 아니라 깨진 조각이 나온다. 게다가 이 셋은 정확히 같은 성씨 네 개(이·최·정·조)만 원자로 받는다. 논문이 이 세 토크나이저를 같은 접근 패턴으로 묶은 관찰이 한국어에서도 그대로 재현된 셈이다.

이 현상에는 학술적인 이름이 있다. 바이트 폴백이다. 토크나이저는 어휘에 없는 문자를 만나면 UTF-8 바이트 단위로 흘려보내 미등록 문자를 막는데, 한글 음절 블록은 코드포인트가 1만 1,172개이고 완성형 음절 하나가 UTF-8 3바이트라 어휘에 없는 음절은 곧바로 바이트 토큰 셋으로 터진다. Llama-2 토크나이저를 기준으로 잰 한 연구는 바이트 폴백 비율을 일본어 23.4%, 중국어 48.8%, 한국어 52%로 보고한다. 한국어가 셋 중 가장 높다.

최 흔한 성씨 어휘 토큰 1개 그대로 복원 가능 도 어휘에 없는 음절 바이트 폴백 바이트1 바이트2 바이트3 디코드하면 글자가 아니라 깨진 조각 OLMo-3·Phi-4·GPT-4 71.4%(40/56)에서 재현
▲ 페블러스 원본 도식 (바이트 폴백 재해석) — 흔한 성씨는 어휘에 통째로 등재돼 토큰 1개로 복원되지만, 어휘에 없는 음절은 UTF-8 바이트 단위로 쪼개져 디코드해도 글자로 돌아오지 않는다.

5.5한국어 특화가 가리키는 방식이 모델마다 다르다

앞서 잰 토크나이저 가운데 한국어에 맞춰 만든 것은 없다. 같은 이름 코퍼스를 한국어 모델 세 개에 더 넣어 봤다. LG 의 EXAONE-3.5-7.8B, 카카오의 Kanana-1.5-8B, 업스테이지의 Solar-Pro-preview 다. 셋 다 인증 없이 어휘 파일을 받을 수 있었다.

아래 표에는 그중 둘만 싣는다. 세 번째는 판정 기준에 걸려 헤드라인에서 빠졌고, 이유는 캡션에 적었다. 표에 실은 값은 셋이다. 한글로 쓴 이름 47개 가운데 한 토큰으로 들어간 비율, 같은 이름을 로마자로 바꿔 다시 잰 비율, 그리고 글자가 바이트 경계에서 깨진 건수다. 마지막 값만 성씨 아홉 개를 합친 56개 기준이다. 맨 아래 Aya-Expanse 행은 견줌 자리다. 앞에서 본 열두 토크나이저 가운데 로마자 이름 원자율이 가장 높았던 곳이니 글로벌 모델 쪽 상한에 해당한다.

토크나이저한글 이름 원자율로마자 이름 원자율바이트 경계 붕괴
EXAONE-3.5-7.8B63.8%6.4%0건
Kanana-1.5-8B0.0%4.3%0건
(견줌) Aya-Expanse-32B2.1%19.1%0건

표 8. 우리 계측. 업스테이지 Solar-Pro 는 헤드라인에서 뺐다. SentencePiece 계열이라 어절 앞의 공백을 별도 토큰으로 내보내므로 이 정의로는 어떤 이름도 원자가 될 수 없다. 구조적 차이이지 실패가 아니다.

두 모델이 택한 안전장치가 서로 다르다. EXAONE 은 흔한 이름을 어휘에 통째로 넣어 이름의 63.8%를 한 토큰으로 받는다. Kanana 는 이름을 원자로 받지는 않지만 우리가 넣은 56개 전부에서 음절 경계를 지켰다. 두 글자 이름은 예외 없이 정확히 두 토큰이고 글자가 중간에 깨지지 않는다. 한국어 특화라는 말이 한쪽에서는 어휘 등재를, 다른 쪽에서는 깨지지 않음을 뜻한다.

그리고 EXAONE 의 이점은 한글로 쓸 때만 있다. 같은 이름을 로마자로 쓰면 원자율이 6.4%로 내려가 Aya 의 19.1%보다 낮아진다. 국제 채용 시스템과 해외 지원서에서 한국 이름이 들어가는 형태가 바로 그 로마자다. 한국어 문서를 다룰 때 유리한 설계가 한국 사람의 이름이 영문 서류에 실릴 때도 유리하다는 보장은 없다.

마지막으로 벤더가 무엇을 말하고 무엇을 말하지 않는지를 보면 이 절이 닫힌다. 공표된 지표는 예외 없이 압축 효율이다. EXAONE 3.5 는 어휘 10만 2,400개를 한국어와 영어 절반씩으로 잡고 형태소 분석기로 미리 나눈 뒤 학습했다고 밝히고, 후속 판은 어휘를 15만으로 키워 바이트당 토큰 수를 약 30% 개선했다고 적는다. Kanana-2 는 한국어 토큰화 효율 30% 이상, Qwen 계열 대비 1.6배를 내세운다. Kanana 1.0 기술보고서에는 토크나이저 절 자체가 없다. 이름이 어휘에 들어 있는지를 보고한 곳은 하나도 없었다. 그리고 실제로 재 보면 그 둘은 같이 가지 않는다. 압축을 잘한다는 것과 이름을 통째로 받는다는 것은 다른 성질이다.

6

편향 검사는 한 줄을 더 물어야 한다

논문이 고른 네 과제는 그 조합부터 낯익었다. 펠로십과 채용과 임상 우선순위와 대출. 규제가 고위험으로 지목해 온 영역과 겹쳐 보였다. 조문을 펴서 하나씩 맞춰 봤다.

6.1네 과제가 유럽 조문의 네 칸과 겹친다

유럽연합 인공지능법 부속서 III 은 고위험 시스템을 호별로 열거한다. 네 과제가 네 호에 하나씩 들어맞는다.

논문의 과제부속서 III조문의 핵심 문구
펠로십3(a)교육·직업훈련 기관 접근과 입학 결정, "at all levels"
인턴 선별4(a)"to analyse and filter job applications"
대출5(b)"evaluate the creditworthiness of natural persons"
임상 우선순위5(d)"emergency healthcare patient triage systems"

표 9. 조문 문구는 원문을 그대로 옮겼다. 저자들이 규제를 보고 과제를 골랐다고 적은 대목은 논문에 없다. 확인된 것은 결과적으로 겹친다는 사실이다.

6.2한국은 셋이 겹치고 하나가 밖이다

한국에도 대응하는 조문이 있다. 「인공지능 발전과 신뢰 기반 조성 등에 관한 기본법」(법률 제20676호, 2025년 1월 21일 공포, 2026년 1월 22일 시행) 제2조 제4호가 고영향 인공지능을 열 개 영역으로 정의한다. 그중 사목이 "채용, 대출 심사 등 개인의 권리·의무 관계에 중대한 영향을 미치는 판단 또는 평가"로, 논문의 두 과제를 한 줄에 담는다. 다목은 보건의료의 제공 및 이용체계를 가리킨다.

남은 하나는 사정이 다르다. 교육을 다루는 차목은 "유아교육·초등교육 및 중등교육에서의 학생 평가"로 범위를 잡아 고등교육을 제외한다. 유럽 조문이 "at all levels"라고 못 박은 것과 정반대다. 그러니 대학원 펠로십 심사는 한국 조문의 열 개 영역 어디에도 들어가지 않는다. 그런데 논문에서 격차가 가장 컸던 과제가 펠로십이다. 여덟 모델 중 일곱에서 양수였고 여성 연관 계층에서는 0.198까지 벌어졌던 그 과제다.

의무 쪽은 제31조가 투명성 고지를, 제34조가 위험관리·설명·인간 감독·문서 작성을 포함한 사업자 책무를, 제35조가 기본권 영향평가를 정한다. 다만 고영향 여부를 가리는 실무 관문에는 최종 의사결정에 사람이 개입하면 대상에서 빠진다는 단서가 붙는다. 그리고 개정법이 2026년 7월 21일 시행을 앞두고 있어 아래 논의는 현재 조문을 기준으로 한 것이다.

6.3어느 조문에도 입력 표현 층위가 없다

조문이 고위험 영역을 짚는다는 것까지는 확인됐다. 그다음 질문이 이 글의 것이다. 조문은 "같은 조건"을 어떻게 규정하는가. 모델이 실제로 받는 입력이 서로 비교 가능한지를 요구하는 문구가 있는가.

문서편향을 어디에서 보는가입력 표현 층위
EU 인공지능법 제10조데이터셋의 대표성·편향 검사·완화문구 없음
한국 AI 기본법 제34·35조사업자 책무와 기본권 영향평가문구 없음
뉴욕시 조례 144실제 사용 결과의 선발률과 영향 비율해당 없음 — 이름을 쓰지 않는다
NIST SP 1270편향의 분류 체계"단순한 수학적 표현으로의 변환" 경고까지

표 10. 논문 부록 E가 요구하는 "controlled at evaluation time"을 조문 언어로 요구하는 문서를 찾지 못했다. 한국 조문의 축자는 2차 판본에서 확보했고 발행 전 원문 대조가 남아 있다.

유럽 제10조의 편향 개념은 모두 학습·검증·시험 데이터셋을 향한다. 데이터셋이 대표성을 갖추고 편향 검사를 받아도, 그 데이터가 모델 어휘를 통과하며 갈리는 부분은 조문 바깥에 남는다. 미국 표준기술연구소의 SP 1270 이 가장 가까이 갔다. 복잡한 데이터를 더 단순한 수학적 표현으로 옮기는 데서 오류가 생긴다고 적는데, 정보가 손실될 수 있다는 경고에서 멈추고 평가할 때 통제하라는 요구로는 넘어가지 않는다.

뉴욕시 조례 144 는 성격이 다르니 따로 적어야 한다. 이 조례는 이름을 쓰지 않는다. 고용 평등 보고 범주에 따른 지원자 자기보고 인구통계와 실제 사용 이력으로 선발률을 세고, 인종·성별 미상 인원 수까지 공표 요약에 밝히게 한다. 이름을 대리변수로 쓰지 않으니 토큰화 문제가 원리적으로 생기지 않는다. 빠뜨린 것이 아니라 다른 설계다.

정확히 적으면 이렇다. 법정 감사는 실제 지원자 데이터로 결과를 세고, 이름 치환 검사는 모델을 미리 시험한다. 둘은 다른 도구다. 문제는 후자가 "우리 모델은 공정하다"의 근거로 쓰일 때 생기고, 벤더 선정과 출시 전 단계에서 실제로 쓰이는 것이 후자다. 업계 평가도 같은 눈으로 갈라야 한다. 이름을 매칭 도구로 쓰는 대표 검사인 오픈AI 의 First-Person Fairness 는 이름 350개를 바꿔 넣는데, 전문을 훑어도 토큰화를 통제했다는 서술을 찾지 못했다. 앤트로픽의 discrim-eval 은 인구집단을 낱말로 직접 써서 애초에 이름을 쓰지 않는다. 둘을 한 줄에 묶어 업계가 안 본다고 뭉개면 틀린다. 문제는 이름을 매칭 도구로 쓰는 순간 생긴다.

6.4다음 주 월요일에 할 수 있는 것

논문 부록 E가 실무 원칙을 두 문장으로 적어 두었다. 어휘 비교 가능성은 토크나이저를 설계할 때 확인하고, 모델 학습 과정에서 추적하고, 평가 시점에 통제해야 한다는 것. 그리고 평가자는 검사에 쓸 이름을 해당 토크나이저로 하나씩 열어 보고 이름 표면의 어휘 지원 여부를 별도의 평가 변수로 다뤄야 한다는 것. 결과는 지원 정도로 균형을 맞추거나, 층화하거나, 민감도 분석을 붙이면 된다. 이 원칙을 우리 실무로 옮기면 다섯 가지가 된다.

하나. 검사에 쓴 이름들을 해당 모델의 토크나이저로 한 번 인코딩해 토큰 수를 센다. 어휘 파일만 있으면 몇 초면 끝난다.

둘. 센 결과로 균형을 맞추거나, 토큰 수로 층화해 따로 보고하거나, 민감도 분석을 붙인다. 셋 중 무엇을 했는지 보고서에 적는다.

셋. 감사 보고서를 받는 쪽이라면 한 문장을 되묻는다. "검사에 쓴 이름들은 이 모델에서 몇 토큰이었습니까?"

넷. 모델을 바꾸면 다시 센다. 같은 이름이 한 모델에서 원자이고 다른 모델에서 쪼개진다. 사후 학습만으로도 신호가 옮겨 간다는 것을 4.3절에서 봤다.

다섯. 한국 이름을 쓴다면 로마자 표기까지 함께 센다. 어느 철자를 고르느냐가 토큰 수를 고르는 일이 된다.

첫 항목은 정말로 몇 줄이다. 어휘 파일을 내려받아 이름 앞에 공백을 붙여 인코딩하고 토큰 수를 찍으면 된다.

pip install tokenizers
curl -sL -o tok.json https://huggingface.co/Qwen/Qwen3-4B/resolve/main/tokenizer.json

python3 -c "
from tokenizers import Tokenizer
tk = Tokenizer.from_file('tok.json')
for name in ['Emily','Emilee','Jihun','Minjun','지훈','민준']:
    ids = tk.encode(' '+name, add_special_tokens=False).ids
    print(f'{name:8s} {len(ids)} {[tk.decode([i]) for i in ids]}')
"

판정 기준은 논문 3절과 같다. 선행 공백을 붙인 표면형이 단일 토큰이고 디코드했을 때 원 표면형으로 무손실 복원되면 원자적이다. 어휘 파일에 문자열이 있는지만 보는 방식은 상한값이라 쓰지 않는다.

7

페블러스 관심의 이유

이 연구가 짚은 자리는 페블러스가 데이터 품질 작업에서 반복해 만나는 자리와 모양이 같다. 아래 세 대목은 제품 소개가 아니다. 앞 절들이 보여 준 구조가 실무에서 어떻게 다시 나타나는지를 본다.

7.1쓸 수 있는 형태가 모델마다 다르다

AI-Ready Data 라는 말은 데이터를 모델이 쓸 수 있는 형태로 만든다는 뜻이었다. 이 연구는 그 쓸 수 있는 형태가 모델마다 다르다고 말한다. 같은 CSV 의 같은 이름 컬럼을 넣어도 모델이 실제로 받는 입력은 같지 않다. 데이터와 모델 사이에 어휘라는 한 칸이 더 있고, 그 칸의 내용물은 데이터를 만든 쪽이 정하지 않는다.

데이터클리닉이 보여 준 경로가 데이터셋의 결함에서 모델 출력의 결함으로 이어지는 선이었다면, 이 연구는 그 선 위에 칸을 하나 더 그린다. 그리고 그 칸은 데이터를 아무리 다듬어도 바뀌지 않는다. 모델을 바꾸면 같이 바뀐다.

7.2품질 점검표에 빠져 있는 항목

데이터 품질 점검은 보통 결측과 중복과 분포 치우침을 본다. 이 연구가 더하는 항목은 표현 가능성이다. 한 컬럼의 값들이 똑같이 깨끗해도, 모델 어휘에 통째로 들어 있는 값과 조각으로 조립돼야 하는 값으로 갈린다면 그 컬럼은 아직 고르지 않다. 그런데 이 치우침은 기존 지표로 보이지 않는다. 결측도 아니고 이상치도 아니기 때문이다.

한국 데이터에서는 한 겹이 더 붙는다. 5절이 보여 준 대로 한글 이름은 거의 전부 조각으로 들어가고, 일부 토크나이저에서는 글자가 바이트 경계에서 깨진다. 로마자로 바꾸면 깨지지는 않지만 미국 이름과의 격차는 그대로다. 컬럼 하나가 고르지 않은 정도가 아니라 컬럼 전체가 한쪽에 몰려 있는 셈이다.

7.3감사 보고서를 받는 쪽이 되물을 한 문장

채용과 여신과 의료에서 AI 도입을 검토하는 조직은 대개 편향 감사 보고서를 받는다. 이 글이 그 보고서를 받는 쪽에 주는 것은 6.3절의 한 문장이다. 검사에 쓴 이름들은 이 모델에서 몇 토큰이었습니까. 비용이 거의 들지 않는 점검이고, 답이 없다면 그 감사는 통제되지 않은 변수를 하나 안고 있다는 뜻이다. 한국 고객에게는 물음이 하나 더 남는다. 한국 이름으로는 그 통제 자체가 성립하지 않을 수 있다.

페블러스는 모델을 바꾸는 회사가 아니라 모델에 들어가기 전 단계를 다루는 회사다. 이 연구가 말하는 것은 그 단계가 공정성 논의의 바깥이 아니라 맨 앞이라는 것이다. 입력 이전을 재는 일이 왜 미룰 수 없는 일인지를, 우리가 아니라 논문의 표가 먼저 말한다.

확인하지 못한 것도 적어 둔다. 논문은 2026년 9월 28일에 공개됐고 이 글을 쓰는 시점까지 후속 검증도 반박도 나오지 않았다. 주요 모델 카드에 토큰화 통제 서술이 있는지는 카드를 직접 열어 대조하지 못해 없다고 단정하지 않는다. 한국 AI 기본법 조문의 축자는 2차 판본에서 확보했고 국가법령정보센터 원문 대조가 남아 있다. 개입 실험의 방법론적 한계는 계보 문헌까지 따라가지 못해 논문 자체의 주의문으로 대신했다. 언어 간 토큰화 비용을 다룬 선행 연구에서 한국어 행의 수치는 찾지 못했으므로, 한국어가 몇 배 비싸다는 서술은 이 글에 없다. 우리 계측의 미국 대조군 20개도 논문 표본이 아니라 우리가 따로 뽑은 표본이다. 긴 글 읽어 주셔서 감사하다.

R

참고문헌

본문의 근거는 네 갈래다. 1번이 이 글의 뼈대가 된 1차 출처이고, 전문과 부록 표를 직접 열어 수치를 옮겼다. 2번부터 11번까지는 이름 기반 편향 연구의 계보와 4절의 반전을 뒷받침하는 해석가능성 문헌이다. 12번부터 14번까지는 5절의 한국어 토큰화 배경이고, 15번 이후는 6절의 조문과 우리 계측이 쓴 이름 코퍼스의 출처다. 5절의 표에 실린 값은 이 run 의 스크립트로 재생성되며, 손계산으로 만든 수치는 하나도 없다.

1차 출처

  • 1.Nayeem, M. T., & Rafiei, D. (2026). Who Gets a Token, and What Does It Carry? Unequal Name Support and Concept Access in Large Language Models. arXiv:2609.34065v1 (2026-09-28), University of Alberta. CC BY 4.0. 표 1·2와 부록 표 11·12·15·21, 부록 E·F를 직접 인용했다. 프로젝트 사이트는 tafseer-nayeem.github.io/NameTrace. arxiv.org

학술 — 이름 편향과 토큰화

  • 2.An, H., & Rudinger, R. (2023). Nichelle and Nancy: The Influence of Demographic Attributes and Tokenization Length on First Name Biases. ACL 2023. arXiv:2305.16577. 가장 가까운 선행 연구로, 토큰화 길이를 교란 변수로 다룬다.
  • 3.Bertrand, M., & Mullainathan, S. (2004). Are Emily and Greg More Employable Than Lakisha and Jamal? American Economic Review, 94(4), 991–1013. 1절의 4,870통·9.65%·6.45%는 이 논문의 값이다.
  • 4.Eloundou, T., 외 (2025). First-Person Fairness in Chatbots. ICLR 2025. arXiv:2410.19803. 이름 350개를 바꿔 넣는 대표 검사. 전문에서 토큰화 통제 서술을 찾지 못했다.
  • 5.Tamkin, A., 외 (2023). Evaluating and Mitigating Discrimination in Language Model Decisions. arXiv:2312.03689. 데이터셋 이름은 discrim-eval. 인구집단을 낱말로 명시해 이름을 쓰지 않는다.
  • 6.Ahia, O., 외 (2023). Do All Languages Cost the Same? Tokenization in the Era of Commercial Language Models. EMNLP 2023, 9904–9923. arXiv:2305.13707. 언어 간 최대 다섯 배 격차. 한국어 행의 값은 확인하지 못했다.
  • 7.Shwartz, V., Rudinger, R., & Tafjord, O. (2020). "You are grounded!": Latent Name Artifacts in Pre-trained Language Models. EMNLP 2020. 저빈도 이름이 덜 안정적으로 표현된다는 계열의 근거다.

학술 — 해석가능성 (4절의 근거)

  • 8.Elazar, Y., 외 (2021). Amnesic Probing: Behavioral Explanation with Amnesic Counterfactuals. TACL. 해독 정확도와 인과 효과가 갈린다는 절차를 정식화했다.
  • 9.Belinkov, Y. (2022). Probing Classifiers: Promises, Shortcomings, and Advances. Computational Linguistics. arXiv:2102.12452.
  • 10.McDougall, C., 외 (2023). Copy Suppression: Comprehensively Understanding an Attention Head. NeurIPS 2023. arXiv:2310.04625. 4.2절의 부호 뒤집기 기계적 설명.
  • 11.From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks. arXiv:2604.00778. 마지막 층 MLP 하나가 정답 확률 질량의 약 7.5%를 억누른다는 값의 출처다.

학술 — 한국어 토큰화 (5절의 근거)

  • 12.Park, K., 외 (2020). An Empirical Study of Tokenization Strategies for Various Korean NLP Tasks. AACL 2020. arXiv:2010.02534.
  • 13.CJK 바이트 폴백 보강 연구. arXiv:2506.07541. 일본어 23.4%·중국어 48.8%·한국어 52%라는 바이트 폴백 비율의 출처다(Llama-2 토크나이저 기준).
  • 14.LG AI Research (2024). EXAONE 3.5 Technical Report. arXiv:2412.04862. 어휘 10만 2,400개, 한국어·영어 약 50대 50, 형태소 사전분절.

정책·통계

  • 15.EU 인공지능법 — 부속서 III 3(a)·4(a)·5(b)·5(d), 제10조 2항 (f)(g) 및 3항. artificialintelligenceact.eu
  • 16.「인공지능 발전과 신뢰 기반 조성 등에 관한 기본법」 법률 제20676호(2025-01-21 공포, 2026-01-22 시행) 제2조 제4호, 제31·34·35조. 조문 축자는 2차 판본에서 확보했고 원문 대조가 남아 있다.
  • 17.New York City Local Law 144 및 소비자·근로자보호국의 자동화 고용결정도구 최종 규칙. 자기보고 인구통계 기준 선발률과 영향 비율.
  • 18.NIST SP 1270 (2022). Towards a Standard for Identifying and Managing Bias in Artificial Intelligence. DOI 10.6028/NIST.SP.1270.
  • 19.우리 계측의 이름 코퍼스 출처 — 통계청 2015년 인구주택총조사 성씨·본관 편, 대법원 전자가족관계등록시스템 신생아 이름 통계, 미국 사회보장국 2024년 발표, 국립국어원 2007년 여권 로마자 표기 실태조사.

페블러스 인접 글