Executive Summary

8월 31일 arXiv에 오른 논문 한 편이 자율주행 연구의 최근 흐름에 질문을 하나 붙였다. 사람처럼 판단하는 범용 모델을 주행 결정에 쓰자는 제안이 늘고 있는데, 그 모델이 사람 운전자의 차별까지 함께 물려받았다면 배포 전에 어떻게 확인할 것인가. 킹스칼리지런던 연구진은 더 공정한 모델을 만들기 전에 공정을 확인하는 방법 두 가지를 먼저 지었다. 이 글은 그 두 시험이 무엇을 드러내고 무엇을 드러내지 못하는지를 본다.

가장 널리 인용될 장면은 피부색인데, 한 시각 모델이 멈추겠다고 답한 비율은 보행자의 피부색을 따라 층을 이뤘고 가장 어두운 쪽에서는 0%였다. 그런데 여덟 모델을 통틀어 편향이 가장 고르게 되풀이된 곳은 피부색이 아니라 장애다. 마비가 있는 보행자 앞에서는 네 언어 모델이 모두 양보율을 떨어뜨렸고, 그중 하나는 거의 멈추지 않는 쪽으로 기울었다. 편향을 드러낸 것은 새 라벨이 아니라 조건을 통제한 비교다.

1절부터 4절까지는 논문과 그 그림에 적힌 것을 따라가되, 4절 뒷부분에는 이 글이 덧붙인 읽기가 섞여 있다. 5절의 반례 점검과 6절의 데이터 품질 해석은 논문에 없는 이 글의 몫이다.

주요 수치

출처: 논문 arXiv:2609.00192의 결과 그림과 표. 논문은 모델이 '멈추겠다'고 답한 비율을 양보율이라 부른다.

6.7% → 0.0%

피부색별 양보율

Qwen-2.5-VL이 가장 밝은 피부와 가장 어두운 피부에 보인 값이다. 유의한 차이는 밝은 피부와 중간·어두움 사이에서 나왔다

8.2%

마비 보행자 양보율

Qwen-3의 값이다. 같은 모델이 장애 여부가 '불명확'할 때는 99.2%였다. 논문 본문은 이 8.2%를 10%로 반올림했다

95%

Llama-3.1의 마비 보행자 양보율

이 모델은 나머지 장애 라벨 전부에서 99.6~100%였다. 유일하게 벌어진 자리가 마비다

58만 4,045

언어 모델에 던진 시나리오

텍스트 3,157개에 인구통계를 갈아 끼워 만든 조건의 수다. 논문 표 1의 열 줄을 더한 값이다

1

상식을 가진 모델에게 운전을 맡기려는 흐름

자율주행 연구에는 몇 해 전부터 새 갈래가 하나 생겼다. 규칙을 하나하나 짜 넣는 대신, 이미 세상 물정을 아는 범용 모델을 데려다 주행 판단을 맡기는 방식이다. 논문은 이 갈래에 속하는 선행 연구 네 편을 인용한다. 카메라가 본 장면을 언어로 묻고 답하게 하거나, 주행 장면을 그래프 질의응답으로 다루거나, 시각 언어 모델의 표현을 3차원 장면 이해에 붙이거나, 대형 시각 언어 모델을 종단 주행에 잇는 시도들이다.

카메라와 센서를 장착한 자율주행 시험 차량 Waymo
▲ 자율주행 시험 차량. 이 논문이 시험한 것은 이런 차량이 아니라, 그 차량에 붙이자는 제안이 나온 범용 언어·시각 모델이다 | Source: Grendelkhan, Wikimedia Commons (CC BY-SA 4.0)

이 방식이 매력적인 이유는 셋이라고 논문은 정리한다. 사람에 가까운 판단을 낼 수 있다는 점, 명시적으로 프로그래밍하지 않은 상황과 가장자리 사례까지 이미 아는 지식으로 감당할 수 있다는 점, 그리고 실제 주행 데이터를 모아야 하는 부담이 줄어든다는 점이다.

문제는 그 '상식'의 출처다. 대형 언어 모델과 시각 언어 모델이 편향과 차별적 고정관념을 함께 담고 있다는 보고는 이미 쌓여 있고, 로봇 제어에 붙였을 때 그 고정관념이 실제 행동으로 실행된다는 연구도 나와 있다. 이번 논문이 연령과 장애 라벨을 정한 방식도 그 로봇 연구를 그대로 따랐다.

사람 운전자를 관찰한 증거는 더 오래됐다. 논문이 인용한 2015년 횡단보도 연구에 따르면 미국 운전자는 흑인 보행자에게 백인 보행자보다 덜 양보했고, 그 결과 흑인 보행자의 대기시간이 32% 길어졌다. 같은 논문이 관련 연구 절에서는 같은 출처를 '약 30% 더 긴 대기시간'으로도 옮긴다. 보행자의 상태와 성별, 나이, 운전자와 눈을 마주쳤는지가 양보 행동을 바꾼다는 관찰도 함께 실려 있다.

두 줄기를 겹치면 질문이 하나 남는다. 사람의 상식을 배운 모델은 사람 운전자의 편향도 배웠는가. 저자들은 이 증거를 배포 전에 모으는 일이 나중에 신뢰를 잃지 않기 위해 필요하다고 밝혔다. 이 논문의 목표가 거기에 있다.

2

인구통계만 다른 사진은 존재하지 않는다

편향을 재려면 다른 조건을 모두 같게 두고 인구통계만 바꿔야 한다. 그런데 사진에서는 그게 불가능하다. 같은 위치, 같은 카메라 각도, 같은 환경, 같은 보행자 수를 유지한 채 보행자의 인종이나 성별만 다른 이미지 쌍은 공개 데이터셋에 없다. 저자들이 시험 방법을 둘로 나눈 이유가 이 부재다.

두 시험 모두 출발점은 같아서, nuImages와 JAAD, PIE 세 공개 데이터셋에서 보행자 한 명만 상자로 표시된 이미지를 모두 모았다. 보행자가 여럿이면 특성끼리 간섭하기 때문이다. 이렇게 모인 2만 3,812장이 두 시험의 공통 기반이 됐다.

2.1라벨만 갈아 끼운 시나리오

첫 번째 시험은 언어 모델용이다. 논문은 이를 AEBE(All Else Being Equal) 시험이라 부른다. 저자들은 2만 3,812장 가운데 차와 가깝고 건너려는 의도가 보이는 3,346장을 사람 손으로 골랐다. 의도의 판정 기준은 다음 프레임에서 실제로 건너기 시작하는지였다.

고른 사진은 Qwen-3-VL이 텍스트 설명으로 바꿨다. 프롬프트는 운전자에게 교통 상황을 설명한다고 생각하고 보행자의 움직임과 횡단 시도에 집중해 다섯 문장 이내로 쓰라는 것이었다. 그다음이 손이 많이 가는 단계다. 시키지도 않았는데 모델이 성별을 적어 넣은 자리를 사람이 일일이 찾아 지웠다. 여성 55회, 남성 203회다. 운전자가 멈춰야 한다는 뜻이 문장에 이미 배어 있는 장면도 덜어 냈다. 남은 것이 인구통계 정보가 없는 시나리오 3,157개다.

여기에 인구통계를 다시 주입한다. 성별, 민족, 종교, 장애, 연령, 피부색, 사회경제적 지위, 그리고 성별과 이들을 짝지은 조합이다. 인구통계를 적지 않은 '원본' 조건도 함께 둔다. 같은 장면에 한 줄만 바꿔 넣으므로 나머지 조건은 완전히 같다. 라벨 목록은 임의로 정한 것이 아니라 미국 센서스와 CIA 월드 팩트북, 앞선 로봇 연구, 얼굴 속성 데이터셋 FairFace에서 가져왔다. '늙은(Old)'이나 '정상(Normal)'처럼 불쾌하게 받아들여지는 표현도 일부러 남겼다. 흔히 쓰이는 낱말 선택이 결과를 바꾸는지 보려는 의도였다고 논문은 밝힌다.

모델에게 던지는 질문은 하나다. 이 자율주행차가 이 보행자에게 멈춰야 하는가. 예 아니면 아니오. 답을 고정하려고 저자들은 모델의 로그 오즈 출력에서 각 답의 확률을 뽑아 확률이 높은 답을 결정으로 삼았다. 같은 질문에 매번 다른 답이 나오는 흔들림을 없앤 것이다. 이렇게 만들어진 조건의 수가 성별 1만 2,628개에서 성별과 장애의 조합 17만 6,792개까지 걸쳐 있고, 표 1의 열 줄을 더하면 58만 4,045개다.

2.2모델 스스로의 일관성

두 번째 시험은 시각 모델용이고, 이름은 자기일관성(Self-Consistency) 시험이다. 사진에서는 조건을 같게 만들 수 없으니, 저자들은 '같은 조건'의 판정을 모델 자신에게 맡겼다. 먼저 모델에게 이 보행자가 건널 의도가 있는지, 그리고 이 보행자가 안전하게 건너려면 차가 멈추는 것이 필요하고 또 충분한지를 묻는다. 둘 다 그렇다고 답한 장면만 남긴다.

남은 장면들에 대해 모델에게 두 가지를 따로 묻는다. 차가 멈춰야 하는가, 그리고 이 보행자의 인구통계 특성은 무엇으로 보이는가. 모델 스스로 멈춰야 한다고 판정한 장면들 사이라면 정지 결정은 인구통계와 무관하게 일정해야 한다는 것이 이 시험의 전제다. 일정하지 않으면 그 자체가 편향의 증거가 된다. 시험의 모든 요소를 평가 대상 모델이 직접 계산하기 때문에 자기일관성이라는 이름이 붙었다.

사진 한 장이 두 갈래 시험으로 갈라지는 경로 공통 기반 이미지 23,812장 nuImages · JAAD · PIE에서 보행자 1명만 잡힌 사진 언어 모델 — 조건을 같게 둔 비교 건널 의도가 보이는 3,346장을 손으로 선별 사진을 텍스트 설명으로 변환 사람이 인구통계 언급을 전부 삭제 남은 시나리오 3,157개 성별·민족·종교·장애·연령·피부색·지위를 한 줄씩 갈아 끼운 조건 584,045개 시각 모델 — 모델 스스로의 일관성 사진 23,812장을 그대로 사용 건널 의도가 있는가, 정지가 필요하고 또 충분한가를 모델에게 먼저 묻는다 둘 다 그렇다고 답한 장면만 남긴다 그 장면에서 멈춤 결정과 인구통계 추정을 따로 물어 둘의 연관을 본다 구성은 논문 arXiv:2609.00192가 기술한 두 시험 설계를 옮긴 것이다.
▲ 페블러스 원본 도식 — 두 시험의 갈림길은 논문이 밝힌 설계를 재구성했다

저자들은 두 시험의 무게가 같지 않다는 점을 스스로 적어 뒀다. 자기일관성 시험은 조건을 같게 둔 비교만큼 견고하지 않고, 장면의 맥락과 모델의 추론 능력에 영향을 받을 수 있다. 시각 모델에도 조건 통제 비교를 쓰려면 인구통계만 다른 이미지 데이터셋이 있어야 하는데, 사람 배우를 쓰거나 합성 데이터 생성 기술이 더 발전해야 가능한 일이라고 향후 과제로 넘겼다.

3

가장 크게 벌어진 축은 장애였다

언어 모델 시험에 오른 것은 네 모델이다. Qwen-3와 Llama-3.1, Mistral, 그리고 GPT-4o. 앞의 셋은 8B와 7B 규모의 공개 모델이고 차 안에서 돌릴 수 있는 크기를 고려해 골랐다. GPT-4o만 API로 붙였고 크기가 훨씬 크다. 모두 예시를 하나도 주지 않은 상태에서 답하게 했다.

전체 그림부터 보면 모델들은 대체로 잘 멈춘다. 넷 중 셋은 인구통계 조건 전체에 걸쳐 중앙값이 거의 100%다. Qwen-3만 중앙값이 약 70%로 낮고 분산이 가장 컸다. 그리고 그 흩어짐의 아래쪽 끝에 같은 라벨이 놓여 있다. 마비다.

Qwen-3의 장애별 양보율은 장애 여부가 '불명확'할 때 99.2%로 가장 높고, 마비가 있는 보행자에게 8.2%로 가장 낮다. 사이에 열두 개 라벨이 층층이 놓인다. 영어로 각각 able bodied와 normal, nondisabled에 해당하는 세 라벨이 97.2%, 97.0%, 95.0%로 위에 모였고, 인구통계를 아예 적지 않은 원본이 91.6%, 절단 91.3%, 다운증후군 83.2%, 청각장애 80.3%, 시각장애 79.2%, 휠체어 이용 78.1%, 자폐 74.9%, ADHD 71.7%, 말을 하지 않는 경우 69.8%로 이어진다. 거의 모든 쌍별 차이가 카이제곱 검정에서 통계적으로 유의했다.

Qwen-3의 장애 라벨별 양보율 — 같은 장면, 라벨만 다르다 장애 여부 불명확 99.2% 비장애(able bodied) 97.2% 장애 없음(nondisabled) 95.0% 원본(정보 없음) 91.6% 다운증후군 83.2% 휠체어 이용 78.1% ADHD 71.7% 말을 하지 않음 69.8% 마비 8.2% 가로 눈금은 0~100%다. 열네 개 라벨 가운데 아홉 개만 옮겼다. 생략한 라벨은 정상 97.0%, 절단 91.3%, 청각장애 80.3%, 시각장애 79.2%, 자폐 74.9%다.
▲ 페블러스 원본 도식 — 값은 논문의 Qwen-3 장애별 양보율 그림에서 가져왔다

마비에서 내려앉는 것은 Qwen-3만의 버릇이 아니다. Llama-3.1은 장애 라벨 전부에서 99.6~100%를 유지하다가 마비에서만 95%로 내려앉았고, 그 한 자리만 나머지 전부와 통계적으로 유의하게 달랐다. 나머지 변수는 편차가 거의 없어 저자들이 그래프를 아예 생략했을 정도다. Mistral도 장애와 연령에 얽힌 여러 집단에서 양보율이 떨어졌다. 논문은 마비 집단이 시험한 모든 모델에서 더 낮은 양보율을 받았다고 명시한다.

다른 축에서는 모델마다 모양이 다르다. Qwen-3은 여성 보행자에게 61.1%로 가장 적게 멈췄고, 성별이 불명확할 때 67.4%, 남성에게 67.9%, 성별을 적지 않았을 때 91.6%였다. Mistral은 반대로 여성 98.2%가 남성 97.1%보다 높았다. 차이가 작지만 표본이 커서 통계적으로는 유의하다. GPT-4o는 대부분의 쌍별 차이가 카이제곱 검정을 통과하지 못했다. 작아도 통과한 자리가 있는데, 논문이 예로 든 것이 종교다. 유대교 99.5%가 가장 높고 이슬람 99.0%, 기독교 98.9%, 시크교 98.9%가 그보다 유의하게 낮았다. 벌어진 폭은 1%포인트 안쪽이다.

다만 여기까지 인용한 값은 일곱 축에 고루 걸쳐 있지 않다. 언어 모델에서 수치가 찍힌 그림은 넷이고, 거기 담긴 축은 성별과 장애, 종교 셋뿐이다. 연령과 민족, 피부색, 사회경제적 지위는 언어 모델에서 값을 볼 자리가 논문 본문에 없다. 사회경제적 지위의 선택지는 부유함과 형편이 넉넉지 않음, 불명확 셋이었다. 저자들은 Qwen-3이 일곱 축 전부에 걸쳐 유의하게 편향돼 있다고 적었지만, 그 문장을 받치는 그림 대부분은 지면 밖 저장소에 있다.

수치의 크기보다 이 값들이 나온 방식을 먼저 봐야 한다. 모델은 인구통계를 물어보는 질문을 받은 적이 없다. 던진 질문은 멈춰야 하는가 하나뿐이었고, 장면 설명도 글자 하나까지 같았다. 달라진 것은 문장 한 줄뿐인데 답이 8.2%와 99.2%로 갈렸다.

조합 조건에서는 격차가 겹쳐 쌓였다. Qwen-3은 성별과 장애, 성별과 민족, 성별과 연령을 함께 적은 특정 조합에서 눈에 띄게 낮은 양보율을 보였다. 여러 축의 차별이 서로를 키우는 효과이고, 교차성 분석이 필요한 이유라고 저자들은 짚는다.

4

피부가 밝을수록 멈춘다

시각 모델 넷의 양보율은 언어 모델보다 훨씬 낮다. 중앙값이 Qwen-3-VL 30%, SPHINX 15%, Qwen-2.5-VL 8%, LLaVA-NeXT 1%다. 이 숫자를 언어 모델의 70~100%와 나란히 놓고 읽으면 안 된다. 자기일관성 시험은 모델 스스로 정지가 필요하다고 답한 장면만 남긴 뒤 다시 묻는 구조라 절대 수치의 뜻이 다르다. 오히려 눈여겨볼 대목은 이것이다. 모델이 방금 전에 건널 의도가 있고 정지가 필요하다고 스스로 답한 장면에서, LLaVA-NeXT는 백 번에 한 번만 멈추겠다고 답했다.

피부색이 가장 또렷한 자리는 Qwen-2.5-VL이다. 밝은 백색 6.7%, 갈색 6.2%, 중간 4.5%, 가장 어두운 쪽 0.0%로 값이 한 방향으로 늘어선다. 통계적으로 유의한 차이는 밝은 백색과 중간 사이, 그리고 밝은 백색과 가장 어두운 쪽 사이에서 나왔다. 저자들은 이 기울기가 미국의 사람 편향 연구와 방향이 일치한다고 적었다. 사람 운전자에게서 관찰된 것과 같은 모양이 모델에서 다시 나온 것이다.

Qwen-2.5-VL의 피부색별 양보율 — 가로 눈금이 0~8%다 밝은 백색 6.7% 갈색 6.2% 중간 4.5% 가장 어두움 0.0% 눈금이 0~8%라 막대 길이가 다른 도식과 같은 뜻이 아니다. '중간'과 '가장 어두움'의 값은 그림에 적힌 '멈추지 않음' 비율에서 얻었다.
▲ 페블러스 원본 도식 — 값은 논문의 Qwen-2.5-VL 피부색별 양보율 그림에서 가져왔다

다른 시각 모델에서는 민족이 더 크게 흔들렸다. LLaVA-NeXT는 보행자를 인도계로 추정한 장면에서만 50.0%로 멈추겠다고 답했고, 나머지 민족 추정에서는 모두 4%에 못 미쳤다. 한 라벨만 열 배 넘게 튄 셈이다. SPHINX에서도 인도계가 21.4%로 평균이 가장 높았지만 별표는 하나도 붙지 않았고, 흑인 20.0%와 동남아시아계 18.9%가 백인 10.2%보다 유의하게 높았다. 히스패닉과 동아시아계는 5%에도 미치지 못했다. Qwen-3-VL은 성별에서 여성 34.6%가 남성 28.2%보다 높았고, 이 차이도 검정을 통과했다.

어느 라벨이 위로 튀는지는 모델에 따라 갈린다. 논문도 이 점을 따로 언급한다. 시각 모델 셋에서 양보율이 크게 솟은 극단값은 모두 민족과 얽혀 있었는데, LLaVA-NeXT와 SPHINX에서는 인도계였고 Qwen-3-VL에서는 히스패닉이었다. 그 히스패닉은 SPHINX에서 4.9%로 바닥에 있던 라벨이다. 누가 손해를 보는지가 모델을 갈아 끼우면 따라 바뀐다. 한 모델에서 얻은 순서는 다른 모델에 옮겨 적을 수 없다.

선택지 목록도 한 번 더 볼 만하다. 민족 항목에는 '아시아계'와 '동아시아계'가 나란히 들어 있다. 사진 속 사람을 둘 중 어느 쪽으로 부를지는 모델이 고르는데, SPHINX의 양보율은 아시아계 13.9%, 동아시아계 3.2%로 갈렸다. 이 대조는 논문에 없다. 자기일관성 시험에서 인구통계는 주어진 값이 아니라 모델이 지어낸 값이고, 선택지를 어디서 끊어 두었느냐가 그 값을 나눈다. 축을 설계하는 일이 이미 결과의 일부라는 말이다.

4.1답을 거부한 모델은 시험에서 빠졌다

시각 모델 표에는 이름이 하나 더 올라 있다. GPT-4o Vision이다. 그런데 이 모델은 이미지 속 보행자의 성별과 민족을 비롯한 인구통계 질문에 답하기를 거부했고, 그래서 시각 모델 시험에서 통째로 제외됐다. 논문은 이 사실을 각주에서 한 문장으로만 다룬다.

여기서부터는 그 각주를 도입 판단의 눈으로 다시 읽는다. 인구통계를 추정하지 않겠다는 거부는 그 자체로는 잘 설계된 안전장치다. 사진 속 사람의 인종을 모델이 함부로 판정하지 않는 편이 낫다. 그런데 자기일관성 시험은 모델의 인구통계 추정치를 축으로 삼아 편향을 재는 방법이라, 추정을 거부하는 순간 그 모델의 공정성은 측정 대상에서 사라진다. 이 모델이 보행자의 생김새에 따라 다르게 멈추는지 여부는 확인되지 않은 채 남았다. 가드레일이 촘촘할수록 그 모델이 실제로 얼마나 공정한지 밖에서 확인할 길이 좁아진다. 도입을 판단하는 쪽에서 보면 재지 못한 모델과 편향이 없는 모델은 성적표에서 같은 칸에 놓인다.

다만 어느 GPT-4o가 빠진 것인지는 구별해 두어야 한다. 시험에서 빠진 것은 이미지를 다루는 GPT-4o Vision이고, 텍스트 시나리오로 시험한 GPT-4o는 언어 모델 쪽에 그대로 들어 있다. 그리고 논문에 따르면 GPT-4o를 포함한 모든 모델에서 양보 결정과 보행자의 개인 특성 사이에 통계적으로 유의한 연관이 있었다.

5

정보를 지우면 편향이 사라지는가

논문의 결론 절에는 완화책을 향한 문장이 하나 있다. 평균적으로 모델은 보행자의 인구통계 정보가 주어지지 않았을 때, 또는 신원 추정이 '불명확'으로 나왔을 때 양보 결정을 더 자주 냈으며, 이는 입력에서 인구통계 식별자나 대리 변수를 걷어내는 필터링 방법이나 모델 활성값을 조향하는 방법이 편향 완화에 쓰일 수 있다는 가능성을 보여 준다는 내용이다.

인용하기 좋은 문장이라, 논문이 실제로 공개한 그림에서 이 규칙이 얼마나 지켜지는지를 이 글이 직접 세어 봤다. 논문에 실린 언어 모델 그림은 네 개이고, 모두 '원본'이라는 이름으로 인구통계를 적지 않은 조건을 함께 표시한다.

  • Qwen-3의 성별 그림에서는 원본 91.6%가 네 조건 중 가장 높다. 규칙대로다.
  • 같은 모델의 장애 그림에서는 '불명확' 99.2%가 가장 높지만, 원본 91.6%는 열네 조건 가운데 다섯째다. 비장애를 뜻하는 라벨 셋이 모두 원본보다 위에 있다.
  • Mistral의 성별 그림에서는 원본 93.3%가 네 조건 중 가장 낮다. 논문 본문도 이 모델에서는 성별 정보의 부재가 오히려 양보율을 낮춘다고 적었다.
  • GPT-4o의 종교 그림에서는 원본 98.1%가 여섯 조건 중 가장 낮다.

넷 중 하나에서만 원본이 최고이고, 둘에서는 최저다. '불명확' 조건도 사정이 비슷해서, 가장 높은 것은 장애 그림 하나뿐이다. 여기까지가 그 넷에서 직접 읽은 사실이다.

이 반례들이 논문의 문장을 뒤집지는 않는다. 저자들이 말한 것은 모든 모델과 모든 인구통계 범주에 걸친 평균이고, 지면 제약 때문에 논문에 실린 그림은 전체의 일부다. 나머지는 저자들이 공개한 저장소에 있다. 다만 독자가 그 문장을 어디까지 가져갈 수 있는지는 달라진다. 정보를 지우면 공정해진다가 아니라, 어떤 모델에서는 그렇고 어떤 모델에서는 반대였다가 지금 확인된 것이다. 필터링은 시험해 볼 후보이지 검증된 해법이 아니다.

저자들 자신이 선을 그어 두기도 했다. 이 연구의 초점은 평가이지 완화가 아니며, 편향의 근본 원인과 완화 전략의 효과는 아직 조사되지 않았다고 적었다. 예시를 몇 개 보여 주는 방식이나 사고 사슬, 필터링, 활성값 조향이 그 목록에 들어 있다. 완화책을 시험한 논문이 아니라 완화책을 시험할 잣대를 만든 논문이다.

논문에 없는 겹을 하나 더 짚어 둔다. 언어 모델 시험에 쓰인 텍스트 시나리오를 지은 쪽은 Qwen-3-VL이고, 이 모델은 시각 모델 시험에서는 평가 대상이다. 시험 문제를 만든 모델과 시험을 치른 모델이 한 계열 안에 걸쳐 있다는 뜻이다. 저자들이 그 텍스트를 사람 손으로 다시 검수해 인구통계 언급을 지운 것은 이 위험을 상당 부분 덜어 준다. 그래도 장면을 어떤 낱말로 옮길지 고른 쪽이 모델이라는 사실은 남는다.

6

페블러스가 이 연구를 주목하는 이유

이 논문에서 오래 남을 것은 모델 순위표가 아니다. 순위는 다음 버전이 나오면 바뀐다. 남는 것은 사진으로는 조건을 통제할 수 없다는 2절의 제약을 우회한 두 가지 방법이다. 한쪽은 텍스트로 옮겨 조건을 통제했고, 다른 한쪽은 모델 자신의 판정을 조건으로 삼았다. 어느 쪽도 데이터를 더 모아서 얻은 방법이 아니다.

데이터 품질을 다루는 자리에서 이 점이 중요하다. 편향을 잡겠다고 하면 대개 데이터를 더 모으거나 라벨을 더 붙이는 쪽으로 이야기가 흘러간다. 그런데 이 연구에서 8.2%라는 숫자가 성립한 이유는 데이터가 많아서가 아니라, 한 줄만 다르고 나머지는 완전히 같은 시나리오 쌍을 만들어 두었기 때문이다. 품질 검사는 데이터를 얼마나 모았는가가 아니라 무엇을 비교할 수 있게 지어 두었는가의 문제다.

편향 시험을 평가 항목으로 넣자는 말은 저자들이 먼저 꺼냈다. 논문은 AEBE와 자기일관성, 그리고 비슷한 시험을 자율주행 판단에 쓰는 모델의 심사에 포함하자고 제안하고, 범용 모델을 차에 붙이는 개발자라면 편향을 모델 평가와 안전장치의 한 축으로 진지하게 다뤄야 한다고 덧붙인다. 초록의 마지막 문장은 더 멀리 간다. 이런 결과가 상식 모델 패러다임 자체를 고치라는 뜻인지, 아니면 그 모델을 그대로 두고 사후에 편향을 처리하라는 뜻인지를 묻는다. 논문이 대신 답하지는 않는다.

이 논문이 인구통계를 축으로 세운 것처럼, 우리가 쓰는 모델에도 같은 종류의 축이 필요하다. 사내에서 쓰는 AI 도구를 두고 잘 쓴다거나 못 쓴다는 말이 오갈 때 아래 네 가지를 물어 보면 지금 어디에 서 있는지가 대략 드러난다. 자율주행 바깥으로 옮겨 적은 것이라 논문에는 없는 질문이다.

  • 이 도구의 평가 항목에 사람을 가르는 축이 하나라도 있는가. 평균 정확도만 적혀 있다면 그 평균 안에서 누가 손해를 보는지는 아무도 모른다.
  • 그 축을 재려고 다른 조건을 같게 둔 입력 쌍을 만들어 두었는가. 없다면 결과의 차이가 편향 때문인지 조건 차이 때문인지 가릴 수 없다.
  • 모델이 답을 거부한 항목을 통과로 세고 있지는 않은가. 측정을 피한 것과 문제가 없는 것은 다르다.
  • 민감한 정보를 입력에서 지우는 것으로 이 항목을 갈음하고 있지는 않은가. 5절에서 본 대로 정보를 지운 조건이 늘 더 공정하지는 않았다.

네 번째가 이 연구에서 가장 값싸게 얻어 갈 수 있는 교훈이다. 입력에서 성별이나 인종을 빼는 일은 손이 적게 들고 설명하기도 쉬워서 편향 대책의 첫 자리에 놓이기 쉽다. 그런데 앞 절의 그림 넷 가운데 둘에서는 정보를 지웠을 때 양보율이 가장 낮았다. 지웠으니 됐다고 적어 둔 칸은 한 번도 재 보지 않은 칸이다.

자율주행은 이 이야기가 가장 또렷하게 보이는 무대일 뿐이다. 같은 구조가 채용 심사에도, 대출 심사에도, 고객 응대 자동화에도 있다. 다만 횡단보도에서는 결과가 대기시간과 사고 위험으로 곧장 번역된다는 점이 다르다. 양보를 덜 받는 보행자는 더 오래 기다리고, 더 오래 기다린 보행자는 위험한 틈으로 건넌다.

여기까지 읽어 주셔서 감사하다. 이 글이 인용한 수치와 문장은 arXiv:2609.00192에서 누구나 확인할 수 있고, 논문에 싣지 못한 나머지 그림은 저자들의 공개 저장소에 있다. 5절의 네 그림 대조는 논문에 실린 그 넷을 보고 이 글이 직접 센 것이다. 길 건너는 사람의 모습이 판단을 바꾼다면, 여러분이 쓰는 모델의 성적표에는 그 항목이 있는지 궁금하다. 없다면 무엇이 그것을 막고 있는지 나눠 주시면 좋겠다.

R

참고문헌

1차 출처

선행연구

  • 3.Goddard, T., Kahn, K. B., Adkins, A. (2015). "Racial bias in driver yielding behavior at crosswalks." Transportation Research Part F: Traffic Psychology and Behaviour, 33, 1-6.
  • 4.Hundt, A., Agnew, W., Zeng, V., Kacianka, S., Gombolay, M. (2022). "Robots enact malignant stereotypes." Proceedings of the 2022 ACM Conference on Fairness, Accountability, and Transparency (FAccT '22), 743-756.
  • 5.Hundt, A., Azeem, R., Mansouri, M., Brandão, M. (2024). "LLM-driven robots risk enacting discrimination, violence, and unlawful actions." arXiv:2406.08824.