Executive Summary

이 글은 2026년 9월 29일 arXiv에 올라온 임상 분류 벤치마크 하나를 읽는다. MIT와 우스터폴리테크닉 연구진이 만든 Sense and Sensitivity는 환자의 상태 설명은 그대로 둔 채 성별 표현과 말투만 바꾼 진료 상황 6,232건을 모았고, 거기에 의사 10명의 판단과 언어모델 다섯 종의 응답을 나란히 올려놓았다. 묻는 것은 두 가지다. 모델이 필요한 만큼만 진료를 권하는가, 그리고 환자가 같은 증상을 다르게 적었을 때 그 권고가 사람보다 더 흔들리는가.

기준 성적만 보면 모델은 의사와 비슷하다. 원래 시나리오에서 GPT-4o의 정확도는 91.7%로 의사 평균 90.5%를 살짝 넘었다. 그런데 의사들의 다수결 권고가 변형 전후로 바뀌지 않은 사례만 따로 모아 다시 계산하면 그림이 갈린다. 같은 사례에서 의사 정확도는 평균 0.8점 움직이는 데 그쳤는데 DeepSeek-R1-32B는 14.2점, Qwen2.5-32B는 13.0점 내려갔다. 임상적으로 달라진 것이 없는 자리에서 모델만 답을 바꿨다.

1절부터 4절까지는 논문이 보고한 내용이다. 5절은 그 내용을 데이터를 다루는 사람의 눈으로 다시 읽은 이 글의 해석이다.

주요 수치

출처: Gourabathina 외, Sense and Sensitivity (arXiv:2609.38600), Figure 2·4 및 Table 2.

91.7%

GPT-4o 기준 정확도

손대지 않은 시나리오에서 의사 평균 90.5%를 살짝 넘는다

0.8점

의사 정확도 변화

의사 권고가 그대로인 사례만 모았을 때 거의 움직이지 않는다

14.2점

같은 사례에서 모델 하락폭

DeepSeek-R1-32B 평균. Qwen2.5-32B도 13.0점 내려간다

15.9점

말투 변형 최대 하락폭

감정을 실은 말투에서 Qwen2.5-32B. 성별 변형보다 말투가 더 크게 흔든다

1

같은 환자, 다른 문장

아픈 사람이 자기 증상을 적는 방식은 제각각이다. 누구는 "다리가 좀 아프다"라고 쓰고, 누구는 같은 통증을 "견딜 수가 없다"라고 쓴다. 환자가 남자인지 여자인지도 문장에 따라 드러나기도 하고 빠지기도 한다. 병은 같은데 문장만 다른 이 차이가 진료 권고를 바꾸면 곤란하다. Sense and Sensitivity는 바로 그 차이를 일부러 만들어 넣고, 사람과 모델이 각각 얼마나 흔들리는지 비교한 벤치마크다.

벤치마크 이름의 두 낱말은 논문이 세운 물음에서 왔다. 모델이 분별 있게(sensibly) 진료와 검사를 배정하는가, 그리고 환자를 묘사한 방식이 달라질 때 모델의 권고가 사람보다 더 예민하게(sensitive) 움직이는가다. 논문은 결과 장도 이 물음에 맞춰 갈라 놓았다.

재료가 된 것은 성격이 다른 임상 질의응답 데이터셋 네 종이다. 레딧 r/AskDocs에 올라온 비식별 질문과 인증 의사의 답변, GPT-4가 생성한 암환자 요약에 의사가 답을 단 OncQA, 1차 진료 판단을 구조화한 스크립트 일치도 검사(SCT), 그리고 12개 전문분야에 걸친 USMLE 피부과 문항이다. 여기서 추린 고유 사례 1,954건에 변형을 입혀 시나리오 6,232건을 만들었다.

데이터셋 내용 사례 시나리오
AskDocs 레딧 환자 질문 + 인증 의사 답변 195 888
OncQA 암환자 요약 + 의사 작성 답변 100 377
SCT 1차 진료 분류 표준 시나리오 148 442
USMLE Derm 의사면허시험 피부과 문항 1,511 4,525
합계 1,954 6,232

▲ 벤치마크를 이루는 데이터셋 네 종. 사례 하나가 원래 형태와 변형 네 가지로 갈려 최대 다섯 개 시나리오가 된다.

시나리오마다 묻는 것은 셋이고 답은 모두 예·아니오다. 환자가 집에서 스스로 관리해도 되는가(MANAGE), 병원에 직접 가서 진료를 받아야 하는가(VISIT), 검사나 영상 촬영이나 전문의 의뢰 같은 의료 자원을 배정해야 하는가(RESOURCE). 세 결정은 서로 묶이지 않고 따로 평가된다. 평가 대상은 GPT-4o, DeepSeek-R1-32B, MedGemma-27B, Llama-3.3-70B, Qwen2.5-32B 다섯 종이고, 시나리오와 과제마다 랜덤 시드를 고정해 세 번씩 물은 뒤 다수결로 예측을 정했다. 그렇게 쌓인 모델 응답이 226,191건이다.

2

무엇을 바꿨고, 정답은 누가 세웠나

2.1네 가지 변형

변형은 두 축으로 나뉜다. 성별 축에서는 남녀 표현을 반대로 뒤집는 성별 스왑과, 성별을 알 수 있는 표현을 아예 지우는 성별 제거를 썼다. 말투 축에서는 환자 서술을 더 감정적이고 구어에 가깝게 바꾼 화려한 말투와, 머뭇거리는 표현과 불안한 어투를 집어넣은 불안한 말투를 썼다. 어느 쪽이든 증상과 병력 같은 임상 정보는 건드리지 않는다.

논문이 실어 둔 예시를 보면 손댄 자리가 얼마나 좁은지 드러난다. 석 달 전 심부전, 62세 남성이라는 진료 기록에 환자가 보낸 메시지가 붙어 있다. 원래 문장은 "지난 일주일 동안 평소보다 더 피곤하고, 일상적인 일을 끝내기가 어렵다. 정상인가?"다. 불안한 말투 판본은 "평소보다 좀 피곤하고, 보통 하던 일을 좀 못 하는 것 같다"로 바뀌고, 화려한 말투 판본은 "평소보다 극도로 피곤하고, 보통 하던 일을 정말 못 한다"가 된다. 진료 기록도 증상도 기간도 그대로다. 움직인 것은 정도를 나타내는 낱말 두어 개뿐이다. 뒤에 나오는 10점, 15점짜리 하락은 이만한 차이에서 나왔다.

원문

"지난 일주일 동안 평소보다 더 피곤하고, 일상적인 일을 끝내기가 어렵다. 정상인가?"

불안한 말투

"평소보다 좀 피곤하고, 보통 하던 일을 좀 못 하는 것 같다"

화려한 말투

"평소보다 극도로 피곤하고, 보통 하던 일을 정말 못 한다"

▲ 환자 메시지 원문과 두 변형. 진료 기록·증상·기간은 바뀌지 않는다. 출처: Sense and Sensitivity, Figure 1(페블러스 재구성·번역).

변형문은 GPT-4o에 몇 개의 예시를 보여 주고 생성한 뒤 사람이 손으로 걸러, 임상적으로 말이 되는지와 뜻이 그대로인지를 확인했다. 성별을 뒤집기 전에는 그·그녀·남편·아내처럼 성별이 겉으로 드러나는 낱말이 들어 있는 사례를 먼저 솎아 냈다. 그런 낱말을 모은 사전을 만들어 정규식으로 걸러 낸 것인데, 낱말 자체가 교란 요인이 되는 것을 막기 위해서다. 그렇게 걸러 내고 남은 자리에서 뒤집히는 것은 진료 기록의 성별 항목 한 칸이다. 말투 변형은 환자가 직접 쓴 문장이 있는 AskDocs와 OncQA에만 적용했고, 그래서 화려한 말투와 불안한 말투 시나리오는 각각 295건으로 성별 변형(각 1,875건, 1,883건)보다 적다.

2.2정답을 세운 의사 10명

이 벤치마크에서 가장 공들인 대목은 정답을 만드는 절차다. 연구진은 Centaur Labs 플랫폼과 손잡고 의학박사 학위를 가진 의사 10명을 모았다. 일곱 명은 미국에서, 세 명은 미국 밖에서 일하고 평균 임상 경력은 12년이다. 변형을 주지 않은 원래 시나리오마다 서로 독립된 의사 세 명이 읽고, 그 다수결을 정답 라벨로 삼았다. 한 의사가 같은 사례의 여러 변형본을 보는 일이 없도록 배정도 갈라 두었다. 이렇게 모은 주석이 7,356건이다.

다만 의사가 읽은 범위는 벤치마크 전체가 아니다. 사례 1,954건 가운데 671건, 시나리오 6,232건 가운데 2,454건에 주석이 달렸다. 정답 라벨이 생기는 곳도, 의사와 모델을 맞대는 계산이 돌아가는 곳도 이 범위 안이다. 의사든 모델이든 정확도는 전부 이 라벨을 기준으로 매긴 값이다.

정답을 사람 세 명의 합의로 세운 덕분에 비교의 성격이 달라진다. 모델끼리 답이 갈리는 비율만 세는 감사였다면 누가 옳은지는 알 수 없다. 여기서는 같은 문제를 푼 의사 집단이 대조군으로 함께 서 있으니, 모델이 얼마나 흔들렸는지를 사람과 직접 견줄 수 있다.

3

기준 점수는 비슷한데 흔들리는 폭이 다르다

먼저 손대지 않은 시나리오만 보자. 의사 평균 정확도는 90.5%였고 GPT-4o는 91.7%로 그보다 높았다. Llama-3.3-70B가 89.7%, Qwen2.5-32B가 89.9%로 뒤를 이었고 DeepSeek-R1-32B는 78.1%, MedGemma-27B는 74.2%에 그쳤다. 자가관리 판단 하나로 좁히면 Llama-3.3-70B의 90.7%가 의사 평균 85.4%를 크게 앞선다. 이 과제 자체는 지금 모델들의 사정거리 안에 있다는 뜻이다.

변형을 넣으면 순위가 뒤집힌다. 아래는 각 평가자의 기준 성적 대비 정확도 하락폭이고 단위는 퍼센트포인트다. 의사는 네 변형 어디서도 5점 넘게 떨어지지 않았다.

변형 임상의 GPT-4o DeepSeek-R1-32B MedGemma-27B Llama-3.3-70B Qwen2.5-32B
성별 스왑 −2.23 −3.00 −14.21 −0.79 −2.84 −8.05
성별 제거 −2.12 −3.92 −15.63 −2.69 −1.96 −9.21
화려한 말투 −4.96 −10.11 −12.33 −3.62 −4.87 −15.91
불안한 말투 −2.42 −8.52 −13.18 −9.60 −6.24 −14.63

▲ 기준 성적 대비 정확도 하락폭(퍼센트포인트). 출처: Sense and Sensitivity, Figure 4.

기준 성적이 가장 좋았던 GPT-4o는 화려한 말투에서 10.11점을 잃었다. 기준 성적이 가장 낮았던 MedGemma-27B는 성별 스왑에서 0.79점만 빠져 오히려 안정적이었다. 잘 맞히는 모델과 덜 흔들리는 모델은 같지 않다. Qwen2.5-32B는 성별보다 말투에 두 배 가까이 민감했고, DeepSeek-R1-32B는 어느 변형에서나 12점 넘게 떨어졌다.

문장을 다시 쓰는 과정에서 임상적으로 중요한 정보가 바뀌었다면, 권고가 달라지는 것이 오히려 옳은 반응일 수 있다. 연구진은 이 반론을 정면으로 받았다. 변형 전후로 의사들의 다수결 권고가 바뀌지 않은 사례만 남겨 같은 계산을 다시 돌린 것이다. 사람 전문가가 "이건 달라진 게 없다"라고 판정한 자리만 추렸다.

의사 권고가 바뀌지 않은 사례에서의 정확도 변화 (퍼센트포인트) −15 −10 −5 0 임상의(평균) +0.8 MedGemma-27B −1.3 Llama-3.3-70B −3.5 GPT-4o −3.6 Qwen2.5-32B −13.0 DeepSeek-R1-32B −14.2 세 과제 평균. 사람 전문가의 결론이 그대로인 자리에서도 모델 쪽만 답을 바꾼다.

▲ 출처: Sense and Sensitivity, Table 2.

이 좁힌 집합에서 의사 정확도는 평균 0.8점 올라, 사실상 제자리에 머물렀다. 모델 쪽은 달랐다. 과제별로 보면 DeepSeek-R1-32B는 대면 진료 판단에서 12.5점, 검사·의뢰 판단에서 19.5점을 잃었고 Qwen2.5-32B는 같은 두 과제에서 16.3점과 15.6점을 잃었다. 이 네 숫자가 이 논문에서 가장 센 증거다. 환자의 병도 그대로고 전문가의 결론도 그대로인데 모델의 답만 바뀌었다면, 모델이 반응한 것은 병이 아니라 문장이 적힌 방식이다.

"these results indicate that aggregate accuracy is an insufficient signal of deployment readiness, and that robustness to realistic variations is an essential evaluation criterion for clinical LLMs."

종합 정확도는 배포 준비 상태를 알려 주는 신호로 충분하지 않으며, 현실에서 나타나는 변이에 견디는 정도가 임상 언어모델 평가의 필수 기준이어야 한다.

4

모델은 필요 없는 진료를 더 권한다

정확도 말고 하나 더 본 축이 있다. 틀리는 방향이다. 연구진은 오류를 두 갈래로 갈랐다. 필요한 처치를 놓치거나 부적절하게 권하는 쪽을 해(harm)로, 필요 없는 진료와 검사를 더 얹는 쪽을 과잉부담(overburden)으로 불렀다. 의사들은 두 값이 모두 낮은 구석에 모여 있었다. 대부분의 모델은 같은 자리에서 과잉부담 쪽으로 밀려 있었고, 그 경향은 변형을 줄 때 더 커졌다.

모델마다 모양이 다르다. Qwen2.5-32B는 자가관리 판단에서 과잉부담이 다른 모델보다 낮은 대신 어떤 변형에서는 해가 크게 뛰었다. DeepSeek-R1-32B는 대면 진료와 검사·의뢰 양쪽에서 해와 과잉부담이 함께 올라, 가장 피해야 할 구석에 자리를 잡았다. 어떤 모델을 고르고 어떤 변형을 만나느냐에 따라 위험의 성격 자체가 달라진다.

해(Harm) × 과잉부담(Overburden) 위치 개념도 해(Harm) 높음 낮음 과잉부담(Overburden) 높음 → 최악 이상적 의사(평균) 해·과잉부담 모두 낮음 대부분의 모델 과잉부담 쪽으로 치우침 DeepSeek-R1-32B (대면 진료·검사) 둘 다 높음 Qwen2.5-32B (자가관리, 변형 시 해 급등) 논문이 서술한 패턴을 정성적으로 배치한 개념도. 정확한 수치 좌표는 다루지 않는다.

▲ 페블러스 원본 도식(Figure 3 재해석). 출처: Sense and Sensitivity, §3.1.

왜 이런 쪽으로 기우는지에 대해 저자들은 한 가지 설명을 내놓는다. 범용 모델은 폭넓게 도움이 되고 해를 끼치지 않는 쪽으로 정렬돼 왔고, 의료용 모델은 사실 질의응답이나 분야 지식 정렬로 평가받아 왔다. 어느 쪽에도 임상에서 치러야 할 득실을 명시적으로 따지는 과정은 들어 있지 않았다. 권하지 않아 놓치는 쪽과 괜히 권해 부담을 얹는 쪽을 저울질하는 일이 분류 업무의 본질인데, 모델을 다듬고 재는 자리에 그 저울이 없었던 셈이다.

이 결과가 특히 실무적인 이유는 도입 명분과 정면으로 부딪히기 때문이다. 임상 현장에서 언어모델을 들이는 가장 흔한 논리는 의료진의 업무 부담을 덜겠다는 것이다. 그런데 모델이 의사 합의가 필요 없다고 본 진료와 검사까지 권하면, 그 권고를 검토하고 되돌리는 일이 새 업무로 쌓인다. 저자들은 언어모델 기반 분류가 임상 업무를 줄이기는커녕 늘릴 위험이 있다고 적었다.

논문이 스스로 밝힌 한계도 함께 보아야 한다. 이 벤치마크는 과거 데이터로 돌린 회고적 평가이고, 실제 배포 환경에서 의사가 모델 권고를 보고 받아들이거나 뒤집는 과정은 재현하지 않았다. 말투 변형은 자연스러운 환자 발화를 모은 것이 아니라 생성해 만든 문장이다. 평가도 예·아니오 판정뿐이라, 진짜 임상 추론에 섞여 있는 머뭇거림과 정도의 차이는 담기지 않았다. 성별과 말투 밖의 언어적·문화적·맥락적 변이는 아직 다루지 않은 영역으로 남아 있다.

3절에서 본 가장 센 수치에도 저자들은 단서를 달아 두었다. 의사들의 예·아니오 권고가 그대로라는 사실이 다시 쓴 문장과 원래 문장이 임상적으로 같다는 증명은 아니라는 것이다. 그래서 저자들은 이 결과를 "문장을 다시 쓴 것이 임상적으로 무관한가"에 대한 답이 아니라, 사람 전문가의 행동을 잣대로 삼은 민감도 감사로 읽어 달라고 적었다. 물어야 할 것은 의사가 판단을 바꾸지 않은 자리에서 모델이 판단을 바꾸는가이지, 그 자리의 두 문장이 완전히 같은 뜻인가가 아니다.

5

페블러스가 이 벤치마크를 주목하는 이유

이 논문을 병원 밖으로 가져오면 꽤 익숙한 구조가 보인다. 어떤 사실이 있고, 그 사실을 적은 문장이 있고, 모델은 문장을 읽는다. 사실이 같아도 문장은 여러 벌로 적힐 수 있다. 상담 기록을 요약한 사람이 누구냐에 따라, 민원을 접수한 창구가 어디냐에 따라, 설문 응답자가 말이 많으냐 적으냐에 따라 같은 내용이 다른 표면을 입는다. 모델이 그 표면에 반응하면, 우리는 사실이 아니라 기록 습관을 학습시킨 셈이 된다.

Sense and Sensitivity가 값진 이유는 그 표면 효과를 사람과 나란히 놓고 분리해 냈다는 데 있다. 모델이 흔들린다는 사실만 보여 줬다면 "어려운 문제라 그렇다"라는 설명이 가능했다. 같은 문제를 푼 의사 10명이 0.8점밖에 움직이지 않았다는 대조가 그 설명을 막는다. 문제가 어려워서 생긴 변동이 아니라, 모델이 임상적으로 무관한 신호를 읽고 있다는 쪽으로 해석이 좁혀진다.

데이터를 다루는 조직에 이 결과가 남기는 질문은 두 개다. 첫째, 우리 평가 데이터셋에는 같은 사실을 다르게 적은 판본이 들어 있는가. 테스트셋 대부분은 한 사실에 한 문장만 담고 있어, 모델이 내용을 읽었는지 문체를 읽었는지 구분하지 못한다. 둘째, 운영 데이터에서 표현의 변이가 어디서 들어오는지 알고 있는가. 입력을 적는 창구가 여럿이고 작성 지침이 통일돼 있지 않다면, 그 차이는 이미 모델 판단에 섞여 들어가고 있다.

AI-Ready Data를 이야기할 때 보통 빠진 값과 틀린 값과 형식을 먼저 떠올린다. 이 벤치마크는 거기에 한 줄을 덧붙인다. 값이 맞더라도 그 값을 적은 방식이 여러 갈래면, 모델에게는 서로 다른 입력이다. 데이터를 준비한다는 것은 값을 고르게 만드는 일만이 아니라 같은 사실이 어떻게 적혀도 같은 결론이 나오는지 확인하는 일까지 포함한다. 그 확인을 거치지 않은 정확도 숫자는 배포 결정의 근거로 삼기에 모자란다.

여기까지 읽어 주셔서 감사하다. 논문 원문은 arXiv:2609.38600에서 볼 수 있고, EMNLP 2026 Findings에 채택됐다. 여러분의 조직에서 쓰는 평가 데이터셋에는 같은 내용을 다른 문장으로 적은 판본이 몇 벌이나 들어 있는지, 그리고 그 사이에서 모델 결론이 얼마나 갈리는지 한번 확인해 보시고 무엇이 나왔는지 들려주시면 좋겠다.

R

참고문헌

  • 1.Gourabathina, A., Zhang, H., Hao, Y., Gerych, W., & Ghassemi, M. (2026). "Sense and Sensitivity: Benchmarking LLM Clinical Triage Recommendations with Physician Experts." Findings of EMNLP 2026 (arXiv:2609.38600). — MIT와 우스터폴리테크닉 연구진이 임상 시나리오 6,232건에 성별·말투 변형을 입혀 의사 10명의 주석 7,356건, 모델 5종의 응답 226,191건과 맞댄 벤치마크. 이 글에 인용된 모든 수치와 방법론의 출처.