Executive Summary

흉부 X선 판독 모델이 병변 대신 촬영 현장의 흔적을 붙잡는다는 지적은 6년째 반복돼 왔습니다. 코펜하겐 IT대학 PURRlab 연구진은 그 흔적이 신경망의 어느 깊이에서 잡히는지를 물었고, MedCLIP의 비전 인코더를 얼린 채 층마다 선형 프로브를 붙여 확인했습니다. 8월 12일 arXiv에 공개되고 스트라스부르에서 열리는 MICCAI 2026 공동 워크숍에 포스터로 나가는 이 논문은, 합성 편향으로만 확인되던 층별 지름길 패턴을 실제 임상 데이터에서 처음 재현했습니다.

정확도 지표는 세 실험 모두 무난했습니다. NIH-CXR14 기흉에서 AUROC 0.839, PadChest 심장비대에서 0.905가 나왔습니다. 그런데 층별 확신도를 따라가 보면 앞선 12개 블록에서 겹쳐 있던 곡선이 13번째 블록부터 갈라지고, 가슴에 배액관이 꽂힌 이미지 쪽이 계속 위에 놓입니다. 배액관은 기흉이라는 병이 아니라 기흉을 치료한 흔적입니다.

이 글이 주목하는 대목은 그다음입니다. NIH-CXR14도 PadChest도 라벨에는 병명만 적혀 있고 배액관이나 스캐너 기종은 없습니다. 연구진은 다른 팀이 수동으로 만든 보강 라벨을 빌려 와야 했고, 그 라벨조차 손으로 확인한 다섯 장 중 세 장이 틀렸습니다.

주요 수치

출처: Pedersen, Sydendal, Cheplygina & Sourget, arXiv:2608.12086

0.839

NIH-CXR14 기흉 AUROC

배액관이 있는 이미지는 0.840, 없는 이미지는 0.812로 갈렸습니다

블록 13

확신도 곡선이 갈라진 깊이

앞선 12개 블록에서는 네 곡선이 0.25 아래에 겹쳐 있었습니다

블록 3

스캐너별 차이가 튄 깊이

PadChest 기흉에서 초반 스파이크가 나왔고 이후로는 안정됐습니다

5장 중 3장

배액관 없음 라벨의 오류

손으로 확인해 보니 이미지 구석에 실제로 배액관이 보였습니다

1

정확도만 보면 아무 문제가 없습니다

흉부 X선 판독 모델의 지름길 학습은 2020년 Oakden-Rayner 연구진이 이미 또렷하게 보여 줬습니다. NIH-CXR14로 학습한 DenseNet-121은 배액관이 꽂힌 기흉 이미지에서 AUROC 0.940을 기록했지만, 배액관이 없는 이미지에서는 0.770으로 떨어졌습니다. 배액관은 기흉을 치료할 때 넣는 관이라 양성 이미지에 자주 따라붙습니다. 모델은 병을 배운 것이 아니라 치료의 흔적을 배운 셈이고, 전체 평균만 보면 이 분리가 보이지 않습니다.

이번 논문이 다루는 MedCLIP은 그보다 한 세대 뒤의 모델입니다. CheXpert와 MIMIC-CXR, COVID, RSNA 폐렴 데이터로 사전학습한 비전 언어 모델인데, 설계의 핵심은 이미지와 리포트를 일일이 짝지어야 하는 제약을 푼 데 있습니다. 의료 현장에서는 짝지어진 이미지와 텍스트가 드물고, 짝이 없다는 이유로 의미가 비슷한 사례까지 음성으로 취급되기 쉽습니다. MedCLIP은 통합의학언어시스템에서 뽑은 의미 유사도로 이 짝짓기를 대신해, 짝이 없는 데이터까지 학습에 끌어들이며 규모를 크게 늘렸습니다. 그런데도 결과는 익숙합니다. 프로브를 붙여 측정한 성능은 NIH-CXR14 기흉 0.839, PadChest 심장비대 0.905, PadChest 기흉 0.875로 모두 무난한 구간에 들어옵니다.

무난하지 않은 쪽은 캘리브레이션입니다. 세 구성 모두 모델이 자기 예측을 실제보다 확신했고, PadChest 기흉이 가장 심했습니다. 특히 양성 사례가 가장 적은 IDC 스캐너 그룹에서 캘리브레이션이 가장 나빴는데, 이는 이 지표 자체가 양성 표본 수에 취약하다는 뜻이기도 합니다. 앞선 연구에서도 CLIP 계열 모델 여섯 종이 배액관 있는 이미지에서 더 좋은 성능을 냈고 예측 확률이 0.5 근처에 몰렸지만, AUROC는 정상 범위에 머물렀습니다.

세 실험 구성의 정확도와 서브그룹 격차, 캘리브레이션 상태를 나란히 놓으면 이렇습니다.

실험 구성 전역 AUROC 서브그룹 캘리브레이션
NIH-CXR14 기흉 0.839 배액관 0.840 / 무배액관 0.812 과신, 전반적으로 낮음
PadChest 심장비대 0.905 IDC 0.917 / PMS 0.893 셋 중 가장 나으나 여전히 과신
PadChest 기흉 0.875 IDC 0.852 / PMS 0.801 가장 나쁨, IDC 그룹이 최악

정리: 페블러스. arXiv:2608.12086 결과 표를 옮겼습니다. IDC는 ImagingDynamicsCompany, PMS는 PhilipsMedicalSystems 장비를 가리키며 PadChest에만 기록돼 있습니다.

2

층마다 확신도를 따로 쟀습니다

평균 하나로는 모델이 무엇을 보고 맞혔는지 물을 수 없습니다. 그래서 연구진은 완성된 예측만 보는 대신, 그 예측이 만들어지는 중간 단계를 층별로 열었습니다. MedCLIP의 비전 인코더인 ResNet-50을 얼려 두고, 내부 블록 16개와 마지막 평균풀링층에 각각 선형 분류기를 하나씩 붙였습니다. 모두 17개이고, 각 프로브는 평균풀링을 거친 특징을 받아 단일 선형층으로 병변 유무를 예측합니다. 백본 가중치는 그대로 두고 프로브만 학습했기 때문에, 프로브가 잘 맞힌다는 것은 그 깊이의 표현에 이미 그 정보가 들어 있다는 뜻이 됩니다.

학습 손실은 프로브 17개의 교차 엔트로피를 모두 더한 값입니다. 백본이 얼어 있고 프로브끼리 가중치를 나누지도 않으므로, 각 프로브는 자기 손실에서 나온 기울기만 받습니다. 한 층의 결과가 다른 층의 프로브를 흔들지 않는다는 뜻이라, 층마다 따로 읽어도 되는 구조가 됩니다. 세 데이터셋 구성 모두 같은 설정으로 돌렸습니다. 에폭 100회, 배치 크기 32, 학습률 0.00001에 검증 손실이 15에폭 동안 나아지지 않으면 멈추도록 했습니다.

백본은 얼리고, 프로브 17개만 독립적으로 학습합니다 흉부 X선 얼린 ResNet-50 (가중치 고정) 1 13 16 avg 선형 프로브 17개 (평균풀링 + 선형층 1개, 가중치 비공유) 학습 손실 = 프로브 17개 교차 엔트로피의 합 한 프로브의 손실이 다른 프로브의 기울기에 영향을 주지 않습니다 arXiv:2608.12086 방법론 재구성 | 페블러스 원본 도식
▲ 얼린 인코더 위에 프로브 17개를 독립적으로 붙여 층마다 확신도를 잽니다 (오렌지 = 13번째 블록) | 페블러스 원본 도식

측정하는 값은 정확도가 아니라 확신도입니다. 예측 확률이 가장 불확실한 지점인 0.5에서 얼마나 멀어졌는지를 재고, 이를 서브그룹별로 나눠 층 순서대로 이어 그립니다. 어떤 서브그룹의 곡선만 특정 깊이에서 튀어 오르면, 그 깊이의 표현이 그 서브그룹을 구분하는 무언가를 담고 있다는 신호가 됩니다. 곡선은 프로브마다 1,000회 부트스트랩 재표집으로 95% 신뢰구간을 함께 그렸는데, 표본이 적은 서브그룹에서 이 구간이 얼마나 벌어지는지가 뒤에서 해석의 발목을 잡습니다.

무대는 셋입니다. NIH-CXR14의 기흉은 환자 30,805명의 이미지 112,120장으로 구성되며, 배액관 유무는 시험 집합에만 표시돼 있습니다. PadChest의 심장비대는 스페인 알리칸테 산후안병원이 모은 환자 67,625명의 이미지 160,861장에서 뽑았고, 유병률이 높고 성별 균형이 좋아 선택됐습니다. 같은 PadChest에서 기흉도 따로 돌렸는데 이쪽 유병률은 0.4%에 그칩니다.

데이터를 다듬는 단계에서 무엇을 뺐는지도 결과를 읽는 데 필요합니다. PadChest에는 다섯 가지 투영 방향이 섞여 있는데 연구진은 선 자세로 찍은 것을 모두 버리고 PA, AP, AP-horizontal 세 가지만 남겼습니다. 질환 라벨이 촬영 부적합이나 제외, 변화 없음으로 적힌 행도 뺐습니다. NIH-CXR14는 데이터셋이 제공하는 분할을 그대로 썼고, PadChest는 8 대 2로 나눈 뒤 학습 쪽에서 다시 20%를 검증용으로 떼어 냈습니다. 세 구성 모두 환자 식별자를 기준으로 갈라, 같은 환자의 이미지가 학습과 시험 양쪽에 섞이지 않게 했습니다.

가설은 앞선 합성 실험에서 왔습니다. Boland 연구진은 2025년에 균일한 잡음처럼 이미지 전체에 퍼진 확산형 지름길은 초반 층에서, 특정 위치의 빨간 사각형처럼 국소적인 지름길은 후반 층에서 드러난다는 결과를 얻었습니다. 배액관은 몸에 들어간 물리적 장치라 국소형에 가깝고, 스캐너 기종에 따른 화질 차이는 화면 전체에 걸린 확산형에 가깝습니다. 그렇다면 배액관은 늦게, 스캐너 차이는 일찍 나와야 합니다.

3

배액관은 늦게, 스캐너 차이는 일찍 나타납니다

NIH-CXR14 기흉에서는 기흉 양성과 음성을 각각 배액관 유무로 갈라 곡선 네 개를 그렸습니다. 네 곡선은 처음 12개 블록 내내 낮고 평평하게 붙어 있습니다. 13번째 블록에서 갈라지기 시작해, 기흉 양성 이미지의 확신도는 0.35에서 0.41 사이로 올라가고 음성 이미지는 0.25 아래에 남습니다. 두 양성 곡선 중에서는 배액관이 있는 쪽이 끝까지 위에 놓입니다. 같은 병을 가진 환자인데 관이 꽂혀 있다는 이유로 모델이 더 확신한다는 뜻입니다.

세로축은 확신도, 가로축은 프로브가 붙은 블록 번호입니다. 앞쪽 절반에서는 네 곡선이 거의 포개져 있고, 갈라지는 자리는 오른쪽 끝에 몰려 있습니다.

13번째 블록부터 배액관 유무로 확신도가 갈립니다 확신도 0.41 0.25 프로브가 붙은 블록 번호 1 17 블록 13 기흉 양성 · 배액관 있음 기흉 양성 · 배액관 없음 기흉 음성 (두 곡선) arXiv:2608.12086 NIH-CXR14 기흉 층별 확신도 결과를 도식화 | 페블러스 원본 도식
▲ 앞쪽 12개 블록에서는 구분되지 않던 네 집단이 후반부에서 갈라집니다 | 페블러스 원본 도식

PadChest 기흉에서는 반대쪽 끝이 나왔습니다. 네 곡선 모두 3번째 블록에서 한 번 튀고 이후로는 각자의 궤적에서 안정됩니다. 배액관이 없는 IDC 음성 곡선은 그 과정에서 0.42까지 올라가지만 끝점은 다른 곡선들과 비슷한 높이입니다. 확산형 지름길이 초반 층에서 나타난다는 예측과 방향이 맞고, 불균형한 조건에서 촬영 장비 차이가 지름길로 이어진다고 본 선행 연구와도 겹칩니다. 다만 연구진은 이 대목에서 한 발 물러섭니다. IDC 장비로 찍은 이미지에는 오른쪽을 뜻하는 R 문자가 찍혀 있어, 이것이 국소형 지름길로 작동했을 가능성을 배제하지 못하기 때문입니다. IDC의 양성 표본이 네 건뿐이라 곡선 자체도 불안정합니다.

PadChest 심장비대에서는 지름길로 볼 만한 패턴이 나오지 않았습니다. 블록 4에서 6 사이와 블록 13에서 작은 스파이크가 보이기는 합니다. 그런데 전 구간 확신도가 0.23에서 0.28 사이로 낮게 깔려 있고 스캐너로 나눈 네 곡선이 같은 폭 안에서 거의 겹치기 때문에, 연구진은 이 봉우리를 지름길의 흔적으로 읽지 않았습니다. 성별로 나눈 비교에서도 유의한 차이는 없었습니다. 같은 방법으로 재도 어떤 데이터셋에서는 신호가 나오고 어떤 데이터셋에서는 나오지 않는다는 사실 자체가, 지름길이 모델의 고정된 성질이 아니라 데이터가 놓인 조건의 산물임을 보여 줍니다.

합성 데이터로 만든 층별 규칙이 실제 임상 데이터에서도 재현됐다는 것이 이 논문의 기여입니다. 지름길의 종류를 알면 어느 깊이를 들여다봐야 하는지 좁힐 수 있고, 반대로 특정 깊이에서 튀는 곡선을 보면 어떤 종류의 흔적을 의심해야 할지 짐작할 수 있습니다. 다만 그 짐작을 확인하려면 의심할 대상이 데이터 어딘가에 기록돼 있어야 합니다.

4

라벨에는 배액관도 스캐너도 없습니다

NIH-CXR14의 라벨은 방사선 리포트에서 자연어 처리로 뽑아낸 흉부 질환 14종의 유무입니다. 환자가 어떤 처치를 받았는지, 어떤 장비로 찍었는지는 들어 있지 않습니다. 그래서 이번 실험의 배액관 라벨은 다른 팀이 따로 만들어야 했습니다. NEATX 프로젝트가 배액관이 보이는 이미지 3,709장을 수동으로 주석했고, 배액관이 없는 쪽은 그 주석으로 학습한 별도 분류기가 자동으로 채웠습니다. 지름길을 확인하는 실험이 또 다른 모델의 판정 위에 서 있는 구조입니다.

연구진은 그 라벨을 그대로 믿지 않고 손으로 확인했습니다. 배액관 없음으로 표시된 이미지 다섯 장을 열어 보니 세 장에서 작은 배액관이 구석에 보였습니다. 논문의 그림에 실린 사례 세 건이 모두 여기에 해당하는데, 셋 다 기흉 음성으로 분류된 이미지이고 관은 왼쪽 위나 오른쪽 위 모서리에 걸쳐 있습니다. 자동 분류기가 놓친 관이 하필 음성 쪽에 남아 있으면, 배액관 유무로 갈라 본 성능 비교의 기준선 자체가 흔들립니다. 이 오류만큼 모든 비교가 흐려진다는 뜻이고, 저자들도 결과를 신중하게 읽어 달라고 직접 적었습니다.

같은 감사에서 다른 것들도 나왔습니다. NIH-CXR14에는 나이가 잘못 입력된 기록과 전체가 회색으로만 채워진 이미지가 있었습니다. PadChest에서는 성별이 서로 어긋나게 적힌 사례, 중복된 이미지와 중복된 메타데이터, 그리고 폐 질환 라벨이 달린 두개골 X선 한 장이 나왔습니다. 두 데이터셋 모두 의료 AI 연구에서 수천 편의 논문이 인용해 온 공개 자산입니다.

결국 무엇을 물을 수 있는지는 라벨이 정합니다. 두 데이터셋에서 라벨에 적힌 항목과 이미지에만 남은 항목을 갈라 정리했습니다.

이미지에는 남아 있고 라벨에는 없는 것들 라벨에 기록된 것 흉부 질환 14종의 유무 환자 나이와 성별 촬영 투영 방향 환자 식별자 리포트에서 자동 추출한 결과 라벨 이미지에만 남아 있는 것 배액관 같은 처치 흔적 스캐너 제조사와 화질 특성 장비가 찍어 넣은 R 마커 병실 이동 촬영 여부 모델은 보지만 감사자는 물을 수 없는 항목 사후 보강: NEATX가 배액관 3,709장을 수동 주석, 나머지는 자동 분류기 손으로 확인한 다섯 장 가운데 세 장에서 오류 발견 arXiv:2608.12086 데이터 감사 결과 재구성 | 페블러스 원본 도식
▲ 지름길을 의심하려면 의심할 대상이 먼저 기록돼 있어야 합니다 | 페블러스 원본 도식

여기서 문제의 성격이 한 번 바뀝니다. 모델이 배액관에 반응한다는 사실을 이 연구가 확인할 수 있었던 것은 다른 팀이 수년에 걸쳐 배액관 라벨을 만들어 뒀기 때문입니다. 그런 보강 라벨이 없는 항목은 애초에 질문의 대상이 되지 못합니다. 심장비대 실험에서 지름길이 안 보인 것인지, 아니면 기록되지 않은 다른 맥락을 잡고 있어서 스캐너로 나눈 곡선에 걸리지 않은 것인지도 지금의 라벨로는 구분할 방법이 없습니다.

5

라벨 옆에 무엇을 함께 적어 둘 것인가

센서로 찍은 데이터에 현장 조건이 함께 새겨지는 상황은 어디에나 있습니다. 제조 검사에서는 카메라 기종과 조명, 라인 번호가 불량률과 얽힙니다. 특정 라인의 불량이 많으면 모델은 결함의 모양이 아니라 그 라인의 조명 색온도를 배울 수 있습니다. 자율주행에서는 센서 구성과 날씨, 지역별 도로 규격이 주행 상황 라벨과 함께 굴러다닙니다. 어느 쪽이든 결과 라벨만 저장하는 순간, 배액관에 해당하는 항목은 이미지 안에만 남습니다.

그래서 데이터셋을 설계하거나 인수받는 자리에서 던져 볼 질문은 정확도 지표 바깥에 있습니다. 우리 라벨링 스키마는 결과 라벨 옆에 무엇을 함께 기록하고 있습니까. 장비 식별자와 촬영 조건, 대상에 가해진 처치 이력을 남기고 있습니까. 남기고 있다면 그 값이 사람이 확인한 것인지, 다른 모델이 채운 것인지 구분됩니까. 이 논문의 배액관 라벨은 세 번째 질문에서 걸렸고, 그 결과 실험 전체의 해석 폭이 좁아졌습니다.

층별 프로브 자체도 그대로 가져다 쓸 만한 도구입니다. 백본을 얼려 두고 선형 분류기만 붙이면 되니 재학습 비용이 들지 않고, 서브그룹 라벨만 있으면 어느 깊이에서 무엇이 갈라지는지 볼 수 있습니다. 다만 연구진이 검증한 것은 CNN 구조의 단일 모델 하나입니다. 트랜스포머 계열이나 다른 데이터셋에서도 같은 층별 규칙이 성립하는지는 아직 열려 있습니다.

Editor's Note: 페블러스가 데이터 품질 현장에서 자주 마주치는 장면도 이와 비슷합니다. 라벨링 지침은 대개 무엇을 정답으로 적을지에 집중하고, 그 데이터가 어떤 장비와 어떤 조건에서 나왔는지는 파일명이나 담당자의 기억에 남습니다. 모델이 이상하게 잘 맞거나 이상하게 못 맞을 때 되짚을 단서가 그때 사라집니다. 맥락 필드 하나를 스키마에 추가하는 비용이, 나중에 별도 주석 프로젝트를 여는 비용보다 훨씬 쌉니다.

같은 축의 이전 글로는 라벨링 화면의 조작 기록을 감사 증거로 남기는 방법을 본 라벨링 클릭의 감사 증거화, 라벨 없이 심장 MRI에서 표현형을 찾은 확산 오토인코더 연구, 정확도가 오히려 격차를 키우는 조건을 다룬 희소 자원 배분의 정확도 함정이 있습니다. 논문 원문은 arXiv:2608.12086, 코드는 GitHub 저장소에서 볼 수 있습니다.

R

참고문헌

1차 소스

지름길 학습 선행 연구

데이터셋·모델 배경

  • 6.Wang, Z., Wu, Z., Agarwal, D., & Sun, J. (2022). "MedCLIP: Contrastive Learning from Unpaired Medical Images and Text." Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing (EMNLP), 3876–3887. — 이 글이 분석하는 MedCLIP 모델의 원 논문.
  • 7.Cheplygina, V., Damgaard, C., Eriksen, T. N., Juodelyte, D., & Jiménez-Sánchez, A. (2026). "Augmenting Chest X-ray Datasets with Non-Expert Annotations." Medical Image Understanding and Analysis (MIUA), 133–144. — NEATX 프로젝트. NIH-CXR14 배액관 3,709장 수동 주석의 출처.
  • 8.Sourget, T., Restrepo, D., Hudelot, C., Ferrante, E., Christodoulidis, S., & Vakalopoulou, M. (2026). "Fairness and Robustness of CLIP-Based Models for Chest X-Rays." Fairness of AI in Medical Imaging, 11–21. — CLIP 계열 모델 6종이 배액관 있는 이미지에서 더 좋은 성능을 냈다는 선행 관찰.
  • 9.Jiménez-Sánchez, A., Avlona, N., de Boer, S., et al. (2025). "In the Picture: Medical Imaging Datasets, Artifacts, and Their Living Review." Proceedings of the 2025 ACM Conference on Fairness, Accountability, and Transparency (FAccT), 511–531. — 공개 의료 영상 데이터셋의 아티팩트·라벨 오류를 정리한 living review.
  • 10.Rafferty, A., & Rajan, A. (2026). "Limitations of Public Chest Radiography Datasets for Artificial Intelligence: Label Quality, Domain Shift, Bias and Evaluation Challenges." arXiv:2509.15107. — 공개 흉부 X선 데이터셋의 라벨 품질 한계를 다룬 서베이.