Executive Summary
이 글은 뇌 MRI 이상 탐지 AI의 성적표가 모델이 아니라 채점 절차 때문에 흔들린 사례를 본다. 10월 1일 arXiv에 올라온 논문이고, 저자들이 MIRTO라고 이름 붙인 평가 방법을 제안한다. 대상은 건강한 사람의 뇌 영상만 보고 학습한 뒤 병변이 있는 영상에서 이상한 자리를 스스로 찾아내는 모델 넷이다. 이런 모델은 보통 점수 하나로 순위가 매겨지는데, 그 점수 뒤에는 거의 보고되지 않는 선택들이 줄지어 서 있다.
가장 눈에 띄는 숫자는 0.873과 0.583이다. 한 확산 모델이 내놓은 이상 지도를 잘못된 축 순서로 읽고 잘라 낸 시야를 되돌리지 않았더니 칸 단위 점수가 0.873에서 0.583으로 내려갔다. 모델도 가중치도 시험 데이터도 그대로였다. 그런데 같은 사고에서 장 단위 점수는 0.112만큼밖에 움직이지 않아, 요약된 숫자만 보던 자리에서는 사고가 보이지 않았다.
4절까지는 논문이 잰 것과 저자들이 밝혀 둔 수치를 따라간다. 5절에서 학습 데이터 품질 쪽으로 옮기는 대목은 논문에 없는 이 글의 해석이다.
주요 수치
아래 네 가지는 모두 같은 논문 한 편에서 나왔다. 앞의 둘은 하나의 사고를 두 점수가 얼마나 다르게 보았는지를 나란히 놓은 것이고, 셋째는 전체 평균 바깥으로 흩어 놓았을 때에야 드러난 신호다. 넷째에서는 지표를 바꾸자 점수를 쥐고 있는 쪽까지 달라졌다.
출처: Kafee Hernashki·Chatterjee, MIRTO: a registration-gated, multiverse-tested evaluation protocol for unsupervised anomaly segmentation in brain MRI arXiv:2610.02136(2026-10-01) 초록 및 본문
0.873→0.583
축 순서가 어긋났을 때 칸 단위 점수
모델도 가중치도 시험 데이터도 바뀌지 않았다
0.112
같은 사고에서 장 단위 점수가 움직인 폭
칸 단위는 0.290 움직였다. 중앙값으로 보면 0.083이다
24%
거꾸로 짚은 환자의 비율
환자별 점수가 0.5 아래다. 동전을 던지는 쪽이 낫다
0.95 vs 0.14
'어떤 모델인가'가 점수를 설명하는 몫
칸 단위 점수에서는 0.95, 병변 민감도에서는 0.14다
점수를 떨어뜨린 것은 모델이 아니었다
뇌 MRI 이상 탐지는 병변의 모양을 미리 배우지 않는다. 건강한 사람의 뇌 영상만 잔뜩 보여 주고 "정상이란 이렇게 생긴 것"을 익히게 한 다음, 새 영상에서 그 정상에서 벗어난 자리를 스스로 짚게 한다. 결과물은 영상과 같은 크기의 지도 한 장이다. 칸마다 "여기가 얼마나 이상한가"라는 점수가 적혀 있고, 이것을 이상 지도라 부른다.
채점은 그 지도를 정답과 맞대 보는 일이다. 정답은 사람이 종양 영역을 칠해 둔 라벨이다. 이번 논문이 쓴 시험 데이터는 BraTS 2020의 환자 312명이고, 네 모델 모두 같은 건강 영상으로 학습한 뒤 같은 환자들로 시험했다. 비교한 방법은 REFLECT, cDDPM, UCCD, AnomalyDINO 넷이다. 한 번의 수송으로 정상 영상을 복원하는 방식, 조건을 준 확산 모델 두 종류, 학습 없이 기성 기반 모델의 특징만 기억해 두고 쓰는 방식을 고르게 담았다.
점수로는 칸 단위 점수(voxel AUROC)를 많이 쓴다. 병변 칸 하나와 정상 칸 하나를 아무렇게나 뽑았을 때 모델이 병변 쪽에 더 높은 점수를 줄 확률이다. 1에 가까우면 잘 짚은 것이고, 0.5는 동전 던지기다. 0.5보다 낮으면 모델이 거꾸로 짚고 있다는 뜻이다.
사고는 지도를 읽는 자리에서 났다. 모델마다 전처리가 달라서 각자 자기 방식대로 지도를 저장한다. 어느 축을 먼저 적을지, 시야를 어디까지 잘라 냈는지, 해상도를 얼마로 줄였는지가 제각각이다. 정답과 맞대려면 그 선택들을 하나씩 되돌려야 하는데, 저자들은 이 되돌리기가 "틀리기는 쉽고 눈에 띄기는 어렵다"고 적었다. 실제로 cDDPM의 지도를 잘못된 축 순서로 읽고 잘라 낸 시야를 무시한 대응이 쓰였고, 그때 칸 단위 점수는 0.583이었다. 같은 지도를 올바르게 되돌리자 0.873이 나왔다. 차이는 0.290이고 구간은 0.277에서 0.302다.
축 순서가 어긋나면 지도가 통째로 뒤집히거나 비틀린다. 3차원 영상은 숫자 덩어리로 저장되고, 어느 방향을 첫 번째 축으로 적어 두었는지는 파일 바깥의 약속으로만 전해진다. 그 약속이 어긋나면 왼쪽 앞의 신호가 오른쪽 위로 가서 앉는다. 모델은 종양 자리를 제대로 짚었는데 채점표가 다른 자리를 보고 있는 것이다.
요약 점수는 왜 조용했나
이 논문에서 가장 서늘한 대목은 떨어진 숫자가 아니라 떨어지지 않은 숫자다. 같은 사고에서 장 단위 점수(slice AUROC)는 0.112만 움직였고, 환자별로 늘어놓고 가운데 값을 보면 0.083이었다. 칸 단위 점수가 0.290 움직이는 동안이다.
두 점수가 묻는 질문이 다르기 때문이다. 칸 단위 점수는 "이 칸이 병변인가"를 칸마다 묻는다. 장 단위 점수는 MRI를 한 장씩 썬 단면을 놓고 "이 단면에 병변이 있는가"만 묻고, 단면 안에서 가장 높은 이상 점수 하나로 그 단면을 대표한다. 지도가 비틀리면 칸 하나하나의 좌표는 전부 어긋나지만, 어느 단면이 수상한지는 상당 부분 남는다. 그래서 세밀한 점수는 무너지는데 요약된 점수는 멀쩡해 보인다.
그러면 사고는 무엇으로 잡았는가. 정답 라벨을 쓰지 않는 진단이 잡았다. 전체 평균 대신 환자를 한 사람씩 떼어 점수를 매기고, 0.5보다 낮은 사람이 몇 명인지를 센다. 저자들은 이 비율을 거꾸로 짚은 비율이라 부른다. 잘못 읽은 지도에서는 cDDPM 시험 환자의 24%가 여기 걸렸다. 평균 한 칸으로 뭉쳐 두면 보이지 않고, 사람 단위로 흩어 놓으면 네 명 중 한 명이 뒤집혀 있는 것이 그대로 드러난다.
이 신호는 혼자 서 있지 않다. 논문은 정답 라벨 없이 잴 수 있는 양을 다섯 가지 세워 두었다. 거꾸로 짚은 비율 말고도, 같은 종양을 가리켜야 할 두 조건에서 환자별 점수의 순위가 함께 가는지 보는 순위 안정성이 있고, 종양이 얼마나 눈에 띄는지는 환자에게 속한 성질이니 방법이 달라져도 환자별 점수가 같이 움직여야 한다는 공유 현저성이 있다. 어느 쪽도 정답을 들여다보지 않는다. 채점표가 제자리에 있는지를 모델의 성적과 떼어 놓고 물을 수 있다.
여기서 잰 것은 이상 탐지 모델의 성능이 아니다. 잰 것은 채점표가 모델의 출력을 제자리에 놓고 있느냐다. 그 하나가 어긋나면 모델이 병변을 아무리 정확히 가려내도 점수는 동전 던지기 근처로 내려온다. 그런데 그 추락은 흔히 보고되는 요약 점수에 거의 나타나지 않는다.
같은 사고가 한 번 더 있었다
한 번이면 누군가의 부주의로 접을 수 있다. 저자들은 이 벤치마크를 조립하는 동안 같은 종류의 사고를 한 번 더 만났다고 적어 두었다. 이번에는 REFLECT의 지도를 내보내는 과정에서였다. 시험 환자의 26%가 거꾸로 짚은 판정을 받았고, 칸 단위 점수는 0.936에서 0.616으로 내려갔다. 그동안 장 단위 점수는 0.915에 그대로 머물렀다.
두 번째 사고가 중요한 까닭은 수치가 더 크기 때문이 아니다. 같은 사람들이 같은 주의를 기울이며 벤치마크를 만드는 동안에도 다시 일어났기 때문이다. 방법마다 자기 축 순서와 자기 잘라 내기와 자기 해상도로 지도를 저장하는 한, 비교할 때마다 되돌려야 할 변환이 생기고 그 변환은 조용히 틀린다.
MIRTO가 모든 비교 앞에 검문소를 세운 이유가 이것이다. 기하가 맞는지 먼저 확인하고 통과한 쌍만 점수를 매긴다. 검문소의 성능은 답을 아는 가짜 영상으로 미리 검증했다. 그대로 둔 영상, 공 모양에서 40%를 잘라 낸 시야, 한 칸 깎아 낸 영상, 20% 부풀린 영상은 통과시키고, 면내 뒤집기와 축 맞바꾸기와 두 단면 밀림은 걸러 낸다. 뒤집기와 축 맞바꾸기는 순위 안정성과 거꾸로 짚은 비율 두 진단만으로 환자 서른 명만 있어도 거짓 경보율 0.05에서 빠짐없이 잡혔다. 실제 자료에서는 방법과 환자를 짝지은 1,344쌍 가운데 1,342쌍이 검문소를 통과했다. 네 방법 각각에 시험 환자 312명과 검증 환자 24명을 짝지어 나온 수다.
채점 경로 15,552가지를 전부 돌린다
축 순서는 채점 절차에 숨은 선택 가운데 하나일 뿐이다. 어떤 영상을 기준으로 삼을지, 뇌 전체를 볼지 시야가 겹치는 부분만 볼지, 임계값을 어느 데이터에서 정할지, 거짓 양성을 몇 세제곱센티미터까지 허용할지, 작은 덩어리를 병변으로 칠지, 얼마나 겹쳐야 맞혔다고 할지, 환자별 점수를 평균으로 묶을지 가운데 값으로 묶을지가 전부 선택이다. 논문은 이런 축을 열 개 세우고 각 축의 선택지를 모두 곱했다. 방법 하나당 155,520가지가 나온다.
그중 누가 봐도 변호할 수 있는 조합만 남겼다. 기준 영상은 정본 하나로 고정하고, 칸 부피는 실제 값만 쓰고, 임계값은 검증 데이터·등각 예측·시험 맞춤 세 가지만 인정한다. 그렇게 추리면 지표 하나당 2,592가지, 여섯 지표를 합쳐 15,552가지가 남는다. 모든 비교를 이 15,552가지 경로에서 되풀이하고, 환자 단위로 짝지은 부트스트랩 구간과 다중 비교 보정을 붙인다. 심리학에서 출발한 멀티버스 분석을 의료 영상 채점에 옮겨 놓은 셈이다.
이 발상이 이 논문에서 처음 나온 것은 아니다. 하나의 결론을 변호할 수 있는 분석 경로 전부에 걸쳐 확인해 보는 멀티버스 분석과 명세 곡선이 먼저 있었고, 같은 자료를 여러 연구 팀에 동시에 맡겨 본 설계에서는 합리적인 경로들끼리도 결론이 갈렸다. 의료 영상 쪽에도 비슷한 경고가 쌓여 있었다. 챌린지 순위가 어떤 지표와 어떤 집계를 쓰느냐에 따라 흔들린다는 보고가 있었고, 시험 데이터를 들여다보고 내린 선택이 성능 추정을 부풀린다는 보고도 있었다. 논문이 새로 얹은 것은 임계값으로 이상 영역을 잘라 내는 작업에 반드시 따라붙는 한 가지다. 어느 지점에서 끊어 이상이라 부를지를 숨기지 않고 적어 두는 일이다.
전부 돌려 보면 지표마다 점수를 쥐고 있는 것이 다르다. 칸 단위 점수와 칸 단위 정밀도-재현율 면적에서는 "어떤 모델을 썼는가"가 결과 차이의 0.95 이상을 설명한다. Dice에서는 0.77이다. 그런데 병변 민감도에서는 0.14로 내려앉고, 대신 병변을 무엇으로 정의하고 얼마나 겹쳐야 맞혔다고 칠지가 결과를 가른다. 같은 모델 묶음을 두고도 어느 지표로 이겼다고 말하느냐에 따라 승자가 바뀔 수 있다는 뜻이다.
같은 방식으로 또 하나가 드러났다. 검증 데이터에서 정한 임계값으로 재면 유의하던 Dice 우위가, 시험에서 실제로 발생한 거짓 양성 부피를 서로 맞추자 사라졌다. 저자들은 정확한 항등식으로 이 차이가 임계값을 옮겨 쓰는 데서 왔음을 밝혔다. 반대 방향의 사례도 있다. REFLECT의 잠재공간 집계 방식을 학습 없이 바꿨더니 같은 거짓 양성 부담에서 Dice가 0.052 올랐다. 더 좋은 모델이 아니라 더 좋은 채점 약속이 점수를 올린 것이다.
저자들은 자기 결과에도 선을 그어 두었다. 가설 아홉 개를 미리 정한 기준에 대고 검정했지만, 프로토콜을 다듬는 데 쓴 환자 집단과 검정에 쓴 집단이 같아서 모든 추론은 탐색적이라고 적었다.
우리가 보는 성능 숫자는 무엇의 숫자인가
모델 성능을 보고받는 자리에서 우리가 실제로 받는 것은 숫자 하나다. 그 숫자가 나오기까지 예측을 어떤 좌표계로 옮겼고, 임계값을 어느 데이터에서 골랐고, 여러 사례를 어떻게 한 줄로 묶었는지는 보고서에 거의 적히지 않는다. 적히지 않은 선택이 틀려도 숫자는 여전히 숫자의 모양을 하고 나온다. 축 순서 하나가 0.873을 0.583으로 끌어내린 사고가 꼭 그랬다. 평가 절차는 모델을 재는 중립적인 잣대가 아니라 그 자체로 데이터를 가공하는 공정이고, 공정에는 품질 결함이 생긴다.
더 눈여겨볼 것은 그 결함이 어디에 숨었느냐다. 사고를 가려 준 것은 거짓말이 아니라 집계였다. 단면 하나를 대표 값 하나로 줄이는 순간 좌표가 어긋난 사실이 함께 지워졌다. 평균과 최댓값은 보기 좋게 정리하는 도구이면서 동시에 결함을 덮는 도구다. 데이터 품질을 전체 지표로만 보는 자리에서 같은 일이 생긴다. 결측률도 중복률도 기준을 넘지 않는데 모델이 특정 구간에서만 틀린다면, 뭉쳐 둔 숫자를 흩어서 단위별로 다시 세어 봐야 한다.
이 논문이 내놓은 해법도 더 똑똑한 지표가 아니었다. 비교를 시작하기 전에 기하가 맞는지 검문하고, 정답을 쓰지 않는 진단으로 뒤집힌 사례가 몇 퍼센트인지 세고, 채점 선택을 하나씩 바꿔 가며 결론이 버티는지 확인한다. 셋 다 모델을 건드리지 않는 절차다. 학습 데이터를 다루는 자리에서도 같은 질문을 걸 수 있다. 라벨과 입력이 같은 좌표에 놓여 있다고 무엇으로 확인했는가. 지금 보고 있는 지표는 뭉쳐진 것인가 흩어진 것인가. 전처리 약속을 하나 바꾸면 결론이 뒤집히는가.
Editor's Note
페블러스가 데이터 품질을 볼 때 되묻는 물음 하나가 이 논문과 겹친다. 지금 보고받은 이 숫자는 무엇을 재고 있는가. 모델의 실력인가, 아니면 그 실력을 재기 위해 깔아 둔 약속들인가. 두 번째 쪽이 틀렸을 때 숫자는 경고를 띄우지 않고 그냥 조금 낮아진다. 축 순서 사고는 요약 점수에 거의 나타나지 않았다. 그 조용함의 가장 선명한 사례다. 다만 이 겹침은 논문이 한 말이 아니라 이 글이 읽어 낸 것이다.
여기까지 읽어 주셔서 감사하다. 원문은 arXiv:2610.02136에서 전문을 볼 수 있고, 이 글의 수치는 초록과 본문에서 직접 확인했다. 평가 절차의 어긋남을 뒤늦게 발견한 경험이 있다면 어떤 신호로 알아챘는지 나눠 주시면 좋겠다.
(주)페블러스 데이터 커뮤니케이션팀
2026년 10월 5일
참고문헌
- 1.Kafee Hernashki, N. & Chatterjee, S. (2026). "MIRTO: a registration-gated, multiverse-tested evaluation protocol for unsupervised anomaly segmentation in brain MRI." arXiv:2610.02136.
- 2.Steegen, S., Tuerlinckx, F., Gelman, A., & Vanpaemel, W. (2016). "Increasing Transparency Through a Multiverse Analysis." Perspectives on Psychological Science, 11(5), 702–712.