Executive Summary

이 글은 같은 진료기록에서 서로 다른 결론이 나올 때 그 차이를 데이터로 가를 수 있는지를 본다. 2026년 9월 24일, 미국 최대 보험자 연합이 3쪽짜리 백서를 냈다. 2023년 초부터 2025년 말까지 입원 청구에서 복합 분류 비율이 약 37%에서 약 40%로 올랐고 그 탓에 2년간 9억 4,200만 달러가 더 나갔다는 것이다. 근거로 내놓은 장면은 영리하다. 2025년 장 수술 청구를 놓고 보면 복합 코딩이 가장 빨리 느는 상위 25% 병원이 나머지 병원보다 중환자실도 덜 썼고 수혈도 덜 했다. 같은 수술인데 기록만 더 아파졌다는 것이다.

그런데 그 분석에는 AI라는 변수가 없다. 백서가 본 것은 청구 데이터뿐이고, 병원마다 무슨 도구를 들였는지는 자료에 없다. 백서 자신의 동사도 조건부다. 시기가 겹친다, 기여하는 것으로 보인다, 연관될 수 있다고 쓴다. 그 조건부를 인과로 굳힌 쪽은 헤드라인이다. 역설적이게도 도구를 넣기 전후를 직접 비교한 연구는 따로 나와 있다. 진료 대화를 받아 적는 도구를 넣은 병원에서 건당 문서화 진단이 3.0개에서 4.1개로 늘었다는 보고 같은 것이다. 이 사안에서 가장 큰 숫자를 가진 문서와 가장 단단한 식별을 가진 문서가 서로 다르고, 언론이 인용한 쪽은 앞의 것이다.

같은 판정이 내려진 적이 이미 한 번 있다. 메디케어 어드밴티지에서 코딩 강도는 20년 논쟁 끝에 계량됐고, 그 초과 지불의 원인은 코딩 관행과 가입자 선별로 나뉘어 추정된다. 그리고 그 격차를 좁힌 것은 고발도 감사도 아니었다. 지불 규칙 자체를 손본 일이었다. 이 글은 보험사 백서의 요약본도 아니고 병원 반박의 대변도 아니다. 아래 여섯 절은 하나의 기록에서 신호와 아티팩트를 갈라내려면 무엇이 필요한지를 순서대로 본다.

5만 5,158건

기준선 대비 초과 복합 분류 건수

건당 평균 1만 1,800달러, 합쳐서 6억 5,300만 달러다

6.5%

가장 자세히 들여다본 계열이 헤드라인 숫자에서 차지하는 몫

장 수술 6,080만 달러를 9억 4,200만 달러로 나눈 값이다

연 4~5달러

가입자 한 사람 몫으로 환산한 증가분

가입자를 1억~1억 1,500만 명으로 잡고 계산한 값이다. 총액은 크지만 1인 몫은 작다

0개

백서가 관측한 AI 사용 변수

표본 크기도 신뢰구간도 추정식도 3쪽 안에 없다

1

3%p가 9억 달러가 되는 길

2026년 9월 24일 미국 최대 보험자 연합인 블루크로스블루실드협회가 백서 한 편을 냈다. 분량은 3쪽이고 저자는 네 명이며 동료심사는 거치지 않았다. 협회는 지역별로 독립된 보험사들의 연합이고 회원사 수는 자기 자료들 사이에서도 31개에서 34개로 엇갈린다. 가입자 총수도 1억 명에서 1억 1,500만 명까지 발표 시점마다 다르다. 이 글은 그래서 정밀한 숫자를 피하고 약 1억 명 남짓, 미국인 세 명 중 한 명이라고만 적는다. 백서가 블루 시스템이라 부르는 것이 그 전체 가입자 집단이다.

백서를 읽기 전에 미국 입원비가 어떻게 매겨지는지부터 봐야 한다. 병원이 환자 한 명을 입원시켜 받는 돈은 진료 항목을 하나씩 더한 값이 아니라, 그 입원 건이 어느 진단명 기준 환자군에 들어가느냐로 정해진다. 그리고 같은 수술이라도 환자에게 어떤 진단이 함께 붙었는지에 따라 환자군이 갈린다. 합병증이나 동반질환이 하나도 없으면 가장 낮은 등급이고, 하나 붙으면 한 칸 위, 그중에서도 주요한 것으로 분류된 진단이 붙으면 또 한 칸 위다. 이 체계에서 진단 코드는 병의 이름인 동시에 가격표다.

백서가 잰 것은 그 가격표가 붙는 빈도다. 2023년 1분기부터 2025년 4분기까지 블루 시스템의 입원 청구를 모아, 합병증이나 동반질환이 붙어 상위 등급으로 분류된 건의 비율을 분기마다 계산했다. 백서는 이 비율이 약 37%에서 약 40%로 올랐다고 적는다. 백서 자신이 대략이라는 말을 붙여 쓰기 때문에 정밀값처럼 옮기면 안 되는 수치다.

먼저 그 3%포인트가 어떻게 움직였는지 보는 편이 낫다. 백서 1쪽에 분기별 꺾은선이 실려 있고, 거기 찍힌 열두 개 값을 읽으면 시작점과 끝점만 이은 직선과는 다른 그림이 나온다. 2023년 2분기와 3분기에는 36.9%까지 내려갔고, 2024년 상반기에 다시 37%대로 되돌아갔다가, 2025년 1분기에 40.1%로 정점을 찍은 뒤 38%대로 내려온다. 계단을 오르듯 올라간 것이 아니라 3%포인트 남짓한 폭으로 요동치면서 우상향했다.

분기별 복합 분류 비율 (블루 시스템 입원 청구, 2023년 1분기 ~ 2025년 4분기) 37% 38% 39% 40% 37.5 36.9 (최저) 40.1 (최고) 39.8 23년 1분기 24년 1분기 25년 1분기 25년 4분기 값은 백서 1쪽 차트에 찍힌 분기별 라벨을 읽은 것이다. 세로축은 37%부터 40%까지만 보여 준다.

시작점 37.5%와 끝점 39.8%만 이으면 완만한 상승이지만, 중간 구간은 36.9%에서 40.1%까지 흔들린다. 백서가 대략 37%에서 대략 40%라고 쓴 이유가 여기 있다.

백서는 이 상승분을 돈으로 환산한다. 2023년을 기준선으로 잡았을 때 그보다 더 나온 상위 등급 분류가 5만 5,158건이고, 건당 평균 1만 1,800달러씩 총 6억 5,300만 달러가 더 지불됐다는 계산이다. 그리고 이 금액이 같은 기간 입원 코딩 강도 증가분 전체의 70%에 해당하며, 블루 시스템 전체로는 2년간 약 9억 4,200만 달러가 더 나갔다고 적는다.

백서가 내놓은 큰 수들끼리는 서로 맞는다. 6억 5,300만 달러를 9억 4,200만 달러로 나누면 69.3%로, 백서가 본문에 쓴 70%와 1%포인트 차이도 나지 않는다. 결론 문단이 6억 5,000만 달러 이상이라고 쓴 대목은 9억 4,200만 달러가 아니라 이 6억 5,300만 달러를 가리킨다. 두 수치가 같은 쪽에 나란히 적혀 있어 섞어 읽기 쉬운 자리다.

맞지 않는 것은 그 바깥이다. 3%포인트가 5만 5,158건이 되려면 전체 입원 건수라는 분모가 있어야 하는데, 백서는 그 분모를 공개하지 않는다. 표본에 들어간 병원이 몇 곳인지, 청구 건수 총계가 얼마인지가 3쪽 어디에도 없다. 5만 5,158건을 3%로 역산하면 약 183만 8,600건이 나오는데, 이 값이 분석 기간 전체를 가리키는지 특정 시점을 가리키는지조차 백서로는 알 수 없다. 연 단위로 풀어 가입자 수로 나눠 보면 통상 알려진 상업보험 입원율보다 낮게 나온다. 이 역산은 맞다고도 틀렸다고도 말할 수 없고, 정합 확인 불가로 남긴다. 이것은 트집이 아니라 이 글의 논지 한가운데에 있는 사실이다. 백서는 9억 달러라는 수를 내놓으면서 그 수를 만든 식을 함께 내놓지 않았다.

1.1검사값 하나가 등급을 올리는 경로

진단 하나가 얼마나 큰 차이를 만드는지는 지불 규정표를 보면 드러난다. 아래는 대장·소장 주요 수술의 세 등급을 연방 메디케어의 2026 회계연도 기준으로 환산한 것이다. 상업보험은 병원마다 따로 협상한 비율을 쓰고 그 계약은 공개되지 않으므로, 이 표는 블루 시스템이 실제로 지불한 금액이 아니다. 같은 수술에서 코드 한두 개가 등급을 어떻게 밀어 올리는지, 그 구조와 규모감을 보여 주는 예시로만 읽어야 한다.

같은 수술, 세 등급 (메디케어 2026 회계연도 상대가중치로 환산한 예시) 약 1만 1,362달러 합병증·동반질환 없음 상대가중치 1.6829 약 1만 6,187달러 동반질환 한 개 상대가중치 2.3972 약 3만 1,041달러 주요 동반질환 한 개 상대가중치 4.5965 +4,825 +14,854 연방 메디케어 기준이며 상업보험 실지불액이 아니다. 지역 임금지수와 자본 가산은 넣지 않은 전미 평균 개념의 예시값이다.

가장 낮은 등급에서 가장 높은 등급까지의 차이는 약 1만 9,679달러다. 같은 수술인데 진단 코드 한두 개로 지불액이 세 배 가까이 벌어진다.

그렇다면 실제로 늘어난 것은 어떤 코드인가. 백서는 장 수술 청구에서 2023년 대비 2025년에 가장 많이 늘어난 진단 열 개를 이름까지 적어 두었다. 백서 자신은 이 목록에서 개별 코드를 짚지 않고 공통점을 짚는다. 이 중 다수가 검사값 하나로 도출된다는 것, 곧 사람이 차트를 읽어 판단하는 진단이 아니라 기계가 수치를 훑어 찾아내기에 최적인 자리라는 것이다.

진단 2023년 2025년 건수 증가
불특정 산증3.3%4.4%+395건
기타 장폐색1.3%2.1%+269건
복강내 농양5.4%6.2%+257건
급성 출혈후빈혈9.6%10.4%+243건
중등도 단백열량영양실조2.5%3.0%+191건
기타 처치후 합병증5.7%6.2%+173건
중증 단백열량영양실조3.9%4.4%+156건
기타 부분 장폐색0.6%1.0%+155건
저삼투압·저나트륨혈증6.5%7.0%+155건
대장게실증1.4%1.8%+150건

장 수술 청구 건 중 해당 진단이 붙은 비율과 건수 증가. 절대 유병률은 급성 출혈후빈혈이 가장 높지만 증가율로는 기타 부분 장폐색이 70%로 가장 빠르다. 빈혈 하나만 대표로 드는 서술은 이 표의 나머지 아홉 개를 지운다.

1.29억 달러에 분모를 붙이면

9억 4,200만 달러는 그 자체로는 크기를 알 수 없는 수다. 분모가 없기 때문이다. 백서도 보도도 이 수를 단독으로 쓴다. 그래서 분모를 세 방향으로 붙여 봤다. 아래 값은 모두 공개 통계에서 끌어온 근사이고, 가정이 두 겹씩 들어가 있다. 백서가 발표한 수치가 아니라는 점을 먼저 적어 둔다.

  • 가입자 한 사람 몫으로 나누면 연 4~5달러다. 2년치를 절반으로 나눈 뒤 가입자 수로 다시 나눈 값이고, 가입자를 1억 명으로 잡으면 4.7달러, 1억 1,500만 명으로 잡으면 4.1달러가 된다.
  • 블루 시스템의 2년치 상업 입원 지출과 견주면 1% 안쪽으로 추정된다. 전미 입원 총원가에서 민간보험 몫을 떼고 그 3분의 1을 블루 계열로 잡은 거친 근사다.
  • 미국 전체 병원 진료비와 견주면 0.03% 수준이다. 다만 이 분모에는 외래까지 들어 있어 실제 비중은 이보다 커야 한다.

세 방향 모두 같은 방향을 가리킨다. 총액으로 들으면 9억 달러지만 한 사람 몫으로 환산하면 한 해 커피 한 잔 값이다. 같은 해 고용주 제공 보험료가 9%, 개인 시장 보험료가 그보다 훨씬 크게 오른 것과 견주면 이 성분은 작다. 그리고 그 인상의 주된 원인으로 지목되는 것은 코딩이 아니라 보조금 만료 같은 정책 변수다.

분모를 협회 자신이 붙여 본 적도 한 번 있다. 3월 이슈브리프는 가입자 6,200만 명 표본에서 1인당 입원 비용이 2023년에서 2024년 사이 9% 올랐고, 그중 코딩 강도가 설명하는 몫을 약 20%로 추정했다. 9%의 20%면 1.8%포인트다. 발행 주체 스스로도 이 성분을 입원비 상승의 주범이 아니라 다섯 요인 중 하나로 잡고 있다는 뜻이다. 다만 그 20%를 어떻게 구했는지는 브리프에도 적혀 있지 않다. 이 글이 9월 백서에 대고 묻는 것과 같은 물음이 3월 문서에도 그대로 남는다.

그러니 이 글은 금액의 크기를 다투지 않는다. 한 사람 몫이 작다고 해서 문제가 사라지지도 않는다. 이 사안의 무게는 총량이 아닌 판정 방식에 실린다. 같은 진료기록을 놓고 한쪽은 기록이 정확해졌다고 하고 다른 쪽은 청구가 부풀었다고 하는데, 그 판정을 지금은 이해당사자 각자가 자기 잣대로 내리고 있다. 다음 절부터는 그 잣대를 하나씩 들여다본다.

2

진단은 있는데 처치가 없다는 시험

진단이 늘었다는 사실만으로는 아무것도 가려지지 않는다. 환자가 정말 더 아팠을 수도 있고, 그동안 빠뜨리던 진단을 이제 제대로 적기 시작했을 수도 있다. 백서는 이 막다른 골목을 우회할 장치를 하나 만들어 낸다. 진단이 사실이라면 그 진단에 따라붙어야 할 처치가 있다는 것, 그러니까 기록과 행위를 대조해 보면 된다는 것이다.

이 설계는 영리하다. 데이터 품질 작업에서 정합성 규칙이라 부르는 것과 정확히 같은 계열이기 때문이다. 어떤 필드의 값이 참이라면 다른 필드에 반드시 나타나야 할 흔적이 있고, 그 흔적이 없으면 값을 의심한다. 백서는 그 규칙을 임상에 세웠다. 중증 빈혈이 있었다면 수혈 기록이 따라와야 하고, 중환자 수준의 합병증이 있었다면 중환자실 이용이 따라와야 한다는 것이다. 청구 데이터만으로는 환자 상태를 알 수 없다는 오래된 한계를, 청구 데이터 안의 두 층을 서로 대조하는 방식으로 비켜 간다.

백서가 그 규칙을 댄 자리는 2025년 한 해의 장 수술 청구다. 코딩 증가가 빠른 상위 25% 병원을 한 무리로 묶고 나머지 병원을 다른 무리로 묶어, 표 두 개에 걸쳐 일곱 가지 지표를 나란히 놓았다. 아래는 그 둘을 합친 것이다.

지표 코딩 증가 상위 25% 병원 나머지 병원
복합 분류 비율75.6%65.0%
중환자실 이용률11.5%13.2%
수혈률3.6%3.9%
재수술률1.7%1.5%
재원일수 중위4.0일4.0일
빈혈 진단율13.7%9.9%
빈혈 진단 건 중 수혈률16.9%19.3%

2025년 한 해, 대장·소장 주요 수술 청구. 시간에 따른 변화가 아니라 같은 해 병원들 사이의 비교다. 백서 서술문은 복합 분류 비율을 76%라 적지만 같은 쪽 표의 값은 75.6%다.

이 표에서 가장 무거운 것은 마지막 두 줄이다. 코딩이 빠르게 느는 병원은 빈혈을 훨씬 더 자주 찾아냈다. 13.7%와 9.9%, 상대적으로 38% 높은 빈도다. 그런데 빈혈을 진단받은 환자 중 실제로 수혈을 받은 비율은 그 병원들이 오히려 낮다. 16.9%와 19.3%다. 빈혈을 더 많이 찾아낸 쪽이 그 빈혈을 덜 치료했다는 뜻이고, 이것이 백서가 겨눈 지점이다. 새로 잡힌 빈혈이 임상적으로 더 가벼운 것들이었거나, 애초에 치료가 필요 없는 수준이었다는 해석이 가능해진다.

같은 표는 반대 방향의 행도 하나 갖고 있다. 재수술률은 상위 25% 병원이 1.7%로 나머지의 1.5%보다 높다. 처치를 덜 했다는 가설과 어긋나는 값이다. 백서 자신도 이 대목을 알고 썼다. 원문의 표현은 비슷하거나 낮은 수준의 서비스 강도라는 것이고, 그 비슷하거나라는 단서를 빼면 백서의 표가 백서의 문장을 반증한다. 이 글이 그 단서를 그대로 옮기는 까닭은 균형 맞추기와 무관하다. 표에 있는 값을 지우지 않는 태도가 이 사안에서 양쪽 모두에게 요구되기 때문이다.

2.1그 시험이 서 있는 땅의 넓이

대조표를 읽을 때 반드시 붙여야 할 경계가 셋이다. 첫째, 이것은 시계열이 아니다. 표 머리글에 적힌 기간은 2025년 한 해뿐이고, 비교 대상은 같은 해의 두 병원 무리다. 그러니 시간이 지나면서 수혈이 늘지 않았다는 식의 문장은 틀린다. 정확한 진술은 더 많이 진단한 병원이 더 적게 처치했다는 쪽이다. 둘째, 모집단이 좁다. 이 표는 대장·소장 주요 수술 한 계열에서만 나온다. 셋째, 그 계열이 전체 그림에서 차지하는 자리가 생각보다 작다.

가장 상세한 증거가 덮는 범위 0 10억 달러 장 수술 계열 단독 증가분 6,080만 달러 2차 진단이 만든 증가분 6억 5,300만 달러 블루 시스템 전체 추정 9억 4,200만 달러 대조표가 나온 계열은 두 번째 막대의 9.3%, 세 번째 막대의 6.5%다. 두 비율은 백서가 준 값들을 나눠 얻은 것이다. 백서에는 이 나눗셈이 실려 있지 않다. 백서가 왜 장 수술 계열을 골라 보여 줬는지, 선정 기준은 3쪽 안에 없다.

진단과 처치를 대조한 증거는 전체 금액의 10분의 1 아래에서만 만들어졌다. 나머지 90% 이상에 대해서는 같은 대조가 제시되지 않았다.

이 차이가 중요한 이유는 주장의 넓이와 근거의 넓이가 다르기 때문이다. 9억 4,200만 달러는 입원 전반에 대한 추정이지만, 진단과 처치가 어긋난다는 증거는 한 계열에서만 나왔다. 부분집합에서 확인한 결론을 전수로 옮기면 그 순간부터 그것은 관측이 아니라 가정이다. 백서가 이 계열을 고른 기준도 3쪽 안에 적혀 있지 않다.

2.2모든 코드가 한쪽으로 몰린 것도 아니다

백서는 장 수술에서 늘어난 진단 열 개를 두 병원 무리로 나눠 다시 보여 준다. 이 그림이 백서 쪽 주장의 가장 강한 물증이자 동시에 가장 정직한 대목이다. 급성 출혈후빈혈은 상위 25% 병원에서 5.64%포인트 올랐는데 나머지 병원에서는 0.12%포인트 내려갔다. 사실상 한쪽에서만 벌어진 일이다. 반면 목록 맨 아래 대장게실증은 두 무리의 차이가 0.04%포인트뿐이고, 그 위 기타 부분 장폐색도 0.14%포인트에 그친다.

2023년 대비 2025년 진단 증가폭 (%포인트) 코딩 증가 상위 25% 병원 나머지 병원 급성 출혈후빈혈 +5.64 −0.12 불특정 산증 +2.49 +0.58 저삼투압·저나트륨혈증 +2.31 +0.03 기타 처치후 합병증 +1.88 +0.12 복강내 농양 +1.60 +0.42 중증 영양실조 +1.44 +0.24 기타 장폐색 +1.19 +0.56 중등도 영양실조 +1.12 +0.39 기타 부분 장폐색 +0.51 +0.37 대장게실증 +0.46 +0.42 맨 위 한 행만 두 무리의 방향이 갈린다. 맨 아래 두 행은 두 무리가 거의 같은 폭으로 늘었다.

열 개 중 병원 무리 간 격차가 뚜렷한 것은 절반 정도다. 모든 코드가 상위 병원에 몰렸다고 일반화하면 이 그림의 아래쪽이 지워진다.

2.3같은 협회의 앞선 분석에는 시계열이 있다

9월 백서가 시계열을 갖지 못한 자리를, 같은 협회가 반년 앞서 낸 분석이 일부 메운다. 2026년 3월에 나온 이슈브리프는 가입자 약 6,200만 명을 덮는 계열사 부분집합에서 2022년 2분기부터 2025년 1분기까지의 입원 청구를 봤고, 초점을 산과 입원과 급성 출혈후빈혈 코딩 하나에 좁혔다.

거기서 나온 그림은 9월 백서보다 선명하다. 산후 빈혈 코딩이 30% 넘게 늘어난 병원 무리에서 산과 입원에 이 진단이 붙은 비율은 4.0%에서 12.3%로 세 배가 됐다. 같은 무리의 수혈률은 같은 기간 0.8%에서 1.2%로 0.4%포인트 오르는 데 그쳤다. 증가율이 30% 이하인 병원들에서는 같은 진단 비율이 7.9%에서 8.2%로 거의 움직이지 않았다. 이것은 병원 간 비교가 아니라 한 무리 안에서의 시간 변화이고, 그래서 9월 백서의 횡단 비교보다 해석의 여지가 좁다.

다만 이 비교에도 경계를 하나 붙여야 한다. 두 무리를 가른 기준이 다름 아닌 그 진단의 증가율이다. 그러니 고성장 무리에서 진단 비율이 세 배가 된 것 자체는 무리를 그렇게 정의한 결과이기도 하다. 이 그림에서 정보를 갖는 쪽은 진단이 아니라 처치다. 진단이 세 배가 되는 동안 수혈은 0.4%포인트 움직였다는 대조가 남는다. 덧붙여 3월 브리프는 표본에 넣은 병원의 기준까지 밝혀 두었다. 산과 입원이 250건을 넘는 병원만 들어갔다는 것인데, 9월 백서에는 이런 기준이 한 줄도 없다.

그리고 이 분석에는 청구 데이터 바깥의 잣대가 한 번 등장한다. 계열사 한 곳이 자기 지역에서 코딩 증가가 가장 두드러진 병원 시스템의 산과 사례를 직접 감사해 봤더니, 산후 빈혈로 코딩된 건 가운데 임상 기준을 충족한 것은 20%가 되지 않았다. 차트를 열어 본 결과라는 점에서 이 한 문장은 청구 데이터 안에서만 만든 어떤 대조보다 무겁다. 감사를 함께한 사람이 그 계열사 소속 산부인과 전문의라는 것까지는 브리프에 적혀 있고, 표본 크기와 판독 절차는 적혀 있지 않다. 병원 시스템 한 곳의 자체 감사이므로 이 역시 단독으로는 전수 판정의 근거가 되지 못한다. 3월 분석이 산과 입원 계열 전체에서 잡아낸 증가분은 분석 기간에 걸쳐 2,200만 달러였다.

3

그 분석에 AI는 들어 있지 않다

여기까지가 백서가 실제로 보여 준 것이다. 청구 데이터에서 상위 등급 분류가 늘었고, 그 증가가 일부 병원에 몰렸으며, 그 병원들의 처치 지표는 대체로 낮았다. 그런데 이 사안이 뉴스가 된 이유는 이 대목이 아니다. 헤드라인이 말한 것은 AI가 의료비를 올리고 있다는 쪽이었다. 그 문장이 어디서 생겼는지 따라가 보면, 백서 자신이 쓴 자리에서는 아직 그 문장이 아니다.

백서에서 AI가 등장하는 문장은 세 곳이고, 세 곳 모두 조건부다. 요약부는 이 상승이 병원들의 새 AI 청구 소프트웨어 도입과 시기가 겹친다(coincides with)고 쓴다. 진단 동인을 다루는 절은 그 기술들이 기여하는 것으로 보인다(appear to be contributing)고 쓴다. 결론부는 AI 기반 수익주기 도구의 체계적 사용이 6억 5,000만 달러 이상과 연관될 수 있다(may be linked to)고 쓴다. 단정하는 동사가 한 번도 나오지 않는다.

조건부로 쓴 이유는 분명하다. 백서는 AI 사용 여부를 관측하지 않았다. 관측한 것은 청구 데이터뿐이고, 어느 병원이 어떤 도구를 도입했는지는 자료에 들어 있지 않다. 그래서 백서에는 AI를 쓴 병원과 쓰지 않은 병원을 나눠 비교한 대조가 하나도 없다. 대조표의 상위 25%는 AI 도입 여부로 나눈 무리가 아니라 코딩 증가 속도로 나눈 무리다. 원인으로 지목된 변수 대신 결과 쪽 변수로 집단을 갈랐다는 뜻이고, 이 설계로는 원인을 가릴 수 없다. 백서의 조건부 동사는 겸양이 아니라 자료의 한계를 정확히 반영한 표기다.

그 한계는 발표문으로 넘어가면서 조금 흐려진다. 같은 날 협회가 낸 보도자료에서 제품·데이터사이언스 부문 수석부사장 루크 챌커는 이렇게 말한다.

"환자가 정말 더 아프다면 우리는 더 많은 치료를 보게 될 것이다. 예컨대 이 병원들에서 빈혈 진단이 눈에 띄게 늘고 있는데 수혈은 그에 상응해 늘지 않았다. 진단과 치료의 단절은 AI가 더 아픈 환자가 아니라 더 많은 청구 가능한 상태를 찾아내고 있음을 시사한다."

앞의 두 문장은 백서가 보여 준 것 그대로다. 마지막 문장에서 주어가 바뀐다. 자료가 보여 준 것은 진단과 처치의 어긋남이고, 그 어긋남에 AI라는 이름을 붙이는 일은 자료가 아니라 해석이 한다. 시사한다는 동사를 쓴 것은 여전히 조심스럽지만, 주어 자리에 AI가 들어온 순간 문장은 인과의 모양을 갖는다.

같은 인물이 며칠 뒤 기술 매체 인터뷰에서는 다른 어조로 말한다. 병원과 보험사가 각자 자동화를 늘리는 상황을 두고 전쟁이 아니라 완전히 일방적인 학살이라고 표현한 대목이다. 절제된 발표문과 이 문장이 같은 사람에게서 나왔다는 사실은, 이 논쟁에서 같은 자료가 어떤 자리에서 어떻게 말해지는지를 보여 준다. 덧붙이면 그 기사에는 병원 쪽 입장이 없다.

3.1반년 전 발표문은 한 걸음 더 나갔다

조건부가 큰 수를 만나면 어떻게 되는지는 3월 발표문에 남아 있다. 앞 절에서 본 3월 이슈브리프는 산과 입원 계열에서 2,200만 달러를 잡아냈는데, 그 브리프를 알린 발표문은 훨씬 큰 수를 싣는다. 비용 영향이 약 23억 달러에 이르며, 연구진은 입원 지출 약 6억 6,300만 달러와 외래 지출 최소 16억 7,000만 달러가 전국적으로 더 공격적인 AI 기반 코딩 관행과 관련될 수 있다고 추정한다는 문장이다.

관련될 수 있다는 조건부는 여기서도 유지된다. 문제는 다른 데 있다. 이 수치들은 가입자 6,200만 명 표본에서 관측한 비율을 미국 전체로 투사해 만든 값인데, 그 투사 계산이 이슈브리프 본문에도 발표문에도 실려 있지 않다. 표본에서 직접 집계한 2,200만 달러와, 전국으로 늘려 잡은 23억 달러가 같은 문서군 안에 나란히 놓인다. 9월 건은 이 점에서 다르다. 백서와 발표문의 숫자가 서로 어긋나지 않고, 9월 발표문은 백서에 없는 수를 새로 얹지 않는다.

혼동하기 쉬운 자리를 하나 짚어 둔다. 3월 분석의 입원 지출 추정치와 9월 백서의 2차 진단 증가분은 숫자가 거의 같아 보이지만 다른 값이다. 앞의 것은 전국으로 투사한 추정이고 뒤의 것은 표본 안에서 집계한 금액이며, 분석 기간도 대상 진료도 다르다. 두 수를 같은 것으로 읽으면 두 번 확인된 사실처럼 보이지만 실제로는 방법이 다른 두 계산이다.

3.2도입률 수치 셋은 서로 다른 것을 센다

AI가 원인이라는 서술을 떠받치는 또 하나의 축은 도입률이다. 보도에는 세 가지 숫자가 돌아다니는데, 세는 단위와 세는 대상이 모두 다르다. 같은 문장에 나열하면 하나의 사실을 세 번 확인한 것처럼 읽히지만 그렇지 않다.

수치 무엇을 셌나 표본과 시점
60% 이상검사 결과와 전자기록을 훑어 2차 진단을 찾아내는 AI를 쓰는 병원 시스템의 비율협회 자체 조사, 표본 크기와 방법 비공개. 2026년
46%청구·코딩·클레임 업무에 AI를 쓰는 병원·헬스시스템의 비율재무관리협회와 벤더의 공동 설문. 2023년
71%와 61%앞은 예측 AI 전반을 쓰는 병원, 뒤는 그중 청구 절차에 쓰는 병원의 비율연방 보건정보 담당 부서의 전수 설문. 2,253곳, 응답률 51%. 2024년

가장 자주 인용되는 60%는 병원이 아니라 병원 시스템, 곧 여러 병원을 묶은 법인 단위다. 그리고 이 수치는 백서 3쪽 본문에 없고 같은 날 발표문에만 있다.

셋 중 방법이 가장 투명한 것은 세 번째다. 연방 설문은 표본 수와 응답률을 밝히고, 예측 AI 전반과 청구 용도를 나눠 보고한다. 그 자료에서 청구 절차에 AI를 쓰는 비율은 1년 만에 36%에서 61%로 올랐다. 도입이 빠르게 번진다는 데는 여러 자료가 같은 방향을 가리킨다. 다만 어느 자료도 도입 시점과 도입 기관을 청구 데이터에 이어 붙여 주지는 않는다. 백서의 공백이 거기서 메워지지 않는다.

3.3도입 자체를 관측한 연구는 따로 있다

여기서 이 글이 조사 중에 발견한 것을 적는다. AI 도입이 코딩을 움직인다는 명제를 뒷받침하는 더 단단한 증거는 보험사 백서가 아니라 의학 저널 쪽에 있었다. 2025년 12월 npj 디지털 메디신에 실린 정책 브리프가 그것이고, 제목부터가 코딩 군비경쟁이다.

이 브리프가 모은 것은 도입 전후를 관측한 사례들이다. 진료 대화를 듣고 기록 초안을 만드는 도구를 넣은 한 의료 시스템에서 의사 업무량 지표가 11% 올랐고 건당 문서화된 위험조정 진단이 14% 늘었다. 다른 종양 진료 조직에서는 건당 문서화 진단 수가 3.0개에서 4.1개로 늘었다. 또 다른 시스템에서는 고단계 진료 청구 비중이 올랐다.

청진기를 목에 건 의료진이 진료실 컴퓨터로 키보드와 마우스를 사용해 기록을 입력하는 모습
▲ 진료 현장의 기록 입력 — 이 브리프가 다룬 도구들이 자동화하려는 지점이다 | Source: Shixart1985 via Wikimedia Commons (CC BY 2.0)

차이는 무엇을 봤느냐에 있다. 백서는 상관을 봤고 이 사례들은 개입을 봤다. 도구를 넣기 전과 넣은 뒤의 같은 조직을 비교했기 때문에, 적어도 어느 병원이 무엇을 썼는지는 자료 안에 있다. 이 사안에서 가장 큰 숫자를 가진 문서와 가장 단단한 식별을 가진 문서가 서로 다른 문서이고, 언론이 인용한 것은 앞쪽이다.

이 사례들도 무작위 배정 실험은 아니다. 도입 조직의 보고이고 대조군이 없으며, 같은 기간에 다른 변화가 겹쳤을 가능성이 배제되지 않는다. 그리고 같은 브리프가 반대편 사실도 함께 적는다. 문서화 누락은 흔하고, 이런 도구가 그동안 빠뜨리던 것을 잡아내는 면이 실제로 있다는 것이다. 브리프의 결론은 어느 한쪽이 나쁘다는 쪽이 아니라, 양쪽의 자동화가 서로를 자극하는 구조가 이미 시작됐다는 쪽이다.

마지막으로 백서 자체의 규격을 적어 둔다. 분량은 3쪽이고 저자는 네 명이며 동료심사를 거치지 않았다. 표본에 들어간 병원 수, 청구 건수 총계, 신뢰구간, 통계 검정, 9억 4,200만 달러를 만든 반사실 모형이 모두 기재되어 있지 않다. 방법론 절 자체가 없다. 발행 주체는 지불 측 당사자이고, 보도에 따르면 병원과 보험사의 계약 협상이 진행 중인 시기에 나왔다. 이 규격은 백서를 무효로 만들지 않는다. 다만 이 정도 규격의 문서가 만든 숫자가 정책 논의의 출발점이 된다는 사실은 그 자체로 기록해 둘 만하다.

4

같은 논쟁의 두 번째 상연

기록이 촘촘해진 것인지 값이 올라간 것인지를 두고 다투는 일은 이번이 처음이 아니다. 미국은 같은 물음을 최소 두 번 치렀다. 한 번은 전자의무기록이 병원에 들어왔을 때이고, 또 한 번은 민간 보험사가 메디케어 가입자를 받으면서 진단 개수가 곧 수입이 됐을 때다. 그 논쟁들이 남긴 것은 청구 데이터만으로는 끝까지 가지 못한다는 경험, 그리고 결국 무엇이 판정을 바꿨는가에 대한 기록이다.

같은 물음이 네 번 제기된 자리 2014 전자의무기록 도입 연구 도입 병원과 미도입 병원의 청구 강도 차이를 찾지 못함 2021 연방 감사 최고 중증도 청구 20% 증가, 절반 이상이 진단 하나로 결정 2024 다섯 개 주 계량 연구 최고 강도 퇴원 41% 증가 중 환자 쪽 변화로 설명되는 몫 13% 2026 의회 자문기구 보고서 지불 규칙을 바꾸자 격차가 실제로 줄었다 네 자리 모두에서 판정의 잣대는 청구 데이터 바깥에 있었다. 차트 리뷰, 재원기간, 진단 개수, 그리고 지불 규칙 자체다. 2021년 감사는 AI 청구 도구가 널리 퍼지기 전의 기간을 대상으로 한다.

20년 가까운 기간에 걸친 네 문서. 이번 백서가 제기한 물음은 이 계보의 가장 최근 항목이다.

4.1새 도구가 들어오면 청구는 정말 오르는가

2009년부터 미국은 연방 예산을 들여 병원에 전자의무기록을 깔았다. 종이 차트가 화면으로 옮겨 가면 기록이 훨씬 촘촘해질 테니 청구도 따라 오를 것이라는 우려가 그때도 있었다. 2014년 보건정책 학술지 헬스 어페어스에 실린 연구가 그 우려를 이중차분 설계로 검증했다. 전자의무기록을 도입한 병원과, 특성을 맞춘 미도입 병원을 짝지어 비교한 것이다. 결과는 널이었다. 환자 중증도도 퇴원당 지불액도 두 집단이 사실상 같았다.

이 연구를 먼저 놓는 이유는 균형 때문만이 아니다. 새 도구를 들이면 청구가 올라간다는 말은 직관적이지만 자동으로 참이 되지는 않는다는 것, 그래서 매번 따로 확인해야 한다는 것이 이 널 결과가 남긴 교훈이다. 이번 백서가 요구받고 있는 것도 정확히 그 확인이다.

흑백 사진 — 병원 진료기록 관리 부서에서 두 직원이 받아쓰기 기기와 서류철로 환자 기록을 정리하는 모습
▲ 전자의무기록 이전, 종이와 받아쓰기로 채워지던 진료기록 부서 | Source: Mennonite Church USA Archives via Wikimedia Commons (No known copyright restrictions)

4.2연방 감사는 5년 전에 같은 문장을 썼다

2021년 2월, 미국 보건복지부 감사관실이 메디케어 입원 청구를 들여다보고 그 결과를 보고서로 냈다. 대상 기간은 2014 회계연도부터 2019 회계연도까지다. 보고서가 찾아낸 것을 읽어 보면 2026년 백서가 말한 구조가 이미 거기 있다.

  • 최고 중증도 등급으로 청구된 입원 건수가 2014 회계연도에서 2019 회계연도 사이에 약 20% 늘었다.
  • 그 건들이 메디케어 입원 지출의 거의 절반을 차지했다.
  • 그중 3분의 1 가까이가 유난히 짧은 재원기간이었다.
  • 최고 등급으로 청구된 건의 절반 이상이 단 하나의 진단으로 그 등급이 결정됐다.

마지막 항목이 특히 무겁다. 진단 하나가 등급을 올린다는 백서의 메커니즘 주장을, 연방 감사가 5년 전에 같은 모양으로 적었다. 그리고 그 기간은 AI 청구 도구가 지금처럼 퍼지기 전이다. 같은 현상이 도구 없이도 일어난다는 뜻이고, 이번 증가분에서 도구의 몫을 떼어내는 일은 백서가 한 비교로는 되지 않는다. 감사관실이 권고한 것도 원인 규명이 아니라 표적 심사였다. 업코딩에 취약한 환자군과 그런 청구를 자주 내는 병원을 골라 들여다보라는 것이다.

4.3보정하고 남는 몫이 얼마인지를 계산한 연구

2024년 12월 같은 학술지에 실린 연구는 한 걸음 더 들어간다. 다섯 개 주의 239개 상병을 2011년부터 2019년까지 추적해, 최고 강도 등급으로 나간 퇴원이 41% 늘었다는 사실에서 출발한다. 그다음 인구 구성, 동반질환, 재원기간, 병원 특성의 변화를 모두 보정해, 코딩 행태가 2011년 그대로였다면 증가폭이 얼마였을지를 계산한다. 그 값이 13%다. 41%와 13%의 간격, 그러니까 늘어난 폭의 3분의 2가량이 환자 쪽 변화로 설명되지 않는다. 논문 제목이 업코딩을 증가분의 최대 3분의 2와 연결해 적은 근거가 이것이다. 연구진은 2019년 한 해 그 상향과 연관된 지불액을 146억 달러로 추정했고, 그중 민간보험 몫이 58억 달러다.

이 연구가 가장 설득력을 얻는 대목은 편차다. 상향 비율이 주마다 3.6%에서 24.5%까지 벌어진다. 환자가 실제로 더 아파졌다는 설명만으로는 주 사이의 일곱 배 차이를 감당하기 어렵다. 저자들 자신도 단서를 달았다. 이 상향이 부정일 수도 있고 실제 중증도를 정확히 반영한 것일 수도 있으며 둘의 비중은 추가 연구가 필요하다는 것이다. 같은 기간 인증 전자의무기록을 쓰는 병원이 28%에서 96%로 늘어난 것이 교란 요인이라는 비판도 있다. 덧붙이면 저널 쪽 초록 페이지는 이번 조사에서도 열리지 않아, 41%와 13%와 146억 달러는 연구를 수행한 기관이 낸 보도자료 원문으로 확인했다. 주별 편차 값만 업계 매체 요약을 경유했다.

4.4격차를 실제로 줄인 것은 고발이 아니었다

이 논쟁의 가장 성숙한 선례는 병원 청구가 아니라 메디케어 어드밴티지에 있다. 민간 보험사가 메디케어 가입자를 받아 운영하는 이 프로그램에서는 가입자의 진단이 많을수록 정부가 보험사에 더 많이 지불한다. 이번 사안과 방향만 반대이고 구조는 같다. 기록을 촘촘하게 만들 유인이 지불 규칙 안에 들어 있다.

의회 자문기구가 2026년 3월 보고서에서 내놓은 추정은 이렇다. 메디케어가 어드밴티지 가입자에게 쓰는 돈은 같은 사람들이 전통 메디케어에 남아 있었을 경우보다 약 14% 많고, 2026년 기준으로 760억 달러에 해당한다. 그 격차를 원인별로 보면 건강한 가입자가 몰리는 효과가 약 11%, 코딩 관행 차이가 약 4%다. 두 값은 각각 따로 추정된 것이라 단순히 더해 14%가 되도록 만들어진 수가 아니다. 그리고 4%는 정부가 해마다 적용하는 코딩 조정을 이미 반영한 뒤에도 남는 몫이다.

결정적인 것은 그다음이다. 같은 기구가 1년 전에 내놓은 추정치는 20%였다. 6%포인트가 내려온 이유로 보고서가 든 것은 감사도 고발도 아니다. 새 위험조정 모형의 단계적 적용이 완료됐다는 것, 그래서 그 모형이 코딩 차이가 지불에 미치는 영향을 줄이려던 의도한 효과를 내고 있다는 것이다. 20년 논쟁 끝에 격차를 실제로 좁힌 것은 누가 나쁜지를 가린 일이 아니라 지불 규칙을 다시 설계한 일이었다.

4.5병원 쪽 주장에는 문헌상 근거가 있다

지금까지는 보험사 쪽 주장의 계보를 봤다. 병원 쪽 주장도 같은 무게로 봐야 한다. 그동안 빠뜨리던 진단을 이제 제대로 적을 뿐이라는 말은 수사가 아니라 문헌이 지지하는 방향이다.

청구 데이터와 차트를 직접 대조한 연구들은 일관되게 같은 결과를 보고한다. 청구 데이터는 차트보다 동반질환을 적게 잡는다. 폐렴 입원 3,471건을 대조한 연구에서 두 자료의 일치도는 상병에 따라 카파 0.01에서 0.78까지 흩어졌고, 거의 모든 동반질환의 유병률이 차트보다 행정 데이터에서 낮았다. 비만이나 체중 감소, 우울처럼 체계적으로 누락되는 항목도 있다. 기록을 촘촘하게 만드는 도구가 실제로 빠진 것을 잡아내고 있을 가능성은 문헌상 충분히 열려 있다.

미국병원협회는 여기에 자기 수치를 더한다. 환자가 얼마나 아픈지를 재는 표준 지표인 케이스믹스 지수가 2019년에서 2024년 사이 약 5% 올랐다고 밝힌다. 고령화와 중증화가 실재한다는 근거로 쓴다. 다만 같은 협회의 비용 보고서가 병원비 증가를 요인별로 분해한 대목이 함께 읽힌다. 환자 수 증가가 36%, 환자 중증도 상승이 19%, 인건비와 재료비 같은 투입 단가 상승이 45%다. 협회 자신의 자료로도 중증도가 설명하는 몫은 5분의 1 정도다.

여기서 하지 말아야 할 일이 하나 있다. 백서의 3%포인트와 협회의 5%를 나란히 놓고 빼는 것이다. 앞은 복합 분류 비율의 변화이고 뒤는 케이스믹스 지수 자체의 변화이며, 기간도 3년과 5년으로 다르다. 두 기관이 서로 다른 자로 같은 대상을 재고 있다는 사실 자체가 이 사안의 핵심이지, 두 숫자의 차이가 답이 아니다. 진짜 쟁점은 기록이 촘촘해진 방향이 아니라 치우침이다. 촘촘해진 기록이 하필 지불 등급을 올리는 코드군에만 몰렸는가, 그것을 가리려면 무엇이 더 있어야 하는가.

5

이제는 양쪽이 다 AI를 쓴다

이 사안은 흔히 병원 대 보험사로 그려진다. 그런데 공개 기록을 시간순으로 늘어놓으면 다른 그림이 나온다. 두 진영은 서로를 논박하지 않는다. 각자 자기 잣대를 들고 따로 발표하고 있으며, 그 사이에 양쪽 모두 자동화를 늘리고 있다.

2026년, 같은 사안을 두고 나온 문서들 3월 5일 보험자 연합 산과 입원 분석과 전국 투사 23억 달러 7월 31일 병원협회 보험사 주장을 근거 없다고 규정한 팩트시트 9월 24일 보험자 연합 장 수술 백서와 9억 4,200만 달러 9월 26일 보도 병원 쪽 반박이 백서보다 약 두 달 앞선다

9월 백서 3쪽 어디에도 7월 팩트시트에 대한 응답이 없다. 백서 발표 이후 병원협회가 그 백서를 특정해 낸 공식 성명은 이번 조사에서 확인되지 않았다.

순서가 중요하다. 병원협회가 코딩 강도 논쟁에 대해 낸 팩트시트는 7월 31일 자이고, 백서는 9월 24일 자다. 병원 쪽 반박이 백서보다 먼저 나왔고, 백서는 이미 나와 있던 반박에 답하지 않았다. 반대로 백서를 특정해 반박한 병원 쪽 문서도 이번 조사에서는 확인되지 않았다. 병원협회가 백서에 반박했다고 쓰면 시점이 틀린다. 실제로 일어난 일은 두 개의 독립 발표다.

그 팩트시트가 자기 근거로 드는 수치를 보면 구도가 더 분명해진다. 병원협회는 의회 자문기구가 2025년 보고서에서 추정한 메디케어 어드밴티지 과지급 400억 달러를 인용한다. 그 과지급이 업코딩에서 비롯됐다고 본다. 코딩으로 돈을 더 받는 쪽은 병원이 아니라 보험사라는 되받기다. 이 수치는 앞 절에서 본 2026년 추정치와는 연도도 항목도 다르므로 같은 문단에서 섞어 읽으면 안 된다. 정작 무거운 대목은 같은 혐의가 양방향으로 오간다는 사실이다.

5.1지불 측의 자동화는 이미 청구서 위에 있다

보험사가 자동화를 쓰는 자리는 구체적이고 공개돼 있다. 시그나는 2025년 10월 1일부터 외래 진료 청구 중 가장 높은 두 단계를, 진단 코드가 그 복잡도를 뒷받침하지 않으면 자동으로 한 단계 내리는 정책을 시행한다고 공지했다. 원래 금액을 받으려면 병원이나 의사가 사후에 차트를 붙여 이의를 제기해야 한다. 판정이 먼저 내려지고 반증 책임이 청구한 쪽으로 넘어가는 구조다. 의사 단체는 이 정책을 강하게 반대했고, 시행이 유예됐다는 보도와 예정대로 시행됐다는 자사 공지가 엇갈린다. 이 글은 시행을 공지한 정책이라는 데까지만 적고 현재 상태는 단정하지 않는다.

더 앞서 나간 사례는 법정에 있다. 유나이티드헬스의 급여 심사 도구를 둘러싼 집단소송이 2023년 11월에 제기됐고, 2025년 2월 일부 청구가 기각됐지만 계약 위반과 신의성실 위반 주장은 살아남았다. 2026년 3월 9일에는 연방 치안판사가 AI 심사와 관련된 광범위한 문서 제출을 명령했다. 회사 측은 문제의 도구가 급여 결정 도구가 아니라 치료 지원 도구라는 입장이다. 이 소송을 다룬 기사에 자주 등장하는 90% 오류율이라는 수치는 원고 측 주장이며, 항소에서 뒤집힌 비율을 오류율로 환산한 값이라 통계적 오탐률과 다르다.

법정 책상 위에 놓인 의사봉 — AI 급여 심사 도구를 둘러싼 집단소송을 상징하는 이미지
▲ 보험사의 AI 심사 도구를 둘러싼 소송도 진행 중이다 | Source: Joe Gratz via Wikimedia Commons (CC0)

병원 쪽 자동화의 지형도 대략 그려 둘 만하다. 지금 병원에 들어가는 도구는 기능으로 다섯 갈래다. 진료 대화를 받아 기록 초안을 만드는 도구, 검사값과 기존 기록을 훑어 2차 진단 후보를 찾아내는 도구, 의사에게 문서 보완을 자동으로 요청하는 도구, 코드를 추천하거나 스스로 부여하는 도구, 청구 전에 미리 감사하는 도구다. 백서가 겨눈 것은 두 번째 갈래이고, 앞 절에서 본 도입 관측 연구가 다룬 것은 첫 번째 갈래다. 개별 제품의 성능 수치는 대부분 자사 발표라 이 글에서는 쓰지 않았고, 시장 규모 추정치도 기관마다 여덟 배까지 벌어져 인용하지 않았다.

이 구도를 경계하는 목소리는 벤더 쪽에서도 나온다. 진료 대화 기록 도구를 만드는 한 회사의 창업자는 봇이 봇과 싸우고 에이전트가 에이전트와 싸우는 상황, 아무도 살고 싶어 하지 않는 끔찍한 디스토피아라는 표현으로 지금의 방향을 요약했다. 양쪽이 자동화를 늘릴수록 확실하게 늘어나는 것이 하나 있다. 청구와 심사와 이의 제기에 드는 행정비용이고, 그 비용은 결국 보험료와 진료비로 돌아온다.

5.2한국은 같은 사안이 아니라 거울상에 가깝다

이 구조가 한국에도 그대로 있는지 묻는다면 답은 절반이다. 한국의 포괄수가제는 일곱 개 질병군에만 적용돼 미국처럼 입원 전반을 덮지 않는다. 적용 범위가 다르면 코딩 유인의 크기도 다르다. 그리고 최근 몇 해 동안 한국에서 빠르게 확대된 자동화는 병원 쪽 코딩이 아니라 심사기관 쪽 심사다. 건강보험심사평가원은 2026년부터 일부 영역에서 AI 판독 결과를 진료비 심사에 반영하기 시작했고, 부당청구 탐지와 집중분석 대상 기관 예측에도 적용을 넓히고 있다.

그러니까 미국 사례가 병원이 AI로 진단을 더 찾아낸다는 논쟁이라면, 한국 쪽은 심사기관이 AI로 감시를 강화한다는 이야기다. 같은 사안이라기보다 거울상이다. 다만 두 경우 모두 한쪽이 자동화를 쥐면 다른 쪽도 쥐게 된다는 점은 같다. 이번 조사에서 한국의 심사조정률이나 국내 AI 코딩 도구 도입률의 구체 통계는 확보하지 못했으므로, 여기서 정량 비교는 만들지 않는다.

6

무엇을 더 재야 가릴 수 있나

지금까지 본 것을 한 줄로 줄이면 이렇다. 청구 데이터 안에서 만든 규칙으로는 청구가 옳은지 끝까지 가릴 수 없다. 백서의 정합성 규칙은 청구 데이터의 한 층을 다른 층에 대 보는 영리한 우회지만, 두 층이 모두 같은 기록에서 나온다는 사실은 그대로다. 진단이 부풀었는지 처치가 절제됐는지, 아니면 둘 다인지를 그 안에서 결정할 방법이 없다. 그래서 선례 넷은 모두 청구 바깥에 잣대를 두었다.

그렇다면 무엇이 더 있어야 하는가. 다섯 가지가 필요하고, 다섯 모두 지금 이 논쟁에서 빠져 있다.

  • 차트 수준의 잣대. 청구 데이터 말고 진료기록 원본을 표본으로 열어 보는 일이다. 3월 분석에서 계열사 한 곳이 실제로 해 본 것이 이것이고, 임상 기준 충족률 20% 미만이라는 값은 그래서 무겁다. 다만 한 곳의 자체 감사로는 전수 판정이 되지 않는다. 표본 설계와 판독자 맹검이 공개된 차트 감사가 필요하다.
  • 처치 동반 신호의 사전 정의. 어떤 진단에 어떤 처치가 따라와야 하는지를 자료를 보기 전에 정해 두는 일이다. 결과를 본 뒤에 고르면 어떤 대조표든 만들어진다. 백서가 내놓은 처치 지표 다섯 중 셋은 가설과 맞고 하나는 반대이며 하나는 두 무리가 같은데, 그 다섯을 언제 골랐는지가 밝혀져 있지 않아 이 성적을 평가할 수 없다.
  • 판별식의 사전 등록. 누가 언제 어떤 규칙으로 판정할지를 미리 공개해 두는 일이다. 임상시험이 오래전에 도입한 장치이고, 여기서도 같은 문제를 막는다. 도입 후에 만든 규칙은 항상 논쟁이 된다.
  • 감사 추적. 어느 진단 코드를 어느 도구가 제안했고 누가 승인했는지가 기록으로 남아야 한다. 이것이 없으면 도구의 몫과 사람의 몫을 영원히 나눌 수 없다. 백서가 겪고 있는 막다른 골목이 정확히 이 공백에서 나온다.
  • 판정 주체의 분리. 지금은 규칙을 만든 쪽과 그 규칙으로 이득을 보는 쪽이 같다. 이해당사자가 자기 잣대로 상대를 재는 구조에서는 어떤 결과가 나와도 상대가 받아들일 이유가 없다.

6.1자동 코딩의 정확도는 코드에 따라 갈린다

도구 자체의 성능을 잰 연구는 이 논쟁의 바깥에서 따로 쌓이고 있다. 2026년 9월 공개된 한 논문은 진단 코드를 자동으로 붙이는 시스템들을 코드의 희귀도로 층화해 평가했다. 결과는 실패 모드가 둘로 갈린다. 신경망 분류기는 자주 나오는 코드와 드물게 나오는 코드 사이에 성능 격차가 크게 벌어졌고, 정해진 절차를 따라가는 워크플로 시스템은 손상이나 외인처럼 다단계 판단이 필요한 코드 구간에서 사실상 아무것도 맞히지 못했다. 도구를 덧붙인 에이전트가 그 구간의 성능을 일부 되살렸다.

이 논문에서 끌어올 수 있는 결론은 한 가지로 제한된다. 자동 코딩의 정확도는 어떤 코드냐에 따라 크게 달라진다는 것이다. 이 논문은 과대코딩이나 과소코딩 쪽으로 치우치는지를 다루지 않았으므로, AI가 청구를 부풀린다는 주장의 근거로 쓸 수 없다. 다만 정확도가 코드마다 다르다는 사실 자체가 하나를 말해 준다. 도구를 넣었을 때 진단 구성이 바뀐다면 그 변화는 균일하지 않을 것이고, 백서가 목록으로 보여 준 열 개 코드가 특정 성격으로 몰려 있는 것도 그 방향과 어긋나지 않는다.

6.2한 채널을 막으면 압력이 옆으로 옮겨간다

규칙을 하나 세우면 끝나는가. 2026년 5월에 공개된 시뮬레이션 연구가 이 물음에 답을 시도했다. 지불 기전을 프로그램으로 합성하고, 공급자가 그 규칙에 전략적으로 대응하는 다섯 가지 통로를 함께 모형에 넣었다. 코딩 조작, 환자 선별, 지연, 노력 조정, 중증도 분류다. 핵심 결과는 이렇다. 감사가 코딩 통로를 겨냥해 막자, 저복잡도 환자를 골라 받는 행동이 두 배 넘게 늘었다.

이것은 현실 데이터의 관측이 아니라 합성된 환경에서의 시뮬레이션이다. 그래도 남는 교훈이 있다. 업코딩만 겨냥한 규칙은 업코딩을 줄이면서 다른 곳에 비용을 만들 수 있고, 그 비용은 환자 선별처럼 훨씬 측정하기 어려운 형태로 나타난다. 같은 연구에서 여러 목적을 함께 넣어 합성한 프로그램은 업코딩을 없애면서 거절도 절반으로 줄였다. 규칙을 하나만 세울 것이 아니라 어느 통로로 압력이 옮겨갈지를 함께 설계해야 한다는 뜻이다.

6.3진단을 만들어 내는 도구는 지금 아무 규제도 받지 않는다

여기서 한 가지가 눈에 띈다. 이 모든 논쟁의 대상인 도구들이 의료기기가 아니다. 2016년 제정된 21세기 치유법이 네 범주의 소프트웨어를 의료기기 규제에서 제외했고, 그중 하나가 행정 지원 소프트웨어다. 청구와 코딩을 다루는 도구는 정확히 그 예외 조항에 앉는다.

임상 의사결정 지원 소프트웨어는 사정이 조금 다르다. 영상이나 신호를 직접 처리하지 않을 것, 기존 정보를 표시하고 분석할 것, 결정을 대체하지 않고 지원할 것, 임상의가 그 근거를 독립적으로 검토할 수 있을 것이라는 네 조건을 모두 만족해야 규제에서 제외된다. 2026년 1월 미국 식품의약국이 이 지침을 개정해 제외와 집행재량의 범위를 넓혔지만, 개정 지침도 임상 문서화를 보조하는 도구를 직접 다루지는 않는다.

정리하면 이렇다. 진단 후보를 만들어 내는 도구가 의료기기도 아니고 별도의 심사 대상도 아니며, 그 산출물을 검증할 의무는 계약과 코딩 지침에만 걸려 있다. 병원협회 팩트시트가 강조하는 문장도 그 지점에 서 있다. 코딩의 무결성을 지키는 데 사람의 검증이 여전히 필수라는 것이다. 맞는 말이다. 다만 그 검증이 실제로 이루어졌는지를 확인할 기록이 어디에도 남지 않는다면, 그 문장은 요구가 아니라 선언에 그친다.

그래서 이 글의 결론은 누가 나쁜가가 아니다. 메디케어 어드밴티지에서 20년 논쟁을 움직인 것은 판정의 강도가 아니라 규칙의 시점이었다. 그 사례가 남기는 물음은 판정을 누가 하느냐보다 앞선다. 규칙을 언제 고정했는가다. 도구가 들어오기 전에 잣대와 판별식을 고정해 둔 쪽은 나중에 다툴 일이 없고, 도구가 들어온 뒤에 규칙을 만든 쪽은 매번 이런 백서와 이런 팩트시트를 주고받게 된다.

7

페블러스 관심의 이유

이 글이 따라온 문제는 의료 청구에만 있는 문제가 아니다. 페블러스가 데이터 품질 작업에서 반복해 만나는 문제와 모양이 같다. 아래 세 대목은 제품 이야기가 아니다. 앞 절들이 보여 준 구조가 다른 현장에서 어떻게 다시 나타나는지를 적는다.

7.1같은 원본에서 신호와 아티팩트를 가르는 일

데이터 진단이 매일 하는 일도 결국 이 모양이다. 한 벌의 기록을 놓고, 어디까지가 실제이고 어디부터가 재는 방식이 남긴 자국인지를 갈라낸다. 이번 사안에서 그 기록은 진료기록이고 자국은 코딩 강도다. 백서가 쓴 규칙, 그러니까 진단이 있는데 따라와야 할 처치가 없다는 판정 장치는 결측이나 중복이나 라벨 오류를 잡을 때 쓰는 정합성 규칙과 같은 계열이다. 기술적으로 특별할 것이 없다는 말이 아니라, 이 규칙이 왜 논쟁을 끝내지 못했는지를 같은 눈으로 볼 수 있다는 뜻이다.

차이는 둘이다. 하나, 규칙을 이해당사자가 직접 설계했다. 둘, 규칙을 데이터가 생긴 뒤에 만들었다. 데이터 품질 작업에서도 이 두 가지가 겹치면 같은 일이 벌어진다. 정제를 맡은 쪽이 자기 성과를 잴 규칙을 자기가 만들고, 그 규칙을 결과를 본 뒤에 확정하면, 나온 숫자가 개선을 가리키는지 규칙의 모양을 가리키는지 아무도 답할 수 없다. 이 백서가 지금 겪고 있는 일이 그것이다.

7.2라벨에 가격표가 붙으면 라벨 분포가 움직인다

진단 코드는 라벨이다. 그리고 이 라벨에는 가격표가 붙어 있다. 1절에서 본 대로 코드 한두 개가 지불 등급을 세 배 가까이 밀어 올린다. 라벨을 만드는 일에 보상이 걸리면 보상이 큰 쪽으로 라벨이 쏠린다. 학습 데이터 라벨링을 외주로 돌리고 어노테이터 보상을 건수에 연동할 때 생기는 편향과 같은 구조다. 다른 점은 이 사례의 규모와 가시성뿐이다.

이번 사례가 그 구조를 특히 선명하게 보여 주는 이유는 이동이 아무 코드에서나 일어나지 않았다는 데 있다. 2절의 그림에서 두 병원 무리의 방향이 갈린 코드는 맨 위 한 행뿐이고 아래 두 행은 거의 같았다. 그리고 백서가 주목한 코드들의 공통점은 검사값 하나로 도출된다는 것, 곧 기계 탐지가 가장 잘 닿는 자리라는 것이다. 보상이 걸린 지점과 자동화가 잘 닿는 지점이 겹칠 때 분포가 가장 크게 움직인다.

모델을 학습시키는 쪽에도 이어지는 함의가 있다. 이렇게 이동한 코드로 학습한 의료 AI는 환자가 아프다는 사실이 아니라 이 병원이 이렇게 적는다는 관행을 배운다. 그리고 4절에서 본 대로 청구 데이터는 원래부터 차트보다 적게 적혀 있었다. 라벨이 두 번 휘는 셈이다. 한 번은 누락으로, 한 번은 보상으로. 두 방향이 서로 다른 코드군에서 다르게 작동한다는 것이 이 자료를 학습에 쓸 때 가장 까다로운 대목이다.

7.3도입 전에 정하지 않은 잣대는 나중에 만들 수 없다

제조와 물류 현장에도 같은 자리가 있다. 검사 판정이나 불량 기록에 AI가 들어가면 합격과 불합격의 비율부터 흔들린다. 그때 수율이 좋아진 것인지 판정 기준이 느슨해진 것인지를 가르려면 도입 전에 두 가지를 고정해 두어야 한다. 사람이 판정한 기준 표본, 그리고 개선과 이동을 가를 판별식이다. 도입 후에 만든 판별식은 언제나 논쟁이 된다. 왜 하필 그 지표를 골랐는지에 답할 방법이 없기 때문이다.

6절에서 본 시뮬레이션이 덧붙이는 교훈도 실무에 그대로 온다. 불량 판정만 조이면 어떤 물건을 검사 대상에 넣을지가 달라지고, 코딩만 막으면 어떤 환자를 받을지가 달라진다. 그러니 그 두 가지를 정할 때는 어떤 지표가 움직일지뿐 아니라 어떤 행동이 어디로 옮겨갈지도 함께 적어야 한다.

제3자 데이터 진단은 판정을 당사자에게서 떼어내려고 존재한다. 다만 이 글이 그 결론으로 끝나는 것은 적절하지 않다. 이 사안에서 판정을 실제로 바꾼 사례는 제3자가 등장한 경우가 아니라 규칙 자체가 다시 짜인 경우였다. 그 사실을 그대로 두는 편이 낫다고 본다. 우리가 이 글을 쓴 것은 결론을 팔기 위해서가 아니다. 같은 물음을 매일 다른 현장에서 만나기 때문이다.

확인하지 못한 것도 적어 둔다. 백서가 9억 4,200만 달러를 만든 추정식, 표본에 들어간 병원 수와 청구 건수 총계는 3쪽 본문에도 발표문에도 없었고 방법론 부록이 따로 공개됐는지 찾지 못했다. 3월 분석이 6,200만 명 표본에서 전국 수치로 넘어간 계산도 마찬가지다. 9월 백서를 특정해 반박한 병원협회 성명은 이번 조사에서 확인되지 않았고, 확인된 것은 백서보다 두 달 앞선 7월 팩트시트뿐이다. 4절에 인용한 2024년 계량 연구는 저널과 색인 사이트가 여전히 막혀 있어, 41%와 13%와 146억 달러는 연구를 수행한 기관의 보도자료 원문으로 확인했고 주별 편차만 업계 요약을 경유했다. 한국의 심사조정률과 국내 AI 코딩 도구 도입률, 그리고 블루 시스템의 연간 상업 입원 지출 총액은 공개 자료에서 찾지 못해 1절의 분모를 전부 근사로 남겼다. 긴 글 읽어 주셔서 감사하다.

R

참고문헌

본문의 수치는 출처의 층이 다르다. 백서와 3월 이슈브리프의 값은 두 PDF 원문을 직접 대조해 옮겼고, 발표문 인용문도 해당 페이지에서 확인했다. 연방 감사 보고서와 의회 자문기구 보고서의 인용은 각 기관 원문에서 확인했다. 아래 주석에 경유 표시가 붙은 항목은 원문을 열지 못하고 요약이나 2차 보도를 거쳐 인용한 것이다. 분모와 환산값은 모두 공개 통계에서 계산한 근사이며, 본문에 가정을 함께 적었다.

당사자 문서 (원문 대조)

  • 1.Blue Cross Blue Shield Association. Hospital Coding Intensity Analysis: Major Bowel Procedures. 백서, 2026년 9월, 3쪽. 저자 Chris Birkmeyer, David Wennberg, Keith Kamons, Luke Chalker. 백서 PDF — 본문의 5만 5,158건, 6억 5,300만 달러, 건당 1만 1,800달러, 9억 4,200만 달러, 장 수술 20.2%에서 22.7%, 임상 불일치 대조표, 분기별 꺾은선 값이 모두 여기서 나왔다. 동료심사를 거치지 않았고 방법론 절이 없다.
  • 2.Blue Cross Blue Shield Association. "BCBSA Analysis: AI Coding Tools Affects Healthcare Costs." 2026년 9월 24일 발표문. bcbs.com — 3절에 인용한 루크 챌커 발언과 병원 시스템 60% 이상이라는 도입률 수치의 출처다. 그 도입률은 백서 본문에는 없다.
  • 3.Blue Cross Blue Shield Association. Rising Coding Intensity and Its Impact on Health Care Affordability. 이슈브리프, 2026년 3월. 브리프 PDF — 2절의 산과 입원 시계열(4.0%에서 12.3%), 수혈률 0.8~1.2%, 저성장 병원 7.9%에서 8.2%, 2,200만 달러, 계열사 자체 감사의 임상 기준 충족률 20% 미만, 1절의 1인당 입원 비용 9%와 코딩 강도 몫 약 20%가 여기 있다. 두 병원 무리를 가른 기준은 산후 빈혈 코딩 증가율 30%이고, 표본은 산과 입원 250건 초과 병원이다. 브리프가 다른 그림에서 쓰는 상위 10% 고성장 병원은 이 무리와 다른 집단이다.
  • 4.Blue Cross Blue Shield Association. "New BCBSA Research Suggests AI in Hospital Billing is Leading to Higher Health Care Costs." 2026년 3월 5일 발표문. bcbs.com — 3절에 인용한 23억 달러, 입원 6억 6,300만 달러, 외래 최소 16억 7,000만 달러는 이 페이지 본문의 문장이다. 같은 날 나온 이슈브리프에는 이 세 값이 없다.
  • 5.American Hospital Association. Fact Sheet: Artificial Intelligence and Coding Intensity. 2026년 7월 31일. aha.org — 보험사 주장을 근거 없다고 규정하고, 메디케어 어드밴티지 과지급 400억 달러로 되받는 문서다. 6절에 인용한 사람의 검증이 코딩 무결성에 필수라는 문장도 여기서 나왔다.
  • 6.American Hospital Association. "Fact sheet details why use of AI alleviates burden for providers and does not improperly increase coding." 2026년 8월 27일. aha.org
  • 7.American Hospital Association. Costs of Caring, 2026년판. aha.org/costsofcaring — 4절의 케이스믹스 지수 약 5% 상승과 비용 증가 분해(환자 수 36%, 중증도 19%, 투입 단가 45%)의 출처다. 9월 백서를 겨냥한 문서가 아니라 연례 보고서다.

정책 · 규제 · 감사 (원문 확인)

  • 8.Medicare Payment Advisory Commission. March 2026 Report to the Congress: Medicare Payment Policy. 2026년 3월 12일 보도자료 및 보고서. medpac.gov — 4절의 14%, 760억 달러, 유리선택 약 11%, 코딩 강도 약 4%, 그리고 새 위험조정 모형이 의도한 효과를 내고 있다는 판단이 여기서 나왔다. 2차 요약에 돌아다니는 코딩 강도 220억 달러라는 값은 이 문서에 없어 쓰지 않았다.
  • 9.HHS Office of Inspector General. Trend Toward More Expensive Inpatient Hospital Stays in Medicare Emerged Before COVID-19 and Warrants Further Scrutiny. OEI-02-18-00380, 2021년 2월 19일. oig.hhs.gov — 4절의 네 항목(최고 중증도 약 20% 증가, 입원 지출의 거의 절반, 3분의 1의 짧은 재원, 절반 이상이 진단 하나로 결정)과 표적 심사 권고의 출처다.
  • 10.Centers for Medicare & Medicaid Services. FY2026 IPPS Final Rule, Table 5 및 운영 표준화 금액. — 1절 도식의 상대가중치 1.6829 / 2.3972 / 4.5965와 기준 금액 6,752.61달러의 근거다. 이번 조사는 집계 사이트를 경유해 확인했고 원 압축 파일은 열지 못했다.
  • 11.ASTP/ONC. Data Brief No. 80, 2025년 9월. AHA IT Supplement 기반. healthit.gov — 3절 표의 71%와 61%, 표본 2,253곳, 응답률 51%가 여기서 나왔다.
  • 12.21st Century Cures Act (2016) §3060, 그리고 미국 식품의약국의 임상 의사결정 지원 소프트웨어 지침 2026년 1월 6일 개정판. — 6절의 규제 공백 서술 근거다.
  • 13.건강보험심사평가원 관련 보도 및 공개 자료. — 5절의 한국 서술 근거이며, 심사조정률 등 정량 지표는 확보하지 못해 정성 서술로만 썼다.

학술

  • 14.Dai T, Kvedar JC, Polsky D. "Policy brief: ambient AI scribes and the coding arms race." npj Digital Medicine, 2025년 12월 24일. PMC12738533 — 3절의 도입 관측 사례(업무량 지표 11%, 위험조정 진단 14%, 건당 진단 3.0개에서 4.1개)와 문서화 누락이 흔하다는 균형 서술의 출처다.
  • 15.Crespin D, Dworsky M, Levin J, Ruder T, Whaley CM. "Upcoding Linked To Up To Two-Thirds Of Growth In Highest-Intensity Hospital Discharges In 5 States, 2011–19." Health Affairs 2024;43(12):1619–1627. doi:10.1377/hlthaff.2024.00596 — 4절의 41%, 코딩 행태가 그대로였다면 13%, 2019년 146억 달러(민간 58억·메디케어 46억·메디케이드 18억), 주별 3.6%에서 24.5% 편차가 여기서 나왔다. 저널 쪽 초록 페이지는 끝내 열지 못했고, 앞 세 값은 연구 수행 기관의 보도자료 원문으로 확인했다. 주별 편차만 업계 매체 요약 경유다.
  • 16.Adler-Milstein J, Jha AK. "No Evidence Found That Hospitals Are Using New Electronic Health Records To Increase Medicare Reimbursements." Health Affairs 2014. doi:10.1377/hlthaff.2014.0023 — 4절의 널 결과다.
  • 17.Chong YE, Cao Y, Chen Y, Mao K, Jiang H. "Understanding the Limits of Agentic ICD Coding." arXiv: 2609.13806, 2026년 9월 12일 — 6절의 자동 코딩 성능 층화 결과다. 과대코딩 편향은 이 논문이 다루지 않으므로 그 주장의 근거로 쓰지 않았다.
  • 18.Wang Z, Xu X, Zha H, Li W. "Healthcare Mechanisms from Policy-as-Code Search under Strategic Provider Response." arXiv: 2605.30680, 2026년 5월 29일 — 6절의 채널 이동 결과다. 현실 데이터 관측이 아니라 시뮬레이션이다.
  • 19.청구 데이터와 차트 리뷰의 일치도 문헌. 폐렴 입원 3,471건 동반질환 비교 연구(PMC3112394) 및 Quan 등의 유병률 보정 카파 방법론(BMC Medical Research Methodology 2009;9:5) — 4절의 카파 0.01에서 0.78, 행정 데이터의 체계적 과소 포착 서술 근거다. 요약 경유 인용이다.
  • 20.Soroush A 외. "Large language models are poor medical coders — benchmarking of medical code querying." NEJM AI, 2024 — 자동 코딩 정확도 배경 문헌이며 본문 수치로는 쓰지 않았다.

업계 · 소송 (경유 인용 포함)

  • 21.Anthony Ha. "Insurers claim AI is already increasing healthcare costs." TechCrunch, 2026년 9월 26일. techcrunch.com — 3절의 일방적 학살이라는 표현과 5절의 봇 대 봇 발언이 여기서 나왔다. 앞은 보험자 연합 임원, 뒤는 진료 기록 도구 회사 창업자의 말이다. 이 기사에는 병원 쪽 입장이 실려 있지 않다.
  • 22.Cigna Healthcare. New Reimbursement Policy for Professional E/M Services Claims effective October 1, 2025 (R49). 자사 공급자 뉴스룸 — 5절의 자동 하향 정책 서술 근거다. 시행 유예를 전하는 보도와 예정대로 시행됐다는 자사 공지가 엇갈려 현재 상태는 단정하지 않았다. 경유 인용이다.
  • 23.Estate of Lokken v. UnitedHealth Group, 미네소타 연방지방법원 — 2023년 11월 제소, 2025년 2월 일부 기각, 2026년 3월 9일 문서 제출 명령. 5절의 근거이며 경유 인용이다. 90% 오류율은 원고 측 주장이다.