Executive Summary
9월 20일 파이낸셜타임스가 의료 AI 기사 한 편을 실었다. 요지는 임상의들이 진단과 영상 판독을 넘어간 AI에 제동을 걸고 있다는 것이다. 기사가 근거로 삼은 조사는 울터스클루버가 입소스에 맡겨 3월에 돌린 미국 의사·간호사 355명 설문이다. 그 안에는 반대 방향으로 보이는 숫자가 나란히 놓여 있다. 쓰는 사람은 두 해 사이에 두 배가 됐고, 걱정하는 사람은 그보다 많다. 이 글은 그 두 숫자 사이에 무엇이 빠져 있는지를 본다.
조사에서 가장 조용한 숫자는 27%다. 소속 기관이 AI를 어떻게 관리하는지 안다고 답한 임상의의 비율이고, 지난해 21%에서 6%포인트 올랐다. 같은 기간에 주마다 AI를 쓰는 의사는 배로 늘었다. 쓰는 속도와 규칙을 아는 속도가 이만큼 갈리면, 어떤 도구가 어떤 검증을 통과했는지 손에 쥔 사람이 현장에 거의 없다는 뜻이 된다. 그렇다고 임상의들이 손을 놓고 있는 것은 아니다. 열에 여덟 가까이가 AI의 답을 다른 자료와 대조한다고 답했다.
1절부터 4절까지는 조사 발표문과 이를 보도한 매체에 적힌 것을 따라간다. 5절에서 진단 쪽으로 논의를 넓히는 대목과 6절의 데이터 품질 해석은 조사에 없는 이 글의 읽기다. 파이낸셜타임스 기사 전문은 유료 구독자에게만 열려 있어, 이 글은 그 요약과 울터스클루버 1차 자료를 대조해 썼다.
주요 수치
출처: 울터스클루버 2026 Future Ready Healthcare 조사 발표문과 헬스케어다이브 보도. 실사는 입소스가 맡았다.
38% → 넷 중 셋
주 1회 이상 AI를 쓰는 의사
2025년과 2026년 같은 문항의 답이다. 올해 값은 보도 문면이 네 명 중 세 명 가까이이고, 간호사는 46%에서 70%로 늘었다
21% → 27%
병원의 AI 관리 방식을 안다는 임상의
사용률이 두 배가 된 사이 6%포인트 움직였다. 지난해와 올해를 같은 문항으로 비교했다
35%
AI 정확성 확인 지침까지 안다는 비율
분모는 규칙을 안다고 답한 27%다. 전체로 환산하면 열에 한 명꼴이다
44%
AI에 진료기록 초안을 맡기는 의사
같은 도구군을 감사한 연구에서는 기록 세 장 중 한 장에 검증된 실패가 있었다
의사와 간호사는 이미 매주 AI를 쓴다
조사의 얼개는 단순하다. 울터스클루버가 입소스에 실사를 맡겨 3월 11일부터 14일까지 미국의 의사 203명과 간호사 152명, 그리고 환자 254명에게 온라인 패널로 물었다. 임상의 표본은 355명이다. 표본이 크지 않으므로 몇 %포인트 차이를 두고 순위를 다툴 자료는 아니고, 두 해 연속 같은 문항을 물었다는 점이 이 조사의 값이다.
그 연속성이 드러낸 변화가 크다. 주 1회 이상 업무에 AI를 쓴다고 답한 의사는 지난해 38%였다. 올해는 네 명 중 세 명에 가깝다. 보도의 문면이 그렇고 소수점까지의 값은 공개되지 않았다. 간호사는 46%에서 70%다. 반대쪽 끝, 업무에서 AI를 한 번도 쓰지 않는다는 응답은 의사 9%, 간호사 18%였다. 한 해 사이에 AI는 일부가 시험해 보는 도구에서 대다수가 매주 만지는 도구로 자리를 옮겼다.
다만 두 해를 견주기 전에 함께 볼 것이 있다. 지난해 조사의 응답자에는 의사와 간호사 말고도 약사와 보건 관련 직종, 행정 담당자, 의학 사서가 들어 있었고, 그해 발표문에는 표본 수도 실사 기간도 적혀 있지 않다. 올해는 의사와 간호사 355명으로 대상을 좁혀 3월의 나흘 동안 물었다. 두 해를 견주는 수치는 각 해의 응답자 가운데 의사와 간호사만 따로 뽑은 것이라 비교가 어긋나지는 않지만, 지난해에 뽑힌 사람이 몇 명이었는지는 공개되지 않았다.
울터스클루버의 최고의료책임자 피터 보니스는 이 속도의 이유를 헬스케어다이브에 이렇게 설명했다. "노출이 늘고 친숙해진 것이 겹쳤다고 본다. 그런데 정말 중요한 건, 충족되지 않은 필요를 채워 주고 있다는 점이다." 진료 시간은 그대로인데 기록해야 할 것이 늘어난 현장에서, AI는 일단 쓰이고 나서 평가받는 순서를 밟았다는 뜻으로 읽힌다.
파이낸셜타임스의 세라 네빌이 9월 20일에 쓴 기사는 이 속도 위에 임상의들의 제동을 얹었다. 기사 전문은 유료 구독자용이고, 테크밈과 AI 위클리가 각각 올린 공개 요약이 같은 논지를 전한다. 논지는 둘이다. 하나, 임상의들의 회의론은 진단과 영상 판독이라는 자리 잡은 용도 밖으로 AI가 나갈 때 나온다. 둘, 기술의 진보가 아직 환자 진료의 실제 개선으로는 옮겨지지 않았고 그 확장을 받쳐 줄 임상·성능 데이터가 부족하다. 아래에서 파이낸셜타임스를 인용할 때는 이 요약과 울터스클루버 발표문이 함께 받치는 범위로 한정했다.
임상의들은 걱정을 각자의 습관으로 막고 있다
사용이 늘었다고 불안이 가라앉지는 않았다. 임상의 74%가 실력 퇴화를 가장 큰 AI 위험 가운데 하나로 꼽았다. 조사가 말하는 실력 퇴화는 막연한 두려움이 아니라 정의가 붙은 항목이다. AI 도구에 지나치게 의존한 결과로 임상의가 스스로 부정확한 내용이나 부실한 권고를 가려낼 능력이 줄어드는 것을 말한다. 헬스케어다이브는 이 우려가 임상 의사결정 지원 도구가 진단과 치료 판단을 더 많이 자동화할수록 커진다고 덧붙였다.
같은 조사에서 환각을 주요 우려로 꼽은 비율도 74%다. 우연히 같은 값이 두 항목에 붙었으니 인용할 때 섞이지 않게 둘 필요가 있다. 하나는 사람 쪽 위험이고 다른 하나는 도구 쪽 위험이다. 광고가 붙은 AI 정보가 의료 판단에 편향을 넣을 수 있다는 우려는 임상의 72%, 환자 61%였다.
그러면서도 임상의들은 스스로 방어선을 치고 있다. 77%는 AI가 준 답을 신뢰하는 출처로 다시 확인한다고 답했고, 73%는 잘못된 답을 알아볼 수 있다는 데 다소 또는 매우 자신 있다고 답했다. 환자가 AI로 알아보고 온 내용을 검토해 근거 자료와 어디가 맞고 어디가 어긋나는지 설명해 준다는 응답도 56%였다. 우려와 사용이 함께 늘어난 가운데, 임상의들은 도구를 놓는 대신 자기 손으로 한 번 더 보기로 했다.
여기까지의 숫자를 모아 보면 방어선의 위치가 보인다. 제도가 아니라 개인의 습관이다. 다시 확인하는 77%도, 알아볼 수 있다는 73%도, 환자가 들고 온 자료를 짚어 주는 56%도 임상의 한 사람의 손끝에 놓인 조치이고, 바쁜 날에 가장 먼저 밀리는 종류의 조치다. 발표문은 이 숫자들을 이어 붙이지 않았다. 방어선이라는 말은 이 글이 붙였다.
실력 퇴화가 걱정에만 머무는 이야기가 아니라는 증거도 이미 나와 있다. 대장내시경 검사에서 AI 보조를 붙였다 뗐을 때 의사들의 선종 발견율이 도리어 떨어졌다는 연구를 앞선 글에서 다뤘다. 이 글의 관심은 그 메커니즘이 아니라, 그런 위험을 알면서도 도구를 계속 쓰는 사람들이 무엇을 요구하고 있는지에 있다.
어디까지가 임상시험을 거친 AI인가
임상의들이 요구하는 것은 사용 중단이 아니다. 파이낸셜타임스 보도의 요약을 따르면, 의심이 몰리는 자리는 진단과 영상 판독 밖으로 AI가 확장되는 지점이고 그 근거로 지목된 것은 확장을 받쳐 줄 임상·성능 데이터의 부족이다. 같은 이름으로 불리는 도구들이 서로 다른 문턱을 넘어왔다는 말이다.
조사도 같은 자리를 물었다. 임상의 절반 남짓인 53%는 AI가 답에 이른 추론 과정을 자세히 보여 주도록 의무화되기를 바란다고 답했다. 앞에서 본 대조 확인 습관과는 층위가 다르다. 대조는 답을 받아 든 뒤에 개인이 하는 일이고, 추론을 내보이라는 요구는 도구가 현장에 들어오기 전에 걸어 두는 조건이다. 절반이 그 조건을 각자의 성실함이 아니라 규칙으로 못 박기를 원한 것이다.
한쪽에는 성능을 재는 잣대가 먼저 정해진 도구들이 있다. 영상에서 무엇을 찾아내는 일은 정답을 따로 확인할 수 있고, 그래서 민감도와 특이도 같은 값으로 논문에 오르고 심사에 오른다. 다른 한쪽에는 진료기록 초안을 쓰고 환자 문의에 답하고 치료 방향을 권하는 도구들이 있다. 이 일에는 채점표가 없다. 무엇이 좋은 진료기록인지부터 사람마다 갈리기 때문이다.
후자가 이미 소수의 실험이 아니라는 점이 조사에 찍혀 있다. 의사 44%가 진료기록 초안 작성에 AI 스크라이브를 쓴다고 답했다. 채점표가 없는 층에 이미 열에 넷이 서 있다.
그 층을 실제로 감사한 연구가 이달 초 페블러스 블로그에서 다룬 자료다. 상용 스크라이브 세 제품에 같은 진료 142건을 똑같이 넣어 진료기록 565장을 만들고 전부를 감사했더니, 검증된 실패가 하나 이상 담긴 기록이 177장이었다. 세 장 중 한 장이다. 임상의들이 요구하는 임상·성능 데이터를 이 층에서 실제로 재면 이런 모습이 된다.
그런데 같은 연구에서 더 오래 남을 대목은 그 31.3%가 아니다. 연구진이 같은 후보 오류 1,295건을 두고 모델도 증거도 설정도 그대로 둔 채 검토자에게 준 지시문 한 줄만 바꿨더니, 인정된 오류가 9.3%에서 79.0%로 벌어졌다. 증거를 요구한다는 말에는 무엇을 오류로 셀지부터 정해 둔다는 요구가 딸려 온다. 잣대를 정하지 않은 채 오류율을 주고받으면, 같은 제품이 열 배 넘게 다른 성적표를 받는다. 설문과 감사 연구를 한 문단에 겹쳐 놓은 것은 이 글이다.
규칙을 아는 사람은 열에 셋도 안 된다
어떤 도구가 어떤 문턱을 넘었는지 가릴 책임은 개인에게 있지 않다. 소속 기관이 정하고 알려야 하는 일이다. 조사에 그것을 묻는 문항이 있었고, 답은 27%였다. 소속 기관이 AI 관련 문제를 어떻게 다루는지 안다고 답한 의사와 간호사의 비율이다. 지난해 같은 문항에서는 21%였다.
두 숫자를 옆에 놓아야 크기가 보인다. 주마다 AI를 쓰는 의사는 38%에서 네 명 중 세 명 가까이로 늘었고, 병원이 AI를 어떻게 관리하는지 아는 임상의는 21%에서 27%로 늘었다. 한쪽은 배가 됐고 다른 한쪽은 6%포인트 움직였다. 발표문은 이 항목을 관리 공백으로 따로 묶어, 의료기관의 실행이 도입 속도에 뒤처졌을 수 있다고 적었다.
바라는 바 자체는 갈리지 않는다. 임상의는 90%를 넘고 환자는 89%가, 진료에 쓰이는 AI 생성 내용은 그 뒤에 놓인 출처까지 사람 전문가가 확인해야 한다고 답했다. 확인이 필요하다는 데는 열에 아홉이 손을 들었다. 자기 조직이 그 확인을 어떻게 하고 있는지까지 아는 응답자는 넷에 한 명을 조금 넘는다.
그 27% 안을 한 겹 더 들어가면 자리가 더 좁아진다. 규칙을 안다고 답한 사람들 가운데 개인정보 규정이 AI 사용에 어떻게 적용되는지 이해한다는 응답은 63%였다. AI 정보의 정확성과 신뢰성을 확인하는 지침을 안다는 응답은 35%, 임상의와 AI 제품의 책임 범위를 규정한 정책이 회사에 있다는 응답은 22%였다. 세 값의 분모는 전체 임상의가 아니라 규칙을 안다고 답한 27%다.
전체 임상의로 환산하면 정확성 확인 지침까지 파악한 사람은 열에 한 명이다. 책임 범위를 정한 정책이 있다고 답한 쪽은 스물에 한 명 남짓이다. 아래 도식이 그 환산이다. 발표문에 실린 값이 아니라 두 비율을 곱해 얻은 값이라는 점을 함께 읽어야 한다.
환자 쪽 숫자를 겹치면 이 공백이 누구에게 청구되는지가 드러난다. 환자 75%는 AI가 진료 과정의 피해에 관여했을 때 책임 소재를 걱정했고, 78%는 임상의가 AI의 권고를 확인해 주기를 기대했다. 기대는 임상의 개인에게 모인다. 책임 범위를 문서로 정해 둔 조직에 있다고 답한 임상의는 스물에 한 명꼴이다.
검증을 통과한 쪽에서도 성능은 흔들린다
지금까지의 이야기를 통과한 도구와 통과하지 않은 도구의 이분법으로 정리하면, 얻는 것보다 잃는 것이 많다. 통과는 한 번 받는 도장이 아니라 계속 갱신해야 하는 값이다.
진단 쪽에서 나온 최근 연구가 그 점을 보여 준다. 뮌헨공대와 임피리얼 칼리지 런던 연구진은 옛 진료기록으로 학습한 모델이 그 기록의 주인을 몇 해 뒤 다시 만날 때 무슨 일이 벌어지는지를 네 개 데이터셋에서 측정했다. 그 환자가 기록에는 없던 병을 안고 돌아오면, 그 환자를 학습하지 않은 같은 구조의 모델보다 병을 찾아내는 민감도가 유의하게 떨어졌다. 그리고 테스트 성능이 사실상 같은 세 모델의 암기량이 쉰여섯 배 갈렸다. 평가 결과가 같아도 안쪽 사정은 다를 수 있다.
그러니 증거의 문턱은 통과 여부를 적어 두는 칸이 아니라, 무엇을 얼마나 자주 다시 재는지를 적어 두는 대장에 가깝다. 임상시험을 거친 계열이 더 낫다는 사실은 그대로 남는다. 다만 한 번 통과한 도구를 그 뒤로 재지 않는 조직에서는, 그 통과 기록이 몇 해 뒤에 무엇을 보증하는지 아무도 답하지 못한다.
페블러스가 이 조사를 주목하는 이유
의료는 이 구조가 가장 또렷하게 보이는 무대일 뿐이다. 사용은 매주 늘고, 어떤 도구가 어떤 증거로 들어왔는지를 아는 사람은 늘지 않는다. 이 구도는 채용 심사에도, 계약서 검토에도, 고객 응대 자동화에도 그대로 있다. 다만 진료실에서는 결과가 사람의 몸으로 곧장 번역된다는 점이 다르다.
데이터 품질을 다루는 자리에서 이 조사가 값진 이유는 도구의 성능을 잰 자료가 아니라는 데 있다. 이 조사가 잰 것은 현장이 그 성능에 관해 무엇을 알고 있는지다. 도구는 이미 좋아졌다. 그 도구에 관한 지식이 조직 안에서 유통되지 않는다면, 남는 것은 성능 문제가 아니라 기록 문제다. 우리가 AI-Ready Data를 말할 때 학습 데이터만 가리키지 않는 이유가 여기에 있다. 도구가 어떤 데이터로 무엇을 통과했고 그 값을 누가 언제 쟀는지가 함께 남아 있어야, 조직이 도구를 갈아 끼울 때 판단할 근거가 남는다.
사내에서 쓰는 AI 도구를 두고 잘 쓴다는 말이 오갈 때 네 가지를 물어 보면 지금 어디에 서 있는지가 대략 드러난다. 설문에 있던 항목이 아니라 이 글이 우리 업무로 옮겨 온 질문이다.
- 이 도구는 무엇을 통과해서 들어왔는가. 시범 사용 뒤에 아무도 반대하지 않았다는 것은 통과가 아니다.
- 그 증거를 지금 누가 갖고 있는가. 도입을 결정한 사람이 퇴사한 뒤에도 남는 곳에 있어야 한다.
- 무엇을 오류로 셀지 정해 두었는가. 3절의 9.3%와 79.0% 사이를 가른 것이 그 한 줄이었다.
- 규칙을 아는 사람이 쓰는 사람과 같은 속도로 늘고 있는가. 두 곡선이 갈라지는 폭이 이 조사가 찍은 27%다.
네 번째가 가장 싸게 확인할 수 있는 항목이다. 사내 AI 지침을 한 번 배포했다면, 지금 그것을 안다고 답할 사람이 몇 %인지 세어 보면 된다. 배포는 조직의 기록에 남지만 인지는 남지 않아서, 세어 보지 않으면 21%와 27% 사이 어디쯤인지 알 수 없다.
여기까지 읽어 주셔서 감사하다. 이 글이 인용한 조사 수치는 울터스클루버의 발표문과 헬스케어다이브 보도에서 누구나 확인할 수 있고, 파이낸셜타임스 기사의 논지는 공개 요약으로 확인했다. 여러분의 조직에서 쓰는 AI 도구에는 무엇을 통과했는지 밝혀 둔 칸이 있는지 궁금하다. 없다면 무엇이 그 칸을 비워 두게 하는지 나눠 주시면 좋겠다.
참고문헌
1차 자료
- 1.Wolters Kluwer Health. (2026). "2026 Future Ready Healthcare Survey." 입소스 실사, 미국 의사·간호사 355명.
보도
- 2.Neville, S. (2026, September 20). "Clinicians push back on medical AI beyond diagnostics." Financial Times. (유료, 공개 요약으로 확인)
- 3.Healthcare Dive. (2026). "Healthcare AI adoption accelerates as providers worry about deskilling."
- 4.AI Weekly. (2026, September 20). "FT: Clinicians Push Back on Medical AI Beyond Diagnostics."