Executive Summary

2026년 봄, 미 특수전사령부의 분석관 한 사람이 AI 챗봇에 공개출처 정보와 정부 데이터베이스의 기밀 신호정보를 함께 넣고 종합을 요청했다. 챗봇은 중동 해상에 있던 중국 선박 한 척의 화물을 이란으로 가는 핵무기 프로그램 부품으로 지목했다. 이 글은 그다음에 일어난 일, 그리고 그 일이 군대 바깥의 조직에도 똑같이 해당하는 이유를 본다.

분석관은 같은 챗봇을 한 번 더 불러 이 결론을 지휘부가 신뢰하는 정식 정보보고서 서식으로 포장했고, 보고서는 그대로 지휘 채널에 올라갔다. 무장한 미군 병력이 승선을 기다리고 군용기가 이미 떠 있을 때, 화물을 잘못 읽었다는 사실이 드러나 작전은 요격 직전에 되돌려졌다. CNN에 상황을 전한 관계자는 그 보고서가 전면 허위였고 하마터면 전쟁을 시작할 뻔했다고 말했다.

3절까지는 보도된 사실과 그 구조를 따라간다. 4절은 모델이 확신에 찬 오답을 내놓는 이유를 설명한 연구와 미 국방부의 도입 속도를 나란히 놓는다. 5절은 이 사건을 데이터 계보의 문제로 읽는 이 글의 해석이다.

주요 수치

앞의 세 값은 미 국방부가 AI를 들이는 속도를 말해 주고, 마지막 값은 잘못된 결론이 공식 문서가 되기까지 걸린 호출 횟수다.

출처: CNN 단독 보도(2026-09-18), 디펜스스쿱(2026-02-02), 에밀 마이클 국방부 연구·공학 차관의 특수전 주간 발언(2026-05-22)

300만 명

전략이 닿겠다고 한 인원

AI 가속 전략 메모가 모든 비밀등급에서 AI 모델을 직접 쥐어 주겠다고 적은 민·군 인력 규모다

8만 → 150만

GenAI.mil 이용자 변화

2025년 12월 출범 시점과 2026년 5월 사이의 수치다. 반년 남짓 만에 열여덟 배가 됐다

6개 중 5개

GenAI.mil을 기본 도구로 채택한 군

해안경비대만 빠졌고 육·해·공군, 우주군, 해병대가 기존 체계 대신 이쪽을 택했다

2번

같은 챗봇을 부른 횟수

첫 호출이 틀린 결론을 만들었고, 두 번째 호출이 그 결론에 정식 보고서 서식을 입혔다

1

채팅창에서 지휘 채널까지

CNN이 9월 18일 이 사건을 단독으로 전했고, 테크크런치를 비롯한 매체들이 받아 다시 보도했다. 사건이 일어난 때는 2026년 봄, 미국이 이란과 교전 중이던 시기다. 보고서를 만든 사람은 특수전사령부 소속 분석관 한 사람이고, 그가 챗봇에 물어본 선박 화물 목록 정보는 하와이에 본부를 둔 미 특수전사령부 태평양에서 나온 것이었다.

분석관이 한 작업 자체는 요즘 사무실에서 흔히 보는 일과 크게 다르지 않다. 공개출처 정보와 정부 데이터베이스에서 꺼낸 기밀 신호정보를 챗봇에 함께 넣고 정리를 맡겼다. 공개출처 정보는 뉴스나 선박 위치 공개 자료처럼 누구나 볼 수 있는 자료를 말한다. 신호정보는 통신을 가로채 얻은 기밀 자료다. 두 자료는 수집 방법도 신뢰 등급도 다르고, 정보기관에서는 취급 절차 자체가 갈린다.

챗봇이 내놓은 답은 중동 해상의 중국 선박 한 척이 이란으로 가는 핵무기 프로그램 부품을 싣고 있다는 것이었다. 그 배에 실제로 무엇이 실려 있었는지는 보도에 나오지 않는다. 확인된 사실은 화물 목록을 잘못 읽었다는 것뿐이다.

여기서 분석관은 그 챗봇 창을 다시 열었다. 이번에는 종합이 아니라 포장을 맡겼다. 지휘부가 늘 받아 보는 정식 정보보고서 서식에 맞춰 문서를 만들어 달라고 했다. 나온 문서는 손질 없이 지휘 채널로 넘어갔다. 보고서는 위로 올라가는 동안 한 번도 멈추지 않았다. 무장한 미군 병력이 승선을 준비했고, 군용기는 이미 하늘에 떠 있었다. 목표는 폭격이 아니라 배에 올라 화물을 확인하고 나포하는 작전이었다.

상대가 중국 선적 선박이라는 점이 이 작전의 무게를 정했다. 미군이 중국 배를 세우고 화물을 압수하는 일은 두 나라 사이의 무력 충돌로 번질 수 있다. 챗봇의 오독 하나가 닿은 범위가 거기까지였다.

보고서가 지나간 길과, 멈춰 세운 지점 1차 호출 공개+기밀 자료 종합 오인식 중국 선박 화물을 핵 부품으로 지목 2차 호출 같은 챗봇이 보고서 서식 입힘 배포·출동 승선 대기, 군용기 이륙 중단 관계자들이 보고서를 다시 들여다봄 보고서가 지휘 채널을 타고 올라가는 동안 출처를 되짚은 단계는 보도에 나오지 않는다. 마지막에 누가 어떤 절차로 다시 들여다봤는지도 상세히 보도되지 않았다.
▲ 페블러스 원본 도식 — 사건 경과는 CNN 단독 보도에서 가져왔다

작전이 멈춘 것은 계획된 시각 직전이었다. 관계자들이 그제서야 보고서를 더 깊이 파고들었고, 그 문서가 AI의 도움으로 만들어졌다는 것과 분석관이 쓴 챗봇이 화물을 잘못 식별했다는 것을 함께 확인했다. 누가 어떤 절차로 다시 들여다봤는지까지는 CNN도 적지 않았다. 다만 보도에 등장하는 검증 장면이 작전 직전의 한 번뿐이라는 점은 그대로 남는다. CNN에 상황을 전한 관계자의 표현으로 그 보고서는 전면 허위(entirely false)였고, 하마터면 전쟁을 시작할 뻔했다(almost started a war).

어떤 도구였는지는 아직 공개되지 않았다. 상업용 챗봇인지 정부가 자체 개발한 도구인지 CNN도 확인하지 못했다. 전직 고위 관료는 그 구분에 큰 의미가 없다고 봤다. 내부 도구라는 것도 대부분 상업용 제품에 립스틱만 바른 사본이라는 표현을 썼다. 미 특수전사령부 태평양과 국방부는 언론 질의에 답하지 않았다.

2

두 자료를 한 문장으로 합치면

이 사건에서 가장 먼저 눈에 띄는 것은 잘못된 답이다. 답이 틀리는 일 자체는 사람에게도 생긴다. 사람이 쓴 보고서가 틀렸을 때 조직이 할 수 있는 일은 되짚기다. 어느 문장이 어느 자료에서 나왔는지 따라 올라가 그 자료를 다시 읽고, 판단이 갈린 지점을 찾는다. 정보기관이 자료마다 출처 등급을 붙이고 보고서 문장마다 근거를 달아 온 이유가 여기에 있다.

챗봇이 내놓은 문장에는 그 표식이 붙지 않는다. 공개출처 자료와 기밀 신호정보를 같은 입력창에 넣는 순간 두 자료는 똑같은 토큰 뭉치가 된다. 모델이 합쳐 낸 문장은 어느 쪽에서 무엇을 가져왔는지 남기지 않는다. 화물 목록이 핵무기 부품이라는 결론이 공개 선박 자료를 잘못 읽어서 나온 것인지, 기밀 통신 기록의 한 대목을 과하게 해석해서 나온 것인지 문서만 보고는 알 수 없다. 한 문장으로 깔끔하게 합쳐졌기 때문에 오히려 알 수 없다.

서로 다른 두 자료가 한 문장이 되는 동안 사라지는 것 공개출처 정보 누구나 볼 수 있는 자료 · 출처 확인 가능 기밀 신호정보 통신 가로채기 · 취급 절차가 따로 있다 AI 챗봇이 한 문서로 종합 "이 선박은 핵무기 프로그램 부품을 운반 중" 문장에 남은 출처 표식: 없음 되짚을 대상이 사라진 자리에서, 문서를 검토하는 사람에게 남는 판단 재료는 문장의 어조와 형식뿐이다.
▲ 페블러스 원본 도식 — 사건 구조를 데이터 계보 관점에서 정리했다. 도식 안의 문장은 보도된 결론을 요약한 것이지 보고서 원문이 아니다

데이터를 다루는 쪽에서는 이 기록을 데이터 계보라고 부른다. 어떤 값이 어디서 나와 어떤 처리를 거쳐 지금 이 자리에 왔는지를 남긴 흔적이다. 계보가 붙어 있으면 결과가 이상할 때 어디를 열어 볼지 알 수 있고, 계보가 없으면 결과 전체를 믿거나 전체를 버리는 두 선택지만 남는다. 지휘 채널에 올라간 그 보고서가 후자였다. 그리고 바쁜 조직은 대체로 버리는 쪽이 아니라 믿는 쪽을 고른다.

여러 출처를 합치는 일은 원래 분석관의 핵심 업무다. 문제는 합치는 작업을 넘긴 것이 아니라, 합치는 과정에서 무엇이 어디서 왔는지 적어 두는 일까지 함께 넘어갔다는 데 있다. 사람이 종합할 때 자동으로 따라오던 각주가 도구를 바꾸자 사라졌다.

3

서식이 검토를 대신한다

두 번째 호출이 이 사건의 성격을 바꿨다. 첫 호출의 결과물은 채팅창에 뜬 답변이었다. 분석관이 혼자 보고 갸웃할 수 있는 형태다. 옆자리 동료에게 보여 줘도 챗봇이 이렇게 말한다는 전제가 화면에 남아 있다. 두 번째 호출을 거치자 그 답변은 지휘부가 매일 받아 보는 문서와 같은 모양이 됐다.

조직에서 문서 서식은 그 자체로 정보를 담고 있다. 정해진 서식을 갖췄다는 것은 규정대로 자료를 모으고, 출처 등급을 매기고, 상급자 검토를 거쳤다는 신호로 읽힌다. 실제로 그 절차가 있었기 때문에 서식이 신호 노릇을 해 온 것이다. 그런데 서식만 몇 초 만에 복제할 수 있게 되면 신호와 실체의 연결이 끊어진다. 받는 쪽은 여전히 서식을 보고 절차를 읽는다.

서식에 이르는 두 갈래 길 예전 — 서식이 절차의 신호였을 때 자료 수집 출처 등급 부여 상급자 검토 서식 완성 = 절차 통과의 신호 지금 — 서식만 복제될 때 챗봇 답변 (수집·등급·검토 생략) 서식 완성 모양은 같다 두 경로의 도착점은 같은 서식이지만, 그 서식이 보증하던 절차는 아래 경로에만 없다.
▲ 페블러스 원본 도식 — 서식이 절차의 신호로 기능하던 경로와, 절차 없이 서식만 복제되는 경로를 비교했다

문서상 작성자가 여전히 사람이라는 점도 여기에 겹친다. 보고서에는 분석관의 이름이 적혔고 체계는 그 이름을 보고 신뢰 수준을 정했다. AI가 판단을 보강한 것이 아니라 판단 자체를 대신했는데, 서명란은 바뀌지 않았다. 보고서를 받은 사람들이 확인할 수 있는 정보에는 이 대체가 들어 있지 않다.

CNN에 상황을 전한 관계자 한 사람은 이 구조를 한마디로 줄였다. AI는 나쁜 아이디어에 더 빨리 도달하게 해 준다(AI allows you to get to a bad idea faster). 같은 관계자들은 이번 일이 고립된 사건이 아니라고 했다. AI 도구가 정부 안에 퍼진 뒤로 정보 공동체 전반에서 비슷한 유형의 오류가 나타난다는 것이다. 다만 관계자들이 다른 사건의 이름도 날짜도 대지 않았으므로, 이 진술이 가리키는 범위는 일반적 서술에 머문다. 젊은 분석관일수록 챗봇을 의심 없이 신뢰하는 경향이 있다는 지적도 함께 나왔다.

관계자들은 조건 하나를 더 짚었다. 분석관들이 AI를 쓸 수 있게 되면서 더 빨리 만들어 더 빨리 내보내라는 압박을 함께 받게 됐다는 것이다. 자료를 모으고 대조하는 데 걸리던 시간이 몇 초로 줄면 그 시간은 검토로 돌아오지 않고 다음 보고서로 간다. 도구가 빨라진 만큼 사람이 한 번 더 들여다볼 여유가 생기지는 않는다.

4

모델은 왜 모른다고 답하지 않는가

챗봇이 화물 목록을 못 읽겠다고 답했다면 이 사건은 없었다. 사진이 흐리다거나 자료가 부족하다는 답은 분석관에게 다음 행동을 알려 준다. 모델은 단정적인 결론을 내놨다. 이 선택이 모델의 성격 문제가 아니라 학습과 평가 방식의 결과라는 설명이 최근 정리됐다.

4.1확신에 점수를 주는 채점표

오픈AI 연구진과 조지아공대의 벰팔라가 2025년 9월에 낸 논문 「Why Language Models Hallucinate」는 할루시네이션을 통계적 필연으로 설명한다. 논지는 간단하다. 모델을 평가하는 채점표가 맞음과 틀림 둘로만 나뉘어 있으면, 답을 모를 때 모르겠다고 적는 쪽보다 그럴듯한 답을 적는 쪽의 기대 점수가 높다. 학생이 객관식 시험에서 빈칸을 남기는 대신 찍는 것과 같은 계산이다. 학습과 평가가 이 계산을 계속 보상하면 모델은 확신하는 습관을 익힌다.

저자들이 제안한 처방도 시험 제도에서 빌려 왔다. 확신에 찬 오답에는 불확실성을 표현한 답보다 큰 벌점을 주고, 적절한 불확실성 표현에는 부분 점수를 준다. 새로운 개념은 아니다. 저자들이 강조한 대목은 이 조정을 벤치마크 몇 개 손보는 일로 끝낼 수 없다는 쪽이다. 정확도 하나로 줄을 세우는 업계 전반의 순위표 구조를 함께 바꿔야 한다고 봤다.

찍는 쪽이 유리한 채점표, 뒤집는 채점표 지금 채점표 (맞음·틀림 두 칸) 0점 모른다고 답 기대 점수 더 높음 그럴듯하게 답 제안된 채점표 (불확실성 반영) 부분 점수 인정 불확실성 표현 확신에 찬 오답 벌점 부과 왼쪽 채점표에서는 찍는 쪽이 유리하다. 오른쪽처럼 불확실성에 부분 점수를 주고 오답에 벌점을 매기면 그 유리함이 뒤집힌다.
▲ 페블러스 원본 도식 — 「Why Language Models Hallucinate」(arXiv:2509.04664)가 제안한 채점 방식 비교를 재구성했다

채점표 이야기를 이번 사건에 포개면 장면이 맞아떨어진다. 챗봇은 화물이 무엇인지 알 수 없다고 답하는 대신 핵무기 부품이라고 답했다. 그리고 두 번째 호출에서 그 확신에 서식이라는 외피가 한 겹 더 씌워졌다. 모델이 가진 확신 편향과 조직이 형식에 부여하는 신뢰가 같은 방향으로 겹친 셈이다.

4.2속도를 먼저 세운 조직

사건의 배경에는 도입을 서두르는 정책이 있다. 피트 헤그세스 국방장관은 2026년 1월 AI 가속 전략을 내놓으며 실험을 풀어 주고 관료적 장벽을 없애 군사 AI에서 앞서 나가겠다고 밝혔다. 전략을 알린 메모에는 세계 최고 수준의 AI 모델을 300만 명에 이르는 민·군 인력의 손에 모든 비밀등급에서 직접 쥐어 주겠다는 문장이 들어 있다. 약속된 것은 닿는 범위와 속도다. 그 모델이 내놓은 문장의 출처를 따라갈 수 있게 하겠다는 약속은 거기 없다.

속도는 이용자 수에도 그대로 찍혀 있다. 국방부 공용 플랫폼 GenAI.mil은 2025년 12월 문을 열 때 이용자가 8만 명 남짓이었다. 2026년 5월 에밀 마이클 연구·공학 차관은 이 숫자가 150만 명이 됐다고 밝혔다. 6개 군 가운데 5개 군은 기존 체계 대신 이 플랫폼을 기본 도구로 삼았고, 해안경비대만 따로 자체 도구를 만들고 있다. 이번 사건 같은 작업을 지금 백만 명 단위가 매일 한다는 뜻이다.

그 백만 단위가 무엇을 쓰고 있는지도 일부는 공개됐다. GenAI.mil에는 구글 제미나이가 첫 프론티어 모델로 올라갔고, 그 뒤 xAI의 그록과 오픈AI의 챗GPT가 차례로 더해졌다. 내부 도구도 결국 상업용 제품의 사본이라던 전직 고위 관료의 말은 여기서 구체적인 근거를 얻는다. 군이 쓰는 도구의 확신 편향도 상업용 모델에서 그대로 건너온다.

국방부가 AI의 이점으로 공개적으로 내세우는 것은 킬체인의 가속이다. 킬체인은 표적을 찾고 고정하고 추적하고 정하고 타격하고 평가하는 여섯 단계 절차를 말한다. 이 사슬을 빠르게 돌리는 것이 목표로 제시된다. 이번 일은 그 가속이 어떤 모습으로 실패하는지 보여 준다. 사슬의 첫 단계에 들어간 오류가 중간에서 걸러지지 않고 마지막 직전까지 그대로 갔다. 빨라진 것은 실행이었고, 검증은 원래 속도에 머물렀다.

정책 연구 쪽에서 나온 지적도 같은 지점을 짚는다. 전직 미군 장교이자 AI 정책 연구기관 GovAI의 연구위원인 제이크 스테클러는 군 복무자가 대규모 언어 모델에 내재한 불확실성을 이해하는 일이 중요하다고 말했다. 도입 속도를 안전장치보다 앞세우면 신뢰를 잃고 결국 도입 자체가 늦어진다는 취지다.

5

페블러스가 이 소식을 주목하는 이유

군사 작전이라는 무대를 걷어 내면 남는 작업은 낯익다. 출처가 다른 자료 여러 건을 한 챗봇에 넣고 정리를 맡긴 다음, 그 결과를 사내 서식에 맞춰 위로 올린다. 시장 보고서와 내부 매출 자료를 함께 넣어 요약을 만들고, 고객 문의 기록과 계약서를 같이 넣어 대응 초안을 뽑는 일이 지금 많은 조직에서 매일 일어난다. 이번 사건과 다른 것은 결과의 크기이지 구조가 아니다.

우리가 AI-Ready Data를 이야기할 때 데이터 계보를 앞에 두는 이유가 여기에 있다. 데이터를 잘 정리하는 일은 모델 성능을 위한 준비이기도 하지만, 먼저 지금 이 값이 어디서 왔는지 말할 수 있는 상태를 만드는 일이다. 모델이 좋아질수록 결과물은 더 매끄러워지고, 매끄러운 결과물일수록 되짚을 자리가 적다. 계보를 붙이는 일과 도구를 도입하는 일은 서로 다른 속도로 진행된다. 그 간격이 벌어진 끝에 이번에는 무장 병력과 군용기가 움직였다.

규칙 문서를 한 장 더 쓰는 일로 이 간격이 좁혀지지는 않는다. AI 사용을 금지하는 조항을 붙여도 작업은 더 안 보이는 곳으로 옮겨 갈 뿐이고, 이번 사건의 분석관도 규정을 어기려던 사람이 아니라 빨리 일하려던 사람이었다. 먼저 산출물에 기록이 따라붙어야 한다. 다음 네 가지를 물어보면 지금 조직이 어디쯤 있는지 대략 나온다.

  • AI가 만든 문서에서 한 문장을 집어 그 근거 자료까지 되짚을 수 있는가. 되짚는 데 며칠이 걸린다면 없는 것과 같다.
  • 서로 다른 등급의 자료를 한 프롬프트에 넣었을 때, 결과물에 그 사실이 남는가. 공개 자료와 대외비 자료가 섞인 요약을 구별할 방법이 있는가.
  • AI가 초안을 쓴 문서와 사람이 쓴 문서가 받는 쪽에서 구별되는가. 서명란만 보고는 알 수 없다면 형식이 신뢰를 떠맡고 있다.
  • 결과가 의사결정으로 넘어가기 전에 출처를 확인하는 단계가 절차에 들어 있는가. 실행 직전에 누군가 마음먹고 다시 열어 보는 것 말고.

네 번째 항목이 이번 사건에서 실제로 비어 있던 자리다. 보고서는 지휘 채널을 타고 올라가면서 여러 사람을 거쳤고, 병력과 항공기가 움직이는 단계까지 갔다. 그 사이에 문장의 출처를 확인한 단계는 기사 어디에도 등장하지 않는다. 작전을 멈춘 것은 문서에 붙어 있던 근거 표시가 아니라, 실행 직전에 보고서를 다시 파고든 사람들이었다.

반대쪽 모습도 그려 두는 편이 낫다. 계보가 붙은 산출물에서는 문장마다 근거가 달려 있어서, 읽는 사람이 의심스러운 대목을 집으면 그 자리에서 원본 문서와 해당 구절이 열린다. 등급이 다른 자료가 한 요약에 함께 들어갔다면 그 사실도 결과물에 남고, 모델이 확신의 정도를 표시했다면 그 표시도 같이 간다. 이런 산출물은 설계에서 나온다. 자료가 들어가는 자리와 결과가 나오는 자리 사이에 기록이 함께 만들어지도록 미리 정해 두어야 한다.

이 글이 기대는 자료의 한계도 적어 둔다. 사건 경과는 익명 취재원 네 사람에게 기댄 CNN 단독 보도 하나에서 나왔고, 이 글은 CNN 홈페이지 대신 제휴 방송사에 배포된 같은 기사 전문을 읽었다. 그 배의 화물이 무엇이었는지도, 어떤 도구가 쓰였는지도 끝내 밝혀지지 않았다. 이런 일이 처음이 아니라는 관계자 진술 역시 구체적 사례 없이 일반적 서술로만 확인된다. 그럼에도 확인된 사실 하나는 분명하다. AI가 종합한 문서가 검증 단계를 통과하지 않고 실행 직전까지 갔고, 그 문서 안에서 출처를 되짚을 방법은 없었다.

여기까지 읽어 주셔서 감사하다. 이 글이 인용한 사건 경과는 CNN 단독 보도에서, 확신 편향에 관한 설명은 「Why Language Models Hallucinate」에서 누구나 확인할 수 있다. 여러분의 조직에서는 AI가 만든 문서의 한 문장을 집었을 때 그 근거까지 얼마 만에 닿을 수 있는지 나눠 주시면 좋겠다.

R

참고문헌

1차 소스·보도

학술 논문