Executive Summary
이 글은 영국 상장사가 연차보고서에 AI 위험을 어떻게 적어 왔는지를 보고서 9,821건으로 전수 분류한 프리프린트 한 편을 읽는다. 2026년 10월 1일에 공개됐고, 영국 AI보안연구소의 사회적 회복력 팀이 재정을 후원했으며, 분류에 쓴 코드와 결과 데이터가 함께 열려 있다. 가장 많이 인용될 수치는 둘이다. AI를 위험으로 적은 보고서가 2.8%에서 41.2%로 늘었다는 것, 그리고 실제로 일어난 AI 사고를 적은 보고서가 손에 꼽힌다는 것.
그런데 늘지 않은 쪽이 따로 있다. 위험을 적은 보고서 가운데 구체적인 내용까지 담은 비율은 2023년 이후 10% 안팎에서 움직이지 않는다. 벌어진 격차는 쓰는 보고서가 많아지면서 생겼다. 내용이 해마다 묽어진 흔적은 이 자료에 없고, 그 대부분은 복사해 붙인 상투어도 아니다. 어디가 위험한지까지는 적고 무엇을 어떻게 하는지는 안 적은 문장이 위험 공시의 큰 몫을 차지한다. 사고를 적은 보고서 수도 그대로 옮기면 틀린다. 저자는 그 라벨이 검증 표본에서 맞힌 것이 하나도 없다는 성적표를 같은 논문에 싣고, 코퍼스 전체에서 걸린 문단을 손으로 다시 읽어 네 건을 남겼다. 일곱과 넷 사이에는 검증 절차가 놓여 있다.
여기까지가 연구가 보고한 사실이고, 아래는 이 글의 해석이다. 저자는 이 공백을 은폐로 읽지 말라고 적었다. 연차보고서가 말해 주는 것은 사고가 얼마나 자주 나는지가 아니라 사고가 어디에 적히는지다. 그러면 질문은 기업의 정직함에서 서식의 설계로 옮겨 간다. 우리 회사가 AI로 겪은 실패는 지금 어느 서식의 어느 칸에 적히고, 그 칸을 누가 읽을 수 있는가. 그 칸이 비어 있으면 재발 방지도 보험도 규제도 설 자리를 찾지 못한다.
41.2%
AI를 위험으로 적은 보고서
2025년 · 보고서 1,561건 기준. 2020년에는 2.8%였다
10.4%
그중 구체적인 등급을 받은 몫
2025년 · 위험을 적은 643건 기준. 2023년 이후 10% 안팎에서 평평하다
78.5%
'어디가'까지만 적은 중간 등급
2025년 · 위험을 적은 643건 기준. 복사해 붙인 등급은 11.0%다
4건
실제 사고를 적은 보고서
2020~2026년 · 보고서 9,821건 중. 자동 분류가 라벨을 건 7건을 저자가 손으로 다시 읽은 뒤 남은 수
숫자 이전에 세는 규칙이 있었다
이 연구는 2026년 10월 1일 arXiv에 올라온 프리프린트다. 동료심사를 거치지 않았고, 저자는 소속을 독립 연구자로 적었으며, 사사에 영국 AI보안연구소(AISI) 사회적 회복력 팀의 재정 후원과 연구 방향 자문을 받았다고 밝혔다. 분류 코드는 Apache-2.0, 결과 데이터는 CC BY 4.0으로 공개돼 있다. 영국 AI보안연구소가 어떤 일을 하는 기관인지는 영국 AI보안연구소가 미국 모델을 먼저 검토한 일에서 다룬 적이 있다.
본문의 수치를 읽기 전에 이 연구가 무엇을 세었는지부터 봐야 한다. 뒤에 나올 모든 백분율이 여기서 정해진 규칙 위에 서 있기 때문이다. 세는 규칙은 크게 셋이다. 어떤 문단을 후보로 올릴지 정하는 관문, 그 문단에 무슨 이름표를 붙일지 정하는 분류, 그리고 보고서 하나에 그 이름표를 어떻게 합산할지 정하는 집계다.
1.1관문을 통과하지 못하는 말들이 있다
먼저 키워드 관문이 걸린다. 고정된 목록에 있는 말이 문단에 하나라도 들어 있어야 LLM 분류로 넘어간다. 목록에는 인공지능·기계학습·대규모 언어모델·생성형 AI 같은 핵심 용어, 신경망·컴퓨터 비전·자연어 처리처럼 분명히 AI에 딸린 기법, 이름이 붙은 AI 제품과 공급사, 그리고 로봇 프로세스 자동화·예측 분석·챗봇 같은 응용 용어가 들어간다. 반대로 통과하지 못하는 말도 저자가 못 박았다.
"데이터 분석", "디지털 전환", "자동화" 같은 포괄적 용어는 그 자체만으로는 관문을 여는 방아쇠가 되지 않는다. 원문: "Generic terms such as 'data analytics,' 'digital transformation,' and 'automation' are not triggers on their own." — §3.2
이 선택에는 값이 따라붙는다. 저자는 한계 절에서 이 관문이 의도적으로 누락을 만든다고 직접 적었다. AI라는 말을 쓰지 않고 '지능형 시스템'이나 자체 플랫폼 이름으로 에둘러 서술하는 회사는 아예 잡히지 않는다. 그래서 이 연구의 수치는 'AI라고 이름 붙여 쓴 논의'의 양으로 읽어야 한다. AI와 관련된 논의 전체의 양은 이보다 크다.
반대 방향의 잡음도 저자가 알고 적었다. 짧은 약어는 AI와 무관한 쓰임과 충돌한다. 수도 회사 보고서의 ML은 메가리터이고, 이사 약력에 나오는 LLM은 법학 석사 학위다. 대문자 AI가 Shanghai나 Chairman 안에서 걸리지 않도록 일부 용어는 대소문자를 구분해 맞춘다. 이렇게 관문을 통과한 문단은 24,189개이고, 각 문단은 방아쇠가 된 문장 앞뒤로 두 문단씩을 문맥으로 함께 끌고 온다.
1.2이름표는 여섯 개, 그중 둘의 정의가 이 글의 축이다
1단계 분류기는 문단마다 여섯 가지 이름표 중 하나 이상을 붙인다. 도입(adoption)·위험(risk)·공급사(vendor)·피해(harm)·일반(general/ambiguous)·해당 없음(none)이다. 이 글이 기대는 두 이름표의 정의는 다음과 같다. 뒤의 모든 수치가 이 두 문장에서 나온다.
| 이름표 | 저자의 정의 | 붙는 조건 |
|---|---|---|
| 위험 | AI에 귀속된 손실 가능성 또는 노출 | AI 근처에 위험이라는 말이 있는 것만으로는 안 되고, 손실이 AI에 귀속돼야 한다 |
| 피해 | 과거에 실제로 일어난, 특정된 AI 유발 사고 | 일어날 가능성을 적은 문단은 해당하지 않는다. 일어난 일이어야 한다 |
논문 §3.3의 1단계 라벨 정의를 옮겼다. 도입 라벨에는 "실제 배치를 가리키는 1인칭 회사 서술"이라는 조건이 따로 붙는다.
2단계에서 위험 문단은 열 개 범주로 다시 나뉘고, 귀속이 얼마나 명시적인지를 1에서 3까지로 매긴다. 3은 같은 문장 안에 AI와 위험을 잇는 인과 표현이 있는 경우다. 저자는 이 신호가 3인 것만 '명시적'이라고 부른다. 같은 2단계에서 구체성 등급도 매겨지는데, 이건 3절에서 따로 본다.
페블러스가 논문 §3.2~3.3의 3단계 분류 절차를 도식으로 재구성했다. 키워드 관문을 통과한 문단만 1단계 라벨을 받고, 그중 위험 라벨이 붙은 문단만 2단계에서 범주·귀속강도·구체성 등급을 추가로 받는다. 뒤에 나오는 모든 백분율은 이 세 단계 중 하나의 산출물이다.
1.3분모는 회사가 아니라 제출 문서다
이 연구에서 가장 자주 잘못 옮겨질 수 있는 수가 9,821이다. 이건 보고서, 즉 제출 문서의 수다. 그 보고서를 낸 회사는 1,362곳이고, 영국 법인 상장사 모집단 1,469곳 가운데 기계가 읽을 수 있는 보고서가 확보된 곳이다. 2025년만 보면 884개 회사가 낸 1,561개 문서다. 논문의 모든 '% of reports'는 문서를 단위로 가중된 값이다.
두 단위를 섞으면 어디서 티가 나는지도 저자가 같은 절에 적었다. 2025년은 문서 기준 41.2%와 회사 기준 41.6%로 차이가 거의 없지만, 2026년 부분 데이터에서는 문서 기준 66.4%와 회사 기준 72.0%로 벌어진다. 같은 현상을 두 단위로 재면 답이 5.6%p만큼 갈리는 것이다. 수치를 인용하기 전에 분모부터 확인하는 습관이 왜 필요한지는 마이크로소프트 AI 확산 지표를 다룬 글에서 한 번 길게 다뤘다.
2026년치는 2026년 4월까지 모인 339건의 부분 데이터다. 저자는 이 값을 추세 방향을 보여 주려고 실었을 뿐 확정치로 다루지 말라고 적었다. 이 글도 2026년 수치는 방향을 말할 때만 쓴다.
넓이는 늘고 깊이는 제자리다
2020년에 영국 상장사가 낸 연차보고서는 1,007건이었고, 그중 AI를 위험으로 적은 것은 28건이었다. 2025년에는 1,561건 가운데 643건이 같은 일을 했다. 비율로 2.8%에서 41.2%로, 약 열다섯 배다. 저자가 결론에서 쓴 표현도 "대략 열다섯 배"다. 건수만 보면 28건에서 643건으로 스물세 배쯤 되지만, 그 수에는 코퍼스가 커진 몫이 섞여 있어서 증가 배수로 쓰기에 적절하지 않다.
같은 표에 나란히 실린 다른 열이 이 절의 본론이다. 저자는 '구체적'이라고 채점된 보고서의 비율을 해마다 함께 적었다. 전체 보고서를 분모로 삼으면 2020년 0.3%에서 2025년 4.3%다. 두 열의 간격은 2.5%p에서 36.9%p로 벌어졌고, 저자는 이 간격이 "해마다 넓어졌다"고 적었다.
| 연도 | 보고서 수 | AI 위험 언급 | 구체적 공시 | 간격 |
|---|---|---|---|---|
| 2020 | 1,007 | 2.8% | 0.3% | 2.5%p |
| 2021 | 1,328 | 4.2% | 0.6% | 3.6%p |
| 2022 | 1,853 | 4.8% | 0.9% | 3.9%p |
| 2023 | 1,905 | 9.8% | 1.2% | 8.6%p |
| 2024 | 1,828 | 30.4% | 3.3% | 27.1%p |
| 2025 | 1,561 | 41.2% | 4.3% | 36.9%p |
논문 Table 4를 옮겼다. 두 비율의 분모는 모두 그해 전체 보고서 수다. 2026년치는 4월까지 모인 339건의 부분 데이터라 이 표에서 뺐다.
2.1같은 자료에서 그린 곡선 셋이 서로 다른 모양이다
저자는 같은 데이터에 거름망을 세 번 다르게 걸어 곡선 셋을 겹쳐 놓았다. 아무 조건 없이 위험 언급을 다 세면 2025년 41.2%다. 귀속 신호가 3인 것, 즉 한 문장 안에서 AI와 위험을 인과로 이은 것만 남기면 30.3%로 내려간다. 구체적 등급을 받은 것만 남기면 4.3%다. 이 셋을 한 그림에 놓으면 모양이 갈린다.
논문 Figure 6과 Table 4를 바탕으로 다시 그렸다. 두 선의 분모는 모두 그해 전체 보고서 수다. 명시적 귀속만 남긴 값은 논문이 2025년 수치만 본문에 적어 두었기에 점 하나로 표시했다.
저자가 그림 설명에 적은 해석은 이렇다. 명시적인 것만 추려도 수준은 내려가지만 성장 궤적은 거의 그대로 남고, 구체적인 것만 추리면 곡선이 거의 평평해진다. 이어지는 문장이 이 연구의 결론을 한 줄로 담는다.
증가분의 대부분은 구체적 기제도, 통제 수단도, 목표치도 없는 공시에 있다. 원문: "most of the growth is in disclosure lacking specific mechanisms, controls, or targets." — Figure 6 캡션
2.2벌어진 간격은 내용이 묽어져서 생긴 것이 아니다
여기서 한 번 더 분모를 바꿔야 한다. 4.3%는 전체 보고서 1,561건을 분모로 삼은 값이다. 위험을 적은 643건만 분모로 삼으면 같은 67건이 10.4%가 된다. 그리고 이 10.4%가 시간에 따라 어떻게 움직였는지가 이 연구에서 가장 조용하면서 가장 중요한 결과다.
2023년 이후로는 구성비가 대체로 안정적이며(위험을 언급한 보고서의 약 10%가 구체적), 분량이 늘어나는 동안에도 그랬다. 2020~2022년의 더 높은 구체성 비율(최대 18%)은 매우 적은 수의 보고서 위에 서 있다. 원문: "since 2023 the composition has been broadly stable (about 10% of risk-mentioning reports substantive) even as volume has grown; the higher substantive shares in 2020–2022 (up to 18%) rest on very few reports." — §4.6
이 한 문단이 두 가지 오독을 동시에 막는다. 첫째, 공시가 해마다 더 부실해졌다는 추세는 이 데이터에 없다. 구체성 비중은 2023년 이후 10% 안팎에서 그대로다. 벌어진 36.9%p는 쓰는 보고서가 많아져서 벌어진 간격이다. 둘째, 2022년의 18%는 "예전에는 더 나았다"는 증거가 되지 못한다. 그해 위험을 적은 보고서가 89건뿐이었고, 그중 16건 위에서 나온 비율이다.
2025년의 반대쪽도 같이 봐야 한다. 그해 보고서 1,561건 중 918건은 AI를 위험으로 아예 적지 않았다. 열에 넷이 적었다는 말은 열에 여섯은 적지 않았다는 말이기도 하다.
위험 공시의 대부분은 '어디가'까지만 적는다
'구체적이지 않다'는 말은 보통 둘 중 하나를 뜻한다. 아무 말도 안 했거나, 어느 보고서에나 들어갈 법한 상투어를 복사해 붙였거나. 이 연구가 센 결과는 그 둘 어느 쪽도 아니다. 2025년에 AI를 위험으로 적은 보고서 643건을 구체성 등급으로 나누면, 복사해 붙인 수준은 11.0%이고 구체적인 것은 10.4%이며, 나머지 78.5%가 가운데 등급에 몰려 있다.
가운데 등급이 어떤 문장인지는 저자가 채점 기준을 설명하면서 직접 예시로 들었다. 세 줄을 나란히 읽으면 선이 어디에 그어져 있는지가 분명해진다.
| 등급 | 저자가 든 예시 문장 | 무엇이 있고 무엇이 없나 |
|---|---|---|
| 복붙 | "AI는 빠르게 진화하는 기술이며 우리 사업에 영향을 줄 수 있다" | 어느 보고서에 그대로 옮겨 놓아도 어색하지 않다 |
| 중간 | "AI 규제가 우리의 컴플라이언스 의무에 영향을 줄 수 있다" | 위험이 있는 자리는 짚었고, 기제도 완화책도 없다 |
| 구체적 | "EU AI법 적합성 확보에 500만 파운드를 배정해 고위험 AI 시스템 셋을 2025년 3분기까지 맞춘다" | 기제와 함께 통제 수단·대상 시스템·측정 가능한 목표가 있다 |
논문 §3.3이 위험 공시에 대해 직접 든 세 예시를 옮겼다. 구체적 등급의 조건은 "구체적 기제를 서술하고, 동시에 명확한 통제 수단이나 이름이 붙은 시스템 또는 측정 가능한 목표를 제시할 것"이다.
이 잣대가 느슨한지 확인하려면 '구체적'을 받은 실물을 보는 쪽이 빠르다. 공개 데이터에 남아 있는 2025년 문단 중 하나는 Bloomsbury Publishing의 보고서다. 이 회사는 AI 관련 위험의 추정 영향을 1백만 파운드 미만, 1백만에서 1천만 파운드, 1천만에서 2천6백만 파운드의 세 구간으로 나눠 적었고, 2024/25년 내내 주주를 포함한 이해관계자가 이 문제에 관여해 왔다고 덧붙였다. 금액 구간과 관여 주체가 같이 적힌 문단이라야 구체적 등급을 받는다.
3.1같은 잣대로 재면 공시 종류마다 모양이 다르다
구체성 등급은 위험 공시에만 매겨진 것이 아니다. 저자는 같은 잣대를 도입 공시와 공급사 공시에도 댔고, 세 띠를 겹쳐 보면 위험 공시가 셋 중 가장 덜 구체적이라는 것이 드러난다. 구체적 등급을 받은 몫은 위험 공시가 10.4%, 도입 공시가 33.8%, 공급사 공시가 64.5%다.
논문 Table 7을 바탕으로 다시 그렸다. 공급사 띠의 왼쪽이 긴 것은 공시의 질이 좋아서가 아니다. 저자가 같은 절에 못 박았다. 공급사 언급은 정의상 제공자 이름을 부르게 되므로 채점 기준의 '이름 붙은 시스템' 조건을 이미 충족한다. 다른 종류와 바로 견줄 수 없는 값이다.
공시가 사용의 전부를 비추지 않는다는 것은 다른 자료와 맞대어 보면 드러난다. 영국 통계청이 2026년 6월 기준으로 조사한 결과 영국 기업의 29%가 AI 기술을 하나 이상 쓰고 있었고, 종업원 10인 이상으로 좁히면 35%, 250인 이상은 49%였다. 같은 시기 영국 상장사 연차보고서에서 AI 공급사 이름이 한 번이라도 나오는 보고서는 19.2%다. 두 수를 빼서 격차를 말할 수는 없다. 모집단이 다르기 때문이다. 통계청 조사는 금융·보험을 제외한 전 규모 기업을 보고, 이 연구는 상장사가 낸 보고서를 본다. 말할 수 있는 방향은 하나다. 공시는 사용의 부분집합이고, 그것도 이름을 적을 만큼 중요하다고 판단한 경우의 부분집합이다. 통계청은 같은 보고에서 AI가 지금까지 미친 변혁적 영향이 상대적으로 제한적이라고 해석했다. 얕게 쓰고 있어서 얕게 적는 것일 가능성을 이 자료는 닫지 않는다.
복붙 등급은 셋 다 10.7%에서 11.0% 사이로 거의 같다. 종류를 가르는 것은 복붙의 양이 아니라 가운데 띠의 길이다. 위험 공시에서 그 띠가 가장 길다. 회사가 무엇을 쓰고 있는지는 상대적으로 구체적으로 적고, 그것이 무엇을 망칠 수 있는지는 자리만 짚는다.
3.2범주가 넓어진 것은 맞지만, 범주별 순위는 믿을 수 없다
저자는 위험 공시의 범주가 2020년의 경쟁 우려 중심에서 사이버보안, 정보 무결성, 인력 영향까지 넓어졌다고 적었다. 이 방향 서술은 이 연구가 뒷받침한다. 다만 범주별 수치를 소수점까지 비교하거나 순위를 매기는 일은 같은 논문이 막아 둔다. 열 개 위험 범주에 대한 사람과 기계의 라벨 일치도가 0.33이기 때문이다. 1단계 유형 분류의 일치도 0.73과 견주면 절반이 못 된다.
늘어난 분량 자체를 AI 특유의 현상으로 읽지 않게 막아 주는 선행 연구도 있다. 미국 10-K 서술 공시를 1996년부터 추적한 연구는 보고서가 길어지면서 중복과 상투성이 함께 올라가고 가독성과 구체성은 내려갔다는 흐름을 보고했는데, 영국 연구가 바로 이 대목을 인용하며 "AI 공시도 같은 양상을 따르는지"를 묻는 질문의 출발점으로 삼는다. 여기에 또 하나의 가능성이 얹힌다. 생성형 AI가 서술형 공시문을 대신 쓰는 일이 늘면 분석 대상 텍스트의 저자와 신뢰성 자체가 달라진다는 지적을 영국 연구가 인용한다. 다만 몇 %가 그렇게 쓰였는지를 측정한 연구는 아직 없다.
분량이 늘면서 문서가 전년 자기 자신에 고착된다는 것도 AI 이전에 측정됐다. 미국 10-K의 경영진단 항목을 1997년부터 2006년까지 28,142 기업-연도로 추적한 연구가 전년 대비 변화량을 코사인 거리로 쟀다. 2006년 기준으로 같은 회사의 작년 문서와는 0.10 떨어져 있었고, 같은 산업 다른 회사의 문서와는 0.64에서 0.75 떨어져 있었다. 기업의 서술형 공시는 남의 글보다 제 작년 글에 훨씬 가깝다. 같은 논문이 인용한 선행 연구는 한 번 깔아 둔 주의 문구를 소송 위험이 낮아진 뒤에도 걷어내지 않는다고 적었다. 영국 연구의 복붙 11.0%를 이 기준선 없이 읽으면 AI 공시만 유난히 상투적이라는 인상으로 기울기 쉽다.
회사가 스스로 적은 문장을 그대로 자료로 삼을 때 어떤 눈금 문제가 생기는지는 데이터 준비도를 자가 응답으로 물은 조사에서도 같은 모양으로 나타난 적이 있다. 이 연구가 특별한 것은 자가 응답을 묻는 대신, 이미 제출된 문서에 같은 기준을 일괄로 댔다는 점이다.
일곱과 넷 사이에 검증이 있다
1단계 라벨 여섯 개 중 하나가 피해다. 과거에 실제로 일어난, 특정된 AI 유발 사고를 적은 문단에 붙는다. 자동 분류는 보고서 9,821건 가운데 일곱 건에서 이 라벨을 걸었다. 문단 수로는 아홉 개이고, 2020년부터 2026년까지 전체 기간을 통틀어서다. 이 수가 이 연구에서 가장 많이 인용될 수치이고, 동시에 가장 조심해서 옮겨야 할 수치다.
조심해야 하는 이유도 저자가 같은 논문에 적었다. 검증 단계에서 피해 라벨의 성적표가 어떻게 나왔는지를 표에 그대로 실었기 때문이다.
검증 세트에는 참인 피해 사례가 하나도 없다. 피해로 태그된 40개 문단은 전부 오탐이었다. 원문: "The validation set contains no true harm instance: all 40 harm-tagged passages were false positives." — Table 2 캡션
사람이 라벨을 붙인 문단 474개 가운데 피해에 해당하는 것은 0개였는데, 분류기는 그중 40개에 피해 라벨을 걸었다. 정밀도 0.00이다. 그래서 저자는 코퍼스 전체에서 걸린 아홉 개 문단을 전부 손으로 다시 읽었고, 그 결과 네 개 보고서에 실린 다섯 개 문단이 실제로 일어난 AI 유발 사고를 서술한다고 판정했다. 일곱과 넷 사이에 있는 것은 과장이 걷힌 흔적이 아니라 검증이 작동한 기록이다. 검사하겠다는데 볼 기록이 없다는 문제는 금융 감독기구의 AI 감사 추적을 다룬 글에서 한 번 다뤘는데, 이번 경우는 결이 다르다. 기록은 있었고, 그 기록에 붙은 라벨이 틀렸고, 사람이 다시 셌다.
4.1피해 라벨은 다른 라벨과 무너지는 방식이 다르다
여기서 성급하게 내릴 수 있는 결론이 하나 있다. 분류기 전반을 믿기 어렵다는 것이다. 저자의 서술은 그 결론을 막는다. 재현율은 점수가 매겨진 라벨 전부에서 0.91에서 0.97 사이로 일관되게 높다. 피해 라벨은 맞출 정답이 0개라 재현율이 아예 매겨지지 않았다. 정밀도가 낮은 라벨들에 대해서는 저자가 원인을 따로 적었다.
일치도가 낮은 다중라벨 범주, 특히 위험 라벨을 수작업으로 들여다본 결과, 그 간극의 상당 부분은 LLM 라벨의 완전성이 더 높다는 점을 반영한다. 분류기는 주석자가 처음 붙인 것보다 문단당 더 많은, 그리고 자주 타당한 라벨을 붙이는 경향이 있다. 원문: "much of the gap reflects higher LLM label completeness: the classifier tends to assign more, and frequently valid, labels per passage than the annotator initially did." — §3.4
피해 라벨만 이 설명이 닿지 않는다. 주석자가 라벨을 덜 붙여서 생긴 간극이 여기엔 없다. 붙일 정답 자체가 0개인데 분류기가 40개를 붙였다. 같은 표 안에서 두 가지 다른 종류의 실패가 섞여 있고, 평균 지표 하나로 보면 그 차이가 보이지 않는다.
이건 이 분류기에 국한된 문제가 아니다. 희귀 사건을 재는 지표의 성질이 그렇다. 정밀도와 재현율이 유병률에 따라 어떻게 달라지는지를 다룬 연구는 같은 분류기와 같은 정확도에서도 균형 잡힌 데이터에서는 정밀도 0.60이 나오고 불균형 데이터에서는 0.33으로 떨어지는 사례를 보였다. 이 코퍼스에서 피해의 유병률은 9,821건 중 일곱 건, 0.07% 수준이다. 이 희소성에서 정밀도 0.00은 모델의 무능을 가리키지 않는다. 그 지표가 희귀 사건 앞에서 작동하는 방식이다. LLM을 주석 작업에 쓴 27개 과제를 복제한 연구가 "LLM으로 자동 주석을 하는 연구자는 언제나 검증해야 한다"고 적은 이유도 같다.
4.2이 글이 가장 세게 기대는 수는 외부에서 다시 셀 수 없다
이 연구는 공개 수준이 높다. 코드는 Apache-2.0, 결과 데이터는 CC BY 4.0으로 열려 있고, 보고서 단위 집계 규칙까지 본문에 적혀 있다. 보고서 하나에는 그 보고서가 가진 문단 중 가장 많은 등급을 주고, 동점이면 높은 쪽으로 올린다는 규칙이다. 이 규칙을 공개 데이터에 그대로 적용하면 2025년의 67건·505건·71건이 숫자 하나 어긋나지 않고 나온다. 코퍼스 규모, 연도별 추세, 시장 구분, 업종별 전년 대비 변화, 구체성 분포, 공급사 집계까지 외부에서 다시 셀 수 있다.
그런데 다시 셀 수 없는 자리에 놓인 수가 하나 따로 있다. 공개된 것은 검증 세트 474행의 사람 라벨이고, 이 라벨 분포는 논문 Table 2의 지지 수 열과 정확히 맞는다. 공개되지 않은 것은 분류기가 그 474개 문단에 무슨 라벨을 매겼는지의 기록이다. 저장소와 배포 자산을 뒤져도 예측 로그는 없다. 그래서 정밀도 0.00과 오탐 40은 논문 서술로만 존재한다. 분모는 100% 검증되는데 분자는 외부 재계산이 불가능하다.
저자는 여기에 유보를 하나 더 얹었다. 참조 라벨은 주석자 한 명이 만들었고, 사람 라벨과 분류기 출력이 어긋난 자리는 전부 다시 읽어 옳다고 판단한 쪽으로 정리했다. 독립된 두 번째 주석자가 없으므로 사람끼리의 일치도 기준선도 없다. 저자가 쓴 표현은 "명백한 정답이라기보다 큐레이션된 벤치마크"다.
이건 저자를 치는 사실이 아니다. 재현 가능하다는 것과 전부 다시 셀 수 있다는 것이 다른 층위라는 이야기다. 그리고 이 글의 논지는 이 논문 자신에게도 그대로 적용된다. 기록으로 남지 않은 것은 검증되지 않는다. 검증 과정에서 남은 중간 산출물을 함께 열어 두는 일이 왜 품질 문제인지가 여기서 드러난다.
4.3'AI 피해'는 한 가지 모양이 아니다
자동 라벨이 걸린 아홉 개 문단은 공개 데이터에 원문 그대로 남아 있다. 저자의 판정 노트가 공개되지 않아 이 아홉 개 중 어느 조합이 네 건으로 남았는지는 외부에서 단정할 수 없다. 다만 금액까지 적힌 구체적 사고 서술이 실제로 어떤 모양인지는 직접 읽을 수 있고, 그 둘이 서로 꽤 다르다.
| 회사(2025년 보고서) | 적힌 사건 | AI가 놓인 자리 |
|---|---|---|
| GEAR4MUSIC | 외주로 쓰던 AI 기반 마케팅 시스템에 문제가 생겨 회계연도 상반기에 차질이 났고, 비용 배분이 어긋나 마케팅비가 과다 지출됐다 | 회사가 쓰던 도구가 오작동했다 |
| TRIFAST | 딥페이크로 임원을 사칭한 메신저 사기 두 건이 내부통제 사고로 보고됐다. 손실은 40만 파운드 충당금과 20만 파운드 회수 불능 추정이다 | 외부 공격자가 AI를 무기로 써서 이 회사를 속였다. 회사는 피해자다 |
공개 데이터(CC BY 4.0)에 실린 2025년 피해 태그 문단에서 옮겼다. 두 회사가 자기 공개 보고서에 직접 적은 내용이고, 여기서는 구체적 사고 서술의 실물로만 인용한다. 저자가 수작업 재검토로 남긴 네 건이 정확히 어떤 조합인지는 판정 노트가 공개되지 않아 확인되지 않는다.
둘을 같은 칸에 적을 수 있는가. 사고 서식을 설계해 본 사람이라면 이 질문이 얼마나 일찍 갈라지는지 안다. 한쪽은 우리가 선택한 도구의 실패이고, 다른 쪽은 우리를 겨냥한 공격의 수단이다. 책임 주체도, 재발 방지 조치도, 보험 처리도 전부 다른 길로 간다. 신고 대상의 정의가 어디서부터 사고를 세기 시작하는지의 문제는 모델 평가 과정에서 생긴 일을 사고로 볼 것인가를 다룬 글에서 다른 사례로 한 번 짚었다.
덜 적는 쪽은 있다, 그 격차에는 조건이 붙는다
전체 평균 뒤에 가려진 편차가 꽤 크다. 2025년 기준으로 주시장에 상장한 회사의 보고서는 57.8%가 AI를 위험으로 적었고, AIM 상장사의 보고서는 6.4%가 적었다. 51.4%p 차이이고 배수로 아홉 배다. FTSE 100만 떼면 68.6%로 열 배가 넘는다. 저자도 결론에서 이 격차를 따로 언급한다.
그런데 이 비교에는 조건이 넷 붙는다. 넷을 같이 읽어야 이 격차가 제 크기로 보인다.
- 2025년 보고서 1,561건 중 687건이 이 비교에서 빠졌다. 시장 구분이 지정되지 않은 676건과 Aquis 11건이다. 비교에 들어간 것은 주시장 703건과 AIM 171건이다.
- 미지정분 대부분을 주시장 쪽으로 돌린 보정 매핑으로 다시 계산하면 주시장은 1,287건에 46.9%가 된다. 격차의 방향은 남지만 폭은 줄어든다.
- 논문이 밝힌 데이터 출처의 커버리지는 FTSE 350이 약 95%, AIM은 약 28%다. 두 모집단을 같은 밀도로 훑은 자료가 아니다.
- 검증 세트는 2023~2024년에 발행된 대형 주시장 보고서에서 뽑혔다. 저자가 직접 적었듯 이 세트는 AIM 보고서에 대한 분류 성능을 독립적으로 검증하지 못한다.
조건을 다 달아도 방향은 남는다. 다만 그 방향이 "AIM 상장사는 적을 의무가 없다"는 뜻은 아니다. 저자가 각주에서 법적 위치를 정리했다. 영국 법인인 AIM 기업도 회사법 414C조에 따라 전략보고서에 주요 위험과 불확실성을 서술해야 한다. 적용되지 않는 것은 상장 규정과 공시지침, 그리고 기업지배구조 코드다. AIM 자체 규칙인 26조는 어느 거버넌스 코드를 따르는지를 웹사이트에 밝히라고 요구할 뿐 연차보고서 기재를 정하지 않는다.
5.1업종 둘이 나란히 낮은데, 낮은 이유가 같지 않다
국가기간산업 열두 업종으로 나눠 보면 에너지가 20.0%, 데이터 인프라가 10.0%로 가장 낮다. 두 업종이 표의 아래쪽에 나란히 있어서 같은 이야기로 묶이기 쉬운데, 저자는 그걸 막는 문장을 바로 뒤에 붙였다.
다만 둘은 다르다. 에너지는 모든 신호에서 낮은 반면, 데이터 인프라는 도입을 중간 수준인 55%로 보고한다. 원문: "The two differ, however. Energy is low on every signal … whereas Data Infrastructure reports adoption at a mid-table 55% …" — §4.5
두 업종의 다른 신호를 같이 놓으면 그 말이 숫자로 잡힌다. 에너지는 AI를 언급한 보고서가 30.7%이고 도입을 적은 보고서가 21%다. 데이터 인프라는 AI 언급이 60.0%, 도입 언급이 55%다.
| 업종 | 2025년 보고서 | AI 언급 | 도입 언급 | 위험 언급 |
|---|---|---|---|---|
| 에너지 | 140 | 30.7% | 21% | 20.0% |
| 데이터 인프라 | 20 | 60.0% | 55% | 10.0% |
논문 Table 6과 §4.5에서 이 절에 필요한 두 줄만 옮겼다. 비교 기준으로 적어 두면, 가장 보고서가 많은 업종인 금융은 657건에 AI 언급 74.7%·위험 언급 47.0%다.
데이터 인프라의 10.0%에는 유보가 셋 따라붙고, 셋을 빼고 인용하면 안 된다. 첫째, 2025년 보고서 20건 위의 값이고 저자가 "20건으로는 추정이 부정확하다"고 적었다. 둘째, 30건 미만 업종은 "참고용으로만" 읽으라는 단서가 붙어 있다. 원자력 3건, 수도 17건, 방위 22건, 정부 23건, 화학 24건, 통신 29건이 모두 그 아래다. 통신의 전년 대비 26.7%p 상승도 29건 위의 값이다. 셋째, 검증에 쓴 15개 회사 가운데 데이터 인프라 기업은 한 곳도 없다. 저자가 이 사실도 직접 적었다.
유보를 셋 다 달고도 남는 사실이 하나 있다. 도입을 55% 적는 업종이 위험은 10% 적는다. 적게 써서 적게 적는 것이 아니라, 쓰는 항목과 적는 항목이 어긋나 있다. 숫자의 정밀도는 믿을 수 없어도 이 어긋남 자체는 20건 안에서도 보인다.
5.2논문이 적은 제도 조건은 그 뒤 바뀌었다
AIM에 관한 각주 하나는 시점을 확인하고 읽어야 한다. 런던증권거래소는 2026년 8월 5일부터 AIM 규칙 26조의 지배구조 조항을 교체했다. 구판은 어느 코드를 적용하는지와 어떻게 준수하는지, 벗어난 대목은 왜 벗어났는지를 밝히라는 준수·설명 방식이었다. 신판은 그 코드에 대해 준수하거나 설명할 것을 요구하지도 기대하지도 않는다고 명시하고, 대신 다섯 항목을 반드시 공시하게 한다. 이사회 구성, 각 이사의 역할, 보수와 성과, 위험·통제 체계, 투자자 관계다. 각 이사의 역할 항목에는 위험의 실효적 관리가 포함된다.
논문이 틀렸다는 뜻이 아니다. 각주가 기준한 것은 구판이고, 이 연구가 다루는 2020년부터 2026년까지의 데이터 기간 대부분에 적용된 것도 구판이다. 짚을 것은 시점이다. 논문이 재고 있는 격차의 제도적 조건이 논문 공개 두 달 전에 움직였고, 바뀐 방향이 하필 위험과 통제를 공시 항목으로 세우는 쪽이다. 다만 AIM 26조는 웹사이트 공시를 정하는 규칙이라 연차보고서 기재와 같은 칸이 아니다. 다음 해 데이터가 어느 쪽으로 움직이는지는 같은 파이프라인을 한 번 더 돌리면 확인된다.
규칙은 모호함을 허용하고, 사고를 받는 칸은 없다
78.5%의 가운데 지대를 "기업이 성의 없이 적은 결과"로 읽기 전에, 그 문장들이 어떤 규칙 아래에서 쓰였는지부터 봐야 한다.
6.1규칙이 요구하는 것은 '서술하라'까지다
영국 상장사의 전략보고서에 AI 위험을 적는 행위에는 네 가지 조건이 동시에 걸려 있다. 넷을 겹쳐 놓으면 가운데 지대가 어디에서 나오는지가 보인다.
| 조건 | 내용 | 근거 |
|---|---|---|
| 법이 요구하는 것 | 회사가 직면한 주요 위험과 불확실성을 서술할 것 | 회사법 2006 414C조 2항 b호 |
| 구체성 요구 | 기업 고유의 서술을 하라는 권고는 있으나, 그 지침이 스스로 구속력 없는 모범 실무라고 밝힌다 | 재무보고위원회 전략보고서 지침 |
| 감사 범위 | 감사인의 의견은 재무제표에 한정되며 전략보고서에 대해서는 어떤 보증도 제공하지 않는다 | 같은 지침 |
| 책임 범위 | 제3자에 대한 책임이 차단되고, 회사에 대해서도 고의 또는 부정직을 요건으로 한다 | 회사법 2006 463조 |
앞의 셋은 법령 원문과 재무보고위원회 지침 원문에서, 마지막 하나는 조문 요지로 확인했다. 기업지배구조 코드의 내부통제 실효성 선언 조항은 2026년 1월 1일 이후 개시하는 사업연도부터 코드를 적용하는 상장 범주의 회사에 적용되며, AIM은 대상이 아니다.
네 조건을 이어 읽으면 한 문장이 나온다. 논문이 "41.2%가 AI를 위험으로 적었지만 그중 10% 안팎만 구체적"이라고 말할 때, 그 나머지는 규칙을 어긴 자리에 있지 않다. 규칙이 요구하지 않는 영역에 있다. 구체적으로 적을수록 그 문장은 검증 가능해지고 다툼의 재료가 되는데, 감사도 받지 않고 책임도 고의·부정직을 요건으로 하는 문서에서 그 선택을 할 유인이 약하다.
법리 쪽에서도 양방향의 힘이 걸린다. 미국 판례에서 발달한 과장 광고 항변은 객관적으로 검증할 수 없는 낙관적 서술을 중요성 단계에서 보호한다. 반대로 미국 증권소송개혁법의 안전항은 "의미 있는 주의 문구"를 요구해서, 면책을 받으려면 오히려 구체적으로 적어야 한다. 모호함을 보호하는 장치와 구체성을 요구하는 장치가 서로 다른 단계에 놓여 있는 셈이다. 가운데 지대가 그 사이의 좁은 길일 수 있다는 설명이 가능하다.
여기까지는 기제의 제시이지 인과의 확인이 아니다. AI 위험 공시의 구체성과 소송 위험 사이의 관계를 직접 검정한 실증 연구는 찾지 못했다. 소송 위험이 바뀌면 위험요인 공시의 길이와 표현이 바뀐다는 실증은 미국의 일반 위험요인 공시를 대상으로 한 것이고, AI를 분리해 본 것이 아니다. "영국 기업이 법적 이유로 모호하게 썼다"는 문장을 지금 쓸 근거는 없다.
6.2저자는 네 가지 해석을 나란히 올렸다
저자도 같은 자리에서 멈춘다. 분량과 질의 간격을 "이 연구에서 가장 정책적으로 중요한 관찰"이라고 쓰면서, 그 원인으로 네 가지를 서로 배타적이지 않은 설명으로 나란히 올렸다. 하나를 고르지 않았다는 것 자체가 이 논문의 태도다.
- 매체의 한계 — 연차보고서라는 문서 자체가 신생 위험에 대해 조심스럽고 포괄적인 표현을 구조적으로 선호할 수 있다. 그렇다면 낮은 구체성은 관리 실패의 증거라기보다 매체의 천장이다.
- 미성숙한 관리 체계 — AI 위험 관리 체계가 대부분의 회사에서 새것이다. 위험을 인지해도 구체적으로 적을 절차나 전문성, 내부 데이터가 없을 수 있다.
- 신호용 공시 — 규제기관과 투자자에게 인지하고 있음을 알리려고 적는 것일 수 있다. 일반·모호 유형이 가장 흔하고 2020년 이후 절대 증가폭도 가장 크다는 결과와 맞물린다.
- 합리적 모호함 — AI 위험과 완화책을 구체적으로 적는 일이 법적 노출이나 투자자의 부정적 반응을 부를 수 있다. 회사가 합리적으로 모호함을 선택할 수 있다.
넷 중 어느 쪽이냐에 따라 할 일이 갈린다. 매체의 한계라면 다른 도구가 필요하고, 체계가 미성숙한 것이라면 시간이 지나며 나아질 것이고, 전략적 모호함이라면 구체성을 강제하는 개입이 필요하다. 저자가 결론에서 가른 갈래도 이 셋이다. 어느 쪽인지는 이 연구가 묻기만 하고 아직 답하지 못하는 질문이라고 저자가 같은 자리에 적었다.
6.3영국에는 AI 사고를 받는 창구가 없다
저자가 연차보고서 대신 가 볼 곳으로 든 것은 셋이다. 규제 집행 기록, 사고 데이터베이스, 소송 기록. 2026년 10월 현재 영국에서 이 셋이 어떤 상태인지를 확인해 보면, 첫 번째 경로의 모양이 분명해진다.
| 창구 | 무엇을 받나 | 시점 |
|---|---|---|
| 정보위원회(ICO) | 개인정보 침해. 인지 후 72시간 안에 신고 | 현행 |
| 금융행위감독청(FCA) | 운영 사고 전반. AI 전용이 아니다 | 2027년 3월 발효 |
| 영란은행 | 금융시장 인프라의 운영 사고 | 2027년 3월 발효 |
| 의약품규제청(MHRA) | AI를 포함한 의료기기의 유해 사례 | 현행 |
| 사이버보안·회복력 법안 | 사이버 사고 | 입법 중 |
각 기관의 공개 문서에서 확인했다. 이 표에 AI 사고를 받는 줄이 없다는 것이 이 절의 요지다.
개인정보가 샜으면 정보위원회로, 금융기관의 시스템이 멈추면 금융행위감독청으로, 의료기기가 오작동하면 의약품규제청으로 간다. AI가 잘못해서 사람이 손해를 봤다는 사실 그 자체를 받아 주는 곳은 없다. 장기회복력센터가 2024년 의회에 낸 서면증거에서 과학혁신기술부에 AI 시스템 관련 사고의 중앙집중적이고 최신인 그림이 없다며 중앙 사고보고 체계 신설을 권고했는데, 2026년 현재 그 권고는 이행되지 않았다.
규제기관 쪽에서 나온 자기 진단 하나가 이 공백의 성격을 잘 보여 준다. 의약품규제청은 2026년 AI Airlock 2단계 보고서에서 현행 사후 감시 제도가 성능 변화를 이산적이고 탐지 가능한 사건으로 전제한다고 적었다. 그런데 AI의 성능 저하와 자동화 편향은 피해가 난 뒤에야 탐지된다. 서식이 가정하는 사고의 모양과 실제 사고의 모양이 어긋나 있다는 지적이다.
저자가 든 두 번째 경로인 사고 데이터베이스도 신고 창구는 아니다. AI Incident Database는 자발적 제보와 보도 수집으로 쌓인 큐레이션된 기록소이고, 사건 번호로 보면 2026년 10월 현재 1,700건 안팎이다. OECD의 AI Incidents Monitor는 아직 베타이고 뉴스 기반 자동 수집 방식이라 제출 기능 자체가 없다. 두 기록소의 누계는 수집 단위와 기준이 서로 달라서 나란히 놓고 비교할 수 있는 수가 아니다. 공통점은 하나다. 둘 다 의무로 들어오는 자료가 아니다. 사고 기록이 실제로 증거가 되는 경로를 다룬 유엔 브리핑 관련 글과, 고용 신고서가 "AI 탓인가"를 묻기 시작한 미국 주 단위 사례가 같은 공백의 다른 면이다.
6.4EU는 보고 의무 앞에 증거를 먼저 깔았다
대비축으로 EU AI법을 놓으면 차이가 분명해진다. EU가 만든 것은 신고 의무 하나가 아니라 신고할 수 있게 만드는 증거의 사슬이다. 네 개 조문이 순서대로 이어진다.
- 12조 — 고위험 AI 시스템은 수명 주기 전체에 걸쳐 사건 기록을 자동으로 남길 수 있어야 한다.
- 19조 — 그 기록을 용도에 맞는 기간, 최소 6개월 동안 보관해야 한다.
- 72조 — 제공자는 관련 데이터를 능동적이고 체계적으로 수집하고 문서화하고 분석해야 한다.
- 73조 — 중대 사고가 확인되면 당국에 보고한다. 사망은 10일, 광범위한 침해는 2일, 그 밖에는 인과를 확정한 뒤 15일이다.
영국에는 앞의 세 단계가 없다. 그래서 연차보고서에 사고가 네 건밖에 안 적혔다는 사실이 기업의 태도 문제로 읽히지 않는다. 기록이 생기게 하고, 남게 하고, 모아 읽게 한 다음에야 보고가 가능해지는데, 그 앞 단계가 제도로 깔려 있지 않다. 조문은 있는데 그것을 집행할 권한과 자원이 따로 노는 구조는 중견국 AI 규제의 집행 격차를 다룬 글에서 다른 나라 사례로 정리한 적이 있다. 여기서는 집행 이전에 기록이 없다는 쪽이 문제다.
6.5미국 연구는 같은 방향을 가리키지만 재는 잣대가 다르다
미국에도 가장 비슷한 연구가 하나 있다. 3만 건이 넘는 10-K 보고서를 훑어, 2020년에 위험요인 항목에서 AI를 언급한 제출 기업이 4%였고 2024년에는 43%가 됐다고 보고했다. 영국 논문도 이 연구를 "가장 비교 가능한 연구"로 부르고, 두 결과가 방향에서 일치한다고 적는다. 그런데 거기까지다.
| 축 | 영국 연구 | 미국 연구 |
|---|---|---|
| 분모 | 그해 제출된 전체 보고서 | 그해 제출한 전체 기업 |
| 재는 대상 | LLM이 'AI가 위험으로 서술됐는가'를 판정 | 25개 용어의 키워드가 해당 항목에 나왔는가 |
| 최신 연도 | 2025년(41.2%) | 2024년(43%) |
| 구체성 지표 | 세 등급으로 채점한 수치가 있다 | 없다 |
두 논문의 방법 절을 맞대어 정리했다. 분모와 단위는 사실상 겹치지만, 재는 대상과 연도가 어긋난다.
43%와 41.2%를 나란히 놓고 "두 나라가 비슷하다"고 쓰면 두 숫자가 같은 것을 센 것처럼 보이지만, 하나는 키워드의 출현을 세고 다른 하나는 서술의 성격을 판정한다. 구체성 축으로 가면 비교할 자리 자체가 없다. 미국 연구는 한계 절에서 AI 위험 공시의 상투어 비중을 정량화하는 체계적 방법을 쓰지 않았다고 직접 밝혔다. 영국의 10.4%와 78.5%에 맞댈 미국 숫자는 존재하지 않는다.
이 대목을 이 글의 약점으로 읽을 필요는 없다. 1절이 한 번 더 실증되는 자리다. 같은 현상을 두 팀이 보았는데 재는 방식이 달라서 두 숫자가 맞붙지 않는다. 수치를 인용하기 전에 세는 규칙부터 확인해야 하는 이유가 여기 있다.
6.6한국 사업보고서에는 대응하는 칸이 아예 없다
같은 연구를 한국에서 하려면 분모를 어디서 잡을지부터 정해야 한다. 한국 사업보고서에는 영국 전략보고서의 '주요 위험과 불확실성'에 하나씩 대응하는 독립 항목이 없기 때문이다. 「위험요소」라는 이름의 독립 섹션은 증권신고서에 있고 사업보고서의 법정 목차에는 없다. AI 위험은 「사업의 내용」 안의 위험관리 서술이나 「이사의 경영진단 및 분석의견」에 흩어져 들어간다. 확인된 범위에서는 기업공시서식 작성기준이 AI 위험을 별도 항목으로 지정하지도 않았다.
사고를 받는 창구의 모양도 영국과 같다. 2026년 1월 시행된 AI 기본법은 일정 규모 이상의 사업자에게 위험관리 체계를 갖추고 그 이행 결과를 정기적으로 제출하라고 요구하지만, 개별 사고가 났을 때 당국에 신고하라는 구조가 아니다. 개인정보 보호법 34조에 따른 72시간 통지·신고가 실효적으로 작동하는 거의 유일한 경로다. 결국 한국에서도 AI 사고가 제도적으로 기록되는 길은 그 사고가 개인정보 유출을 동반했을 때 열린다. 데이터 사고의 책임이 이사회로 올라간 과정은 개인정보 보호법 개정을 다룬 글에 정리했다.
페블러스 관심의 이유
진단을 기록으로 남긴 연구다
페블러스의 일은 데이터가 학습에 들어가기 전에 그 상태를 묻는 것이다. DataClinic은 들어온 데이터셋을 진단하고, AI-Ready Data는 학습 전 정리를 다룬다. 이 연구가 드문 이유는 진단 자체를 기록으로 남겼다는 데 있다. 보고서 9,821건을 분류하고, 474개 문단으로 성능을 재고, 가장 중요한 라벨의 정밀도가 0.00으로 나오자 그 숫자를 표에 적은 다음 코퍼스 전체에서 걸린 문단을 손으로 다시 훑었다. 자동 분류 파이프라인을 운영해 본 사람은 이 순서를 안다. 재고, 어디가 무너지는지 보고, 무너진 자리만 사람이 다시 본다.
4절에서 본 대비가 여기서 실무 교훈이 된다. 정밀도가 낮은 라벨 대부분은 주석자가 라벨을 덜 붙여서 낮았고, 피해 라벨만 달랐다. 맞출 정답이 0개였다. 희귀 라벨은 다른 방식으로 무너지는데, 평균 지표 하나만 보면 그 차이가 지워진다. 라벨별 성능을 따로 들여다볼 이유, 그리고 희소 라벨에 대해서는 사람의 재검토를 절차로 삼을 이유가 여기 있다.
채워진 필드와 행동을 지시하는 필드는 다른 질문이다
데이터 품질 논의는 보통 결측과 중복과 범위를 다룬다. 이 연구가 드러내는 결함은 결이 다르다. 위험 공시의 78.5%는 스키마로는 전부 통과하는 문장이다. AI라는 말이 있고, 위험이라는 말이 있고, 둘이 같은 문장에서 인과로 이어져 있다. 비어 있지 않고, 형식도 맞고, 주제도 맞다. 그런데 무엇을 어떻게 한다는 내용이 없다.
저자가 그은 선은 분명하다. AI 규제가 컴플라이언스 의무에 영향을 줄 수 있다는 문장은 중간이고, 적합성 확보에 얼마를 배정해 어떤 시스템을 언제까지 맞춘다는 문장은 구체적이다. 필드가 채워졌는가와 그 필드가 행동을 지시하는가는 다른 질문이고, 품질 지표를 설계할 때 뒤쪽이 앞쪽만큼 중요해지는 자리가 여기다.
오늘 해 볼 수 있는 일이 둘 있다
하나는 자기 조직의 문서를 같은 잣대로 재 보는 것이다. 사업보고서든 내부 위험 등록부든 AI가 등장하는 문단을 꺼내, 저자의 세 등급에 대 보면 된다. 복붙인가, 어디가 위험한지까지 적었는가, 무엇을 어떻게 하는지까지 적었는가. 논문이 프로덕션 프롬프트 전문을 부록에 실었고 코드와 데이터를 공개했으니 그 기준을 그대로 빌릴 수 있다.
다른 하나는 질문이다. 우리가 AI로 겪은 실패는 지금 어느 서식의 어느 칸에 적히는가. 연차보고서가 아니라면 어디인가. 6절에서 본 대로 영국에도 한국에도 그 칸은 따로 없고, 개인정보가 샜을 때만 창구가 열린다. 반면 EU는 보고 의무 앞에 기록을 남기고 보관하고 모아 읽는 단계를 먼저 깔았다. 기록이 먼저고 보고가 나중이라는 순서는 데이터 파이프라인을 설계해 본 사람에게 낯설지 않다.
칸을 만들기로 했다면 4절의 두 사례가 바로 설계 질문이 된다. 회사가 쓰던 AI 도구가 오작동한 사건과 외부 공격자가 AI를 무기로 써서 회사를 친 사건을 같은 칸에 적을 수 있는가. 사고 분류 체계를 만들 때 가장 먼저 갈리는 지점이고, 여기서 갈라 두지 않으면 나중에 집계한 숫자가 무엇을 센 것인지 아무도 말할 수 없게 된다.
금지 목록 이전에 기록 목록이 있다
지금까지 AI 관리 논의는 무엇을 금지할 것인가에 많이 머물렀다. 이 연구가 보여 주는 것은 그 앞 단계다. 무엇이 기록으로 남는가. 기록이 없으면 규제도 보험도 재발 방지도 설 자리가 없고, 기록이 있어도 그것이 어디가 위험한지까지만 적혀 있으면 읽어서 할 수 있는 일이 없다.
페블러스가 할 수 있는 일은 이 구분을 데이터 쪽에서 먼저 한국어로 언어화하는 것이다. 채워진 필드와 행동을 지시하는 필드는 다르다는 것, 그 차이를 재는 잣대가 이미 공개돼 있다는 것, 그리고 희귀한 사건일수록 평균 지표가 거짓말을 한다는 것. 세 문장 다 데이터 품질 규격으로 옮겨 적을 수 있는 내용이다.
본문의 축자 인용은 arXiv 프리프린트 전문과 공개 저장소의 데이터, 영국 법령 원문, 재무보고위원회 지침 원문, EU AI법 조문에서 직접 대조했다. EU 조문은 관보 원문을 열지 못해 재수록본으로 확인했기에 적용일과 개정 번호는 본문에 쓰지 않았고, 조문의 내용과 기한만 적었다. 저자가 수작업으로 남긴 네 건이 정확히 어떤 보고서인지, 분류기가 검증 세트 474개 문단에 무슨 라벨을 붙였는지는 공개돼 있지 않아 그 공백을 다른 수치로 메우지 않았다. 1절부터 5절까지는 연구와 1차 문서가 보고한 것이고, 6절 뒤쪽과 이 절은 그 문서들이 하지 않은 이야기이니 나눠서 읽어 주시기 바란다. 긴 글 읽어 주셔서 감사하다.
참고문헌
이 글의 대상
- 1.The AI Risk Observatory: What Can We Learn from AI Disclosures in Annual Reports About Societal Resilience?. arXiv:2610.02281v1 [cs.AI], 2026-10-01. ⚠️ 프리프린트 v1이며 동료심사 전이다. 저자 표기는 독립 연구자이고, 사사에 영국 AI보안연구소(AISI) 사회적 회복력 팀의 재정 후원과 방향 자문이 적혀 있다. 본문의 축자 인용은 전부 이 전문에서 대조했다.
- 2.AI-Risk-Observatory — 코드·데이터 저장소(릴리스 dataset-v1.1). 코드 Apache-2.0, 데이터 CC BY 4.0. 2절·3절·4절·5절의 표 수치를 이 데이터로 다시 세어 확인했다. 분류기의 예측 라벨 로그는 포함돼 있지 않다.
영국 제도 — 법령·지침 원문
- 3.Companies Act 2006, s.414C — 전략보고서에 주요 위험과 불확실성을 서술할 의무. AIM 상장 영국 법인에도 적용된다.
- 4.Companies Act 2006, s.463 · Financial Services and Markets Act 2000, s.90A — 전략보고서 서술에 대한 책임 제한. 조문 요지로 확인했다.
- 5.Financial Reporting Council, Guidance on the Strategic Report(2026년 2월판) — 기업 고유의 서술을 권고하되 스스로 구속력 없는 모범 실무 지침이라고 밝힌 §1.5·§1.17, 감사 범위가 재무제표에 한정된다는 §2.13, 적용 범위 표 §9.1.
- 6.Financial Reporting Council, UK Corporate Governance Code 2024, Provision 29 — 2026년 1월 1일 이후 개시 사업연도부터 코드를 적용하는 상장 범주에 적용되며 AIM은 대상이 아니다.
- 7.London Stock Exchange, AIM Rules for Companies Rule 26 — 2026년 1월판(논문 각주가 기준한 구판)과 2026년 8월 5일 발효 신판을 둘 다 확인했다. 신판은 준수·설명 방식을 폐지하고 위험·통제 체계를 포함한 다섯 항목의 공시를 요구한다.
사고 기록 경로
- 8.Regulation (EU) 2024/1689(EU AI Act), Articles 12 · 19 · 72 · 73 — 로그 자동 생성, 최소 6개월 보관, 능동적·체계적 수집과 분석, 중대 사고 보고 기한. ⚠️ 관보 원문 접근에 실패해 재수록본으로 확인했으므로 적용일과 개정 규정 번호는 본문에 쓰지 않았다.
- 9.Centre for Long-Term Resilience, 영국 의회 제출 서면증거 — 과학혁신기술부에 AI 사고의 중앙집중적 그림이 없다는 지적과 중앙 사고보고 체계 신설 권고.
- 10.MHRA, AI Airlock Phase 2 Programme Report(2026) — 현행 사후 감시 제도가 AI의 성능 변화를 탐지하지 못하는 구조라는 규제기관 자기 진단. FCA PS26/2(2026-03-18 공표, 2027-03-18 발효) — 운영 사고 보고, AI 전용이 아니다.
- 11.AI Incident Database(Responsible AI Collaborative) · OECD AI Incidents Monitor(베타) — 둘 다 신고 창구가 아니다. 누계는 수집 단위가 달라 나란히 비교하지 않았다.
- 12.개인정보 보호법 제34조(및 시행령 39·40조) · 인공지능 발전과 신뢰 기반 조성 등에 관한 기본법(2026-01-22 시행) — 한국의 두 경로. 기본법 조문 전문을 확보하지 못해 축자 인용 없이 구조만 적었다.
대조군·선행 연구
- 13.Uberti-Bona Marin, L. G., Rijsbosch, B., Spanakis, G., Kollnig, K. (2026). Are Companies Taking AI Risks Seriously? A Systematic Analysis of Companies' AI Risk Disclosures in SEC 10-K forms. arXiv:2508.19313 / ECML PKDD 2025 Workshops, pp. 86–106, Springer. DOI 10.1007/978-3-032-19096-3_6 — 6.5절의 미국 대조군.
- 14.Chiu, I. H.-Y. (2025). Using generative artificial intelligence in corporate narrative reporting. Cambridge Forum on AI: Law and Governance 1:e43. DOI 10.1017/cfl.2025.10038 — 생성형 AI가 공시문을 쓰는 문제. 비율을 측정한 연구가 아니다.
- 15.Dyer, T., Lang, M., Stice-Lawrence, L. (2017). The evolution of 10-K textual disclosure. Journal of Accounting and Economics 64(2–3): 221–245 — AI 이전의 기준선. ⚠️ 전문을 확인하지 못해 방향 서술까지만 썼다. Brown, S. V., Tucker, J. W. (2011). Large-Sample Evidence on Firms' Year-over-Year MD&A Modifications. Journal of Accounting Research 49(2): 309–346 — 서술형 공시가 전년 문서를 복사하는 쪽으로 고착된다는 1차 증거. 본문의 2006년 0.10 대 0.64~0.75는 p.320에서, 주의 문구를 걷어내지 않는다는 Nelson & Pritchard(2007) 인용은 p.314에서 확인했다. difference score는 전년 문서와의 코사인 유사도를 1에서 뺀 값이다.
- 16.Saito, T., Rehmsmeier, M. (2015). PLoS ONE 10(3): e0118432 — 유병률이 낮으면 정밀도가 수학적으로 붕괴한다. Pangakis, N., Wolken, S., Fasching, N. (2023). Automated Annotation with Generative AI Requires Validation. arXiv:2306.00176 — 27개 과제 중 9개가 정밀도 또는 재현율 0.5 미만.
- 17.Donelson, D. C. et al. (2024). The effect of securities litigation risk on firm value and disclosure. Contemporary Accounting Research 41(3): 1785–1818 — 소송 위험이 바뀌면 위험요인 공시의 문체가 바뀐다. ⚠️ 초록만 확인했고, AI 공시를 따로 본 연구가 아니다.
- 18.ONS, Artificial intelligence in UK businesses: 2023 to 2026(2026-07-20, BICS Wave 159) — 영국 기업의 AI 실사용 비율. 모집단이 달라 본문의 공시 비율과 빼거나 나란히 놓지 않았다. 변혁적 영향이 지금까지 상대적으로 제한적이라는 해석도 같은 보고에 있다.
페블러스 블로그 인접 글
- 19.분모를 먼저 읽는 법(1.3절) · 영국 AI보안연구소가 하는 일(1절) · 자가 응답의 눈금 문제(3.2절) · 검사할 기록이 없는 자리(4절) · 무엇부터 사고로 세는가(4.3절) · 사고 기록이 증거가 되는 경로(6.3절) · 신고서가 AI 탓인지 묻기 시작한 자리(6.3절) · 조문은 있고 집행은 없는 구조(6.4절) · 이사회로 올라간 데이터 사고 책임(6.6절) · 평범한 서류를 대량으로 읽는 방법 · 적히지 않는 사용