Executive Summary
국립중앙도서관이 9월 17일 국가문헌으로 만든 AI 학습데이터를 처음으로 일반에 열었다. '공유서재'라는 이름의 누리집에서 회원 가입 없이 검색하고 내려받을 수 있다. 들어간 자료는 1930~40년대 근대잡지와 1940~60년대 정부간행물·교과서, 도서관이 펴낸 자료, AI 학습 이용 허락을 받은 오픈액세스 학술논문이다. 이 글은 그 발표에 붙은 '3,833만 건'이라는 숫자가 무엇을 센 값인지를 본다.
공유서재 첫 화면이 적어 둔 총계는 38,332,587건이다. 그 가운데 38,307,128건이 '글자 데이터셋'이라는 이름을 달고 있고, 전체의 99.9%가 여기서 나온다. 텍스트로 풀린 자료는 3,974책이다. 세 값은 세는 단위가 서로 다른데, 발표 수치는 셋을 그대로 더한 결과다. 같은 플랫폼의 검색 화면은 같은 데이터를 두고 25,459건을 내놓는다.
1절과 2절은 도서관이 밝힌 내용과 공유서재 화면에 적힌 값을 따라간다. 3절부터의 읽기는 이 글이 세운 것이다.
주요 수치
출처: 국립중앙도서관 공유서재 데이터 현황(2026-09-26 확인) · 아주경제 (2026-09-17).
3,974책
텍스트로 풀린 자료
발표 수치에서 책이나 기사 단위로 센 몫이다. 절반이 넘는 2,114건이 오픈액세스 학술논문이고, 교과서와 정부간행물은 합쳐서 49건이다
3,830만
글자 데이터셋 건수
정확히는 38,307,128건이고, 발표 총계의 99.9%가 여기서 나온다. 이용가이드는 이것을 이미지 데이터로 묶어 설명한다
21,485건
표·삽화·사진·광고
표 7,030, 삽화 7,444, 사진 4,680, 광고 2,331을 합한 값이다. 지면의 그림만 모은 묶음이다
300여 책
연말에 이어서 열릴 자료
20세기 초에 값싸게 찍어 팔던 한글 딱지본 소설이고, 분량은 약 3만 면으로 예고됐다
텍스트에서 가장 많은 자료는 학술논문이다
9월 17일 국립중앙도서관이 낸 발표의 요지는 짧다. 소장 자료를 디지털로 옮기면서 만들어 둔 AI 학습데이터를 일반에 처음 내놓는다는 것이다. 국가를 대표하는 도서관이 자기 소장 문헌을 AI가 학습할 수 있는 형태로 묶어 공개한 첫 사례다. '공유서재'는 원래 시민 참여 프로젝트용 누리집이었고, 이번에 AI 학습데이터를 다루도록 화면을 새로 짰다.
들어간 자료는 네 갈래다. 1930~40년대 근대잡지, 1940~60년대 정부간행물과 교과서, 국립중앙도서관이 직접 펴낸 자료, 그리고 AI 학습에 써도 좋다는 허락을 받은 오픈액세스 학술논문이다. 공유서재 화면에서 텍스트를 유형별로 나눠 보면 여기에 단행자료와 연속간행물도 함께 잡힌다. 근대잡지와 연속간행물, 오픈액세스 논문은 책이 아니라 기사 단위로 쪼개져 있다.
유형별로 몇 건씩인지는 검색 화면의 자료유형 필터가 그대로 알려 준다. 발표문이 자료를 소개한 차례와 실제 분량의 차례는 같지 않다.
| 자료유형 | 텍스트 | 이미지 |
|---|---|---|
| OA 학술논문(기사단위) | 2,114 | 0 |
| 근대잡지(기사단위) | 998 | 1,186 |
| 연속간행물(기사단위) | 565 | 291 |
| 단행자료 | 200 | 10,377 |
| 국립중앙도서관 발간자료 | 48 | 6,794 |
| 교과서 | 29 | 1,284 |
| 정부간행물 | 20 | 1,553 |
| 합계 | 3,974 | 21,485 |
출처: 공유서재 통합검색 자료유형 필터별 건수(2026-09-26 확인). 각 열의 합은 화면에 적힌 총계와 일치한다.
텍스트의 절반이 넘는 2,114건이 오픈액세스 학술논문이다. 발표문이 앞자리에 올린 교과서와 정부간행물은 29건과 20건으로, 둘을 합쳐도 49건이다. 이미지에서는 차례가 또 달라진다. 단행자료에서 나온 10,377건과 도서관 발간자료에서 나온 6,794건이 대부분을 차지한다. 같은 공개를 텍스트로 세느냐 이미지로 세느냐에 따라 맨 앞에 오는 자료가 통째로 바뀐다.
받는 형식도 공개돼 있다. 텍스트는 글자가 숨어 있는 PDF와 XML, TXT, JSON으로 준다. 스캔 이미지 위에 인식된 글자를 겹쳐 둔 PDF는 사람이 읽기에 좋고, XML과 JSON은 기계가 바로 먹기에 좋다. 이미지는 표·삽화·사진·광고를 유형별로 잘라 두고 각각에 맥락 정보를 붙였다. 도서관은 인식된 텍스트를 검수해 오류를 고치고 그 결과를 다시 모델에 반영하는 절차를 거쳤다고 밝힌다.
내려받는 문턱은 낮다. 회원 가입 절차가 없고, 개별 자료는 상세 화면에서 형식을 골라 바로 받는다. 다만 데이터셋을 통째로 받는 '전체 다운로드'에서는 기관인지 개인인지와 무엇에 쓸 것인지를 고르게 한다. AI 학습, 서비스 개발, 학술연구, 콘텐츠 제작, 교육 같은 보기가 준비돼 있고, 고르고 나면 압축 파일 하나로 내려온다.
이번 공개는 갑자기 나온 결정이 아니다. 도서관은 2026년 2월에 저작권이 소멸했거나 해결된 자료를 중심으로 AI 학습용 데이터를 만들어 과학기술정보통신부의 '독자 AI 파운데이션 모델 프로젝트'에 넘기고, 공유서재를 열어 같은 데이터를 국민에게도 개방하겠다고 밝힌 바 있다. 9월의 공개는 그해 초에 세운 계획의 뒷부분이 실행된 것이다.
도서관이 다음 걸음도 예고해 뒀다. 올해 안에 한글 딱지본 소설 300여 책의 텍스트를 더 내놓는다. 딱지본은 20세기 초에 표지를 알록달록하게 찍어 값싸게 팔던 대중 소설책이고, 이번에 예고된 분량은 약 3만 면이다. 이현주 디지털정보기획과장은 이번 개방을 두고 "도서관의 방대한 지식자원을 인공지능 시대의 핵심 인프라로 전환하는 중요한 시작점"이라고 말했다.
숫자 하나에 단위가 셋
보도에 붙은 표제 숫자는 3,833만 건이다. 이 값이 어디서 왔는지는 공유서재 첫 화면이 그대로 보여 준다. 화면의 데이터 현황은 텍스트 3,974, 표 7,030, 삽화 7,444, 사진 4,680, 광고 2,331, 글자 데이터셋 38,307,128을 나란히 놓고, 그 아래에 총계 38,332,587을 붙인다. 여섯 값을 더하면 정확히 총계가 된다. 표제 숫자는 이 총계를 만 단위로 줄인 값이다.
덧셈 자체는 틀리지 않았다. 더해진 것들의 단위가 서로 다를 뿐이다. 텍스트 3,974는 책이나 기사를 센 값이다. 표·삽화·사진·광고 21,485는 지면에서 떼어 낸 그림 조각을 센 값이다. 그리고 38,307,128은 글자를 센 값이다. 책과 그림과 글자를 한자리에 놓고 더해서 나온 숫자에는 이름을 붙이기가 어렵다. 그런데 그 숫자가 이번 공개의 크기를 대표하는 값으로 기사 제목에 올랐다.
38,307,128을 38,332,587로 나누면 99.93%다. 발표 수치의 거의 전부가 글자 데이터셋 하나에서 나온다. 텍스트와 이미지를 합쳐도 전체의 0.07%에 못 미친다.
그러면 글자 데이터셋은 대체 무엇인가. 공유서재 이용가이드는 제공 데이터를 "텍스트(OCR), 표·삽화·사진·광고·글자 데이터셋 이미지 데이터, 그리고 메타데이터"로 적는다. 게시판의 자주하는 질문도 제공 형태를 세 줄로 나누면서 마지막 줄을 "글자 이미지 데이터"라고 부른다. 낱글자를 하나씩 잘라 낸 그림에 그 글자가 무엇인지를 붙여 둔 묶음이다. 옛 활자를 읽어 내는 문자 인식 모델을 기르는 데 쓰는 재료이지, 문장을 배우는 언어 모델이 삼킬 글뭉치가 아니다.
한 건이 무엇인지는 자료 상세 화면에서 되짚을 수 있다. 자료마다 표·삽화·사진·광고 옆에 글자 데이터셋 건수가 따로 붙는데, 1957년 문교부가 펴낸 『고등 국어』 한 권이 93,483건이고 1949년에 나온 이광수의 『선도자』가 135,485건이다. 기사 단위로 들어간 1959년 잡지 기사 한 편은 1,405건이다. 한 건이 낱글자 하나에 해당한다고 보면 들어맞는 규모다. 다만 플랫폼이 이 단위를 문장으로 설명한 곳은 확인한 범위에서 없다. 발표 총계의 99.93%를 차지하는 항목이 무엇을 세는지는 이용자가 역산해야 한다.
한국어 모델을 기르려고 이 데이터를 찾아온 사람에게 실제로 의미 있는 값은 3,974책이다. 3,833만 건이라는 표제를 보고 짐작한 크기와, 텍스트 파일을 받아 마주하는 크기 사이에는 네 자릿수의 거리가 있다. 그런데 다시 센 값은 이미 플랫폼 안에 있다. 같은 자료를 통합검색에서 열면 화면 위쪽에 전체 25,459건, 텍스트 3,974건, 이미지 21,485건이 적혀 있다. 글자 데이터셋을 뺀 수다. 바깥으로 나간 표제 숫자만 그 계산을 하지 않았다.
저작권이 그은 선
발표문에서 가장 자주 되풀이되는 표현은 "저작권이 해결된"이다. 권리 문제를 정리하고 내놓았다는 뜻이고, 데이터를 쓰려는 사람에게는 안심할 만한 소식이다. 그런데 같은 문장을 수집 쪽에서 읽으면 성격이 달라진다. 무엇을 담을지가 내용이 아니라 권리 상태로 정해졌다는 말이기 때문이다.
그 기준이 고른 시기가 발표문에 그대로 드러난다. 근대잡지는 1930~40년대, 정부간행물과 교과서는 1940~60년대다. 1930~40년대는 식민지 시기이고, 그 시기 잡지에 실린 한국어는 지금 쓰는 말과 표기도 어휘도 같지 않다. 1940~60년대 정부간행물과 교과서는 국가기관이 펴낸 문서라 저작권을 풀기가 상대적으로 쉽다. 남은 한 갈래인 오픈액세스 논문은 시기가 최근이고 학술 문장이라는 좁은 결을 가지는데, 건수로는 이것이 가장 많다.
그러면 어디가 비는지도 함께 보인다. 1960년대 이후 상업 출판물 대부분이다. 소설과 산문집, 신문과 대중잡지, 교양서처럼 전후 한국어 산문이 가장 두껍게 쌓인 자료가 통째로 권리 관계 안쪽에 남아 있다. 이 데이터로 길러진 모델이 아는 한국 근현대는, 그 시대에 실제로 쓰인 글의 표본이 아니라 권리가 먼저 정리된 글의 표본이다. 여기까지는 이 글의 해석이고, 도서관이 그렇게 말한 것은 아니다.
다만 비는 자리가 어디인지는 짐작으로 둘 일이 아니다. 검색 화면에는 발행년도 필터가 있어 텍스트 3,974건을 연대로 끊어 셀 수 있다. 1930년대 699건, 1940년대 353건, 1950년대 351건으로 근현대에 1,400건 남짓이 몰려 있고, 1960년대로 넘어가면 93건으로 줄어든다. 1970년부터 1999년까지 서른 해에서 나온 것은 다 합쳐 94건이다. 그리고 2000년 이후가 2,251건으로 전체의 57%를 차지한다. 최근 연대를 채운 것은 오픈액세스 논문과 도서관이 직접 펴낸 자료다. 권리가 정리되는 방식은 둘이다. 하나는 시간이 지나 보호기간이 끝나는 것이고, 다른 하나는 처음부터 열어 두기로 하는 것이다. 그 둘이 코퍼스의 양쪽 끝을 만들고 그 사이 서른 해가 비어 있다.
기울어진 표본이 나쁜 데이터라는 뜻은 아니다. 옛 활자를 읽는 문자 인식 모델에는 이만한 재료가 따로 없고, 디지털 인문학에서는 시기가 몰려 있는 편이 오히려 다루기 좋다. 문제가 되는 대목은 이 데이터를 일반 목적의 한국어 코퍼스처럼 섞어 넣을 때다. 그때는 어느 시기 어떤 성격의 글이 얼마나 들어갔는지가 학습 결과에 그대로 남는다.
이용 조건에도 확인할 것이 남는다. 공유서재 저작권 안내가 말하는 대상 자료는 두 가지다. "저작권 보호기간이 만료되어 누구나 자유롭게 이용할 수 있는 저작물 또는 국립중앙도서관이 저작권을 보유한 저작물"이다. 그런데 발표문이 말한 네 번째 자료, AI 학습 이용 허락을 받은 오픈액세스 논문은 이 두 가지 어디에도 들어가지 않는다. 허락의 범위가 어디까지인지는 안내에 나오지 않는다. 게시판의 자주하는 질문은 "별도의 저작권 허락 없이 열람·다운로드·가공·연구·학습 목적 등으로 활용할 수 있다"고 답하는데, 열거된 목적 가운데 상업적 이용은 없다.
자료 하나하나의 권리 상태를 적을 칸은 이미 설계돼 있다. 이용가이드의 메타데이터 구조 안내를 보면 단행자료와 연속간행물 모두에 '저작권 정보'가 필수 항목으로 들어가 있다. 그런데 자료 상세 화면에 뜨는 항목은 저작자와 발행지, 발행처, 발행년, 주제명, 자료구분, 주제구분까지다. 확인한 다섯 건 모두 저작권 정보는 화면에 나오지 않았다. 스키마에 칸이 있다고 해서 이용자가 그 값을 볼 수 있는 것은 아니다.
공공저작물에는 표시 제도가 이미 마련돼 있다. 2026년 1월 문화체육관광부와 과학기술정보통신부는 공공저작물의 AI 학습 이용 기준을 고치면서 공공누리에 'AI 유형'을 새로 뒀다. 인공지능 학습용 데이터로 쓸 때에 한해 적용되고, 원본과 같거나 사실상 비슷한 산출물이 나오지 않도록 기술적 조치를 하라는 것, 검색증강생성처럼 직접 인용하는 경우에는 출처를 밝힐 기술적 조치를 하라는 것, 학습용 데이터를 되팔지 말라는 것이 준수사항으로 붙는다. 우리가 열어 본 공유서재 화면에는 이런 유형 표시가 자료에 붙어 있지 않았다.
내려받기 전에 확인할 것
여기까지의 이야기를 실무 절차로 옮기면 네 가지가 된다. 공유서재만의 이야기가 아니라, 공개됐다는 데이터를 처음 손에 쥘 때마다 같은 순서로 물어볼 만한 것들이다.
4.1이 숫자는 무엇을 센 값인가
총 건수만 적힌 카탈로그는 크기를 알려 주지 않는다. 단위가 다른 항목이 섞여 있으면 더 그렇다. 유형별 값이 따로 공개돼 있다면 그 값을 기준으로 잡고, 없다면 압축을 풀어 파일 개수와 용량을 직접 확인하면 된다. 공유서재의 경우 첫 화면에 유형별 값이 있고, 검색 화면은 자료유형과 주제, 발행년도별로 나눈 값까지 보여 준다. 확인에 드는 품이 크지 않다.
4.2선별 기준이 무엇을 뺐는가
공개 데이터에는 반드시 고르는 기준이 있고, 기준은 담은 것만큼 뺀 것을 정한다. 저작권으로 골랐는지, 기관 소관으로 골랐는지, 품질 점수로 골랐는지에 따라 빠지는 쪽이 달라진다. 무엇을 담았는지는 대개 발표문 첫 문단에 있지만, 무엇이 빠졌는지는 적혀 있지 않다. 빠진 것을 헤아리는 일은 데이터를 쓰는 사람의 몫이다.
4.3이용 조건이 어디에 적혀 있는가
가입 없이 받을 수 있다는 것과 마음대로 써도 된다는 것은 다른 이야기다. 자료마다 붙은 이용 조건 표시를 먼저 찾고, 화면에 없으면 내려받은 메타데이터 파일의 필드까지 열어 본다. 거기에도 없으면 기관에 물어 근거를 문서로 남겨 두는 편이 낫다. 모델을 상업적으로 서비스할 계획이라면 특히 그렇다. 학습에 한 번 들어간 데이터는 나중에 빼기가 어렵다.
4.4품질은 누가 어떻게 확인했는가
문자 인식으로 만든 텍스트에는 오인식이 남는다. 공유서재는 그 사정을 숨기지 않는다. 이용자가 인식 결과를 직접 고치는 '함께 만드는 데이터' 창구에 올라온 자료가 18,675건이고, 화면은 대상을 "OCR로 자동 추출된 비정제 텍스트"라고 부른다. 같은 화면에 고친 결과물이 "국립중앙도서관의 공식 데이터가 아닌 참고용 자료"라는 안내도 붙어 있다. 이용자가 바로잡은 값이 내려받는 데이터셋으로 곧장 돌아가지는 않는 것으로 읽힌다. 그러니 쓰기 전에 표본을 몇 건 떠서 스캔 이미지와 텍스트를 나란히 놓고 눈으로 대조하는 작업이 필요하다. 그 결과가 곧 이 데이터를 어디까지 믿고 쓸지를 정한다.
한 달 앞선 8월 12일, 감사원은 정부가 2017년부터 1조 6,328억 원을 들여 만든 AI 학습용 데이터 908종을 두고 유사·중복 구축과 품질 관리 공백을 지적했다. 서울시가 2020년에 만든 대형폐기물 학습데이터는 2,303장 가운데 538장이 파일명과 실제 이미지가 맞지 않았고, 구축 실적 상위 20개 기관 중 9개는 제3자 품질검증 없이 납품을 받았다. 권리 관계를 정리하는 일과 품질을 관리하는 일은 서로 다른 과제다. 이 감사 결과는 앞선 글에서 자세히 다뤘다.
페블러스가 이 공개를 주목하는 이유
이번 공개에서 우리가 눈여겨본 자리는 데이터 자체가 아니라 그 데이터를 설명하는 한 줄이다. 카탈로그에 '총 건수'만 남으면, 그 데이터셋을 받은 사람은 크기도 구성도 다시 세야 한다. 항목마다 단위가 다르면 그 일조차 쉽지 않다. 우리가 AI-Ready Data를 말할 때 수집량보다 수집 조건과 단위를 먼저 묻는 이유가 이 대목이다.
같은 문제를 다른 창구에서도 본 적이 있다. 정부의 독자 AI 파운데이션 모델 사업으로 만들어진 학습데이터 29종을 항목마다 맞춰 봤을 때도 같은 데이터를 두고 발표 기록과 개방 창구의 건수와 용량이 어긋났다. 공공데이터 개방 계획에 붙은 단서를 하나씩 읽었을 때도, 국립중앙도서관 도서 정보에는 "저작권 만료된 데이터 우선 개방"이라는 조건이 이미 달려 있었다. 이번 공유서재는 그 조건이 실제 데이터셋으로 구현된 모습이다.
기업으로 옮겨 오면 물음은 익숙해진다. 사내 데이터 카탈로그에 적힌 '총 건수'를 누가 어떤 단위로 셌는지를 답할 수 있는가. 센서 측정값과 검사 이미지와 작업 이력이 한 지표 아래 뭉쳐 있지는 않은가. 우리가 데이터 품질 진단에서 자주 만나는 첫 장면이 바로 이것이다. 데이터가 나쁜 것이 아니라, 데이터를 설명하는 값이 실제 데이터와 다른 것을 가리키고 있는 경우다.
그러니 이번 공개를 깎아내릴 이유는 없다. 저작권 부담 때문에 학습 자료를 구하지 못하던 연구자와 작은 기업에게 3,974책은 결코 작은 선물이 아니고, 문자 인식 모델을 기르려는 사람에게 3,830만 건의 글자 재료는 국내 어디에도 없던 자산이다. 다만 그 가치가 제대로 전해지려면, 무엇이 얼마나 들어 있는지를 단위와 함께 적는 한 줄이 먼저 필요하다. 카탈로그를 고치는 일은 데이터를 다시 만드는 일보다 훨씬 싸다.
여기까지 읽어 주셔서 감사하다. 이 글이 인용한 건수는 국립중앙도서관 공유서재 화면에서 2026년 9월 26일에 확인한 값이고, 공개 내용과 발언은 9월 17일 보도에서 확인할 수 있다. 여러분의 조직에서 공개 데이터를 실제로 학습에 넣어 본 적이 있다면, 그때 무엇을 먼저 확인했는지 이야기를 나눠 주시면 좋겠다.
참고문헌
1차 소스 (공식)
- 1.국립중앙도서관. (2026). "공유서재 — AI 학습데이터 현황 및 이용안내." (2026-09-26 확인)
- 2.공공누리(한국문화정보원). (2026). "공공누리 'AI 유형' 안내." (2026-09-26 확인)
보도
- 3.윤주혜. (2026). "잡지·교과서·학술논문 등 3833만건 AI 학습데이터, 국민에 '활짝'." 아주경제.
- 4.김희윤. (2026). "국가문헌이 AI 인프라로…국립중앙도서관 '공유서재' 문 연다." 아시아경제.
- 5.이미숙. (2026). "국립중앙도서관, 국가문헌 AI 학습데이터 3,833만 건 첫 공개." 한국강사신문.
- 6.금나래. (2026). "국립중앙도서관, 국가문헌 AI 학습데이터 대국민 첫 공개." 우리문화신문.
배경·정책
- 7.이윤정. (2026). "국립중앙도서관, AI 학습데이터 구축·개방 나선다." 이데일리.
- 8.김송이. (2026). "감사원 "1.6조 투입 공공기관 AI 학습 데이터, 저품질·관리 부실"." 경향신문.
- 9.이종길. (2026). "공공데이터, 출처 안 밝히고 AI 학습에 쓴다…'공공누리' 개편." 아시아경제.