Executive Summary
이 글은 서울시가 2026년 9월에 내놓은 공공데이터 계획 하나를 읽는다. 서울시는 9월 4일 빅데이터심의위원회에서 'AI 고가치 데이터셋 톱100 선정안'을 심의했고, 이틀 뒤 그 내용을 공개했다. 242개 정보시스템에 들어 있는 3만 7,924개 테이블과 65만 3,190개 컬럼의 메타데이터를 분석해 후보 204개를 추렸고, 거기서 다시 100개를 골랐다. 고른 데이터는 2027년부터 3년에 걸쳐 품질과 구조를 손본 뒤 서울 열린데이터광장으로 내보낸다. 지방자치단체가 AI 활용을 목적으로 고가치 데이터를 추려 체계적으로 정비하겠다고 밝힌 것은 이번이 처음이다.
고르는 잣대는 촘촘하다. 서울시 발표를 옮긴 기사들은 "AI 활용성, 정책 활용성, 시민 체감도 등 6개 기준"이라고만 적었지만, 보도자료 붙임에는 여섯 지표가 배점과 함께 그대로 나와 있다. 합이 100점인 표를 내부 3명과 외부 6명, 모두 아홉 사람이 들고 채점했다. 비어 있는 자리는 그 뒤에 있다. 어떤 데이터의 정비가 끝났다고 누가, 어떤 근거로 판정하는지는 계획 어디에도 적혀 있지 않다.
1절부터 5절까지는 서울시 발표와 보도로 확인되는 사실이다. 6절은 그 사실을 기업 데이터 담당자의 눈으로 다시 읽은 이 글의 해석이다.
주요 수치
출처: 서울시 디지털도시국 데이터전략과 보도자료(붙임 1~3 포함 전문은 한국사회복지저널 전재), 이투데이, 머니투데이 (2026년 9월 6일), 세계일보.
65만→100
컬럼에서 데이터 집합으로
242개 시스템과 3만 7,924개 테이블을 훑어 후보 204개를 거쳐 좁혔다
100점
선정 지표 여섯의 배점 합계
보도자료 붙임에 여섯 지표와 배점이 다 있다. 보도가 옮긴 것은 셋뿐이었다
24 대 2
교통·물류 대 교육
9개 분야 가운데 최다와 최소. 어느 영역에 수요가 몰렸는지를 드러낸다
0
공개된 정비 완료 판정 기준
고를 때는 배점표가 있었는데, 끝났다고 판정할 자리에는 지표도 배점도 없다
개방 건수를 세던 자리에 활용 가능성이 들어섰다
공공데이터 정책의 성적표는 오랫동안 건수였다. 몇 건을 개방했는지, 전년 대비 몇 퍼센트 늘었는지가 발표의 첫 줄에 놓였다. 서울시가 9월에 내놓은 계획은 그 첫 줄을 바꾼다. 정영준 서울시 디지털도시국장은 "그동안 공공데이터 정책이 '얼마나 많이 개방했는가'에 초점을 맞췄다면, AI 시대에는 '어떤 데이터를 어떤 품질로 제공해 실제로 쓰이게 할 것인가'가 핵심"이라고 말했다.
말을 바꾸는 일과 일하는 방식을 바꾸는 일은 다르다. 이번 계획에서 바뀐 것은 후자에 가깝다. 지금까지 개방된 공공데이터는 파일을 내려받은 쪽이 따로 전처리를 해야 쓸 수 있었다. 항목 이름이 기관마다 달랐고, 빈 칸과 오류값이 섞여 있었고, 코드값의 뜻은 별도 문서를 찾아야 알 수 있었다. 서울시는 이 손질을 내려받는 쪽이 아니라 제공하는 쪽이 하겠다고 했다. 그래서 개방 시점도 2027년으로 미뤘다. 고르는 데는 한 해가 걸리지 않지만 손보는 데는 3년을 잡았다.
지방자치단체가 AI 활용을 겨냥해 고가치 공공데이터를 선별하고 체계적으로 정비하는 것은 이번이 처음이다. 그리고 이 사례는 서울시 안에만 머물지 않았다. 9월 30일 행정안전부가 처음 연 'AI·데이터행정 책임관 협의회'에서 서울시는 이 계획을 지자체 사례로 발제했다. 한 도시의 데이터 정비 계획이 발표 3주 만에 범정부 회의의 안건으로 올라간 셈이다.
컬럼 65만 개가 데이터 100개로 좁혀진 경로
선별은 목록이 아니라 메타데이터에서 시작했다. 서울시는 242개 정보시스템이 품고 있는 3만 7,924개 테이블과 65만 3,190개 컬럼의 메타데이터를 분석했다. 여기에 시민과 기업이 요청해 온 데이터 수요, 그리고 시의 주요 정책과제를 겹쳐 후보 204개를 발굴했다. 마지막으로 6개 기준을 종합 평가해 100개를 확정했다. 단순히 개방 요청이 많거나 공개하기 쉬운 데이터를 고른 것이 아니라 AI가 분석하기 좋은 구조를 갖췄는지까지 봤다는 것이 서울시의 설명이다.
후보 204개는 한 갈래에서 나오지 않았다. 서울시가 보유한 데이터의 시·공간적 특성과 구조를 분석해 찾아낸 것이 50개, 주요 정책과 시민·기업 수요와 기존 활용 실적을 종합해 찾아낸 것이 154개다. 앞의 갈래는 가진 것에서 출발하고 뒤의 갈래는 원하는 것에서 출발한다. 둘을 따로 돌린 뒤 합쳤다는 점이, 수요 조사만으로 목록을 만드는 방식과 이 계획이 갈리는 자리다.
▲ 서울시가 밝힌 선별 경로. 마지막 칸을 가른 것은 배점까지 붙은 6개 지표다.
100개가 어느 영역에서 나왔는지를 보면 수요가 어디에 몰려 있는지가 드러난다. 9개 분야 가운데 교통·물류가 24개로 가장 많고, 교육이 2개로 가장 적다. 도시가 매일 만들어 내는 데이터 가운데 이동에 관한 것이 가장 두껍고 가장 자주 요청된다는 뜻으로 읽힌다.
| 분야 | 선정 개수 | 분야 | 선정 개수 |
|---|---|---|---|
| 교통·물류 | 24 | 공공질서·안전 | 9 |
| 지역개발·도시관리 | 14 | 문화·관광 | 9 |
| 복지·보건 | 12 | 산업·경제 | 8 |
| 일반공공행정 | 11 | 교육 | 2 |
| 환경·에너지 | 11 | 합계 | 100 |
출처: 서울시 발표, 2026년 9월 6일.
개방은 한꺼번에 이루어지지 않는다. 2027년에 30개, 2028년에 30개, 2029년에 40개를 차례로 연다. 순서를 무엇으로 갈랐는지는 서울시가 밝혀 두었다. 데이터별 개방 난이도와 시민·기업 수요, 그리고 AI 활용 가능성 세 가지다. 서울시는 개방 이후에도 실제 활용 실적과 시민·기업의 추가 수요, 새로 불거진 도시문제를 반영해 이 100개 목록을 주기적으로 점검하고 고도화하겠다고 밝혔다.
AI-Ready 데이터는 무엇을 손보겠다는 말인가
서울시가 쓴 'AI-Ready 데이터'라는 말은 선언이 아니라 작업 목록으로 제시됐다. 발표문이 꼽은 항목은 다섯 가지다. 데이터 표준화, 결측·오류값 정비, 코드체계 정비, 시계열·공간정보 구조화, 메타데이터 보강이다. 다섯 항목이 각각 무엇을 막으려는 것인지는 데이터를 실제로 써 본 사람이라면 금방 알아본다.
| 정비 항목 | 손보지 않으면 생기는 일 |
|---|---|
| 데이터 표준화 | 같은 항목이 시스템마다 다른 이름과 다른 단위로 적혀 있어 합칠 수 없다 |
| 결측·오류값 정비 | 빈 칸과 잘못 들어간 값이 학습 결과를 조용히 비틀어 놓는다 |
| 코드체계 정비 | 코드값이 무엇을 뜻하는지 알려면 별도 문서를 찾아야 한다 |
| 시계열·공간정보 구조화 | 시점과 좌표가 제각각이라 시간이나 지점을 기준으로 이어 붙이기 어렵다 |
| 메타데이터 보강 | 어떤 데이터인지 설명이 얇아 찾아내는 단계에서 이미 걸린다 |
왼쪽 칸은 서울시 발표문의 항목이고, 오른쪽 칸은 각 항목이 겨냥하는 문제를 이 글이 풀어 쓴 것이다.
서울시가 든 활용 예시 두 가지가 이 다섯 항목의 쓸모를 잘 보여 준다. 하나는 교통량과 대중교통 이용량과 택시 운행 정보를 묶어 교통 수요와 혼잡을 예측하는 일이고, 다른 하나는 하천 수위와 배수펌프장 정보와 침수 취약지역 데이터를 묶어 침수 위험을 예측하는 일이다. 둘 다 여러 출처를 시간과 위치로 맞대어 붙이는 작업이다. 시점 형식이 다르거나 좌표 체계가 어긋나면 모델을 아무리 잘 골라도 붙이는 단계에서 멈춘다.
손본다고 해서 다 그대로 열 수 있는 것도 아니다. 서울시는 개인정보나 보안 때문에 원천데이터를 그대로 공개하기 어려운 경우에 가명·익명처리, 집계·격자화, 합성데이터 가운데 데이터 특성에 맞는 방식을 적용하겠다고 했다. 선정 목록을 보면 이 처리를 이미 전제한 이름들이 섞여 있다. '서울시민 가명정보 소비활동 데이터'나 '50m 격자 단위 실시간·시간대별 인구 분포 데이터' 같은 것들이다. 정비 항목 다섯 가지 옆에 이 갈래가 하나 더 붙어 있는 셈이고, 원본을 바꿔서 여는 방식인 만큼 "어디까지 바꿔야 안전하고 어디까지 남겨야 쓸모가 있는가"라는 물음이 따라붙는다.
제공 방식도 함께 바뀐다. 서울시는 원천데이터의 품질과 구조를 먼저 진단한 뒤 정비해 서울 열린데이터광장 등으로 내보내고, AI 개발자가 필요한 데이터를 쉽게 찾고 쓸 수 있도록 API와 메타데이터를 비롯한 AI 친화적 제공 방식을 확대하겠다고 했다. 파일을 내려받아 여는 것과 API로 호출하는 것은 같은 데이터라도 쓰임이 다르다.
여섯 지표에는 배점이 있고, 정비에는 없다
발표를 옮긴 기사들이 공통으로 적은 기준 이름은 AI 활용성과 정책 활용성과 시민 체감도 셋이다. 세 곳 모두 "등 6개 기준"이라고 썼다. 그런데 나머지 셋은 감춰진 적이 없다. 서울시 보도자료의 붙임 1에 여섯 지표가 배점과 함께 그대로 적혀 있고, "등"이라는 한 글자 뒤로 묶인 셋의 이름은 확장성, 융합성, 구축가능성이다. 여섯을 합치면 100점이 되고, 채점에는 내부 3명과 외부 6명, 모두 아홉 사람이 참여했다.
▲ 윗부분은 서울시 보도자료 붙임 1의 평가지표와 배점이고, 아래 점선 칸은 붙임에 없다.
배점이 드러나면 이 표가 어디에 무게를 실었는지도 보인다. 100점 가운데 40점이 AI 활용성과 정책 활용성 둘에 걸려 있고, 나머지 넷은 15점씩 나눠 가졌다. 다만 각 지표의 정의는 붙임에도 적혀 있지 않다. 이를테면 확장성과 융합성이 각각 무엇을 재는 말인지가 그렇다. 이름과 배점은 공개됐고, 그 점수를 매기는 잣대는 공개되지 않았다.
그래도 여기까지는 채워진 쪽이다. 정말 비어 있는 자리는 그 다음에 있다. 선정안은 빅데이터심의위원회 심의를 거쳤고, 무엇을 고를지는 아홉 사람이 100점짜리 표를 들고 판단했다. 그런데 고른 뒤에 이어지는 일, 곧 "이 데이터는 정비가 끝났다"는 판정을 누가 무엇을 보고 내리는지는 계획에 적혀 있지 않다. 고르는 자리에는 배점표가 섰는데, 끝내는 자리에는 아직 표가 없다.
정비할 항목 다섯 가지는 밝혀졌지만, 각 항목을 어디까지 채워야 통과인지는 밝혀지지 않았다. 결측값을 몇 퍼센트 아래로 낮춰야 하는지, 코드체계에 설명이 붙지 않은 코드가 몇 개까지 남아도 되는지, 메타데이터에 어떤 필드가 반드시 있어야 하는지가 그런 물음이다. 2029년에 100번째 데이터가 열릴 때, 첫해에 열린 30개와 같은 잣대를 통과했는지를 확인할 방법도 같은 자리에 걸려 있다.
서울시가 이 문제를 모른 척했다고 보기는 어렵다. 목록을 주기적으로 점검하고 고도화하겠다는 계획이 발표에 들어 있고, 원천데이터의 품질과 구조를 진단한 뒤 정비한다는 순서도 명시돼 있다. 다만 진단한다는 말과 무엇을 진단해 어떤 값이 나와야 통과인지를 적는 일 사이에는 아직 거리가 있다. 3년짜리 일정의 첫해가 시작되기 전에 그 거리가 좁혀지는지가 이 계획을 지켜볼 대목이다.
행안부도 같은 날 100개를 꺼냈다
서울시가 이 계획을 발제한 회의는 행정안전부가 9월 30일 정부서울청사 별관 국제회의실에서 연 '제1회 AI·데이터행정 책임관 협의회'다. 임의로 모인 간담회가 아니라 'AI·데이터 행정법' 제19조에 근거한 법정 협의체로, 행정안전부 차관이 의장을 맡고 각 기관에서 AI·데이터행정 업무와 데이터 구축·제공·공동활용을 총괄하는 국장급 책임관들로 구성된다. 이날 행정안전부와 중소벤처기업부, 서울특별시, 인천광역시가 각각 안건을 냈다.
같은 회의에서 행정안전부가 낸 안건 가운데 숫자가 겹치는 항목이 하나 있다. 지능형 업무관리 플랫폼 '온AI' 추진 방향과 공공 누리집 UI·UX 개선 방안과 함께 발제된 '공공데이터 상위 100개 조기 개방'이다. 서울시의 100개와 행정안전부의 100개는 이름과 숫자가 닮았지만 같은 목록이 아니다. 이건 추측이 아니라 서울시가 직접 적어 둔 것이다. 보도자료 붙임 2가 두 TOP100을 나란히 놓고 비교한다.
그 비교를 보면 두 계획이 겨냥하는 곳이 다르다. 행정안전부 쪽은 국가 AI 산업 생태계와 기업 경쟁력을 목적으로 두고 법령·판례, 농업, K-문화처럼 분야별 전문 데이터를 전국 단위부터 시설 단위까지 모은다. 서울시 쪽은 도시문제 해결과 AI 기반 도시행정을 목적으로 두고 생활인구·이동, 도시상권·카드소비, 도로·주차처럼 50m와 250m 격자까지 내려가는 시공간 데이터를 모은다. 일정도 어긋나 있다. 행정안전부는 2025년부터 2027년까지, 서울시는 2027년부터 2029년까지다. 먼저 출발한 쪽은 중앙부처이고, 서울시 사례는 그 뒤를 따라가는 것이 아니라 다른 축에서 나란히 간다.
겹침은 숫자에서 끝나지 않는다. 앞으로 여러 기관이 각자 'AI-Ready 데이터'라는 이름을 걸고 정비에 들어갈 텐데, 그 이름이 무엇을 뜻하는지를 가르는 공통 잣대는 아직 없다. 어떤 기관은 메타데이터 충실도를 기준으로 삼고, 어떤 기관은 결측값과 코드값 정합성을 기준으로 삼고, 어떤 기관은 라이선스 표기가 있는지를 볼 수 있다. 세 기관이 모두 정비를 마쳤다고 발표해도, 그 데이터를 한데 모아 쓰려는 쪽은 세 번 다시 손봐야 한다.
같은 회의에서 인천광역시가 낸 안건이 마침 그 자리를 가리킨다. 지방정부가 AI·데이터 사업 공모에 참여할 기회를 넓히고, 잘 만든 서비스를 다른 지방정부도 가져다 쓸 수 있게 공동 활용·확산 체계를 마련하자는 제안이다. 그런데 서비스를 옮겨 심으려면 그 아래 데이터가 비슷한 상태여야 한다. 확산을 이야기하려면 "같은 상태란 무엇인가"부터 정해야 한다는 뜻이다. 이날 논의한 과제들은 관계 기관이 함께 검토한 뒤 행정안전부가 법·제도 지원 방안을 마련하고 각 기관이 업무 특성에 맞는 추진 방안을 세워 이행하는 순서로 넘어간다. 행정안전부는 12월까지 'AI 영향평가 가이드라인'을 배포하고 2027년까지 '공공 AI·데이터협회'를 설립한다는 일정도 함께 내놓았다. 데이터 정비의 합격선이 그 문서들에 들어가는지는 공개된 자료로는 알 수 없다.
페블러스가 이 계획을 주목하는 이유
이 계획에서 기업 담당자가 가져갈 것은 서울시가 무엇을 골랐는지가 아니다. 고르는 일과 끝났다고 판정하는 일이 서로 다른 역량이라는 사실이다. 앞의 일은 우선순위를 정하는 작업이라 배점표와 심사위원으로 풀린다. 실제로 서울시는 그 표를 만들어 공개까지 했다. 뒤의 일은 측정과 합격선의 문제라 사람을 더 모아도 풀리지 않는다. 65만 개 컬럼을 훑어 100점짜리 표를 세운 조직도 두 번째 표는 아직 내놓지 않았다.
사내 데이터 정비 과제도 같은 자리에서 멈춘다. 대체로 착수 보고서에는 손볼 항목이 적혀 있다. 표준화, 결측 처리, 코드 정리, 스키마 정비까지 목록은 서울시의 다섯 항목과 크게 다르지 않다. 그런데 종료 보고서에 적히는 것은 대개 "정비 완료"라는 네 글자다. 완료의 정의가 착수 시점에 숫자로 적혀 있지 않으면, 끝났다는 판정은 일정이 끝났다는 뜻이 된다. 다음 팀이 같은 데이터를 받아 다시 전처리를 시작하는 이유가 여기 있다.
그래서 확인할 것은 세 가지로 좁혀진다. 우리 조직이 데이터의 우선순위를 무엇으로 가르는지, 그 기준에 배점이 붙어 있는지, 그리고 정비가 끝났다는 판정을 사람이 아니라 수치가 내리고 있는지다. 셋 중 마지막이 비어 있으면 앞의 둘이 아무리 정교해도 결과를 검증할 수 없다. 서울시 계획을 읽으며 남는 물음도 정확히 그 자리에 있고, 3년 뒤에 100개가 실제로 쓰이느냐도 결국 거기에 달려 있다.
공공 쪽이 이 자리를 먼저 채운다면 기업 쪽에도 쓸모가 크다. 기관이 어떤 지표로 정비 완료를 판정했는지가 공개되면, 그것은 그대로 산업이 참조할 수 있는 첫 공개 합격선이 된다. 지금 한국에서 이 잣대를 가장 넓은 범위의 데이터에 걸어 볼 수 있는 곳이 공공이기 때문이다. 못 할 일도 아니다. 무엇을 고를지에 대해서는 이미 지표와 배점을 붙임에 적어 내놓은 전례가 있다.
여기까지 읽어 주셔서 감사하다. 평가지표와 배점이 담긴 붙임까지 포함한 서울시 보도자료 전문은 한국사회복지저널 전재본에서, 발표의 요약 수치는 이투데이와 머니투데이 기사에서, 협의회 내용은 디지털데일리 기사에서 볼 수 있다. 여러분의 조직에서는 데이터 정비가 끝났다는 판정을 무엇으로 내리고 있는지, 그 기준이 착수 시점에 숫자로 적혀 있었는지 한번 확인해 보시고 무엇이 비어 있었는지 들려주시면 좋겠다.
참고문헌
1차 소스
- 1.서울특별시 디지털도시국 데이터전략과. (2026). "서울시 AI 고가치 데이터셋 TOP100 선정" 보도자료(붙임 1~3 포함). 한국사회복지저널 전재본.
업계·보도
- 2.세계일보. (2026.9.6). "많이 개방에서 AI가 바로 쓰게." seoul.thesegye.com.
- 3.이투데이. (2026.9.6). "서울시, AI 고가치 데이터 TOP100 선정…2029년까지 개방." etoday.co.kr.
- 4.정세진. (2026.9.6). "AI가 바로 쓸 수 있게…서울시, 지자체 최초 고가치 데이터 선정." 머니투데이.
- 5.박재현. (2026.9.29). "국장급 책임관 한자리에…행안부, 범정부 AI·데이터행정 협력체계 본격 가동." 디지털데일리.