Executive Summary

소행성은 저마다 다른 속도로 팽이처럼 돈다. 한 바퀴 도는 데 걸리는 시간을 알아내는 방법은 단순하다. 같은 소행성을 여러 번 찍어 밝기가 오르내리는 리듬을 읽으면 된다. 다만 그 리듬은 사진이 충분히 쌓였을 때만 보인다. 칠레의 베라 루빈 천문대가 2025년부터 2026년 사이 시험 가동 중에 남긴 관측은 그 조건에 한참 못 미쳤다. 대부분의 천체가 하루 이틀에 몰아서 몇십 번 찍힌 뒤 한참 잊혔다. 브라질 상파울루주립대의 발레리오 카루바 등 10명이 9월 24일 arXiv에 올린 논문은 그런 자료를 앞에 두고 질문을 뒤집었다. 사진을 더 모으는 대신, 답이 나오려면 사진이 어떻게 모여 있어야 하는지를 먼저 계산했다. 이 글은 그 계산이 무엇을 정해 두었는지를 본다.

연구진은 잘 관측된 소행성 하나를 골라 그 자료를 일부러 깎아냈다. 관측을 몇 개의 시간 덩어리로 나누고 그 폭을 바꿔 가며 30개만 남긴 뒤, 그래도 원래의 자전주기가 되살아나는지를 열 번씩 확인했다. 둘로 나눈 가장 빡빡한 조건에서 한 계산법은 열 번 모두 실패했고, 넷으로 늘리자 열 번 모두 성공했다. 사진 장수는 그대로였다. 다만 그 기준으로 실제 관측을 걸러 보니 초기 후보 140개 중 36개만 남았고, 통과한 36개의 평균 관측 횟수는 286회였다. 성기게 찍어도 된다는 이야기가 아니라, 어디부터가 성긴 것인지에 숫자로 금을 그은 이야기다.

1절부터 4절까지는 논문에 적힌 내용이다. 5절은 그 내용에서 이 글이 끌어낸 해석이다.

주요 수치

출처: Carruba 외, arXiv:2609.29841 (Planetary and Space Science 게재 확정) 본문 5장·6장과 부록 표 C.7.

0번 → 10번

덩어리를 둘에서 넷으로 늘렸을 때

가장 좁은 창에서 푸리에 방식은 열 번 시도해 한 번도 자전주기를 되살리지 못했다. 사진 수는 30개로 같았다

36 / 140

신뢰 기준을 통과한 천체

2월과 4월 두 차례 자료의 초기 후보 140개 가운데 약 26%만 남았다. 나머지에는 주기 값을 매기지 않았다

286회

통과한 36개의 평균 관측 횟수

앞선 퍼스트룩 자료에서 믿을 만한 주기를 얻은 76개의 평균 290회와 거의 같은 값이다

2건 중 2건

문헌과 맞춰 본 분류의 불일치

기존 분류가 있어 직접 비교할 수 있었던 천체는 둘뿐이었고, 둘 다 이번 결과와 어긋났다

1

정답을 아는 소행성 하나를 일부러 깎았다

루빈 천문대는 아직 본 임무를 시작하지 않았다. 지금 쌓이는 것은 장비와 절차를 맞춰 보는 과정에서 나온 관측이고, 앞서 한 차례 공개된 퍼스트룩 자료와는 성격이 다르다. 퍼스트룩은 2025년 4월 21일부터 5월 5일까지 아홉 밤 동안 약 34만 회를 찍어 천체 2,103개를 훑은 자료다. 마지막 밤을 뺀 밤마다 60회가 넘는 촬영이 몇 시간 안에 몰렸다. 그렇게 모으고도 믿을 만한 자전주기가 나온 것은 76개였다. 천체당 관측 횟수의 중앙값은 132회였는데, 주기를 얻어 낸 76개의 평균은 290회였다. 반면 이번에 쓰인 과학검증 관측은 천체 대부분이 165회 이하로 찍혔고, 그 관측조차 두세 개의 짧은 시간대에 몰려 있다. 2월 자료에서 150회 넘게 찍힌 것은 주소행대 천체 30개와 근지구천체 2개뿐이었다. 같은 망원경의 자료인데 밀도가 다르다.

칠레 세로 파촌 산정에 있는 베라 루빈 천문대의 시몬시 조사망원경 돔
▲ 칠레 세로 파촌 산정의 베라 루빈 천문대. 이번 논문이 다룬 성긴 관측이 여기서 나왔다 | Source: J. Fuentes / Vera C. Rubin Observatory, NOIRLab/AURA/NSF (CC BY 4.0)

이런 자료에서 주기를 뽑아 보고 "잘 나왔다"고 말하는 것은 쉽다. 어려운 것은 그 말이 언제 참이 아닌지를 아는 일이다. 검증하려면 정답을 아는 사례가 있어야 하는데, 성긴 자료에는 그 정답이 없다. 연구진이 택한 길은 정답을 새로 구하는 대신 이미 가진 정답을 망가뜨려 보는 것이었다.

실험대가 된 것은 2026 DO14라는 소행성이다. 259번 관측됐고, 하룻밤 사이에 한 바퀴를 다 도는 것이 잡혔다. 자전주기는 약 1.9시간, 밝기의 오르내림도 컸다. 이 논문에서 가장 잘 관측된 천체이자, 연구진 스스로 "특히 유리한 검증 사례"라고 못 박은 천체다. 지름 0.1킬로미터에 못 미치는 작은 몸으로 두 시간이 안 되는 주기로 도는 초고속 자전체이기도 하다. 2월 27일 소행성센터로 제출된 묶음은 천체 하나를 259번 찍은 것이 전부였다. 코스모스와 M49 영역을 짧은 간격으로 훑은 고빈도 관측이고, 그 하나가 2026 DO14다. 정답 노릇을 할 표본은 남은 자료에서 골라낸 것이 아니라 다른 방식으로 찍었기에 생겼다.

연구진은 이 소행성의 관측 기록을 세 가지 손잡이로 깎아냈다. 전체 관측 기간에 시간 덩어리를 몇 개 놓을 것인가(두 개, 세 개, 네 개), 그 창을 얼마나 넓게 열 것인가(반폭 0.008일에서 0.014일, 대략 12분에서 20분), 그리고 그 안에서 몇 개를 남길 것인가. 마지막 값은 30으로 고정했다. 퍼스트룩 논문이 밴드당 최소 관측 수로 삼았던 바로 그 숫자다.

핵심은 세 손잡이 가운데 사진 장수만 고정돼 있었다는 점이다. 남기는 개수가 늘 30으로 같으니, 결과가 달라진다면 그것은 사진을 몇 장 찍었느냐 때문이 아니라 며칠에 걸쳐 몇 번 나눠 찍었느냐 때문이다. 자료를 더 모아서는 알 수 없고, 오직 가진 자료를 깎아 봐야 알 수 있는 것을 겨냥한 설계다.

깎아낸 자료마다 무작위로 열 번씩 다시 뽑아 주기를 계산했고, 원래 값의 ±10% 안에 들어오면 복원에 성공한 것으로 셌다. 열 번은 많은 횟수가 아니다. 논문도 그 점을 미리 밝힌다. 복원 비율을 정확한 확률이 아니라 대략의 눈금으로 읽어야 한다는 단서다.

2

두 계산법은 성긴 자료를 다르게 견딘다

주기를 구하는 계산법은 하나가 아니다. 이 논문은 성격이 다른 둘을 나란히 돌렸다. 하나는 고차 푸리에 방식으로, 밝기 곡선의 모양을 자유롭게 따라가도록 항의 개수를 통계 검정으로 정한다. 유연한 대신 자료가 부족하면 진짜 주기의 두 배나 절반을 정답으로 착각하기 쉽다. 다른 하나는 다중 밴드 롬-스카글 방식으로, 곡선의 모양을 2차로 고정하는 대신 네 가지 색 필터(g·r·i·z)의 밝기를 하나의 공통 주기로 묶어 한 번에 맞춘다. 자유도를 줄여 헤매지 않게 만든 쪽이다.

깎아낸 자료를 두 계산법에 각각 먹인 결과가 아래 표다. 칸의 숫자는 열 번 시도해 참값 근처로 되돌아온 횟수다.

사진 30장은 그대로 두고, 나눠 찍은 방식만 바꿨을 때의 복원 성공 횟수 고차 푸리에 방식 롬-스카글 방식 창 반폭(일) 0.008 0.010 0.012 0.014 0.008 0.010 0.012 0.014 덩어리 2개 0 1 3 9 6 3 7 8 덩어리 3개 1 3 10 10 5 7 8 10 덩어리 4개 10 9 10 10 10 10 8 10 열 번 시도해 참값 1.9시간의 ±10% 안으로 되돌아온 횟수. 남긴 사진은 어느 칸에서나 30장으로 같다.
Carruba 외(2026) 부록 표 C.7의 값을 옮긴 것이다. 창 반폭 0.008일은 약 12분, 0.014일은 약 20분에 해당한다.

표를 세로로 읽으면 방향이 보인다. 왼쪽 블록의 맨 위 칸, 그러니까 덩어리가 둘뿐이고 창도 가장 좁은 조건에서 푸리에 방식은 열 번 모두 빗나갔다. 같은 조건에서 롬-스카글 방식은 여섯 번 맞혔다. 넷으로 늘리면 두 방식 모두 거의 매번 정답 근처로 돌아온다. 사진은 내내 30장이었다.

논문이 결론에 쓴 문장은 여기서 나온다. 푸리에 방식으로 믿을 만한 주기를 얻으려면 시간 덩어리가 적어도 셋은 있어야 한다. 자전주기가 1.9시간인 천체를 20분짜리 창 두 개로만 들여다보면, 곡선의 어느 구간을 봤는지가 우연에 맡겨진다. 덩어리를 늘리는 일은 관측 횟수를 늘리는 일이 아니라 위상을 골고루 훑는 일이다.

두 방식을 함께 돌린 이유도 여기 있다. 연구진은 둘의 결과를 대조해 신뢰 여부를 판정하는 상위 절차를 두었다. 조건은 넷이고 하나라도 어긋나면 그 천체의 주기는 적지 않는다.

  • • 두 계산법 가운데 적어도 하나가 유효한 주기를 내놓아야 한다.
  • • g·r·i 세 필터 가운데 둘 이상에서 각각 30회 넘게 찍혀 있어야 한다.
  • • 밝기의 오르내림 폭이 0.1등급을 넘어야 한다. 신호가 잡음에 묻히지 않았다는 뜻이다.
  • • 둘 다 값을 냈다면 두 주기의 차이가 10% 안이어야 한다.

이 네 가지는 퍼스트룩 논문이 쓰던 기준을 그대로 가져온 것이다. 새로운 것은 기준 자체가 아니라, 두 계산법을 맞대는 절차로 묶고 자료를 성기게 깎아 가며 그 기준이 언제 무너지는지를 확인해 둔 부분이다. 논문은 그 일치조차 과신하지 말라고 각주로 덧붙인다. 두 방식은 같은 측광 자료를 쓰고 자전에 대한 가정도 일부 공유하므로, 결과가 맞아떨어지는 것은 서로 다른 구현이 어긋나지 않았다는 확인일 뿐 편향이 없다는 증거는 아니다. 같은 대목에서 반대쪽 이야기도 한다. 두 방식은 푸리에 차수를 고르는 방법도 밝기 보정 절차도 다르므로, 그렇게 다른 경로를 거쳐 같은 값에 닿았다면 그 값이 한쪽 구현의 버릇에서 나왔을 가능성은 그만큼 줄어든다는 것이다.

3

같은 기준을 실제 관측에 걸어 보면

연구진은 이 절차를 2026년 2월과 4월에 소행성센터로 제출된 루빈 관측 자료에 걸었다. 2월분은 후보 84개, 4월분은 56개로 출발했다. 그 84개를 세는 과정에도 판단이 한 번 있었다. 자료가 적은 묶음에서 천체를 미리 잃지 않으려고 두 밴드 30회라는 문턱을 2월 9일·16일·27일 묶음에 한해 10회로 낮춰 보았는데, 2월 9일에서만 후보가 311개 더 걸렸다. 광도곡선을 열어 보니 전부 성겨 주기를 믿을 수 없었고, 연구진은 그 묶음에 대해 완화를 도로 거뒀다. 남은 84개는 2월 3일자 23개, 12일자 60개, 27일자 1개를 합한 수다. 결과는 2월에 16개, 4월에 20개가 남았다. 둘을 합치면 초기 후보 140개 가운데 36개, 약 26%다. 2월 쪽은 84개 중 68개가 떨어져 탈락률이 81%에 이른다.

초기 후보 140개 가운데 신뢰 기준을 통과한 36개 전체 140 36 (26%) 104 탈락 2월 84 16 68 탈락 (81%) 4월 56 20 36 탈락 (64%) 신뢰 기준 통과
2월·4월 두 차례 자료의 초기 후보 수와 신뢰 기준 통과 후 남은 수. 막대 길이는 천체 수에 비례한다.

떨어진 이유는 대체로 같다. 광도곡선이 성기거나, 관측이 한두 시간대에 몰렸거나, 주기 스펙트럼에 가짜 봉우리가 섞였거나, 측광 품질 자체가 나빴다. 또 푸리에 방식이 진짜 주기의 두 배 되는 값으로 빠지는 일이 네 천체에서 확인돼, 곡선의 봉우리를 하나로 제한해 다시 계산해야 했다. 한 예로 2010 TA205는 제한 없이 돌렸을 때 약 6.692시간이 나왔지만, 제한을 걸자 약 3.346시간으로 내려와 롬-스카글 값 3.343시간과 맞아떨어졌다.

논문이 담담하게 내놓은 숫자 하나가 눈에 걸린다. 통과한 36개의 평균 관측 횟수는 286회에 표준편차 180이었다. 퍼스트룩에서 자전주기를 성공적으로 얻은 76개의 평균은 290회에 표준편차 110이었다. 사실상 같은 값이다.

성긴 자료에서도 주기를 뽑는 방법을 세우는 것이 이 논문의 목표였는데, 정작 기준을 통과한 천체들은 예전과 비슷한 밀도로 관측된 것들이었다. 방법이 요구량을 낮춰 준 것이 아니라, 방법이 요구량을 드러내 준 셈이다. 무엇을 통과시킬지 정해 두지 않았다면 이 숫자는 나오지 않았을 것이다. 논문도 결론에 이를 한 줄로 남겼다. 초기 루빈 자료에서 발목을 잡는 것은 방법이 아니라 자료의 질이다.

26%라는 비율이 루빈 천문대의 앞날을 말해 주는 것도 아니다. 이 관측은 시험 가동 기간에 서로 다른 전략으로 모인 것이라, 본 임무가 시작되면 관측이 더 길고 고르게 쌓여 통과 비율이 오를 것으로 논문은 본다. 다만 얼마나 오를지는 앞으로의 자료를 받아 봐야 알 수 있는 일이라며 이번 범위 밖으로 미뤄 두었다. 통과율을 성과로 읽지 말라는 단서가 결과 문장과 결론 양쪽에 따로 들어 있다.

남은 36개에서 무엇이 나왔는지도 함께 볼 만하다. 두 시간이 안 되는 주기로 도는 초고속 자전체가 2026 DO14 말고도 다섯 개 더 확인됐다. 반대쪽 끝에는 대조군 성격의 사례가 있다. 소행성 3021 루쿠브라티오의 주기는 12.08시간으로 계산됐는데, 광도곡선 데이터베이스에 실린 기존 값은 12.09시간이다. 정답이 알려진 천체에서 값이 맞아떨어진 것은 절차가 제대로 돌아간다는 확인이 된다.

4

논문은 어긋난 자리를 숨기지 않는다

주기 다음은 색이다. 소행성의 표면이 무엇으로 덮여 있는지는 필터별 밝기의 차이로 어림잡는다. 지금까지 이런 분류는 대체로 g·r·i 세 필터에 기대 왔고, 그 경우 탄소질 계열과 규산염 계열을 가르는 정도가 한계였다. 이번 논문은 여기에 z 필터를 더했다. 파장 1마이크로미터 근처의 흡수 특징에 민감한 자리라, 세 필터만으로는 겹쳐 보이던 성분이 갈라진다.

까다로운 점은 소행성이 도는 동안 밝기가 계속 변한다는 것이다. 필터를 갈아 끼우며 찍은 사진은 같은 순간의 것이 아니므로, 그대로 빼면 색이 아니라 자전이 섞여 나온다. 연구진은 네 필터를 하나의 공통 주기로 묶고 필터마다 밝기 차이만 따로 두는 모델을 써서 자전의 몫을 먼저 걷어낸 뒤 색을 구했다. 그렇게 25개 천체에 분류를 붙였다. D형 5개, S형 5개, L형 10개, X형 4개다.

이 대목에서 논문이 하는 일이 평범하지 않다. 결과를 내놓은 자리 바로 옆에 그 결과가 어디서 어긋나는지를 함께 적었다.

  • • 문헌과 맞춰 볼 수 있던 두 건이 모두 달랐다. 기존 분류가 있는 천체는 셋뿐이었고 직접 비교가 가능한 것은 둘이었다. 92048은 이번에 D형으로 나왔으나 문헌은 S형이고, 2015 MA122는 L형으로 나왔으나 문헌은 S형이다.
  • • 분류 이전에 색부터 벌어졌다. 분류가 아니라 색지수를 문헌과 맞춰 볼 수 있던 천체는 일곱이었고, 그 가운데 넷이 0.1등급 넘게 달랐다고 논문은 밝힌다. 가장 크게 벌어진 것도 92048로 0.28등급이다.
  • • 다른 정보도 같은 쪽을 가리켰다. 92048은 표면이 빛을 되비추는 정도가 중간쯤인데, 이 값은 D형이라는 이번 판정을 받쳐 주지 않는다. 연구진은 자기 분류 쪽이 불확실하다고 인정했다.
  • • 두 계산법이 한 천체에서 갈렸다. 2017 SC180은 롬-스카글 쪽에서 S형, 푸리에 쪽에서 C형으로 나왔다. 반사 스펙트럼의 모양은 양쪽 다 S형에 가까워 보인다는 관찰까지 함께 달려 있다.
  • • 표본이 겹치지 않았다. 2월 자료에서 푸리에 방식으로 주기를 확정한 천체는 넷인데, 그 가운데 분류까지 붙은 것은 둘이다. 나머지 둘은 z 필터로 찍힌 적이 없어 색을 구할 수 없었다.
문헌과 직접 비교 가능했던 두 천체, 둘 다 어긋났다 92048 D형 (이번 분석) ≠ S형 (문헌) 2015 MA122 L형 (이번 분석) ≠ S형 (문헌) 기존 분류와 직접 비교할 수 있었던 천체는 이 둘뿐이며, 둘 다 어긋났다.
페블러스 원본 도식 — Carruba 외(2026) 6.3절 서술을 그대로 옮겼다.

이렇게 어긋난 것을 자료가 성긴 탓으로만 돌릴 수도 없다. 문헌과 색을 맞춰 본 천체 가운데 성기게 찍히지 않은 것은 2015 MA122 하나뿐인데, 분류가 어긋난 두 건에 하필 그 하나가 들어 있다. 논문은 이 건을 넓은 대역의 밝기만으로 분류할 때 원래 있는 겹침 탓으로 본다. 가장 잘 관측된 2026 DO14조차 i 필터의 반사율이 D형에서 기대되는 값보다 낮게 나왔고, 자전의 잔여 효과로는 설명되지 않아 원인을 미결로 남겼다.

그래서 논문은 이번 분류를 확정이 아니라 후보로 부른다. 외부 자료와 맞춰 본 확인들이 "견고한 검증을 이루지 못한다"고 본문에 적었고, 결론에서도 같은 말을 되풀이한다. 자료가 성길 때 무엇이 흔들리는지를 아는 쪽이 결과를 몇 개 더 늘리는 쪽보다 낫다는 판단이 문장마다 배어 있다.

한 가지 더. 이번 절차는 완전 자동이 아니다. 후보를 걸러내는 과정에 사람이 광도곡선과 주기 스펙트럼을 직접 눈으로 보고 판단하는 단계가 들어 있다. 논문은 이 대목을 한계로 적으면서, 대규모 처리를 하려면 이 단계를 객관적인 품질 지표로 대체해야 한다고 다음 과제로 넘겼다. 분석에 쓴 코드는 깃허브에 공개돼 있다.

5

페블러스가 이 논문을 주목하는 이유

지금부터는 이 논문을 데이터 품질의 눈으로 다시 읽는다.

데이터 품질 현장에서 가장 자주 듣는 말은 데이터가 부족하다는 말이다. 그런데 그 말을 듣고 되물으면 대개 다음 대답이 막힌다. 얼마나 있어야 충분한가. 부족하다는 판단의 기준은 어디서 나왔는가. 지금 가진 것으로 어디까지 주장할 수 있는지를 실제로 확인해 본 적이 있는가. 이 세 물음에 답이 없는 상태에서 "부족하다"는 말은 느낌이지 진단이 아니다.

이 논문이 한 일은 그 세 물음에 순서를 준 것이다. 새 관측을 기다리는 대신 정답을 아는 표본 하나를 깎아 내려가며, 답이 무너지기 시작하는 지점을 먼저 찾았다. 그러고 나서 그 지점을 기준으로 삼아 실제 자료를 걸렀다. 통과한 것과 떨어진 것이 나뉘었고, 떨어진 104개에 대해서는 주기를 적지 않았다. 아무것도 적지 않는 것이 잘못 적는 것보다 낫다는 판단이 절차로 굳어 있다.

데이터 진단에서 우리가 하는 일도 형태가 같다. 라벨이 맞았는지를 곧바로 묻기 전에, 이 라벨이 어떤 지침으로 누구 손에서 어떤 순서로 붙었는지를 먼저 본다. 그 조건이 기록돼 있으면 틀린 라벨은 고칠 수 있고, 기록돼 있지 않으면 맞는 라벨조차 믿을 근거가 없다. 모델을 학습시키기 전에 "이 데이터로 어디까지 말할 수 있는가"를 계량으로 정하는 일은 일정표에서 가장 먼저 밀려나지만, 밀려난 만큼 나중에 되돌아온다.

통제된 축소 실험은 그 계량을 만드는 가장 값싼 방법이기도 하다. 잘 갖춰진 표본을 골라 깎아 보면 새 데이터를 한 건도 모으지 않고 최소 조건을 얻는다. 몇 건이 필요한가만 묻는 것이 아니라, 어떻게 흩어져 있어야 하는가까지 물을 수 있다는 점이 특히 그렇다. 이 논문에서 사진 장수는 30으로 고정돼 있었고 결과를 가른 것은 그 30장이 며칠에 걸쳐 몇 번으로 나뉘었는가였다. 데이터가 모자란 것과 데이터가 한쪽에 쏠린 것은 다른 문제이고, 흔히 앞의 이름으로 뒤의 사정이 불린다.

루빈 천문대는 페블러스가 전에도 들여다본 곳이다. 이 천문대가 매일 밤 쏟아 낼 알림을 무엇을 믿고 골라 볼 것인가는 따로 다룬 적이 있고, 관측 장비를 쏘아 올리기 전에 탐지 한계를 미리 계산해 둔 사례도 한 번 소개했다. 세 이야기가 겹치는 자리는 하나다. 자료가 쌓이는 속도보다 그 자료로 무엇을 말해도 되는지를 정하는 속도가 늘 느리고, 그 간격에서 잘못된 확신이 자란다.

그러니 남는 질문은 이렇게 된다. 우리 데이터는 정말 부족한가. 아니면 부족함의 경계를 아직 측정해 보지 않았을 뿐인가. 앞이라면 더 모으면 되고 뒤라면 더 모아도 달라지지 않는다. 둘을 구분하는 데에는 새 데이터가 아니라 이미 가진 데이터를 깎아 볼 하루가 필요하다.

여기까지 읽어 주셔서 감사하다. 이 글이 따라간 논문은 arXiv:2609.29841에서 전문을 볼 수 있고, 바탕이 된 퍼스트룩 논문은 ApJL에 실려 있다. 여러분의 조직에서 "데이터가 부족하다"고 쓰인 문서를 찾았다면, 그 판단의 근거가 어느 실험에서 나왔는지 한 번 열어 보시고 이야기를 나눠 주시면 좋겠다.

R

참고문헌