Executive Summary

이 글은 스노클AI가 9월 22일 발표한 시리즈 E 투자 유치를 읽는다. 받은 돈은 3억 5,000만 달러이고, 그 과정에서 인정받은 회사 값은 35억 달러다. 열일곱 달 전 시리즈 D에서 1억 달러를 받으며 매겨졌던 13억 달러의 세 배에 가깝다. 그런데 이 발표에서 성격을 정하는 대목은 금액이 아니라 무엇을 팔아서 번 돈인가에 있다. 이 회사는 본래 데이터에 라벨을 자동으로 붙여 주는 소프트웨어를 팔았다. 지난 1년 사이 파는 물건을 바꿨다. 완성된 데이터셋과 강화학습 환경, 평가 과제를 직접 만들어 납품한다.

회사가 내건 숫자는 연환산 매출 3억 7,500만 달러다. 지난 1년 사이 18배가 됐다는 설명이 붙어 있는데, 두 숫자를 나누면 1년 전 출발점은 2,000만 달러 남짓이다. 배수가 커 보이는 이유의 절반은 기저가 작았다는 데 있다. 연환산 매출이라는 말도 함께 읽어야 한다. 이 값은 12개월 동안 실제로 들어온 돈이 아니라 최근 실적을 1년치로 환산해 놓은 숫자다.

1절부터 3절까지는 회사 발표문과 테크크런치 보도에 적힌 내용이다. 4절은 거기서 이 글이 끌어낸 해석이다.

주요 수치

출처: 스노클AI 발표문(2026-09-22)과 테크크런치 보도. 배수 두 개는 이 글이 두 발표 수치를 나눈 값이다.

35억 달러

시리즈 E에서 인정받은 회사 값

열일곱 달 전 시리즈 D 때는 13억 달러였다. 그때 받은 돈은 1억 달러다

3억 7,500만 달러

회사가 밝힌 연환산 매출

12개월 동안 받은 돈이 아니라 최근 실적을 1년치로 환산한 값이다. 발표문은 이번 주에 이 선을 넘었다고 밝혔다

약 2,100만 달러

18배라는 설명의 출발점

3억 7,500만을 18로 나눈 값이다. 1년 전 이 회사의 연환산 매출이 그쯤이었다는 계산이다

약 9배

회사 값을 연환산 매출로 나눈 배수

35억을 3억 7,500만으로 나누면 9.3이 나온다. 연환산 매출이 그대로 1년 매출이 된다는 전제가 깔린 배수다

1

도구를 팔던 회사가 완성품을 팔기 시작했다

스노클AI는 스탠퍼드 AI 연구실에서 4년 동안 진행된 연구를 들고 2019년에 상용 제품을 냈다. 공동 창업자이자 최고경영자인 알렉스 랫너가 그 연구를 이끌었다. 회사가 오래 팔아 온 것은 소프트웨어였다. 고객이 가진 데이터에 사람이 일일이 라벨을 붙이는 대신, 규칙과 모델로 라벨을 자동으로 붙이게 해 주는 도구다. 데이터를 만드는 일은 고객의 몫으로 남고, 그 일을 빠르게 해 주는 연장을 파는 구조였다.

스노클AI 공동 창업자이자 최고경영자 알렉스 랫너의 인물 사진
▲ 스탠퍼드 AI 연구실에서 시작된 연구를 이끌고 2019년 스노클AI를 창업한 알렉스 랫너 | Source: 스노클AI 발표문

이 구조에서는 팔 수 있는 값이 고객의 역량에 갇힌다. 연장을 쥐여 줘도 어떤 라벨이 옳은지 정할 수 있는 사람이 고객 쪽에 없으면 일이 진행되지 않는다. 소프트웨어 값은 자리 수와 사용량으로 정해지는데, 정작 어려운 부분인 판단은 고객이 떠안은 채로 남는다. 회사가 1년 사이에 바꾼 것이 바로 그 경계다. 지금 스노클AI가 파는 것은 연장이 아니라 결과물이다. 전문가가 손을 댄 완성된 데이터셋, 모델을 훈련시킬 강화학습 환경, 모델의 실력을 확인할 평가 과제를 회사가 직접 만들어 납품한다. 랫너의 발표문 기준으로 이 사업은 시작한 지 곧 1년이 된다.

고객으로는 프런티어 연구소와 하이퍼스케일러, 신생 모델 기업, 특정 산업에 특화한 AI 기업, 일반 기업, 그리고 미국 정부 기관이 발표문에 나열돼 있다. 테크크런치는 이 성장을 떠받치는 것으로 고급 학습 데이터에 대한 AI 연구소들의 식지 않는 식욕을 꼽았다. 이번 투자는 인사이트 파트너스와 S32가 공동으로 이끌었고, 기존 투자자인 애디션과 라이트스피드, 그레이록, GV, 웰스파고가 함께 들어왔다.

팔 것만 바뀐 것이 아니라 만드는 방식도 다르다. 테크크런치는 이 회사의 방식을 혼합형이라고 짚었다. 사람 전문가를 중개하는 장터로만 움직이지 않는다. 자사 소프트웨어와 모델로 데이터를 합성해 낸 다음 그 옆에 도메인 전문가를 붙인다. 사람이 처음부터 끝까지 만드는 구조가 아니라 기계가 초안을 뽑고 사람이 판정하는 구조다. 전문가에게 나가는 돈의 크기가 경쟁사와 다르게 잡히는 이유도 여기에 있다.

스노클AI의 매출 곡선이 꺾인 자리는 새 기술이 나온 시점이 아니라 파는 물건의 단위를 바꾼 시점이다. 라이선스를 팔 때는 고객이 몇 명이 쓰느냐가 값을 정하지만, 데이터셋을 팔 때는 그 데이터가 얼마나 어렵고 얼마나 많으냐가 정한다. 같은 회사가 같은 기술로 전혀 다른 크기의 매출을 올리게 되는 지점이 거기다.

2

창업자가 붙인 이름, 데이터 1.0과 데이터 2.0

랫너는 이번 투자 유치를 알리는 글의 제목을 "데이터 2.0, 그리고 AI 데이터의 연구 시대"로 달았다. 그 안에서 AI 학습 데이터 시장을 두 단계로 갈라 놓는다. 앞 단계인 데이터 1.0은 "전부 물량에 관한 것이고, 대체로 인력 배치와 물류의 문제"다. 뒤 단계인 데이터 2.0은 "지극히 복잡하고 정밀하게 겨냥된 고품질 데이터를 어떤 차례로 먹일 것인가의 문제이며, 일차적으로는 연구와 기술의 문제"다.

같은 글은 이 구분을 거리에 빗대 다시 말한다. "첫 구간은 더 단순한 데이터의 물량이 끌고 가고, 마지막 구간은 더 복잡한 데이터의 품질이 끌고 간다." 모델이 쉬운 문제를 이미 다 풀어 버린 뒤에는 사람 손을 몇 배로 늘려도 성능이 움직이지 않고, 어려운 문제를 정확히 겨냥한 소수의 데이터만이 남은 차이를 만든다는 주장이다.

랫너는 이 구분을 코딩 데이터로 풀어 놓는다. 몇 해 전만 해도 대형 언어 모델은 코드 자동 완성조차 겨우 했고, 그래서 필요한 것은 사전 학습에 넣을 대량의 원시 코드, 그리고 지도 학습과 사람 선호 학습에 쓸 대량의 쉬운 코딩 문제와 코드 선호 라벨이었다. 지금은 여러 코딩 영역에서 모델이 사람을 넘어서는 수준에 다가서 있다. 그래서 쓸 만한 코딩 데이터와 강화학습 환경이 갖춰야 할 조건을 랫너는 다섯 가지로 적었다. 선임 엔지니어가 며칠이나 몇 주를 붙들고도 헤맬 만한 개발 과제에 가까울 것, 제품 규모의 결과물을 두고 미묘한 목표와 보상 신호를 담아낼 것, 모델이 틀리는 지점을 분포로 겨냥할 것, 모델이 규칙을 우회하거나 속이려 드는 시도를 견딜 것, 그리고 수백 가지 품질 검사를 통과할 것이다.

같은 패턴이 법률과 금융, 생물학에서도 나타난다. 예전에는 기본적인 챗봇 문답 과제나 선호 라벨을 만들어 줄 전문가를 충분한 수만큼 모으면 됐다. 지금 필요한 데이터 한 점은 사람이 며칠에서 몇 주를 들여야 하는 전문가 과제다. 회사 하나를 통째로 흉내 내는 환경이 필요한 경우까지 있다.

그 결론을 랫너는 두 문장으로 못 박는다. "프런티어 데이터는 더 이상 사람의 시간과 인원을 효율적으로 공급하는 것만으로는 풀리지 않는다." 그리고 "AI를 안전하게 측정하고 훈련시킬 데이터와 환경을 만드는 일은 가장 뛰어난 사람 전문가조차 혼자서는 감당하기 어려워지고 있다." 데이터 작업의 병목이 인원 수급에서 판단의 난이도로 옮겨 갔다는 진술이고, 이 회사가 왜 사람을 모으는 대신 데이터를 만들어 파는 쪽을 택했는지에 대한 설명이기도 하다.

이 대목에서 랫너가 오해를 미리 막는다. 연구와 기술의 문제라는 말이 사람을 빼도 된다는 뜻은 아니라는 것이다. 프런티어 데이터는 모델이 아직 모르는 무언가를 겨냥해야 값어치가 생긴다. 순수한 합성 데이터는 모델이 이미 아는 것과 상관이 높을 수밖에 없다. AI가 스스로 만든 데이터로 다시 학습하는 순환에 빠지면 모드 붕괴가 온다. 내놓는 답의 폭이 좁아지는 현상이다. 큰 모델의 능력을 작은 모델로 옮기는 증류를 빼고 나면, 사람이 고리 안에 남아 있는 데이터가 가장 값어치가 크다.

규범적인 이유도 발표문에 함께 있다. 데이터는 AI를 측정하고 사람의 가치와 판단에 맞추는 수단이다. 사람이 한 명도 끼지 않고 만든 데이터라면, 사람의 감독을 통째로 내려놓는 셈이다. 사람을 덜 쓰겠다는 선언이라기보다, 사람이 서 있을 자리를 검수와 판정 쪽으로 옮기겠다는 선언으로 읽어야 하는 대목이다.

2.1회사가 내놓은 증거 한 가지

주장을 받치는 사례로 발표문은 자사의 코딩 데이터 품질 검수 과정을 든다. 코딩 에이전트용 환경과 데이터를 만들 때 사람 전문가의 검수에 더해 수백 개의 전문화된 에이전트를 붙였다. 사람과 시중 대형 언어 모델만으로 검수하던 기준선과 견주어 검수 속도가 50% 넘게 빨라지고 검수 정확도가 15포인트 넘게 올랐다.

여기서 고리가 한 번 더 돈다. 사람이 대규모로 남긴 검수 결과를 다시 약한 지도 신호로 삼아 그 에이전트들을 학습시키고, 그렇게 길러진 에이전트는 전문화되지 않은 프런티어 모델 기준선보다 정확도가 2배 이상 높아진다는 수치가 뒤따른다. 회사는 이 되먹임 구조를 데이터를 위한 재귀적 자기개선 엔진이라고 부르고, 지금까지의 성장을 밀어 온 것이 이 고리라고 설명한다. 그래서 "사람과 AI 에이전트가 서로를 불려 가며 함께 일할 때에만 프런티어의 가속되는 수요를 감당할 수 있고, 앞으로 수십 년 동안 AI 발전의 운전석에 사람을 앉혀 둘 수 있다"는 문장이 나온다.

AI 에이전트와 사람 전문가가 서로를 개선하는 재귀적 자기개선(RSI) 순환 구조 도식 — AI 에이전트가 사람 전문가를 가속하고, 사람 전문가의 피드백이 AI 에이전트를 정제한다
▲ 스노클AI가 설명하는 재귀적 자기개선 순환 — AI 에이전트가 사람 전문가를 가속하고, 사람 전문가의 피드백이 다시 AI 에이전트를 정제한다 | Source: 스노클AI 발표문

이 수치들은 회사가 자기 작업 과정을 자기 기준으로 측정한 값이다. 비교 대상인 기준선의 정의도 회사가 정했고, 제3자가 같은 조건에서 다시 확인한 기록은 공개돼 있지 않다. 숫자를 의심할 근거가 따로 있다는 말은 아니다. 이 숫자가 어디까지 확인된 것인지 표시해 두자는 뜻이다.

구분 자체에 대해서도 한 가지 더 적어 둘 것이 있다. 1.0을 인력과 물류의 문제로, 2.0을 연구와 기술의 문제로 이름 붙이면, 사람을 많이 쓰는 방식으로 성장한 경쟁사들과 자기 회사를 갈라 세우는 효과가 따라온다. 업계 전반의 변화를 서술하는 말인 동시에, 이 회사가 파는 것을 설명하는 말이기도 하다. 둘 중 어느 쪽인지는 이 발표문 하나로는 알 수 없다.

다만 이 주장이 이번에 처음 나온 것은 아니다. 랫너는 10년 전 스탠퍼드에서 연구 과제로 출발할 때의 논지를 같은 글에서 다시 꺼낸다. AI의 발전이 점점 데이터 중심으로 갈 것이므로 데이터 개발은 인력 배치와 크라우드소싱의 문제가 아니라 제대로 된 연구와 기술의 문제로 다뤄져야 한다는 내용이었다. 이번에 바뀐 것은 주장이 아니라 이름이고, 시장이 그 주장 쪽으로 옮겨 왔다는 서술이기도 하다.

3

3억 7,500만 달러를 읽는 법

이번 발표에서 가장 많이 인용된 숫자는 연환산 매출 3억 7,500만 달러다. 이 값을 그대로 연매출로 옮겨 적기 전에 확인할 것이 네 가지 있다.

3.1연환산이라는 단서

연환산 매출은 가장 최근의 한 달이나 한 분기 실적에 12배 또는 4배를 곱해 1년 치로 늘려 놓은 값이다. 12개월 동안 실제로 받은 돈이 아니다. 랫너의 발표문도 이번 주에 이 선을 넘었다고 적었지 지난 1년 동안 그만큼 벌었다고 적지 않았다. 계약이 끊기지 않고 지금 속도가 유지된다는 조건이 붙어야 성립하는 숫자다.

3.218배의 출발점

스노클AI와 테크크런치는 이 매출이 1년 사이 18배가 됐다고 전한다. 3억 7,500만 달러를 18로 나누면 2,100만 달러 언저리가 나온다. 1년 전 이 회사의 연환산 매출이 그 정도였다는 뜻이다. 18배는 큰 배수이지만, 큰 이유의 절반은 나누는 쪽 숫자가 작았다는 데 있다. 같은 회사가 내년에 다시 18배를 하려면 67억 달러를 넘겨야 하고, 그 일이 일어날 것이라고 이 발표문은 말하고 있지 않다.

출발점의 날짜도 마찬가지다. 랫너는 새 데이터 서비스를 시작한 지 1년이 다 돼 간다고 적었다. 그런데 열일곱 달 전 시리즈 D를 알린 2025년 5월 29일 보도자료는 스노클 엑스퍼트 데이터 서비스를 스노클 이밸류에이트와 함께 정식 출시했다고 이미 알렸다. 같은 이름의 상품이 그때 이미 팔리고 있었다면, 1년 전 연환산 매출 2,100만 달러 안에 이 사업의 몫이 얼마간 들어 있었다는 이야기가 된다. 발표문이 말하는 시작이 상품을 내놓은 시점인지 사업의 무게중심을 옮긴 시점인지는, 두 문서를 나란히 놓아도 가려지지 않는다.

3.3두 문장이 측정한 대상이 다르다

같은 18배인데 두 곳의 문장이 조금 다르다. 랫너의 발표문은 새 데이터 사업을 시작한 뒤로 그 사업이 18배 넘게 컸다고 쓴다. 테크크런치는 회사의 연환산 매출이 지난 12개월 동안 18배가 됐다고 쓴다. 새 사업 하나의 성장과 회사 전체 매출의 성장은 같은 숫자로 적힐 수 있지만 같은 말이 아니다. 두 문장이 모두 참이려면 1년 전 회사 매출의 거의 전부가 이미 사라졌거나 무시할 만큼 작았어야 한다. 어느 쪽인지는 공개된 자료에 없다.

3.4회사마다 매출의 뜻이 다르다

테크크런치는 같은 시장의 다른 회사들을 나란히 적어 두었다. 머코어의 총 연환산 매출은 20억 달러에 이르렀고, 핸드셰이크는 올해 초 10억 달러를 넘었으며, 마이크로1은 5억 달러 수준으로 올라섰다. 그런데 같은 기사는 바로 뒤에 조건을 붙인다. "이 회사들은 최상단 매출의 60~70%가량을 실제로 일을 하는 도메인 전문가에게 직접 지급하므로, 실제 순매출은 겉으로 내건 총액보다 상당히 낮다는 점을 유념해야 한다."

스노클AI는 회계 처리가 다르다고 설명한다. 사람의 노동이 아니라 강화학습 환경과 완성된 데이터셋을 팔기 때문에, 전문가에게 나간 돈은 매출이 아니라 매출원가로 잡힌다는 것이다. 이 설명이 맞는다면 스노클AI의 3억 7,500만 달러와 머코어의 20억 달러는 같은 자로 잰 값이 아니다. 앞의 숫자에서는 전문가 비용이 이미 빠져 있고, 뒤의 숫자에서는 아직 빠지지 않았다.

네 가지 확인 사항 중 어느 것도 발표된 숫자가 거짓이라는 근거가 아니다. 다만 이 숫자들은 무엇을 측정한 값인지 표시되지 않은 채로 한 줄에 놓여 비교된다. 데이터를 다루는 회사들의 매출표에서 정의가 서로 다르다는 사실은, 그 자체로 이 시장이 아직 어린 시장이라는 신호로 읽힌다.

4

페블러스가 이 소식을 주목하는 이유

지금부터는 이 발표를 데이터를 다루는 사람의 눈으로 본다.

이번에 값이 매겨진 것은 모델이 아니라 데이터를 만드는 일 자체다. 회사 안에서 그 일은 대개 비용 항목에 들어간다. 모델 도입 예산서를 열면 학습 비용과 호출료는 줄이 잡혀 있는데, 학습에 쓸 데이터를 정리하고 정답을 정하는 일은 담당자의 업무 시간 속에 흩어져 있다. 그 일에 시장이 가격을 매기기 시작했다는 것이 이 발표의 내용이다.

회사 안의 데이터 작업에 랫너의 구분을 그대로 걸어 볼 수 있다. 지금 우리 조직에서 데이터 작업이 막히는 이유는 손이 모자라서인가. 아니면 무엇이 맞는 답인지 정하기가 어려워서인가.

  • • 손이 모자란 문제라면 사람을 더 붙이거나 외주 물량을 늘리면 풀린다. 진행 속도가 투입한 인원 수에 비례해 올라가는지 확인해 보면 구분이 된다.
  • • 답을 정하기 어려운 문제라면 사람을 열 배로 늘려도 풀리지 않는다. 같은 자료를 두고 담당자 두 사람의 판정이 갈리는 일이 자주 생긴다면 이쪽이다.
  • • 뒤쪽에서 모자란 것은 인원이 아니다. 판정 기준, 그 기준을 세울 수 있는 사람, 그리고 같은 판정이 다음에도 똑같이 나오게 만드는 절차가 있어야 한다.

페블러스가 앞서 살핀 이야기들도 같은 자리에 모인다. 라벨링 자체가 값싸지자 몸값이 오른 것은 에이전트를 훈련시키고 채점할 환경이었다. 그 이야기를 한 번 다뤘고, AI 학습 데이터 공급이 소수의 회사로 몰리고 있다는 계산도 따로 살폈다. 이번 발표는 그 두 흐름이 한 회사의 매출표에서 만난 사례다.

그래서 이 소식에서 자기 조직으로 돌아올 때 들고 갈 질문은 세 개면 충분하다. 우리 데이터 작업에서 가장 오래 걸리는 단계가 모으는 일인가 판정하는 일인가. 그 판정을 할 수 있는 사람이 조직 안에 몇 명이고, 그 사람이 자리를 비우면 작업이 멈추는가. 그리고 올해 예산서에서 데이터 준비에 붙은 금액을 한 줄로 뽑아낼 수 있는가.

여기까지 읽어 주셔서 감사하다. 이 글이 인용한 문서는 스노클AI 발표문과 테크크런치 보도에서 직접 볼 수 있다. 여러분의 조직에서 데이터 작업이 막히는 지점이 어느 쪽이었는지, 그리고 그 판단이 맞았는지 이야기를 나눠 주시면 좋겠다.

R

참고문헌