Executive Summary
이 글은 사람 대신 AI가 설문에 답하게 하는 일이 얼마나 정확한지를 묻지 않는다. 그 정확도가 어느 층에서 확인된 것인지를 따라간다. 컬럼비아 경영대의 오데드 네처와 미국 시장조사 회사 TRC 인사이츠의 라잔 샘반담이 9월에 공개한 논문은, 태도 문항 백여 개를 놓고 같은 AI 응답자를 네 가지 다른 잣대로 재 보았다. 네 수가 서로 다른 말을 했다.
가장 무거운 결과는 한 문단 안에 있다. 나이와 성별 같은 인구통계만 알려 준 응답자는 한 사람의 답을 거의 못 맞혔다. 백여 개 문항 가운데 개인 수준 상관이 0.5를 넘은 문항은 없었다. 그런데 사람들을 다 합친 전체 평균은, 같은 분야의 태도 문항까지 물려 준 응답자보다 오히려 잘 맞았다. 두 수 모두 같은 조사에서 나왔고, 둘 다 참이다. 집계값만 들여다보는 검수라면 한 사람도 못 맞힌 트윈에게도 합격을 줄 수 있다는 뜻이다.
그래서 합성 응답을 살 때 물을 것은 정확도가 몇 퍼센트인가가 아니다. 그 수가 네 갈래 가운데 어디에서 나왔는가, 우리가 내릴 결정은 세 층 가운데 어디에 있는가, 둘이 같은 층인가. 세 번째에서 어긋나면 "잘 맞았다"는 말은 참이면서 동시에 우리 결정과 무관해진다. 그리고 이 물음에 답하라고 요구하는 조항은, 이 업계에 이미 와 있는 국제 규범 어디에도 아직 없다.
나이와 성별만 알려 준 AI 응답자가 개인의 답과 맞은 정도
문항 108개 가운데 상관 0.5를 넘긴 것이 하나도 없었다
전체 평균의 오차 — 정보를 덜 준 쪽이 더 작다
같은 자료, 같은 순간에 나온 두 수다
사전 진단을 통과해 AI에게 물어도 되는 문항 수
나머지 62개는 사람에게 다시 물으라고 골라낸 것이다
한국 패널의 성·연령 집단 오차와 아무 정보도 안 쓴 기준선
보정하지 않은 합성 패널이 기준선보다 나빴다
같은 자료에서 두 지표가 반대로 움직였다
먼저 말부터 못 박는다. 이 글의 "디지털 트윈"은 공장 설비나 장기(臟器)를 컴퓨터 안에 똑같이 지어 놓고 돌려 보는 그 트윈이 아니다. 설문에 답할 사람 한 명을 대신해 거대언어모델이 답을 만들어 내게 하는 일, 그리고 그렇게 만들어진 가짜 응답자를 가리킨다. 업계는 이것을 합성 응답자, 합성 소비자, 합성 패널이라고도 부른다. 셋 다 같은 것을 조금씩 다른 각도에서 부르는 이름이고, 이 글은 필요할 때마다 그때그때 알맞은 쪽을 쓴다. 참고로 반대 방향의 문제, 그러니까 사람에게 물은 설문에 사람 아닌 답이 몰래 섞여 드는 쪽은 사람에게 물었는데, 점점 AI가 답하고 있다에서 따로 다뤘다.
출발점은 9월에 공개된 논문 한 편이다. 쓴 사람은 둘인데 서 있는 자리가 다르다. 한 명은 오데드 네처 컬럼비아 경영대 교수이고, 다른 한 명은 사람 표본을 파는 시장조사 회사 TRC 인사이츠의 라잔 샘반담 대표다. 실증 자료는 라이스대 경영대학원의 고객전략연구센터(C-CUBES)가 2025년에 수집한 대규모 조사인데, 현장 수행을 맡은 곳도 바로 그 회사다. 이해관계를 먼저 밝혀 두는 편이 낫겠다. 합성 응답의 한계를 짚는 논문의 공저자가, 합성 응답이 잠식할 시장에서 먹고사는 쪽이다. 논문 자신이 서론에서 그 구조를 먼저 지적한다. 낙관 쪽에 상업적 동기가 있는 것처럼 비관 쪽에도 상업적 이해가 있고, 가장 목소리 큰 회의론이 사람 표본을 업으로 삼는 회사들에서 나온다는 것이다.
조사는 18개 산업 분야에 걸쳐 고객이 무엇을 중요하게 여기는지를 물었다. 응답자는 3,063명이지만 한 사람이 18개 분야를 다 평정한 것은 아니다. 각자 최대 세 분야까지만 답했고, 그래서 한 분야당 실제 응답자는 500명 안팎이다. 태도 문항은 분야마다 6개씩, 모두 108개다. 연구진은 이 자료로 두 가지 조건을 나란히 만들었다. 하나는 나이·성별을 비롯한 인구통계만 알려 준 트윈, 다른 하나는 같은 분야의 나머지 태도 문항 다섯 개까지 물려 준 트윈이다. 그리고 두 조건에서 같은 문항들을 다시 답하게 했다.
결과를 한 표에 놓으면 두 지표가 서로 반대 방향으로 간다. 개인 수준 상관은 트윈에게 정보를 많이 줄수록 크게 올랐다. 반면 사람들을 다 합쳐 문항별 평균을 낸 뒤 실제 평균과 견준 오차는, 정보를 적게 준 쪽이 더 작았다.
| 트윈에게 준 것 | 개인 수준 상관 | 상관 0.5를 넘긴 문항 | 집계 평균 오차 |
|---|---|---|---|
| 인구통계만 | 0.08 | 108개 중 0개 | 0.39 |
| 인구통계 + 같은 분야 태도 문항 5개 | 0.57 | 74.1% | 0.48 |
네처·샘반담(2026) 표 1과 5.2절. 상관은 응답자들의 높낮이 순서를 문항마다 얼마나 맞췄는지를, 집계 평균 오차는 문항별 평균값이 실제 평균에서 얼마나 떨어졌는지를 나타낸다. 오차는 작을수록 좋다.
왼쪽 줄을 읽어 보자. 나이와 성별만 아는 트윈은 한 사람의 답을 사실상 못 맞혔다. 상관 0.08은 거의 0이고, 108개 문항이 전부 0.5 아래였다. 그런데 같은 트윈이 만든 문항별 평균은 실제 평균에서 0.39만큼 떨어져 있었고, 이것은 태도 문항까지 다섯 개나 물려 준 조건의 0.48보다 작다. 정보를 더 준 쪽이 평균에서는 더 멀어진 것이다.
인구통계만 준 조건에서 트윈과 사람 응답의 평균 개인 수준 상관은 0.08이었고, 108개 문항 가운데 상관 0.5를 넘긴 것은 하나도 없었다. 그런데 그 조건의 집계 오차는 0.39로, 인구통계에 태도 문항까지 준 조건보다 오히려 조금 나았다. 한 사람에 대해 아무것도 모르는 트윈도 고객이 받아들일 만한 집계 결과는 만들어 낸다. 네처·샘반담(2026) 5.2절. 원문: "A twin that knows nothing about a person can still produce a topline a client would accept."
이 어긋남은 이 한 조사에만 있는 것이 아니다. 네처와 샘반담이 정리한 바에 따르면, 트윈 연구에서 가장 널리 인용되는 "정확도 75%"라는 수치도 같은 구조 위에 서 있다. Twin-2K-500이라 불리는 대규모 트윈 연구에서, 한 사람의 500문항 기록을 통째로 준 트윈의 적중률은 0.748이었다. 그런데 개인에 대한 정보를 아무것도 주지 않고 만든 "트윈"은 0.734였고, 인구통계 14개만 준 트윈은 0.746이었다. 논문의 표현으로는 온전한 페르소나와 통계적으로 구별되지 않는다. 헤드라인 숫자의 거의 전부가 정보를 아주 조금만 주거나 전혀 주지 않아도 이미 나와 있다는 뜻이다.
세 수가 이렇게 붙어 있는 이유는 척도에 있다고 논문이 적는다. 5점이나 7점처럼 양끝이 막힌 척도에서는 모두에게 한가운데 값을 찍어 주기만 해도 개인 수준 적중률이 0.75 근처에 닿는다. 어떤 답도 중앙에서 멀리 떨어질 수가 없기 때문이다. 같은 비교에서 아무렇게나 찍었을 때의 바닥도 0.629로 이미 높다. 그러니까 0.748이 말해 주는 것은 0.748이라는 크기가 아니라 바닥 위로 올라온 높이이고, 그 높이는 정보를 전혀 주지 않은 조건보다 1퍼센트포인트 남짓 위일 뿐이다.
그러니까 문제는 트윈이 얼마나 정확한가가 아니다. 어떤 잣대로 쟀길래 그 수가 나왔는가다. 다음 절이 그 넷을 하나씩 갈라 본다.
정확도라는 말이 가리키는 네 가지
논문의 두 번째 기여는 정확도라는 한 낱말을 네 개로 쪼갠 것이다. 서로 다른 연구가 서로 다른 것을 재 놓고 모두 "정확도"라고 불렀기 때문에, 거의 완벽에서 거의 우연에 이르는 넓은 편차가 생겼다는 것이 논문의 진단이다. 한쪽 끝에는 생성 모델이 도덕 시나리오 464개에 매긴 점수가 사람들의 평균 판단과 0.95로 맞았다는 보고가 있고, 다른 쪽 끝에는 앞 절에서 본 0.748과 0.734가 있다. 같은 문헌을 읽고도 트윈이 95% 정확하다고, 75% 정확하다고, 우연보다 조금 나을 뿐이라고 각각 결론 내릴 수 있고 세 결론 모두 발표된 근거를 갖는다. 방법의 우열이 아니라 재는 대상의 차이가 그 편차의 상당 부분을 설명할 수 있다.
2.1네 개의 잣대, 세 개의 결정
네 갈래를 가르는 기준은 간단하다. 사람과 트윈을 한 명씩 짝지어 놓고 비교하느냐, 아니면 합쳐 놓고 비교하느냐. 그리고 논문은 여기에 구매자 쪽 잣대를 하나 더 붙였다. 우리가 내리려는 결정이 어느 층에 있느냐다. 아래 표는 그 둘을 한 화면에 놓은 것이다.
| 갈래 | 무엇을 재는가 | 이 갈래만으로 정당한 결정 |
|---|---|---|
| 1. 문항 사이 대응 | 문항·시나리오·연구 사이에서 요약값(대개 평균)이 서로 따라가는지 | 없음 |
| 2. 문항별 분포 비교 | 문항 하나에서 합성 응답과 사람 응답의 분포가 겹치는지 | 1층 — 콘셉트 선별, 평균 지불의사, 수요곡선, 평균 처치효과 |
| 3. 짝지은 개인 정확도 | 사람 한 명의 답과 그 사람 트윈의 답을 1대 1로 | 3층 — 개인화, 트윈을 패널로 쓰기, 개인 단위 결측 보정 |
| 4a. 한 사람 안에서 문항들에 걸친 상관 | 한 사람의 답들이 문항을 건너가며 이루는 모양 | 보조 |
| 4b. 한 문항 안에서 사람들 사이의 상관 | 한 문항에서 누가 더 높게, 누가 더 낮게 답하는지의 순서 | 2층 — 세분화, 타깃팅, 포지셔닝, 차등 가격 |
네처·샘반담(2026) 3절. 2층은 4b에 더해 세그먼트 안에서 따로 계산한 2번 갈래까지 함께 요구한다.
첫 줄의 "없음"이 이 표에서 가장 중요한 칸이다. 모든 합성 응답자에게 똑같은 답을 하게 만들어도, 즉 개인차를 하나도 넣지 않고 인구 전체의 사전 분포만으로 답을 찍어도, 1번 갈래의 상관은 1에 가까워질 수 있다. 문항들의 평균이 높은 순서만 대충 맞으면 되기 때문이다. 그래서 1번 갈래의 수치는 1번 갈래의 주장을 뒷받침할 뿐이고, 개인이나 세그먼트 이야기로 넘어가는 순간 오도한다.
방향도 한쪽으로만 흐른다. 개인을 맞히면 모든 평균이 자동으로 따라온다. 평균이 맞는 것은 개인에 대해 아무것도 말해 주지 않는다. 그래서 논문은 구매자에게 한 문장을 요구한다. 벤더의 정확도 주장이 어느 층에서 성립한 것인지를 물어서 확인하라는 것이다.
2.2바닥을 안 빼면 천장만 보인다
정확도 수치가 부풀려지는 자리는 한 군데 더 있다. 사람도 같은 문항에 두 번 답하면 두 번 다 같게 답하지 않는다. 그래서 트윈의 정확도를 사람 자신의 재검사 일치도로 나눠 "상대 정확도"를 내는 관행이 생겼다. 천장을 인정하는 이 계산 자체는 옳다. 그런데 그 비율은 바닥까지 함께 가려 버린다.
네처와 샘반담이 정리한 바에 따르면, 두 시간짜리 면담을 근거로 만든 생성 에이전트 연구가 그 예다. 따로 떼어 둔 사회조사 문항에서 이 에이전트의 원 정확도는 65.7%였고, 참여자 본인의 2주 뒤 재검사 일치도 79.5%로 나누면 82.6%가 된다. 널리 인용되는 쪽은 뒤의 수다. 그런데 같은 연구에서 인구통계만 준 에이전트는 같은 척도로 74%에 이른다. 천장까지의 거리는 재면서 바닥에서의 거리는 재지 않은 것이다. 논문이 권하는 교정은 양끝을 함께 세우는 쪽이다. 정확도에서 바닥을 뺀 값을 재검사 일치도에서 바닥을 뺀 값으로 나누면 위아래가 같이 묶인다. 재검사 자료가 아예 없는 경우가 더 흔한데, 그때는 바닥 보정만 걸어도 수가 달라진다.
상관계수를 쓸 때도 같은 함정이 있다. 상관은 값을 늘이거나 줄여도 변하지 않기 때문에 크기에 대해서는 침묵한다. 네처와 샘반담이 인용한 예로, 실험 70건의 처치효과를 예측한 한 연구는 상관 0.85를 냈지만 예측된 효과의 크기는 실제의 두 배쯤이었고, 한 실험 안에서 처치 조건들끼리만 비교하면 상관이 0.39로 떨어졌다. 이 연구는 그 뒤 네이처에 실렸는데, 게재본은 사전등록 실험 70건·처치효과 469개·참여자 11만 9,330명으로 보고한다. 방향은 그대로다. 상관은 높고 효과 크기는 과대추정된다.
반대로, 바닥과 천장을 제대로 세우면 낮아 보이던 수가 올라가기도 한다. 같은 논문의 실증에서 태도 문항까지 준 조건의 상관 0.57은 만점 1에 견주면 초라해 보인다. 그런데 이 자료에서 원리상 도달 가능한 상관의 천장은 0.736이다. 0.57은 그 천장의 77%다. 잣대를 어디에 두느냐에 따라 같은 수가 57%로도, 77%로도 읽힌다.
수치에 붙은 정밀도를 읽는 방식에도 함정이 하나 있다. 합성 응답에서는 질의를 몇 번 던질지가 표집의 제약이 아니라 설계의 선택이다. 그래서 질의를 늘리면 통상적인 표준오차는 0을 향해 줄어든다. 값 자체가 틀려 있어도 신뢰구간은 얼마든지 좁게 만들 수 있다는 뜻이고, 논문은 이것을 위험한 정밀도의 착각이라고 부른다. 합성 패널의 결과에 붙은 좁은 오차 막대는 표본이 커서 생긴 것이 아닐 수 있다.
2.3사람들 사이를 가르는 자리에서 가장 크게 틀린다
네 갈래를 갈라 놓고 보면, 평균에서 잘하는 트윈이 개인차에서 무너지는 패턴이 여러 연구에 걸쳐 되풀이된다. 네처와 샘반담이 토대 논문으로 삼은 브랜드·이스라엘리·응웨의 연구는, 미세조정을 거친 모델조차 인구 평균은 근사하면서 소득·성별·정치 성향에 따른 차이는 복원하지 못했고 때로는 뒤집어 놓았다고 보고한다. 벤더의 주장과 입증된 것 사이의 간극이 가장 넓은 자리가 바로 여기라고 논문은 적는다.
모양은 두 가지다. 하나는 퍼짐이 좁아지는 것이다. 트윈의 답은 자기가 대신하는 사람들보다 좁은 범위 안에 몰린다. 다른 하나는 정확도 자체가 사람마다 다른 것이다. 학력이 높고 소득이 높고 정치적으로 중도인 사람일수록 트윈이 더 잘 맞힌다. 두 패턴 모두 평균 정확도 지표에서는 보이지 않는다. 타깃팅에 쓰려는 쪽에서 보면 이것은 고르게 부정확한 것보다 나쁘다. 세그먼트를 비교하는 바로 그 자리에서 도구가 가장 크게 틀리기 때문이다.
퍼짐이 왜 좁아지는지는 학습 데이터 쪽에서 실측한 자료가 따로 있다. 우리가 앞서 쓴 LLM 출력 다양성, 학습 데이터보다 낮았다가 그 기전을 실측으로 다뤘다. 여기서는 결론만 가져온다. 개인차를 복원하려면 개인 단위 자료가 있어야 하고, 인구 전체의 사전 분포에서 개인차로 건너뛰는 지름길은 없다.
여기까지를 묶으면 논문이 도달하는 결론이 하나 있다. 정확도는 트윈이라는 물건에 붙는 성질이 아니라 트윈과 문항이 이루는 한 쌍에 붙는 성질이라는 것이다. 어떤 사람의 브랜드 선호를 잘 되살리는 트윈이 같은 사람의 정치 성향에 대해서는 아무것도 모를 수 있다. 그래서 어떤 제작 방식에 붙은 정확도 한 개는, 평가에 쓴 문항이 밑자료에서 얼마나 멀리 떨어져 있었는지를 함께 밝히지 않으면 읽을 방법이 없다. 유출 문제도 같은 자리에 걸린다. 널리 쓰이는 조사 척도, 교과서에 실린 판단 편향 문항, 오래 반복된 사회조사 문항은 학습 자료에 이미 들어가 있을 확률이 높다. 그런 문항으로 낸 성적은 새 문항에서의 성적을 부풀린다.
그리고 이 결론에서 다음 절의 방법이 곧바로 따라 나온다. 문항과 밑자료 사이의 거리가 정확도를 좌우하고 그 거리를 사람의 답을 받기 전에 잴 수 있다면, 이 트윈에게 이 문항을 맡겨도 되는지는 물어보기 전에 답할 수 있다.
정답지 없이 미리 걸러 내는 진단
논문이 합성 응답에 내주는 자리는 좁고 구체적이다. 조사를 이미 끝낸 뒤에야 "그걸 물어볼걸" 하고 떠오르는 문항, 논문이 "잊힌 문항"이라 부르는 자리다. 사람들에게 다시 물으려면 현장을 다시 열어야 하고, 그 비용 때문에 대개 그냥 묻힌다. 이미 받아 둔 응답으로 트윈을 만들어 그 문항만 대신 답하게 하면 어떨까. 그럴듯하지만 곧바로 벽에 부딪힌다. 그 문항의 정답지가 없으니 잘 맞혔는지 확인할 방법도 없다.
논문의 세 번째 기여가 이 벽을 우회한다. 트윈이 내놓은 답을, 트윈에게 넣어 준 자료만으로 얼마나 되짚을 수 있는지를 랜덤 포레스트로 재는 것이다. 이 값이 높으면 트윈의 답은 그 사람에 대해 받아 둔 자료의 함수라는 뜻이다. 낮으면 트윈의 답이 응답자 자료를 따라 체계적으로 움직이지 않는다는 뜻이고, 그 경우 모델은 자기 일반 지식에서 답을 꺼내 온 것이다. 그 출력은 이 응답자들에 대한 모사로 신뢰해서는 안 된다고 논문은 적는다. 이 계산에는 사람의 답이 한 줄도 들어가지 않는다. 잊힌 문항에 대한 정답지를 모으지 않고도 돌릴 수 있다.
108개 문항에 이 진단을 걸고 기준을 조금씩 올려 가며 남은 문항의 성적을 다시 낸 것이 아래 표다. 왼쪽에서 두 번째 칸을 함께 읽어야 한다.
| 선별 기준 | 남은 문항 | 평균 상관 | 상관 0.5 미만 문항 비율 | 집계 평균 오차 |
|---|---|---|---|---|
| 선별 없음 | 108개 (100%) | 0.57 | 25.9% | 0.48 |
| 진단값 0.5 초과 | 94개 (87%) | 0.59 | 18.1% | 0.48 |
| 진단값 0.6 초과 | 72개 (67%) | 0.62 | 11.1% | 0.42 |
| 진단값 0.7 초과 | 46개 (43%) | 0.65 | 4.3% | 0.32 |
네처·샘반담(2026) 표 2. 평균 상관은 남은 문항들의 개인 수준 상관을 평균한 값이고, 오차는 문항별 평균의 절대오차다.
"잘 못 맞히는 문항이 25.9%에서 4.3%로 줄었다"는 문장은 이 표의 맨 윗줄과 맨 아랫줄에서 나온다. 두 수를 나란히 놓는 순간 트윈이 여섯 배쯤 좋아진 것처럼 읽히지만, 그런 일은 일어나지 않았다. 4.3%는 108개 가운데 남은 46개 안에서의 비율이다. 나머지 62개는 사라진 것이 아니라 "사람에게 새로 물어야 하는 문항"으로 따로 표시된 것이다. 진단이 한 일은 트윈을 개선한 것이 아니라 트윈에게 묻지 않을 문항을 미리 골라낸 것이다. 논문 스스로도 이것을 두 추정량 사이의 선택이 아니라 아예 물을지 말지를 정하는 가부 결정이라고 적었다.
그 대가를 표가 함께 보여 준다는 점이 좋다. 성적이 오른 칸 옆에 남은 문항이 절반 아래로 줄어든 칸이 나란히 있다. 정확도를 올린 것이 아니라 정확도를 보장할 수 없는 영역을 잘라 낸 것이므로, 잘린 넓이가 곧 이 방법의 비용이다.
진단 자체의 한계도 논문이 먼저 적어 둔다. 이 값은 필요조건이지 충분조건이 아니다. 모델이 주어진 자료를 잘 활용하면서도 결과를 틀리게 예측할 수 있기 때문이다. 실제로 진단값과 개인 수준 상관의 상관은 0.61에 머문다. 같은 방향을 가리키지만 같은 것을 재지는 않는다.
한 가지 덧붙일 것이 있다. 연구진은 같은 판단을 사람에게도 시켰다. TRC 인사이츠의 마케팅 연구원 16명에게 108개 중 18개 문항을 보여 주고, 트윈이 응답자의 답을 되살릴 수 있을지에 대한 확신을 0에서 100 사이로 매기게 했다. 사람의 확신과 기계의 진단값은 0.87로 일치했다. 논문의 결론은 기계가 사람을 이겼다가 아니다. 한쪽이 비쌀 때 다른 쪽으로 갈음할 수 있고, 판돈이 클 때는 둘 다 돌려 서로를 검증할 수 있다는 것이다. 다만 전문가 쪽 수치는 18문항에서만 나온 값이라 정밀도가 낮으니 조심해서 받아들이라고 논문이 스스로 단서를 달았다.
논문은 잊힌 문항에서 한 걸음 더 나간다. 같은 논리가 더 크고 더 값나가는 자리에도 적용된다는 것인데, 저자들은 그 자리를 잊힌 단계라고 부른다. 학술 연구나 국가 통계는 한 질문을 제대로 보기 위해 여러 단계를 차례로 밟는다. 상업 조사에서는 그런 일이 거의 없다. 예산과 일정 때문에 조사는 대개 한 단계, 많아야 두 단계로 끝난다. 정성 탐색은 줄거나 생략되고, 가격대는 시험 대신 감으로 정해지고, 문안은 예비 조사 없이 현장에 나가고, 속성 목록은 자료가 아니라 회의에서 확정된다. 여기서 잘려 나가는 것은 고객이 돈을 내고 사는 최종 조사가 아니다. 그 최종 조사를 더 낫게 만들었을 준비 단계들이다.
합성 응답이 놓일 자리가 여기라고 논문은 본다. 문안 스무 개를 다섯 개로 줄이고, 그럴듯한 가격 범위를 잡고, 속성 목록이 말이 되는지 보고, 설문지가 문항 순서나 표현에 흔들리지 않는지 눌러 보는 일이다. 판돈이 작고 반복이 많고 방향만 맞으면 되는 종류의 일이라, 방향은 맞히면서 크기는 놓치는 도구에 잘 맞는다. 예비 점검이 어긋나도 뒤따르는 사람 조사가 잡아 주기 때문에 오차가 결정까지 흘러가지 않는다. 이렇게 놓으면 합성 응답은 사람 조사와 같은 예산을 놓고 다투지 않는다. 예산이 이미 지워 버린 단계를 되살리는 쪽이 된다.
수치 하나를 정확히 옮겨 둔다. 논문 초록은 이 선별이 평균 상관을 15% 올렸다고 적었는데, 표의 두 값(0.57과 0.65)으로 계산하면 14.0%다. 논문은 이 차이를 따로 설명하지 않는다. 반올림 전의 값으로 계산했을 가능성이 커 보이지만 확인하지 못했으므로, 이 글은 두 수를 섞지 않고 표의 값을 쓴다.
의견이 가장 갈리는 문항이 목록에서 빠진다
앞 절의 표는 몇 개가 떨어졌는지만 말한다. 이 글이 가장 무겁게 보는 것은 무엇이 떨어졌는지다. 논문은 그 목록을 한 문단으로 밝혀 놓았고, 각주에 한 줄을 더 달아 놓았다. 두 대목을 따로 읽으면 어느 쪽이든 오독이 되기 때문에 함께 옮긴다.
진단값 0.7 기준이 떨어뜨리는 문항을 들여다보면, 답할 수 없는 항목은 체계적으로 제공된 태도 자료에 가장 덜 닿아 있는 항목이다. 우리 자료에서는 특히 다양성·형평·포용의 중요도를 묻는 항목들이 그랬는데, 이 항목들은 여러 분야에 걸쳐 트윈의 실제 정확도가 낮았고 진단값 자체도 불안정했다. 네처·샘반담(2026) 4.3.1절
진단값은 매우 높은데 상관은 낮은 두 개의 이상치 문항은 안전에 관한 문항과 다양성·형평·포용에 관한 문항이다. 이는 선행 연구가 보고한 고정관념과 이념 편향을 반영한 것일 수 있다. 네처·샘반담(2026) 각주 10
두 문장은 어긋나지 않는다. 같은 문항군이 두 갈래로 갈린다는 뜻이다. 대체로는 진단에서 떨어져 나가고, 일부는 높은 진단값을 달고 통과한 다음 실제로는 틀린다. 진단이 가장 잘 듣지 않는 자리와 트윈이 가장 못 맞히는 자리가 겹쳐 있는 것이다.
왜 하필 그 문항들인가. 다양성이나 안전의 중요도를 묻는 항목은 사람마다 답이 가장 크게 갈리는 항목이다. 같은 나이, 같은 소득, 같은 분야의 소비 습관을 가진 두 사람이 이 문항에서는 정반대로 답할 수 있다. 그리고 그 갈림은 트윈에게 물려 준 인접 태도 문항에 잘 담기지 않는다. 사람들이 서로 가장 다르게 답할 문항이 곧 트윈이 개인차를 살리지 못하는 문항이다.
정상 작동하는 경우와 견주면 차이가 선명하다. 잊힌 문항이 스트리밍 서비스 가격 부담의 중요도일 때, 트윈의 답은 같은 분야의 인접 항목에 압도적으로 끌려간다. 그 사람이 콘텐츠 선택권과 화질을 얼마나 중요하게 여긴다고 답했는지가 답을 거의 결정하고, 인구통계는 거의 기여하지 않는다. 이것이 이 방법이 잘 듣는 모양이다. 물어보지 않은 것을 이미 물어본 것들 사이에서 보간하는 일. 보간할 이웃이 없는 문항에서 이 방법은 할 일이 없다.
구매자 입장에서 이 사실은 뒤집어 읽어야 값이 나온다. 사전 진단을 돌렸다는 말은 안심할 근거가 아니라, 어떤 문항이 진단을 통과하지 못했는지를 받아 볼 근거다. 빠진 목록이 우리 의사결정의 핵심 문항과 겹친다면 그 조사는 사람에게 다시 물어야 한다. 합성 응답을 쓸지 말지는 그다음 문제다.
정체성이 얽힌 문항에서 합성 응답자가 무너지는 모양은 우리가 8월에 다룬 정체성 두 개를 준 합성 응답자가 하나만 썼다에서 한 번 본 적이 있다. 그 글이 다룬 것은 페르소나에 정체성을 둘 이상 넣었을 때 모델이 하나만 반영하는 현상이었다. 이번 논문의 자료는 다른 방식으로 같은 방향을 가리킨다.
한국어로 물었을 때 없던 차이가 새로 생겼다
지금까지의 자료는 전부 미국 것이고 영어로 물은 것이다. 한국어로, 그것도 빠르게 변하는 소비 영역에서 같은 일을 하면 어떻게 되는가. 7월에 공개된 프리프린트 한 편이 그 자리를 짚었다. 서울사이버대와 성균관대에 적을 둔 연구자 두 사람이 쓴 이 논문은 아직 심사를 통과하지 않았다. 학술지 서식으로 작성돼 있고 논문 식별자 자리가 아직 비어 있다. 그래서 이 절의 수치는 프리프린트의 수치로 읽어야 한다.
검증 대상은 엔비디아가 공개한 한국어 합성 페르소나 데이터셋이다. 연구진은 이 페르소나를 두 모델에 물려 각각 8,000개 규모의 가상 패널을 만들고, 성별과 연령으로 층을 나눈 뒤 미디어 서비스 이용 지표 여덟 개를 답하게 했다. 정답지는 정보통신정책연구원의 한국미디어패널조사다. 2010년부터 같은 가구와 개인을 해마다 다시 찾아가는 추적조사이고, 2024년 조사는 4,006가구 8,693명을 대상으로 했다. 논문은 2024년과 2025년 두 해분을 썼다.
결과에서 눈을 붙들어야 할 줄은 세 번째다. 성별과 연령으로 나눈 집단마다 따로 맞혀 보게 했을 때의 오차와, 집단을 아예 나누지 않고 전체 가중 평균 하나만 모든 칸에 써 넣었을 때의 오차를 나란히 놓은 줄이다.
| 조건 | 제미나이 | 엑사원 |
|---|---|---|
| 전체 오차 (2024년) | 17.1%p | 15.0%p |
| 성·연령 집단별 오차 | 18.9%p | 15.9%p |
| 집단을 안 나눈 전체 평균 기준선 | 11.6%p (두 모델 공통) | |
| 집단 사이 오차 격차 | 52.4%p | 36.2%p |
| 연령 회귀로 보정한 뒤 | 8.6%p | 6.7%p |
| 보정에 쓴 실제 자료로 그냥 직접 추정 | 3.6%p (두 모델 공통) | |
김·조(2026) 프리프린트, 표 7 및 본문. 단위는 퍼센트포인트이고 작을수록 좋다. 전체 평균 기준선은 여덟 개 지표 전체에 걸쳐 가중 전체 평균 하나만을 모든 칸의 예측값으로 쓴 경우다. 집단 사이 오차 격차는 인구 대비가 가장 어긋나는 10대 칸을 빼고 다시 재면 제미나이 42.2%p, 엑사원 32.6%p로 줄어든다. 나머지 지표의 크기와 순서는 그대로다.
세 번째 줄과 두 번째 줄을 비교해 보자. 페르소나가 만들어 낸 집단 구조는, 집단 구조를 아예 쓰지 않은 것보다 나빴다. 논문의 설명은 명확하다. 페르소나가 틀린 변이를, 그러니까 고정관념에서 온 없는 차이를 집어넣기 때문이다. 이것이 앞 절들과 다른 층위의 문제다. 개인차가 지워지는 것은 정보를 잃는 일이다. 없던 개인차가 새로 생기는 것은 없는 정보를 얻었다고 믿게 되는 일이다.
단서를 함께 읽어야 공정하다. 연구진은 같은 페르소나에서 서사를 떼어 내고 성별과 나이만 준 조건도 따로 돌려 봤는데, 그쪽의 집단별 오차는 22.3%p와 22.8%p로 더 컸다. 페르소나에 붙은 서사가 아무것도 보태지 않은 것은 아니다. 다만 보태고 난 뒤에도 집단을 아예 나누지 않은 쪽에는 미치지 못했다.
가장 뚜렷한 사례는 "AI 이용" 지표다. 두 모델 모두 나이가 어릴수록 이용률을 크게 부풀렸고, 그 부풀림이 연령대를 따라 매끄럽게 줄어든다. 제미나이는 10대를 71%p 과대추정했고 70대 이상에서는 2%p에 그쳤다. "젊을수록 AI를 더 쓴다"는 통념을 각 연령대에 고르게 얹어 놓은 모양이다. 방향이 반대인 사례도 있다. 같은 모델이 60대의 OTT 이용률은 64%p나 낮게 잡았다. 논문은 이 지표에서 문항을 "OTT 서비스"라는 말로 짧게 물었을 때 합성 응답이 무너졌다고 따로 적어 두었는데, 다만 사람을 대상으로 한 대조 문면이 없어 이것은 모델의 문면 민감성을 보인 것이지 사람 기준의 타당도 회복을 보인 것은 아니라고 저자들이 스스로 단서를 달았다.
보정을 걸면 오차는 내려간다. 그런데 그 보정에 쓰는 것은 실제 조사 자료다. 같은 자료를 보정에 쓰지 않고 그냥 직접 추정에 쓰면 오차가 3.6%p로 더 내려간다. 합성 패널이 남는 자리는 실제 자료가 거의 없거나 어떤 집단이 통째로 비었을 때뿐이라는 뜻이다. 게다가 보정은 다음 해로 넘어가지 않는다. 1년 차를 두고 적용하면 오차가 14%p 대로 되돌아간다. 논문은 이것을 앞을 내다보는 타당도가 아니라 같은 시점 안에서의 오차 감소라고 부른다.
왜 하필 한국의 소비 영역인가. 저자들은 자기 결과가 미국 여론에 대한 긍정적 보고들과 모순되지 않는다고 본다. 정치 태도는 학습 자료에 풍부하게 담겨 있고 천천히 변한다. 반면 비영어권 시장에서 빠르게 변하는 기술 수용 행동은 문화적 대표성이 얇은 데다 변화 속도까지 빨라, 고정관념과 문면 집착이 지배하기 딱 좋은 조건이 된다는 것이다. 합성 패널의 타당도는 거대언어모델 일반의 성질이 아니라 영역과 지역에 따라 달라진다는 결론이 여기서 나온다.
이 논문이 검증한 데이터셋은 우리가 4월에 소개한 Nemotron-Personas-Korea 그 데이터셋이다. 그 글은 이 페르소나를 "대체가 아닌 보완"으로 소개했고, 이번 논문이 그 문장에 숫자를 붙인 셈이다. 숫자 하나만 조심하면 된다. 4월 글에 나오는 11.6%는 다른 논문(arXiv:2509.10127)에서 심층 페르소나 조건화가 정확도를 향상시킨 폭이고, 이 절의 11.6%p는 이번 프리프린트에서 아무 정보도 쓰지 않은 기준선의 오차다. 우연히 같은 숫자일 뿐 서로 다른 논문의 다른 지표이고, 방향도 반대다.
마지막으로 이 결과가 무엇에 대한 증거이고 무엇에 대한 증거가 아닌지를 적어 둔다. 이 연구가 쓴 페르소나는 개인 단위의 실제 응답 기록에 묶여 있지 않다. 즉 앞 절들이 말한 세 번째 유형의 트윈이 아니라, 집단 수준 페르소나에 가깝다. 그래서 이 수치를 개인 단위 자료로 만든 어떤 상용 제품의 성적으로 옮기면 틀린다. 여기서 말할 수 있는 것은 하나다. 앞 절의 분류가 예측한 실패, 그러니까 집단 수준 페르소나로 세그먼트를 가르려 할 때 생기는 실패가 한국어 자료에서 실제로 나타났다는 것. 참고로 저자들은 분석 코드와 집계 결과를 공개 저장소에 올려 두었다. 다만 개인 단위 원자료는 제공 기관의 신청 절차를 거쳐야 해서 패키지에서 빠져 있다.
규범은 이미 와 있다
여기까지의 요구가 업계 바깥의 잔소리처럼 들릴 수 있다. 그렇지 않다. 시장조사 업계에는 이미 국제 규범이 있고, 그 규범은 2025년에 합성 데이터를 정식 항목으로 받아들였다. 다만 그 규범이 요구하는 선은 공시까지다.
국제상업회의소(ICC)와 시장조사 업계 단체 에소마(ESOMAR)가 함께 두는 국제 코드는 이 업계의 사실상 헌법이다. 직전 개정이 2016년이었으니 9년 만의 손질이고, 코드 스스로 이번 개정이 윤리적 처신과 책임, 투명성, 그리고 사람의 감독 필요성을 강조한 중요한 개정이라고 적었다. 눈에 띄는 것은 용어 정의다. "개인"이라는 말을 합성·가상 페르소나와 구별하기 위해 사람을 가리키는 말로 다시 정의했고, 합성 데이터와 합성 페르소나를 각각 따로 정의했다. 정의에 들어갔다는 것은 규범의 사정거리 안에 들어왔다는 뜻이다.
의무 조항은 넷이다. 아래는 코드 본문을 옮긴 것이다.
| 조항 | 요구하는 것 |
|---|---|
| 제4조 (a) ii | 자료 수집에 합성 페르소나를 쓴다면 조사 시작 시점에 대상자에게 분명히 알려야 한다 |
| 제7조 (e) | AI를 비롯한 신기술을 쓸 예정이면 고객에게 알려야 하고, 여기에는 합성 데이터와 합성 페르소나의 사용이 포함된다. 그런 경우 사람의 감독 범위를 명시해야 한다 |
| 제7조 (g) | 요청이 있으면 고객이 자료 수집과 자료 준비의 품질에 대한 독립 점검을 주선하도록 허용해야 한다 |
| 제9조 (b) | AI나 합성 데이터가 표집·실행·분석·해석에 중요한 역할을 했는지, 사람의 감독이 어느 정도였는지를 공시해야 한다 |
ICC/ESOMAR 국제 코드 2025년판. 코드 본문은 무료로 공개돼 있다. 2025년 개정 이전 판은 2016년판이다.
네 조항을 나란히 놓으면 공통점이 보인다. 전부 밝히라는 요구다. 합성 페르소나를 쓴다고 알릴 것, 사람의 감독 범위를 적을 것, 공개할 때 합성 데이터의 역할을 공시할 것, 요청이 오면 독립 점검을 허용할 것. 정확도 주장이 네 갈래 가운데 어디에서 세워졌는지를 밝히라는 조항은 코드 전문을 훑어도 나오지 않는다. 제7조 (g)의 독립 점검조차 문면상의 대상이 자료 수집과 자료 준비의 품질이라, 정확도가 어느 층에서 성립했는지를 따지는 일까지 포함하는지가 분명하지 않다.
규범 쪽 소식이 하나 더 있다. 시장조사 서비스 요구사항을 정한 국제표준 ISO 20252의 새 판이 2026년 9월에 나왔다. 2019년판은 폐지됐고 전환 기간은 3년이다. 새 판에는 AI를 어느 단계에 썼는지 기술하고 고객에게 알리고 버전을 기록하라는 취지의 조항이 들어갔다고 알려져 있다. 다만 표준 원문은 유료라 직접 확인하지 못했다. 이 새 판이 합성 응답자를 어떻게 다루는지는 이 글에서 단정하지 않는다.
6.1국내에서 팔리는 것들, 그리고 회사가 스스로 그은 선
한국에도 이미 제품이 있다. 하나가 아니라 적어도 셋이다. 아래 표의 셋째 칸은 각 사업자가 스스로 공개한 것만 적은 것이고, 공개하지 않은 검증이 없다는 뜻은 아니다.
| 사업자 | 무엇을 내놓았는가 | 공개한 검증 |
|---|---|---|
| 오픈서베이 | 데이터스페이스 '합성 소비자와 대화'(7월) · '컨셉 스튜디오' 클로즈드 베타(8월) | 기존 데이터와 분포 비교 · 별도 AI 검증 단계로 논리가 맞지 않는 응답 걸러 내기 · 답변의 근거 있음과 없음을 구분해 표시 |
| 마크로밀 엠브레인 | AI 합성서베이 파일럿(6월) | 조사 유형 네 가지를 사람 패널과 대조한 파일럿 결과를 스스로 공개 |
| ManyPerson | AI 여론 시뮬레이션 서비스 | 확인하지 못했다 |
먼저 회사들이 스스로 그어 둔 선을 적는다. 오픈서베이는 4월에 올린 웨비나 정리 글에서 합성 패널의 위험을 셋으로 꼽으면서 첫 번째를 "분산 붕괴"라고 이름 붙였다. 거대언어모델이 평균적인 사람은 그럴듯하게 만들지만 실제 집단 안의 다양한 응답 패턴은 심하게 과소 재현한다는 것이다. 이 글의 앞 절들이 퍼짐이 좁아지는 현상이라고 부른 바로 그 문제를, 회사가 자기 언어로 먼저 이름 붙인 셈이다. 같은 글에서 "99%의 정확도를 기대하기보다 80%의 정확도로도 충분히 활용할 수 있는 쓰임새를 찾는 것이 현실적"이라고도 적었고, 제품 소개에서는 합성 소비자를 실제 패널의 대체재가 아니라 리서치 앞단의 1차 선별 도구로 규정했다. 파는 쪽이 먼저 낮춰 잡은 기대치다.
엠브레인은 6월에 파일럿 결과를 먼저 공개했다. 브랜드 인지와 상기, 실제 소비 행동, 인식, 그리고 자극물 평가라는 네 유형을 사람 패널과 대조했더니, 브랜드 인지도와 실제 소비 행동 문항에서는 사람과 AI 응답 사이에 유의미한 차이가 나타났고 신제품 콘셉트와 네이밍 같은 자극물 평가에서는 두 응답의 차이가 비교적 작았다. 회사 임원은 이것을 두고 모든 조사를 대체하는 도구가 아니라 특정 조사 유형에서 쓸 수 있는 보조 수단이라고 말했다. 회사 스스로 파일럿 테스트라고 불렀고 층별 성적을 따로 내지는 않았으므로, 이것을 검증이라고 부를 수는 없다.
검증이 원리적으로 불가능한 것도 아니다. 다만 사례가 있는 쪽은 다른 기술이다. 실제 설문 자료로 학습한 통계 모델이 응답자를 증강하는 방식에는 구글, 로레알과 프랑스 여론조사기관, 유고브 등이 참여한 독립 검증 사례가 여럿 공개돼 있다. 거대언어모델로 개인의 답을 만들어 내는 이 글의 방식과는 다른 기술이고, 그 검증들이 확인한 것도 전부 분포 비교, 그러니까 앞 표의 1층에 해당한다.
여기까지가 사실이다. 조문도, 표준의 발행도, 세 사업자의 제품과 공개 자료도 확인할 수 있는 문서에 적혀 있다. 한 가지 덧붙이면, 이 논문에 대한 국내 매체 보도는 찾지 못했다. 찾지 못했다는 것이지 없다는 뜻은 아니다.
아래는 해석이다. 지금 비어 있는 것은 규범이 아니라 규범과 논문 사이의 한 칸이다. 코드는 합성 데이터를 썼다는 사실을 밝히라고 요구하고, 논문은 그 정확도가 어느 층에서 성립했는지를 밝히라고 요구한다. 앞의 요구는 계약서에 적을 수 있고 뒤의 요구는 아직 그럴 자리가 없다. 국내 제품들은 4월부터 8월 사이에 차례로 나왔고 이 글이 빌려 쓴 잣대는 9월에 공개됐다. 순서로 보면 물건이 먼저고 잣대가 나중이다. 그래서 지금 이 물음을 계약서에 넣을 수 있는 쪽은 규범 기구가 아니라 사는 쪽이다. 제7조 (g)가 열어 둔 독립 점검의 자리에 무엇을 점검해 달라고 적을지는, 적어도 당분간은 구매자가 정한다.
페블러스 관심의 이유
이해관계를 먼저 밝힌다. 페블러스는 데이터 품질 검증을 하는 회사다. 합성 응답의 검증이 비어 있다고 지적하는 글은 우리에게 유리한 쪽으로 기운다. 그래서 아래 세 대목은 제품 이야기가 아니라, 앞 절들이 보인 구조가 우리 실무에서 어떤 모양으로 다시 나타나는지에 대한 것이다.
7.1합격 점수가 무엇에 대한 합격인지
1절이 보인 것은 한 지표의 합격이 다른 지표의 합격을 뜻하지 않는다는 사실이다. 개인을 전혀 모르는 트윈이 집계 평균에서 더 낮은 오차를 냈다. 두 수는 서로 다른 잣대를 댄 결과이고, 어느 쪽도 틀리지 않았다.
데이터 품질 작업에서 반복해 만나는 것이 같은 모양이다. 데이터셋 하나에 붙는 품질 점수는 대개 전체에 대한 한 수다. 결측률, 라벨 일치도, 분포 적합도. 그 수가 좋다는 것은 그 수가 재는 것에 대해서만 좋다는 뜻이다. 소수 집단의 라벨이 어긋나 있어도 전체 일치도는 거의 움직이지 않는다. 학습이 그 집단에서 실패할 때, 실패는 전체 점수가 아니라 그 집단 안에서만 보인다. 그래서 점수는 값보다 먼저 물어야 할 것이 있다. 몇 개를 어떤 단위로 냈는가.
7.2없는 차이를 만들어 내는 쪽이 더 비싸다
5절의 한국 실측에서 가장 무거운 줄은 오차의 크기가 아니었다. 보정하지 않은 합성 패널이 집단 수준에서 아무 정보도 안 쓴 전체 평균보다 나빴다는 것이고, 그 이유가 페르소나가 틀린 변이를 집어넣기 때문이라는 것이다. 지워진 차이는 자료를 조용하게 만들고, 없던 차이는 자료를 틀린 쪽으로 또렷하게 만든다. 대가는 뒤쪽이 더 크다.
합성 데이터의 품질을 재는 자리에서 이 구분은 거의 항상 빠진다. 분포가 원본과 닮았는지는 재고, 닮지 않은 방향으로 얼마나 자신 있게 틀렸는지는 재지 않는다. 그래서 합성 데이터 성적서에 한 줄을 더할 수 있다면, 그것은 원본과 얼마나 비슷한가가 아니라 원본에 없는 구조를 얼마나 집어넣었는가 쪽이다.
7.3요구할 수 있는 검사에는 이름이 있다
이 글이 실무자에게 남기는 것은 경고가 아니라 이름 붙은 검사 네 개다. 전부 논문에 적혀 있고, 전부 만든 쪽이 이미 가진 자료로 돌릴 수 있다.
- 정보 없는 바닥과 비교한 값. 무작위로 찍기, 척도 중앙값으로 통일하기, 빈 페르소나, 인구통계만 준 조건. 이 가운데 하나라도 함께 보고하지 않은 정확도는 능력을 재지 않는다.
- 한 문항 안에서 사람들 사이의 순서를 맞췄는가. 세그먼트 판단이 걸린 결정이라면 이것이 최소 요건이다.
- 집단별로 따로 낸 정확도. 평균 정확도 하나로는 어느 집단에서 크게 틀리는지가 보이지 않는다.
- 틀린 사람 트윈 시험. 각 트윈을 다른 사람의 기록으로 다시 지어 보고, 맞는 사람 기록으로 지은 트윈과의 차이를 본다. 그 차이가 곧 이 제품이 개인에 대해 실제로 아는 양이다.
네 검사가 새 자료를 요구하지 않는다는 점이 중요하다. 갈래들은 서로 다른 자료를 쓰는 것이 아니라 같은 자료를 다르게 묶을 뿐이다. 그래서 "검증 비용이 많이 든다"는 대답은 적어도 이 네 항목에 대해서는 성립하지 않는다.
요구할 자리도 이미 계약 안에 있다. 6절에서 본 국제 코드 제7조 (g)는 요청이 있으면 고객이 독립 점검을 주선하도록 허용하라고 적었다. 다만 그 문면의 대상은 자료 수집과 준비의 품질이다. 위 네 검사를 그 점검 목록에 넣자고 말하는 일은 아직 사는 쪽의 몫이다.
페블러스가 여기서 내세울 수 있는 것은 많지 않다. 한 데이터셋에 점수 하나를 붙이는 대신, 점수를 무엇의 단위로 몇 개 낼지를 먼저 정하는 일을 다뤄 봤다는 것 정도다. 데이터클리닉의 진단은 데이터셋 전체 등급과 함께 클래스별·구간별 성적을 따로 남긴다. 그것이 이 글과 우리가 닿는 자리의 전부다.
확인하지 못한 것도 적어 둔다. 국제표준 ISO 20252의 새 판은 원문이 유료라 열지 못했고, 6절의 서술은 2차 요약에 기댄 것이다. 국내 한 제품이 생성 규모의 상한을 600명 남짓으로 밝힌 근거가 원본 기록 수인지 계산 비용인지도 공개 자료에서 찾지 못했다. 이 논문을 다룬 국내 매체 보도 역시 찾지 못했는데, 이것은 없다는 뜻이 아니라 우리가 못 찾았다는 뜻이다. 긴 글 읽어 주셔서 감사하다.
참고문헌
목록은 네 묶음이다. 1번과 2번은 이 글의 뼈대가 된 논문 두 편으로, 둘 다 전문을 직접 읽고 옮겼다. 3번은 그중 한 편의 재현 패키지다. 4번부터 12번까지는 두 논문이 인용한 선행 연구인데, 원문을 확정하지 못한 항목에는 재인용 표시를 달았고 본문에서도 그런 값은 "네처와 샘반담이 정리한 바에 따르면"이라는 전달 구문으로 낮춰 썼다. 13번부터는 규범 문서와 국내 업계 자료, 그리고 이 글이 이어 붙인 우리 글이다.
학술
- 1.Netzer, O., & Sambandam, R. (2026). "Synthetic Data in Marketing Research: How to Evaluate and When to Trust." arXiv:2609.13995 (v1 2026-09-12, v2 2026-09-19). 전문 열람. arxiv.org/abs/2609.13995
- 2.Kim, H., & Cho, K. T. (2026). "Distributional Validity and Calibration of a Korean Synthetic Persona Panel for Digital and AI Service Use: A Secondary-Data Validation Against the Korea Media Panel Survey." arXiv:2608.28615 (v1 2026-07-23). 심사를 거치지 않은 프리프린트. arxiv.org/abs/2608.28615
- 3.위 논문의 재현 패키지. github.com/howardkim1977/persona-validation-repro (MIT), Zenodo 스냅숏 doi 10.5281/zenodo.21397425. 개인 단위 원자료와 API 키는 패키지에서 제외돼 있다.
- 4.Ashokkumar, A., Hewitt, L., Ghezae, I., & Willer, R. (2026). "Large language models can predict the results of social science experiments." Nature 656(8126), 115–122. doi 10.1038/s41586-026-10742-x. 본문의 상관 0.85는 1번 논문이 인용한 값이다. 게재본의 표본 규모는 본문 2.2절에 적었다.
- 5.Brand, J., Israeli, A., & Ngwe, D. (2026). "Using LLMs for Market Research." 1번 논문이 토대로 삼은 연구. [재인용 — 원문 미확정]
- 6.Toubia, O. 외 (2025). Twin-2K-500 대규모 트윈 연구. 정보 없는 바닥 0.734의 출처. [재인용]
- 7.Peng 외 (2026). 트윈 응답의 퍼짐 축소와 응답자 집단별 정확도 차이. [재인용]
- 8.Park 외 (2026). 면담 기반 생성 에이전트. 원 정확도 65.7%, 재검사 일치도로 나눈 값 82.6%. [재인용]
- 9.Kinzinger & Hartmann (2026). 트윈 응답 210만 건 분석. 추론 모드가 특정 갈래의 정확도만 올린다는 보고. [재인용]
- 10.Miller (2026). 틀린 사람 트윈 시험과 최빈 응답 바닥. [재인용]
- 11.Mittal, V., & Tsiros, M. (2025). 라이스대 C-CUBES 조사(응답자 3,063명)의 원 문헌. [재인용]
- 12.Morris 외 (2025). 합성 데이터를 여론·설문 데이터의 대체재로 "써서는 안 된다"는 업계 필자들의 결론. [재인용]
규범·표준·통계
- 13.ICC/ESOMAR (2025). International Code on Market, Opinion and Social Research and Data Analytics. 직전 개정은 2016년. 전문 열람. standards.esomar.org
- 14.ESOMAR (2025). 5 Topics of Discussion to Help Buyers of Augmented Synthetic Data. 구매자용 지침. [부분 — 요지만 확인, PDF 원문 미열람]
- 15.ESOMAR (2024). 20 Questions to Help Buyers of AI-Based Services. [부분]
- 16.ISO 20252:2026. 시장·여론·사회조사 용어 및 서비스 요구사항. 2026년 9월 발행, 2019년판 폐지, 전환 3년. AI 사용에 관한 조항 포함. [부분 — 2차 요약, 표준 원문 유료]
- 17.정보통신정책연구원. 한국미디어패널조사. 2024년 조사는 15차년도, 4,006가구 8,693명. 2번 논문이 정답지로 쓴 2024~2025년 자료다.
- 18.Fairgen 계열 통계식 합성 증강에 대한 제3자 검증 사례(구글, 로레알·IFOP, 유고브, GIM, Dig Insights). 전부 홀드아웃 표본 검정이며, 이 글이 다루는 거대언어모델 방식과는 다른 기술이다. [부분 — 벤더 공개 자료 경유]
국내 업계·보도
- 19.오픈서베이 공식 블로그. "AI가 만든 응답자, 믿어도 될까?" (2026-04-29). 분산 붕괴·사회적 바람직성 편향·대표성 부재 세 가지와 신뢰도 기준 셋을 회사가 직접 정리한 글. blog.opensurvey.co.kr
- 20.오픈서베이 공식 블로그. 컨셉 스튜디오 소개. 푸드 다이어리 기반, 한 응답자 단위로 최대 120개 문항 연결, "실제 패널을 대체하는 것이 아니라 리서치 앞단의 1차 스크리닝 도구".
- 21.전자신문 (2026-04-08). AI 합성패널 출시 예고. "LLM이 답변 분포도 평균에 수렴하는 답변을 생성하는 오류를 줄이기 위해 기존 데이터와 분포도를 비교하는 데 집중했다."
- 22.디지털투데이 (2026-07-09). 데이터스페이스 합성 소비자 대화 기능 출시. 근거 있는 답변과 추론한 답변을 구분해 제시한다는 설명.
- 23.AI타임스 (2026-09-24). 오픈서베이 이건노 CTO 인터뷰. 개인정보 처리 세 단계, 최대 600여 명 규모, 별도 AI 검증 단계, 품질 평가 프레임워크 구축의 필요성. aitimes.com
- 24.마크로밀 엠브레인 보도자료 (2026-06-25, 뉴스와이어). AI 합성서베이 파일럿 테스트 결과. 6.1절 표의 셋째 칸과 본문에 옮긴 회사 임원 발언의 출처다.
페블러스 인접 글
- 25.페블러스. "Nemotron-Personas-Korea — 한국 AI 자립의 출발점". report/nemotron-personas-korea-2026-04
- 26.페블러스. "정체성 두 개를 준 합성 응답자가 하나만 썼다". report/synthetic-persona-intersectional-collapse
- 27.페블러스. "LLM 출력 다양성, 학습 데이터보다 낮았다". report/llm-training-data-diversity-gap
- 28.페블러스. "사람에게 물었는데, 점점 AI가 답하고 있다". blog/ai-survey-contamination-social-science