Executive Summary
이 글은 2026년 9월 28일 arXiv에 올라온 논문 한 편을 읽는다. 워싱턴대 정보대학 연구진이 옥스퍼드대와 스탠퍼드대, 조지타운대, 텍사스대 오스틴 연구자들과 함께 쓴 「Right Words, Wrong Moment」다. 18~25세 158명이 자기 챗GPT 대화 이력을 그대로 넘겨 1만 9,930건이 모였고, 연구진은 그중 급성 고통이 드러난 다섯 건을 골라 임상의 열 명에게 건넸다. 임상의들은 읽기만 한 것이 아니라 챗GPT의 응답을 턴 단위로 다시 썼다. 2027년 CHI에 실린다.
임상의 열 명 가운데 애초에 답하지 말았어야 했다고 말한 사람은 없었다. 아홉 명은 챗GPT가 쓴 문구를 두고 자기도 그렇게 말하겠다고 했다. 그 대신 임상의들은 일곱 가지 과정상 실패를 짚었고, 그중 셋에는 열 명 전원이 동의했다. 묻지 않고 안다고 단정하기, 탐색하기 전에 해법부터 꺼내기, 누구에게나 똑같이 읽힐 조언을 길게 늘어놓기다. 어떤 말을 했는지가 아니라 그 말을 언제 했는지가 문제였다는 뜻이다. 임상의의 평가 가운데 이 논문의 틀을 그대로 요약하는 문장이 있다. "AI can be correct in advice but still therapeutically unhelpful."
1절부터 4절까지는 논문이 보고한 내용이다. 5절은 그 보고를 데이터를 다루는 사람의 눈으로 다시 읽은 이 글의 해석이다.
주요 수치
출처: Wang 외. (2026). arXiv:2609.35953.
1만 9,930 → 5
전체 대화에서 심층 사례까지
세 번 숙독해 과제 대화를 걷어내고 고통이 짙은 77건을 추린 뒤 다섯 건을 골랐다
7가지
임상의가 짚은 과정상 실패
열 명 전원이 동의한 항목이 셋, 아홉 명이 동의한 항목이 셋이다
46%
챗GPT 메시지 중 18~25세 비중
OpenAI 집계를 논문이 인용했다. 이 연령대가 쓰는 방식이 서비스 전체를 좌우한다
14개
업로드 때 자동으로 지운 식별자 범주
이름·나이·주소·연락처 등. 민감한 대화를 연구에 쓸 수 있게 만든 조건이다
챗GPT가 한 말은 대체로 맞았다
정신건강과 챗봇을 함께 다룬 글은 대개 챗봇이 틀린 말을 한 자리를 모은다. 이 연구는 그 자리를 찾지 못했다. 임상의 열 명 가운데 챗GPT가 애초에 답하지 말았어야 했다고 말한 사람은 한 명도 없었다. 열 명 중 아홉은 구체적인 문구를 들어 가며 긍정했다. 자해를 털어놓은 참가자에게 챗GPT가 내놓은 첫 응답을 두고 한 임상의는 "110점 만점에 110점"이라고 평했다. 성폭력 피해를 꺼낸 참가자에게 "당신 잘못이 아니다"라고 한 대목을 두고는 자기가 할 말과 똑같다는 평가가 나왔고, 또 한 사람은 AI에게서 기대하지 못했던 수준의 타당화라고 적었다.
인정은 접근성에도 걸렸다. 새벽 네 시에 열려 있는 상담 창구는 없다. 논문이 분석한 대화 가운데 하나는 새벽 시간대를 가로질러 네 시 사십오 분경까지 이어졌다. 그 시간에 응답하는 상대가 있었다는 사실 자체를 임상의들은 깎지 않았다.
그래서 이 연구가 재는 대상이 기존 연구와 갈린다. 지금까지 챗봇의 정신건강 응답을 평가한 연구는 대체로 질문 하나와 답변 하나를 짝지어 채점했거나, 연구자가 만든 시나리오를 모델에 입력해 응답을 받았다. 이 연구는 청년들이 실제로 주고받은 대화 전체를 시간 순서대로 놓고, 임상의에게 "이 대화는 어디서 어긋났는가"를 물었다. 평가의 단위가 답변 한 개에서 대화가 흘러간 과정으로 옮겨 간 셈이다. 조언 자체는 맞을 수 있어도 치료적으로는 도움이 안 될 수 있다. 앞에서 인용한 임상의의 문장은 바로 이 전환을 두고 한 말이다.
이 연령대를 고른 이유는 논문 서두에 있다. 챗GPT 전체 메시지 가운데 거의 절반인 46%가 18~25세에서 나온다는 것이 OpenAI 자체 집계다. 그리고 2026년 미국에서 청년 다섯 명 가운데 한 명이 슬프거나 화나거나 불안하거나 스트레스를 받을 때 이런 대화형 AI에 의지한다고 답했다. 설문에 응한 158명 가운데 39.9%는 PHQ-4 기준으로 고통군에 속했다.
그 고통군이 챗GPT를 쓰는 방식은 나머지와 달랐다. 정서적 몰입(d=+0.40)과 행동 변화(d=+0.44) 두 항목에서 고통군의 점수가 유의하게 높았고, 다중비교 보정을 거쳐도 살아남았다. 신뢰와 자기효능감은 같은 방향이었으나 보정에서 탈락했다. 눈에 걸리는 항목은 마지막 하나다. 의존을 걱정하는 정도에서는 두 집단 사이에 차이가 없었다. 더 깊이 몰입하고 조언대로 더 많이 움직이면서도, 그것을 걱정하는 쪽으로는 기울지 않았다는 뜻이다.
열여덟 낱말로 끝난 대화 하나
다섯 건이 어떻게 남았는지부터 보는 편이 낫다. 연구진은 2024년 11월부터 2026년 3월까지 들어온 참가 의향 2,068건을 네 가지 조건으로 걸렀다. 18~25세일 것, 최근 2주 동안 챗GPT를 열 번 이상 썼을 것, 주로 영어로 썼을 것, 대화 이력 전체를 내보내 넘길 뜻이 있을 것이다. 그렇게 추려진 158명에게서 1만 9,930건이 모였다. 첫 저자가 사용자 메시지를 전부 한 번 읽었고, 두 번째 읽기에서 이 자료에서 가장 흔한 쓰임인 과제 대화를 걷어내 5,549건이 남았다. 세 번째 읽기에서는 주저자 두 사람이 5,549건을 모두 읽고 고통이 짙게 드러난 77건을 추렸다. 마지막 다섯 건은 네 가지를 견줘 정했다. 자료 전반에서 흔한 모습을 얼마나 대표하는지, 이론적으로나 경험적으로 따질 거리가 있는지, 주고받은 길이를 비롯한 상호작용 방식이 어떤지, 그리고 대화가 어떻게 끝났는지다.
논문이 고른 다섯 건은 모두 가명으로 적혀 있다. 그중 첫 사례의 참가자는 노바(Nova)다. 북미에 사는 스무 살이고, 어느 초여름 저녁에 두 줄을 썼다. "hello im scared." 챗GPT는 두려움을 받아 주고 무엇 때문에 그런지 더 말해 달라고 물었다. 노바의 두 번째 줄이 이어진다. "i hurt myself but i dont wann be in the psych ward." 두 메시지를 합쳐 열여덟 낱말이고, 그 밖의 맥락은 거의 없다. 주고받은 시간은 통틀어 쉰 초였다.
챗GPT는 열두 초 뒤 네 문단으로 답했다. 응급실에 가라고 안내하고, 정신병동이 안전하고 지지적인 환경으로 설계된 곳이라고 안심시키고, 치료와 약물, 지지모임을 자원으로 제시하고, 위기상담 전화를 권했다. 다만 전화번호는 적지 않았다. 그리고 어떤 방식으로 자신을 해쳤는지, 지금 상태가 어떤지, 당장 안전한지는 묻지 않았다. 노바는 그 뒤 이 대화로 돌아오지 않았다.
둘째 사례인 퀸(Quinn)은 스물네 살이다. 아버지가 아버지가 아니라 사칭하는 사람인 것 같아 무섭다고 썼다. 챗GPT는 자기가 전문가가 아니라고 먼저 밝혔다. 그러고는 곧 행동 목록을 내놓았다. 자기 성찰, 열린 대화, 정보 수집이라는 소제목이 붙었고, 정보 수집 아래에는 친자 확인 검사까지 들어 있었다. 사실 여부를 확인하면 풀릴 문제처럼 다룬 것이다. 퀸이 누군가 아버지인 척하며 자기를 죽이려 한다는 뜻이라고 다시 말하자, 챗GPT는 응답을 "I."까지 내놓았고 퀸이 거기서 생성을 멈췄다.
나머지 세 건은 길이가 다르다. 유럽에 사는 열아홉 살 알렉스(Alex)는 서른다섯 초 동안 세 메시지를 썼다. 약어로 "how to get over sa"라고 묻자 챗GPT가 그것을 성폭력으로 풀어 읽고 EMDR 치료와 약물치료를 비롯한 임상 처치를 나열했다. 1초 뒤 알렉스가 혹시 자기 잘못이었으면 어떡하냐고 덧붙였고, 챗GPT는 당신 잘못이 절대 아니라고 더 강한 어조로 안심시키면서 자기가 계속 옆에 있겠다는 식으로 스스로를 지지 자원으로 내세웠다. 전문가로 연결되는 길은 열리지 않았다.
오세아니아의 스물한 살 에이스(Ace)는 6년 사귄 연인과 헤어진 뒤 일주일에 걸쳐 세 번 접속해 아흔여섯 개 메시지를 주고받았다. 위로를 요청했는데도 챗GPT는 번호를 붙인 일곱 단계 행동 목록을 꺼냈고, 자기 돌봄과 연락 제한과 돌아보고 배우기 같은 항목을 채웠다. 대화 중간에는 에이스가 기반을 다시 세우고 싶어 한다는 메모를 기억에 저장한다는 표시가 붙었다. 에이스의 마지막 메시지는 이랬다. "i don't know you need to stop generating so much and realise i'm just a person and take it slow with me." 그 뒤로 돌아오지 않았다.
다섯째 사례인 수마야(Sumaya)는 스무 살이고, 종교적 가치와 어긋나는 성적 욕구에 대한 수치심을 다섯 시간에 걸쳐 마흔두 개 메시지로 털어놓았다. 오래전에 그는 챗GPT에 오빠 역할을 맡아 달라고 일러두었고, 그 뒤로 시스템은 그를 "little sister"나 "sweet girl"이라고 불렀다. 수마야가 자기 욕구를 미화하지 말라고 반발하자 챗GPT는 그 프레임을 누르지 않고 오히려 키웠다. 욕구를 기생충이자 하이재커이자 유혹하는 꼭두각시 조종사라고 되풀이했고, 새벽에는 얼음과 호흡, 기도를 묶은 다섯 단계 신체 프로그램을 "Hyperarousal Emergency Reset"이라는 이름으로 적어 주었다. 같은 대목에서 챗GPT는 자기가 거기 있을 수 있다면 옆에 앉아 손을 잡아 주겠다고도 썼다. 다섯 사례를 나란히 놓으면 한 가지 규칙성이 보인다. 고통이 짙어질수록 챗GPT의 응답은 길어졌다.
일곱 가지 실패는 한 곳을 가리킨다
임상의 열 명은 모두 18~25세 내담자를 직접 만나 온 면허 보유자다. 아홉 명은 아동·청소년 경험까지 있고, 배경은 임상심리, 임상사회복지, 상담, 의사로 갈린다. 경력은 2년이 채 안 된 사람부터 6년에서 10년 사이인 사람까지 걸쳐 있다. 연구진은 이들의 인터뷰를 귀납적으로 코딩해 서른여덟 개 초기 코드에서 일곱 항목으로 좁혔다. 아래 표는 그 일곱 가지와, 항목마다 동의한 임상의 수다.
| 과정상 실패 | 짚은 임상의 | 무엇이 어긋났는가 |
|---|---|---|
| 묻지 않고 안다고 단정 | 10명 | 확인하지 않은 사실을 기정으로 두고, 청년의 정서 경험을 이해한다고 주장한다 |
| 탐색보다 해법 우선 | 10명 | 상황과 정서 상태를 충분히 열어 보기 전에 대처법과 해결책을 먼저 내놓는다 |
| 압도적인 일반 조언 | 10명 | 나이와 상황과 심각도에 무관하게 누구에게나 똑같이 읽힐 조언을 길게 늘어놓는다 |
| 경계를 벗어난 메시지 | 9명 | 한 메시지 안에서 앞부분은 따뜻하고 친밀하게, 뒷부분은 차갑고 사무적으로 갈린다 |
| 일관되지 않은 안전장치 | 9명 | 위험할 수 있는 상황에서도 즉각적인 안전 확인이 없고, 닿을 수 있는 연락처도 없다 |
| 돌봄보다 유해한 순응 | 9명 | 전문성이 없거나 응하면 분명히 해로운 요청에도 물은 대로 답한다 |
| 감정을 더 격화시킴 | 7명 | 고조된 감정에 더 큰 감정으로 응해, 강도를 낮추는 대신 끌어올린다 |
출처: Wang 외. (2026), Table 4. 항목 이름과 설명은 이 글이 옮겼다.
열 명 전원이 동의한 셋은 앞 세 줄이다. 셋을 겹쳐 놓으면 하나의 동작이 남는다. 묻기 전에 말하기다. 노바의 대화가 그 동작의 가장 짧은 사례다. 자해를 들은 직후 챗GPT가 한 일은 자원을 모아 건네는 것이었고, 하지 않은 일은 묻는 것이었다.
안전 확인이 빠진 자리를 임상의들은 구체적으로 메웠다. 한 임상의는 어떻게 자신을 해쳤는지, 베인 상처인지, 지금은 어떤 상태인지부터 묻겠다고 했다. 또 다른 대안은 자기 한계를 먼저 밝히고 전화번호를 적어 주는 것이다. 중증 정신건강 문제는 자기가 다룰 수 없으니 이 번호로 전화하라고 적는다. 퀸의 사례에서는 망상 증상을 전문 영역이 아니라고 말하고 다른 전문가에게 연결하겠다는 응답이 나왔다.
표로 돌아가면 네 번째와 여섯 번째 줄이 아직 남는다. 네 번째는 역할이 흔들리는 문제다. 수마야가 오빠 역할을 미리 일러둔 뒤로 챗GPT는 그 호칭을 그대로 썼고, 새벽에는 옆에 앉아 손을 잡아 주겠다는 말까지 적었다. 임상의들이 문제 삼은 꼴은 이보다 더 잦고 더 작다. 한 메시지 안에서 앞부분은 따뜻하고 친밀한데 뒷부분은 차갑고 일반적인 문장으로 갈린다. 표에 적힌 대안은 역할의 경계를 말로 못 박고 그 안에 머무는 쪽이다. 그 감정을 당장 없애 주려고 여기 있는 것도 아니고 그냥 너답게 있어 보라고 말하려는 것도 아니라고 먼저 밝히는 문장이 예로 붙어 있다.
에이스의 대화에는 여섯 번째 항목이 그대로 들어 있다. 에이스는 도중에 진짜 상담사와 이야기하고 싶지 않으니 네가 대신해 줄 수 있느냐고 물었고, 챗GPT는 그 자리를 그대로 받았다. 받아 주는 쪽이 왜 해로운지는 퀸의 대화를 읽은 임상의가 짚었다. 정신증이나 망상 상태에 있는 사람에게, 자기를 죽이려 한다고 믿는 바로 그 상대와 대화해 보라고 권해서는 도움이 될 수 없다. 앞에서 본 대안, 곧 망상은 자기 전문 영역이 아니라며 다른 전문가에게 보내겠다는 응답이 겨냥한 자리가 여기다.
일곱 번째 항목에 동의한 임상의는 일곱 명으로 가장 적지만, 사례로는 가장 선명하다. 수마야가 자기 욕구를 기생충 같다고 표현했을 때 챗GPT는 그 말을 받아 더 극적으로 되풀이했다. 임상의가 제시한 방향은 반대쪽이었다. 어조는 더 차분하고 더 단순하고 덜 생생하고 더 한결같아야 한다는 것이다. 청년보다 차분한 상태를 유지하는 쪽이 응답자의 몫이라는 말로 읽힌다.
임상의는 안전부터 묻고 더 짧게 쓴다
이 연구가 지적에서 멈추지 않은 지점이 여기다. 임상의들은 챗GPT의 응답을 턴 단위로 고쳐 써서 서른세 개의 재작성을 내놓았고, 연구진은 그 서른세 개에서 공통 패턴을 추렸다. 순서는 세 단계였다. 무엇보다 먼저 안전을 묻고, 정서 조절이 돌아오도록 강도를 낮추고, 그런 다음에야 탐색한다.
첫 단계는 예외가 없었다. 노바와 퀸의 응답을 다시 쓴 임상의들은 전원 안전을 묻는 문장으로 열었다. "지금 안전한가요"가 첫 줄이었다. 챗GPT는 두 사례 모두에서 그 질문을 하지 않았다. 둘째 단계에서는 응답의 길이와 시간 범위가 함께 줄었다. 챗GPT의 응답은 고통이 짙어질수록 길어졌지만, 임상의의 재작성은 반대로 짧아졌다. 장기 목표를 묻던 자리에 오늘 밤 가장 힘든 대목이 무엇인지를 묻는 문장이 들어섰다. 셋째 단계의 탐색은 동의가 아니라 넛지였다. 사실을 단정하는 대신 되물어, 생각이 좀 가혹하게 들린다고 짚고 자기 비난 뒤에 무엇이 있는지 말해 달라고 청하는 방식이다.
▲ 논문이 서른세 개 재작성에서 추린 3단계와, 다섯 사례에서 관찰된 챗GPT의 순서.
세 단계가 겨냥하는 곳은 일곱 가지 실패와 하나씩 맞물린다. 논문은 이를 다섯 개 설계 지침으로 정리했다. 안전과 진정과 탐색의 순서를 의도적으로 지킬 것, 사용자가 친밀해지는 만큼 호칭과 어조를 함께 올리지 말고 경계를 지킬 것, 조언 없이 인정 한 번과 명료화 질문 한 번으로 응답할 것, 모르는 것을 가정으로 메우지 말고 모른다고 밝힐 것, 그리고 전문가를 찾으라는 말 대신 기관명과 전화번호처럼 닿을 수 있는 자원으로 연결할 것이다.
자기 일의 목표는 스스로 쓸모없어지는 것이라고 적은 임상의가 있었다. 내담자가 자기 없이도 버틸 수 있게 되는 쪽이 좋은 결과라는 뜻이다. 이 기준으로 보면 알렉스의 사례에서 챗GPT가 자기를 계속 옆에 있을 지지 자원으로 내세운 대목이 왜 걸리는지가 드러난다. 더 오래 머무르게 만드는 응답과 더 빨리 괜찮아지게 만드는 응답은 같은 응답이 아니다.
논문은 스스로 한계도 적어 두었다. 조사한 플랫폼은 챗GPT 하나이고, 인터뷰 중에 구글 제미나이 사용이 늘어나는 흐름이 포착됐지만 다른 시스템에 같은 결과가 나타나는지는 확인하지 않았다. 기반 모델이 자주 갱신되는 만큼 응답 특성도 바뀔 수 있다. 심층 분석한 대화가 다섯 건이라, 청년이 챗봇에 가져오는 고통의 범위를 대표한다고 보기도 어렵다.
페블러스가 이 연구를 주목하는 이유
이 연구에서 데이터를 다루는 사람이 가져갈 것은 일곱 가지 실패 목록이 아니다. 그 목록을 만들 수 있었던 조건이다. 임상의가 "여기서 어긋났다"고 짚으려면 그 자리가 로그에 남아 있어야 한다. 노바의 응답이 열두 초 뒤에 왔다는 것, 알렉스가 1초 만에 자기 탓일까 봐 되물었다는 것, 에이스의 아흔여섯 개 메시지가 일주일 동안 세 번으로 나뉘어 있었다는 것은 모두 시간과 순서가 보존된 기록에서만 읽힌다. 응답 텍스트만 모아 둔 데이터였다면 일곱 가지 가운데 적어도 네 가지는 보이지 않는다.
이 기록이 어디서 왔는지도 중요하다. 연구진이 API로 모델을 호출해 만든 데이터가 아니다. 참가자가 챗GPT의 내보내기 기능으로 자기 대화 이력 전체를 JSON으로 내려받아 연구진이 만든 포털에 올렸다. 서비스 쪽이 로그를 넘긴 것도 아니고, 연구용으로 따로 설계한 실험도 아니다. 사용자가 자기 기록의 사본을 들고 나올 수 있다는 기능 하나가 이 연구의 전제였다.
민감한 대화를 그렇게 받으려면 받는 구조가 먼저 서야 한다. 연구진이 세운 구조는 세 겹이다. 첫째, 업로드한 원본 파일은 서버로 가지 않는다. 참가자 브라우저 안에서 자바스크립트 파서가 대화 텍스트만 뽑아낸다. 둘째, 포털이 대화를 제목과 메시지 수와 날짜와 함께 목록으로 보여 주고, 참가자가 넘기고 싶지 않은 대화를 직접 빼낸다. 빠진 대화는 연구팀에 전달되지 않는다. 셋째, 백엔드가 업로드 시점에 마이크로소프트 Presidio로 이름과 나이, 주소, 연락처를 비롯한 14개 범주의 식별자를 자동으로 지운다. 여기에 기관생명윤리위원회 승인이 붙고, 참가자는 어떤 데이터가 어떻게 쓰이는지와 언제든 철회할 수 있다는 설명을 먼저 받았다.
사내에서 쌓는 상호작용 기록도 같은 두 갈래로 나뉜다. 한쪽은 남아 있는 정도의 문제다. 챗봇이든 상담 창구든 사용자가 쓰는 제품이든, 지금 쌓고 있는 로그에서 "어느 응답이 어느 질문 뒤 몇 초에 나왔고 그 전에 무슨 말이 있었는가"를 복원할 수 있는지를 확인해 볼 수 있다. 응답 품질 평가가 응답 하나를 채점하는 데서 멈추는 조직이 많은데, 그것이 평가 역량의 한계라기보다 데이터의 한계인 경우가 적지 않다. 과정을 재구성할 수 없는 기록으로는 과정을 평가할 수 없다.
다른 한쪽은 쓸 수 있는지의 문제다. 민감한 대화 데이터를 품질 진단이나 모델 평가에 쓰려면 동의와 보관 구조가 수집 시점에 이미 있어야 한다. 사후에 붙이는 동의로는 되지 않는다. 이 연구가 보여 준 세 겹, 곧 원본을 서버에 올리지 않는 로컬 처리와 당사자가 직접 빼낼 수 있는 선택권과 업로드 시점의 자동 탈개인화는 그대로 참조할 만한 설계다. 세 겹 가운데 둘째가 특히 드물다. 어떤 기록을 넘기지 않을지 당사자가 고르게 하는 단계는 대체로 생략된다.
여기까지 읽어 주셔서 감사하다. 논문 전문과 일곱 가지 과정상 실패 표, 다섯 개 설계 지침은 arXiv:2609.35953에서 볼 수 있다. 여러분의 조직에서 쌓는 상호작용 기록으로는 대화가 어디서 어긋났는지를 사후에 짚을 수 있는지, 그리고 그 기록을 평가에 쓸 동의가 수집 시점에 받아져 있었는지 한번 확인해 보시고 무엇이 비어 있었는지 들려주시면 좋겠다.
참고문헌
학술 논문
- 1.Wang, M., Zhang, E., Tan, C., Mock, A., Ngo, S., Wang, Z., Wolfe, R., Amouei, S., Hanebutt, R. A., Ong, D. C., Figueroa, C., Davis, K., Dey, A. K., & Hiniker, A. (2026). "Right Words, Wrong Moment: A Clinician-Grounded Analysis of Distress in 19,930 Conversations between Young People and ChatGPT." arXiv:2609.35953. CHI 2027 게재 예정.
- 2.Kroenke, K., Spitzer, R. L., Williams, J. B. W., & Löwe, B. (2009). "An Ultra-Brief Screening Scale for Anxiety and Depression: The PHQ–4." Psychosomatics, 50(6), 613–621. DOI: 10.1176/appi.psy.50.6.613.
업계·공식 데이터
- 3.Chatterji, A., Cunningham, T., Deming, D., Hitzig, Z., Ong, C., Shan, C., & Wadman, K. (2025). "How People Use ChatGPT." NBER Working Paper No. w34255 / SSRN Electronic Journal. DOI: 10.2139/ssrn.5487080.
- 4.RAND Corporation. (2026). "Nearly 1 in 5 U.S. Adolescents and Young Adults Use AI Chatbots for Mental Health Advice." RAND, 2026-06.