실사용 대화 25만 건이 보여준 AI 협업의 실제
AI

실사용 대화 25만 건이 보여준 AI 협업의 실제

블로그로 돌아가기

Anthropic이 외부 연구진 세 곳에 Claude 사용 데이터를 연 파일럿을 공개했습니다. Stanford 논문의 과제 중요도와 주도권, 마찰 분석, 데이터 전달 절차와 프라이버시 감사, 클러스터 해석 지침을 정리하고 우리나라 기업이 확인할 점을 짚습니다.

AX Specialist 김지우AnthropicClaudeAI 도입사용 데이터AI 협업기업 AX

외부 연구진에게 사용 데이터를 연 파일럿

Anthropic이 2026년 8월 26일 Enabling independent research on how people use Claude를 공개했습니다. 외부 연구 기관 세 곳이 실제 Claude 사용 데이터로 각자 연구를 설계하고 독립적으로 분석한 파일럿의 결과와 운영 교훈을 담았습니다. Anthropic은 AI 기업의 자체 사용 데이터로 외부 연구진이 공개 독립 연구를 수행한 첫 사례로 봅니다.

배경 설명도 구체적입니다. AI와의 실제 상호작용 데이터는 소수 연구소에 몰려 있습니다. 외부 연구자가 쓸 수 있는 자료는 두 가지였습니다. 하나는 연구소가 공개한 분석으로, 실제 사용을 반영하지만 연구소의 질문에 답하는 경우가 많습니다. 다른 하나는 공개 데이터셋으로, 자유롭게 분석할 수 있지만 가벼운 용도에 치우쳐 있습니다. Anthropic은 둘 다 독립 연구에 충분하지 않다고 판단했습니다.

연구 기관분석 데이터연구 질문결과 공개 상태
Stanford SALT LabClaude.ai 대화 약 25만 건사람이 AI에 어떤 일을 맡기고 어떤 역할을 유지하며 협업이 어디서 막히는가논문 공개
Oxford Human Information Processing LabClaude.ai 대화 약 25만 건사용 중 감정 상태와 Claude 행동의 관계작성 중
METRClaude Code 대화 약 25만 건코딩 에이전트의 실제 생산성 향상과 모델 세대별 변화작성 중

분석 도구는 Anthropic 내부 팀이 수백만 건의 Claude 대화에서 사용 패턴을 볼 때 쓰는 Anthropic Insights(이전 이름 Clio)입니다. 각 프로젝트의 집계 데이터는 Hugging Face에 CC BY 4.0 라이선스로 공개됐습니다. 한 행이 클러스터 하나이며 Stanford 974행과 Oxford 472행, METR 604행과 METR 후속 실행 27행으로 이뤄졌습니다.

데이터가 연구진에게 전달되기까지

부록은 운영 절차를 자세히 설명합니다. 협업은 2026년 2월에 시작됐고, Anthropic은 파일럿 목표와 도구의 기술적 조건을 담은 연구 입문서를 먼저 썼습니다. Anthropic Insights는 Claude가 표본 대화를 읽고 연구자가 쓴 질문에 대화마다 답하는 방식입니다. 이 질문을 facet이라고 부릅니다. 개방형 답변은 유사도로 묶어 클러스터를 만들고 Claude가 클러스터 설명을 씁니다. 객관식이나 숫자형 답변은 집계만 합니다. 대화 수나 계정 수가 최소 기준에 못 미치는 클러스터는 버립니다.

단계내용
제안과 구성파트너가 연구 질문과 facet 구성을 제출하고 Societal Impacts 팀이 기술적 표현을 함께 다듬음. 법적 위험은 평가하되 Anthropic에 유리한 결과가 나오도록 조정하지 않음
WildChat 검증공개 대화 데이터셋 WildChat에서 먼저 실행해 실제 출력 형태를 확인하고 구성을 마지막으로 수정
법무와 프라이버시 검토내부 연구와 같은 기준으로 최종 구성을 검토
본 실행Stanford와 Oxford는 Claude.ai 대화 약 25만 건씩, METR는 Claude Code 대화 약 25만 건. 2026년 4~5월 고정 기간에서 실행마다 별도 표본 추출
수동 검토공유 전 모든 클러스터 출력을 사람이 검토
분석과 초안 검토파트너가 약 60일 동안 분석하고, Anthropic은 방법론 서술의 정확성만 검토해 일부 수정을 요청

표본 조건도 명시했습니다. Team·Enterprise·API 고객 데이터는 전혀 포함하지 않았고 모든 대화는 Free·Pro·Max 요금제 사용자에게서 나왔습니다. Claude Code는 모델 개선에 데이터 사용을 허용한 소비자 사용자만 표본으로 삼았고, METR가 전후를 비교하도록 Claude 모델 출시 시점을 걸친 기간을 골랐습니다. 실행 비용은 Anthropic이 부담했습니다.

계약상 Anthropic의 검토 권한은 네 영역으로 제한됐습니다. 사용자 프라이버시와 이용 정책 위반을 도울 수 있는 정보, Anthropic 기밀 정보와 연구 정확성입니다. 그 밖의 연구 내용에는 관여하지 않았고, 연구진은 Anthropic에 불리한 결과도 발표할 수 있습니다. 연구진은 원본 대화에 한 번도 접근하지 않았고 모든 원본 데이터와 연산은 Anthropic 서버에 남았습니다.

SALT Lab 결과: 사람들이 AI에 맡기는 일의 무게

SALT Lab 논문 Human-AI Collaboration at Scale은 2026년 4월 25일부터 5월 9일까지 Claude.ai 소비자 채팅에서 무작위로 뽑은 대화 249,834건을 분석했습니다. Claude Code나 Claude Cowork 같은 에이전트 제품의 트래픽은 빠졌습니다. 연구진은 facet 17개를 설계했고 결과 데이터는 클러스터 891개였습니다. facet마다 WildChat 대화 10건을 사람이 직접 코딩해 Claude Haiku 4.5의 판정과 비교했는데, 첫 정확도는 56%였고 프롬프트를 고쳐 표본 기준 100%까지 올렸습니다.

과제의 중요도는 되돌릴 수 있는지, 외부에 드러나는지, 영향이 얼마나 큰지 세 차원으로 판정해 네 등급으로 나눴습니다.

등급정의비중
일시적(ephemeral)완전히 되돌릴 수 있고 사용자 본인에게만 영향20%
운영(operational)내부 대상이며 부분적으로 되돌릴 수 있는 중간 수준24%
결과가 따르는(consequential)외부 이해관계자에 영향을 주거나 되돌리기 어려운 일44%
고위험(high stakes)되돌릴 수 없거나 공개적·재무적·법적 영향이 큰 일12%

실행할 과제가 있는 대화의 56%가 결과가 따르는 등급 이상이었습니다(과제가 없는 대화는 34%). 사람들이 책임이 가벼운 일을 주로 AI에 넘긴다는 기존 연구와 다른 결과입니다. 영역별 과제 중요도 지수(TCI)는 등급을 0~3으로 놓고 대화량으로 가중 평균한 값입니다. 법률·재무 상담 대화는 약 24%가 고위험이었습니다.

영역TCI
법률·재무 상담2.14
비즈니스1.75
커리어1.70
소프트웨어 개발1.37
AI·데이터1.32
창작 콘텐츠1.25
건강·생활 상담1.19
학업 과제1.06

요청 방식은 대체로 느슨했습니다. 언어 구체성 점수는 최빈값 2, 평균 2.74였고 과제 분해는 한 번에 전부 요청하는 최저 단계가 41%였습니다. 중요도가 올라가면 대화가 길어집니다. 고위험 과제의 대화 턴 수는 일시적 과제의 1.91배(6.5턴에서 12.4턴)였고 언어 구체성은 1.21배, 과제 분해는 1.20배, 맥락의 단계적 제공은 1.08배 늘었습니다.

산출물을 다루는 방식에서는 결과물을 자기 맥락에 맞게 크게 고치는 '적응'이 모든 등급에서 가장 흔했습니다. 적응 비율은 일시적 46%에서 운영 49%와 결과가 따르는 등급 60%를 거쳐 고위험 52%였고, 그대로 쓰는 비율은 21%에서 13%로 줄었습니다. 이해를 위한 질문은 결과가 따르는 등급에서 11%까지 내려갔다가 고위험에서 21%로 뛰었습니다. 논문은 고위험 과제에서 적응과 비판이 줄고 이해만 늘어나는 현상이 가장 중요한 지점에서 사람의 감독을 약하게 만들 수 있다고 경고합니다.

SALT Lab 결과: 주도권과 학습, 마찰

주도권은 Human Agency Scale(H1~H5)로 쟀습니다. 사람이 이끌고 AI가 돕는 H4가 72%(176,319건)였고 AI가 주도하는 H1과 H2를 합쳐도 18.2%였습니다. AI 주도 비율은 발표 자료 제작(58.7%), 문서 형식 변환(53.3%), 스프레드시트 작성(42.9%)에서 높았고 개인 의료 상담(4.9%)과 소비자 하드웨어 문제 해결(4.2%)에서 낮았습니다. 같은 과제 유형 안에서도 주도권 분포가 넓게 퍼져 있어, 논문은 과제만으로 주도권이 정해지지 않고 사용자가 대화마다 선택한다고 해석합니다.

AI가 가르치는 역할은 대화의 67%(117,544건)에서 나타났습니다. 방법은 혼합형이 61.1%로 가장 많았고 단계별 설명 17.4%와 개념 설명 12.8%, 예시 중심 7.7%가 뒤를 이었습니다. 소크라테스식 질문(0.6%)과 비유(0.4%)는 드물었습니다. 영역은 건강·생활과 소프트웨어 개발이 각각 18%, 학업은 15%에 그쳐 학습이 학교 과제 밖에서 널리 일어났습니다.

국가별 차이도 분석했습니다. 대화가 2,000건 이상인 19개국을 Oxford Insights의 정부 AI 준비도 지수와 비교했습니다.

지표AI 준비도와의 상관해석
AI가 가르치는 비율r = 0.16, p = 0.503국가 간 차이 거의 없음
이해를 추구하는 참여r = 0.54, p = 0.018준비도가 높을수록 증가
산출물 직접 실행r = −0.46, p = 0.049준비도가 높을수록 감소

마찰은 대화의 49.7%에서 발생했습니다. 마찰이 있는 대화에서 사용자 쪽 원인은 19.4%로 요청 불명확 18.8%와 적대적 의도 0.6%였습니다. 모델 쪽 원인은 38.6%로 능력 한계 28.5%와 환각 8.3%였습니다. 가장 많은 것은 불명확한 요청이 모델의 오해로 이어지는 복합 원인으로 42.0%였습니다. 마찰이 잦고 생산적인 마찰도 많은 주제는 전체 주제의 33.0%였지만, 결과가 따르거나 고위험인 과제의 40.8%가 여기에 속했습니다. 임베디드 하드웨어 개발, 소프트웨어 디버깅, 브랜드 아이덴티티 개발 같은 비정형 과제입니다.

마찰 대응 전략마찰 대화 중 비중원문이 밝힌 결과
바로잡기(repair)49.7%생산적 결과 61.8%
요청 재구성(reformulate)22.3%표현만 바꾼 재구성은 19.8%가 비생산적
대화 재시작(restart)0.8%같은 스레드 안의 재시작만 집계
진행(advance)18.5%모델 응답을 받아들이고 넘어감
모호성 확인(disambiguate)5.0%생산적 결과 67.1%
대응 없음3.6%주제 전환이나 포기

사용자는 마찰 대화의 78.7%에서 능동적으로 대응했습니다. 세부 전략 중에는 모델의 추론에 이의를 제기하기(생산적 결과 81.5%), 더 단순한 결과 요청하기(80.3%), 사실 오류 바로잡기(76.8%)의 성과가 가장 좋았습니다. 논문은 한계도 밝힙니다. 클러스터 단위 데이터라 대화 수준 검증이 불가능하고, 챗봇 트래픽만 다뤄 에이전트 워크플로에 일반화하기 어렵고, 단일 서비스 사용자 기반이라는 점입니다.

Oxford와 METR의 초기 결과

Oxford 연구진은 사용자의 감정과 Claude 행동이 대화 안에서 함께 나타나는 패턴을 찾았습니다.

Claude의 행동함께 나타난 사용자 반응
따뜻한 응답더 긍정적인 태도
거절이나 이견반박
독특한 응답지적 몰입 증가
단순한 도움만족

몰입, 좌절, 즐거움 같은 상태 사이의 패턴은 일상적인 인터넷 브라우징을 다룬 별도 연구와 매우 비슷했습니다. 연구진은 사람들이 AI와 다른 디지털 활동에 참여하는 방식이 닮았다고 해석합니다. 한편 부록에 따르면 Oxford 출력에서 facet 하나는 잘못 쓰인 프롬프트가 오해를 부르는 클러스터 설명을 만든 것으로 강하게 의심돼 통째로 제거됐습니다.

METR은 Claude Code 대화에서 AI 없이 했다면 걸렸을 시간에 대한 Claude의 추정과 모델별 실제 소요 시간을 비교했습니다. 예비 결과는 새 모델이 이전 모델보다 상당한 속도 향상을 준다는 방향입니다. 이 방법은 Claude의 시간 추정에 기대므로, METR은 이전 개발자 연구에서 확인된 실제 완료 시간과 비교해 Claude의 추정이 실제 시간과 상관관계가 있음을 확인했습니다. 다음 과제는 AI가 연구자의 작업을 얼마나 빠르게 하는지 측정하는 일입니다. METR의 제안은 Anthropic 경제 연구 "Agentic coding and persistent returns to expertise"와 겹쳤고, Anthropic은 METR을 경제팀과 연결해 두 팀의 연구가 모두 나아졌다고 밝혔습니다.

운영하며 드러난 방법론의 제약

Anthropic은 사용자 프라이버시와 연구 독립성을 모두 지켰지만 파일럿이 AI 연구소의 통상 속도에 비해 느리고 자원이 많이 들었다고 인정합니다. 두 요인 모두 확대를 어렵게 합니다.

가장 큰 제약은 질문 문구입니다. 연구자가 "이 사람은 어떤 종류의 지침을 요청하는가" 같은 질문을 쓰면 Claude가 모든 대화에 답하고, 연구자는 최종 범주와 범주별 비율만 봅니다. Claude의 판단에 의존하므로 질문이 잘못 쓰이면 대화가 실제와 다른 범주에 들어가고, 아무도 원본을 읽을 수 없어 오류를 잡기 어렵습니다. 내부에서는 몇 주에 걸쳐 질문을 반복 수정하지만, 외부 파트너는 데이터를 받을 때마다 프라이버시 검토를 거쳐야 해 같은 방식이 불가능했습니다. WildChat은 가벼운 용도와 창작에 치우쳐 있어 거기서 잘 작동한 질문이 실제 Claude 대화에서 오해를 부르는 범주를 만든 경우도 있었습니다.

부록의 해석 지침은 클러스터를 읽을 때의 함정을 네 가지로 정리합니다.

함정원문 설명
강제 분류모든 대화에 판단을 요구하면 근거가 없어도 답을 만듦. "특별한 문제 없음" 선택지를 두거나 별도 분류기로 먼저 거르라고 권고
최악 가정유해 행동을 선명하게 설명하도록 설계된 프롬프트와 Claude의 성향이 겹쳐 법률 안내를 "자격 없는 법률 자문"처럼 과장할 수 있음
클러스터 오분류원 논문 검증에서 대화의 약 3%가 배정된 클러스터로 명확히 설명되지 않았고, 이 수치는 주제 facet에서만 측정됨
경계와 크기K-평균 군집이라 같은 데이터로 다시 돌려도 결과가 달라짐. 2026년 5월 기준 Claude.ai 대화의 약 10%가 여러 주제에 걸치지만 클러스터는 하나만 배정

지침은 빈도를 알고 싶다면 범주형 분류기를 쓰고 개방형 클러스터는 각 범주의 질적 내용을 이해하는 데 쓰라고 권합니다.

오용 데이터 처리 원칙도 공개했습니다. 이용 정책이나 약관 위반을 드러낸 범주는 대부분 공유했고, 사용자가 안전장치를 우회한 방법을 설명하는 범주만 가렸습니다. 각 연구에서 영향을 받은 범주와 대화는 5% 미만이었습니다. 부록의 세부 수치는 다음과 같습니다.

연구가리거나 제거한 클러스터해당 대화
Stanford1.9%4.28%
Oxford3.33%3.85%
METR1.8%2.96%

프라이버시 감사와 위협 모델

Anthropic은 공개 전 Imperial College London의 AI Security and Privacy Lab에 클러스터와 위협 모델 문서를 넘기고 2주 동안 사용자 재식별을 시도하게 했습니다. Claude 크레딧 1,000달러를 주고 필요하면 더 제공하겠다고 했습니다. 레드팀은 사용자를 재식별하지 못했고 위협 모델 위반도 찾지 못했습니다. 다만 한 클러스터 설명에 남은 도구 고유의 문구로 널리 쓰이는 오픈소스 프로젝트 사용을 높은 확신으로 연결해 냈습니다. Anthropic은 이를 위협 모델 밖의 사안으로 보면서도 클러스터 최소 사용자 수를 크게 올리고, 설명 생성 방식을 바꾸고, 레드팀의 연결 기법을 이후 공개 데이터에 직접 적용하겠다고 밝혔습니다.

위협 모델은 유럽 데이터보호이사회(EDPB) 익명화 지침 초안의 세 기준을 따릅니다. 한 사람에게만 해당하는 속성 조합이 없어야 하고(record isolation), 다른 곳의 정보와 연결되지 않아야 하며(linkage), 개인에 대한 의미 있는 결론을 끌어낼 수 없어야 합니다(inference). 공격자는 영국 정보위원회(ICO)의 "동기 있는 침입자" 개념에 가장 뛰어난 AI 모델 접근을 더한 모습으로 가정했습니다.

피해 유형원문 예시
신원 연결특정인이 Claude로 파산 문제를 상의했다는 사실 입증
속성 노출특정인의 심각한 질병을 추론
소집단 노출식별 가능한 지역 종교 공동체 구성원에 대한 민감 정보 파악
조직 노출식별 가능한 기업의 미발표 제품 계획 파악

반대로 수백만 명에게 해당하는 집단 수준 패턴, Anthropic에 불리한 집계 결과, 연구 결과를 왜곡하려는 시도는 프라이버시 피해로 보지 않았습니다. 대화를 심어 표본을 조작하는 공격은 표본 기간을 연구 뒤에 공개하고 무작위 추출과 최소 기준, 자동·수동 검토를 모두 통과해야 해 현실성이 낮다고 평가했습니다. 악의적 연구자는 직접 질의를 실행할 수 없고, 모든 연구가 WildChat에서 먼저 돌기 때문에 걸러진다고 설명합니다.

우리나라 기업이 확인할 것

첫째, 이 수치가 어떤 사용자에게서 나왔는지부터 구분해야 합니다. 세 연구는 Free·Pro·Max 요금제 사용자 데이터만 썼고 Team·Enterprise·API 고객은 제외했습니다. SALT Lab 결과도 챗봇 트래픽 기준입니다. 절반 넘는 대화가 결과가 따르는 일이었다는 결과는 개인 사용자의 흐름을 보여주며, 사내 배포 환경의 분포는 직접 측정해야 합니다.

둘째, 사내 AI 사용을 분석할 때 강제 분류의 함정을 피해야 합니다. LLM으로 대화 로그를 분류하면 근거가 없어도 범주가 만들어지고 문제 범주는 실제보다 심각하게 보일 수 있습니다. 질문마다 "해당 없음" 선택지를 두고, 빈도는 범주형 분류기로 재고, 클러스터 설명은 질적 참고 자료로만 쓰는 지침을 그대로 적용할 만합니다.

셋째, 업무 중요도 기준으로 AI 사용 정책을 나눠 볼 수 있습니다. 되돌릴 수 있는지, 외부에 드러나는지, 영향이 큰지의 세 차원은 사내 업무 분류에 바로 쓸 수 있는 틀입니다. 법률·재무 영역의 TCI가 2.14로 가장 높았고 고위험 과제에서 비판적 검토가 줄어드는 경향도 관찰됐으므로, 이런 업무에는 검토 절차를 따로 두는 편이 안전합니다.

넷째, 임직원 교육에 효과가 확인된 대응 전략을 넣어야 합니다. 모델의 추론에 이의를 제기하거나 더 단순한 결과를 요청하거나 사실 오류를 바로잡는 전략은 생산적 결과 비율이 76.8%에서 81.5%였고, 표현만 바꾸는 재구성은 성과가 낮았습니다. AI 준비도가 높은 나라일수록 이해를 추구하는 참여가 늘었다는 결과도 교육 목표를 결과물 생산보다 이해와 검증 역량에 두는 근거가 됩니다.

다섯째, 사용 데이터를 외부와 공유하거나 사내에서 분석할 때 프라이버시 기준을 문서로 정해야 합니다. Anthropic의 위협 모델은 조직의 미발표 활동 노출을 피해 범위에 넣었고, 도구 고유 문구가 클러스터 설명에 남아 특정 도구 사용이 드러난 사례도 보고했습니다. 최소 집계 단위, 재식별 시험, 기밀 정보 검토 권한을 계약과 절차에 넣는 방식은 우리나라 기업이 협력 연구나 외부 분석을 맡길 때 참고할 수 있습니다.

여섯째, 생산성 효과는 내부 기준선으로 확인해야 합니다. METR의 결과는 Claude의 시간 추정에 기댄 예비 결과이며 최종 보고서는 아직 나오지 않았습니다. 모델 교체에 따른 효과를 보고할 때는 조직 안에서 비교 가능한 기준선을 함께 확보하는 편이 안전합니다.

출처: Enabling independent research on how people use Claude, Appendix to "Enabling independent research on how people use Claude", Human-AI Collaboration at Scale: Task Criticality, Agency, and Friction Across 250,000 Conversations, Anthropic Insights Pilot: Partner Cluster Data

김지우 (Tristan Kim)

코텍시스 창업자로 AX 컨설팅과 기업 AI 교육, AI 에이전트 개발을 직접 수행합니다.

코텍시스 AI 인사이트 최신 논문 리뷰

AI 솔루션이 필요하신가요?

cortexys.team에서 맞춤 AI 개발 서비스를 확인하세요.

컨설팅 신청하기