채용을 해 본 관리자가 지원자의 자기소개서를 읽어요. 맨 아래에 한 문장이 딸려 있어요. 이 글을 생성형 AI가 작성했다는 문장이에요. 다른 관리자는 똑같은 자기소개서를 받았는데, 그 자리에 커리어 코치가 작성했다고 적혀 있어요. 또 다른 관리자가 받은 것에는 그 문장이 아예 없고요.
애리조나대의 Oliver Schilke와 Martin Reimann이 채용 경험이 있는 관리자 85명을 무작위로 셋으로 나눠 돌린 실험이에요. 평가한 지원자는 같은 사람이고, 지원한 자리도 같고, 자기소개서도 같아요. 달라진 건 그 한 문장뿐이고요.
코치가 대신 썼다고 밝혀도 신뢰 점수는 안 떨어졌어요
관리자들이 매긴 지원자 신뢰 점수는 이렇게 나왔어요.
| 자기소개서에 딸려 온 한 문장 | 지원자 신뢰 점수 | 문장이 없는 자기소개서와 비교 |
|---|---|---|
| 아무 문장도 안 붙음 | 4.40 | 기준 |
| 커리어 코치가 작성했습니다 | 4.32 | 차이가 유의하지 않음 (p = 0.81, d = 0.06) |
| 생성형 AI가 작성했습니다 | 2.91 | 차이가 뚜렷함 (p < 0.001, d = 1.42) |
연구진이 커리어 코치 문장을 넣은 이유는, 신뢰가 떨어진 게 그냥 남에게 일을 넘겼다는 사실 때문인지 확인하려는 거였어요. 그리고 실험 결과가 그 가능성을 지웠어요. 코치가 써 줬다는 문장이 붙은 자기소개서와 아무 문장도 안 붙은 자기소개서 사이의 신뢰 점수 차이는 통계적으로 의미가 없었거든요. 채용하겠다는 의향에서도 같은 순서가 나왔어요.
그러니 신뢰 점수를 떨어뜨린 건 직접 안 썼다는 사실이 아니에요. 코치가 썼다는 문장이 붙은 자기소개서는 아무 문장도 안 붙은 것과 같은 점수를 받았고, 점수가 떨어진 건 AI가 썼다는 문장이 붙은 자기소개서뿐이었어요.
이 실험의 참가자는 85명이에요. 연구진은 같은 비교를 더 많은 사람을 상대로 한 번 더 했어요. 학부생 195명에게 교수의 학기 첫 주 환영 메시지를 보여 주고 같은 방식으로 나눴어요. 과제를 생성형 AI가 채점한다고 적힌 메시지를 받은 학생들은 교수 신뢰 점수를 2.48로 매겼고, 대학원 조교가 채점한다고 적힌 메시지를 받은 학생들은 2.87, 채점자를 안 적은 메시지를 받은 학생들은 2.96이었어요. 여기서도 조교라고 적은 것과 안 적은 것의 차이는 유의하지 않았고요. 투자자 345명에게 같은 광고를 보여 준 실험에서도 순서가 같았어요.
AI를 썼다는 문장을 여섯 가지로 바꿔 봤지만, 여섯 가지 다 안 적은 것보다 신뢰 점수가 낮았어요
그러면 말하는 방식을 고치면 될까요. 연구진이 그 질문으로 실험을 하나 더 돌렸어요. 앞의 자기소개서 실험에서 커리어 코치 문장을 빼고, 대신 AI를 썼다고 알리는 문장을 여섯 가지로 다르게 붙였고요.
- 일반적인 표현 AI를 썼다고만 적은 경우예요.
- 사람이 검토하고 고쳤다 최종 책임이 사람에게 있다고 알린 경우예요.
- 교정에만 썼다 AI의 역할을 최소로 한정한 경우예요.
- 왜 썼는지 밝힘 사용한 의도를 설명한 경우예요.
- 오류가 있을 수 있다 AI 결과의 한계를 미리 알린 경우예요.
- 투명하게 밝힌다는 점을 강조 공개 자체를 미덕으로 내세운 경우예요.
여섯 문장 모두, 아무 문장도 안 붙은 자기소개서보다 신뢰 점수가 낮았어요. 전부 p 값이 0.02보다 작았고요. 채용하겠다는 의향에서도 같은 순서가 나왔어요.
공개를 규정으로 강제하면 달라질까 싶어 또 한 번 돌렸어요. 참가자들에게 주 정부가 AI 사용 공개를 의무화하려 한다는 기사와, 자율에 맡기려 한다는 기사를 나눠 읽힌 뒤 같은 디자이너를 평가하게 했거든요. 의무화 기사를 읽었든 자율 기사를 읽었든, AI를 썼다고 밝힌 디자이너의 신뢰 점수가 낮다는 결과는 그대로였어요.
"열세 개의 실험은 일관되게 보여 준다. AI 사용을 밝힌 행위자는 밝히지 않은 행위자보다 덜 신뢰받는다."
— Schilke & Reimann, Organizational Behavior and Human Decision Processes (2025)
이 논문을 믿을 만한 이유는 실험 개수만이 아니에요. 열세 개를 전부 데이터 수집 전에 OSF에 사전등록했고, 실험마다 등록 링크를 표에 달아 뒀어요. 참가자 수는 미리 계산해서 정했고, 나중에 뺀 데이터는 없고요. 자료와 분석 구문, 조작 점검까지 공개돼 있어요. 열세 개를 합친 메타분석의 대상은 4,093명이에요.
2026년 미국 직장인은 94%가 이미 AI를 쓰고 있어요
여기까지는 연구진이 조건을 통제한 실험이에요. 올해 6월 Atlassian의 Teamwork Lab이 미국 지식 노동자를 상대로 같은 질문을 직장 맥락에서 던졌어요.
따로 돌린 설문 1,006명 가운데 94%가 지난달에 업무에서 AI를 썼다고 답했고, 80%가량은 관리자와 동료에게 그 사실을 숨기지 않는다고 답했어요. 그리고 961명을 상대로 한 통제 실험에서, 사업 제안을 요약한 같은 이메일을 같은 가상의 동료가 썼다고 보여 주되 그 일을 어떻게 했는지 적은 한 줄만 바꿨어요. AI를 썼다고 적힌 이메일을 본 사람들은, 그 동료에게 눈에 띄는 프로젝트를 맡기라고 임원에게 추천하겠다는 응답이 24%포인트 적었고요.
Atlassian은 표현을 바꾸면 얼마나 완화되는지도 봤어요. "내 시간을 아꼈다"고 적은 이메일보다 "팀과 고객을 위해 썼다"고 적은 이메일이, 노력을 인정한다는 응답에서 45%에서 56%로, 추천하겠다는 응답에서 43%에서 51%로 올랐어요. 두 이메일 모두 AI를 아예 언급하지 않은 이메일보다는 낮았고요.
Atlassian은 AI 제품을 파는 회사이고, 이 결과는 논문으로 나오지 않았어요.
한 가지 겹치는 대목은 있어요. Atlassian은 AI 사용을 권장하는 회사에서는 AI를 썼다고 밝혀도 불이익이 거의 없었다고 보고했고, Schilke와 Reimann도 주변이 AI 사용을 당연하게 여기는 상황에서는 신뢰 점수 하락이 작아지는 걸 실험으로 확인했거든요. 두 조사가 같은 결과를 냈어요.
AI를 썼다고 말 안 한 상담사가 점수가 제일 높았고, 들키면 제일 낮았어요
마지막 실험은 세무 상담이었어요. 참가자 195명이 Charles라는 세무 상담사와 채팅으로 환급액을 상담받아요. 참가자들은 셋으로 나뉘었어요. 상담사가 AI를 썼다고 스스로 밝히는 채팅을 본 사람들, 제3자를 통해 상담사가 AI를 썼다는 사실이 드러나는 채팅을 본 사람들, 그런 말이 아예 없는 채팅을 본 사람들이에요.
같은 실험, 같은 척도에서 나온 세 점수예요. 상담사가 스스로 밝혔을 때의 점수는 AI 언급이 없었을 때보다 낮았고, 제3자가 드러냈을 때는 스스로 밝혔을 때보다 또 낮았어요. 세 점수의 간격은 모두 통계적으로 뚜렷했고요.
그래서 이 연구가 알려 주는 건 이렇게 하라는 권고가 아니라, 무엇을 하면 점수가 어떻게 되는지예요. AI를 썼다고 말하지 않는 게 점수가 가장 높아요. 그 점수는 아무도 모르는 동안에만 유지되고요. 실험 13개가 끝난 뒤에도 답이 없는 질문은 이거예요. 94%가 쓰고 있는 걸, 말하면 손해고 들키면 더 큰 손해인 상태로 얼마나 오래 둘 수 있을까요.



