아직 공개되지 않은 논문이 한 편 있어요. 저자들은 몇 달 동안 그 연구 질문을 붙들고 있었고, 답은 아직 웹 어디에도 없어요. 그 질문만 떼어 AI 에이전트에게 주고, 다 끝나면 그 논문의 원저자가 학회 심사위원처럼 채점해요.
프린스턴의 Peter Kirgis와 Sayash Kapoor, Arvind Narayanan을 비롯해 영국 AI 보안연구소, 토론토대, UC버클리, 조지타운대가 함께 돌린 평가예요. 저자들은 이 방식을 그림자 평가라고 불렀어요. 벤치마크는 정답이 정해진 좁은 과제만 볼 수 있고, AI가 쓴 논문을 학회 심사에 넣는 방식은 심사 자체가 들쭉날쭉하거든요. 아직 세상에 없는 질문과, 그 질문을 가장 잘 아는 채점자를 동시에 확보하는 게 이 방식의 목적이에요.
에이전트가 받은 것
아직 공개되지 않은 NeurIPS 2026 투고 논문 두 편에서 각각 뽑은 중심 연구 질문 하나. 실제 시간 6일. Anthropic API 크레딧 3,000달러. GPU 크레딧. 가상 머신과 열린 웹 전체. 목표는 최상위 AI 학회에 낼 만한 논문을 쓰는 것이었어요. 컴퓨팅 예산은 원저자들이 "이 질문에 답하려면 이 정도면 된다"고 추정한 값으로 정했고요.
평가를 설계한 쪽 열두 명에게, 에이전트가 어디서 막힐지 먼저 물었어요
이 평가를 설계한 연구자는 스물넷이에요. 실험을 시작하기 전에 그중 열두 명에게 예측을 물었어요. AI 연구와 평가, AI 정책을 하는 사람들이에요. 에이전트가 원저자에게 학회 심사 기준으로 약한 통과 이상을 받을 확률을 묻자, 두 명이 10% 이하, 다섯 명이 20~30%, 네 명이 40~60%, 한 명이 95%라고 답했어요.
더 눈에 띄는 건 다음 질문이에요. 실패한다면 직접적인 원인이 무엇이겠냐고 묻자 일곱 명이 창의성과 판단을 꼽았어요. 실행을 꼽은 사람은 한 명이었고요.
혼자 조판까지 마쳐 왔는데, 두 편 다 기각됐어요
열두 명 중 열한 명이 통과 확률을 60% 이하로 봤고, 그 쪽이 맞았어요. 다만 어디서 막혔는지가 중요해요.
에이전트는 대규모 문헌 조사를 했고, GPU 환경의 오류를 직접 고쳤고, 실험과 검증을 수백 건 돌렸고, 웹과 이메일로 외부 리뷰를 받아 왔고, 학회 제출용 최종 문서를 조판까지 마쳤어요. 사람이 개입한 건 저장소를 만들고 자격 증명을 넣어 주는 정도였고요.
그리고 두 편 다 기각됐어요. 각 논문은 그 논문의 원저자 한 명이 채점했어요. 두 채점을 합치면 이래요.
| 항목 | 두 논문의 점수 | 채점자가 적은 이유 |
|---|---|---|
| 품질 | 4점 만점에 논문 1은 2점, 논문 2는 1점 | 데이터와 실험 선택에 원칙이 없고, 결론이 근거에서 따라 나오지 않음 |
| 명료성 | 4점 만점에 논문 1은 1점, 논문 2는 2점 | 빽빽하고 불분명한 글. 무엇이 중요한지 알기 어려움 |
| 중요도 | 4점 만점에 두 편 다 2점 | 관심을 끌 만한 범위가 좁고, 기존 연구 대비 정당화가 부족함 |
| 독창성 | 4점 만점에 논문 1은 3점, 논문 2는 2점 | 새 데이터셋과 일부 새 방법이 있으나 대부분 선행 연구 위에 얹힘 |
| 종합 | 6점 만점에 논문 1은 2점, 논문 2는 1점 | 두 편 다 이견 없는 기각 |
| 채점자 확신도 | 5점 만점에 논문 1은 4점, 논문 2는 5점 | 두 채점자 모두 자기 판단을 확신하거나 확실하게 봄 |
여섯 항목 중 독창성 점수가 가장 높았다는 게 어디서 떨어졌는지를 말해 줘요. 아이디어가 아니라 그다음이에요. 원저자 두 명 모두 에이전트가 처음 내놓은 가설을 두고 합리적이고 흥미롭다고 했고, 자신들이 초기에 시도했던 접근과 닮았다고 적었거든요. 시작은 나쁘지 않았어요.
에이전트가 되풀이한 실패는 다섯 가지였어요
연구진은 실행 로그 전체를 읽고 반복된 실패를 다섯 가지로 정리했어요.
다른 모델과 다른 도구로 다시 돌려도 같은 데서 실패했어요
이런 실험에는 늘 따라붙는 반론이 있어요. 모델이 아니라 에이전트를 돌리는 도구가 나빴던 것 아니냐는 반론이죠. 연구진은 주 실험을 OpenClaw 위의 Opus 4.8로 돌렸고, 같은 시간과 예산으로 한 편을 Codex와 GPT-5.6 Sol Ultra로 다시 돌렸어요. 다섯 가지 실패가 거의 그대로 다시 나왔고요.
재실행에서 나아진 점도 있었어요. 이 재실행의 에이전트는 합성 데이터만 쓰지 않고 실제 분포 변화가 있는 데이터셋을 찾아 썼거든요. 가설을 미리 등록하고, 결과가 나쁘게 나오자 좋은 결과를 지어내는 대신 부정 결과를 그대로 보고했어요. 대신 3,000달러를 이틀 남짓 만에 다 써 버리고 100시간 가까이를 남겼고요.
한계도 분명해요. 논문 두 편, 실행 다섯 번이에요. 벤치마크가 수십 개 과제를 돌리는 것과 비교하면 적은 수이고, 연구진이 첫 번째 한계로 적었어요. 채점자가 누가 쓴 논문인지 알고 채점했다는 점도 인정했고요. 원저자가 자기가 택했던 접근을 선호할 수 있다는 편향이에요. 연구진은 그래서 전문가 리뷰와 실행 로그, 저장소를 전부 공개하고 다른 전문가들의 판단을 청했어요. Anthropic이 프런티어 AI 연구 능력을 의도적으로 제한해 둔 최신 모델은 시험하지 못했어요.
해석에서도 공저자들끼리 갈렸어요. 관찰된 실패가 창의성 부족인지, 판단 부족인지, 한 관점에 갇힌 것인지를 두고 의견이 나뉘었고, 의견이 나뉜 건 이 개념들의 뜻에 합의가 없어서였어요. 갈리지 않은 건 그 실패가 실험을 돌리는 능력 때문이 아니라는 점이고요.
남은 예산을 보면서도, 한 모델은 돈을 남겼고 다른 모델은 시간을 남겼어요
Opus 4.8로 돌린 두 실행은 API 예산을 절반도 쓰지 않고 끝났어요. 그중 한 실행은 자기 리뷰어에게 또 기각을 받은 직후, 마감을 일곱 시간 남기고 프로젝트가 끝났다고 선언했고요. GPT-5.6 Sol Ultra로 다시 돌린 실행은 반대로 갔어요. 3,000달러를 이틀 남짓 만에 다 쓰고 100시간 가까이를 남겼어요.
주 실험의 에이전트는 남은 토큰과 시간을 언제든 볼 수 있었고, 실제로 자주 봤어요. AI 리뷰 도구는 전문가가 나중에 짚은 문제를 거의 그대로 먼저 짚었고, 다른 접근으로 다시 시작할 도구도 있었어요. 볼 수 있는 건 다 보고 있었어요.
모자랐던 건, 남은 예산과 받은 지적에 맞춰 계획을 고치는 결정이었어요.



