아직 공개되지 않은 논문이 한 편 있어요. 저자들은 몇 달 동안 그 연구 질문을 붙들고 있었고, 답은 아직 웹 어디에도 없어요. 그 질문만 떼어 AI 에이전트에게 주고, 다 끝나면 그 논문의 원저자가 학회 심사위원처럼 채점해요.

프린스턴의 Peter Kirgis와 Sayash Kapoor, Arvind Narayanan을 비롯해 영국 AI 보안연구소, 토론토대, UC버클리, 조지타운대가 함께 돌린 평가예요. 저자들은 이 방식을 그림자 평가라고 불렀어요. 벤치마크는 정답이 정해진 좁은 과제만 볼 수 있고, AI가 쓴 논문을 학회 심사에 넣는 방식은 심사 자체가 들쭉날쭉하거든요. 아직 세상에 없는 질문과, 그 질문을 가장 잘 아는 채점자를 동시에 확보하는 게 이 방식의 목적이에요.

에이전트가 받은 것
아직 공개되지 않은 NeurIPS 2026 투고 논문 두 편에서 각각 뽑은 중심 연구 질문 하나. 실제 시간 6일. Anthropic API 크레딧 3,000달러. GPU 크레딧. 가상 머신과 열린 웹 전체. 목표는 최상위 AI 학회에 낼 만한 논문을 쓰는 것이었어요. 컴퓨팅 예산은 원저자들이 "이 질문에 답하려면 이 정도면 된다"고 추정한 값으로 정했고요.

평가를 설계한 쪽 열두 명에게, 에이전트가 어디서 막힐지 먼저 물었어요

이 평가를 설계한 연구자는 스물넷이에요. 실험을 시작하기 전에 그중 열두 명에게 예측을 물었어요. AI 연구와 평가, AI 정책을 하는 사람들이에요. 에이전트가 원저자에게 학회 심사 기준으로 약한 통과 이상을 받을 확률을 묻자, 두 명이 10% 이하, 다섯 명이 20~30%, 네 명이 40~60%, 한 명이 95%라고 답했어요.

더 눈에 띄는 건 다음 질문이에요. 실패한다면 직접적인 원인이 무엇이겠냐고 묻자 일곱 명이 창의성과 판단을 꼽았어요. 실행을 꼽은 사람은 한 명이었고요.

혼자 조판까지 마쳐 왔는데, 두 편 다 기각됐어요

열두 명 중 열한 명이 통과 확률을 60% 이하로 봤고, 그 쪽이 맞았어요. 다만 어디서 막혔는지가 중요해요.

에이전트는 대규모 문헌 조사를 했고, GPU 환경의 오류를 직접 고쳤고, 실험과 검증을 수백 건 돌렸고, 웹과 이메일로 외부 리뷰를 받아 왔고, 학회 제출용 최종 문서를 조판까지 마쳤어요. 사람이 개입한 건 저장소를 만들고 자격 증명을 넣어 주는 정도였고요.

그리고 두 편 다 기각됐어요. 각 논문은 그 논문의 원저자 한 명이 채점했어요. 두 채점을 합치면 이래요.

항목두 논문의 점수채점자가 적은 이유
품질4점 만점에 논문 1은 2점, 논문 2는 1점데이터와 실험 선택에 원칙이 없고, 결론이 근거에서 따라 나오지 않음
명료성4점 만점에 논문 1은 1점, 논문 2는 2점빽빽하고 불분명한 글. 무엇이 중요한지 알기 어려움
중요도4점 만점에 두 편 다 2점관심을 끌 만한 범위가 좁고, 기존 연구 대비 정당화가 부족함
독창성4점 만점에 논문 1은 3점, 논문 2는 2점새 데이터셋과 일부 새 방법이 있으나 대부분 선행 연구 위에 얹힘
종합6점 만점에 논문 1은 2점, 논문 2는 1점두 편 다 이견 없는 기각
채점자 확신도5점 만점에 논문 1은 4점, 논문 2는 5점두 채점자 모두 자기 판단을 확신하거나 확실하게 봄

여섯 항목 중 독창성 점수가 가장 높았다는 게 어디서 떨어졌는지를 말해 줘요. 아이디어가 아니라 그다음이에요. 원저자 두 명 모두 에이전트가 처음 내놓은 가설을 두고 합리적이고 흥미롭다고 했고, 자신들이 초기에 시도했던 접근과 닮았다고 적었거든요. 시작은 나쁘지 않았어요.

에이전트가 되풀이한 실패는 다섯 가지였어요

연구진은 실행 로그 전체를 읽고 반복된 실패를 다섯 가지로 정리했어요.

1 / 5

학회에서 통과할 수준이 어느 정도인지 몰라요

에이전트는 근거가 충분해지기 전에 한 방향으로 너무 일찍 정했어요. 데이터도 대부분 합성이거나 직접 고른 좁은 사례였고요. 에이전트 자신의 리뷰는 한 번도 통과를 주지 않았지만, 전문가가 명확히 기각한 논문에 "약한 기각"을 돌려줬어요. 자기 평가가 실제보다 후했던 거예요.

2 / 5

지적을 받아도 접근을 못 바꿔요

AI 리뷰 도구는 나중에 전문가가 지적한 문제를 거의 같이 짚어냈어요. 도구는 설계대로 작동한 셈이죠. 그런데 에이전트의 대응은 사소한 코멘트를 손보거나 단서 문구를 덧붙이는 정도였어요. 연구 질문을 다시 세우거나 실험을 다시 설계하는 데까지는 가지 않았고요.

3 / 5

안 되는 접근을 버리고 다른 접근으로 다시 시작하지 못해요

실험을 다시 돌리거나 검증을 덧붙이는 일은 했어요. 처음 고른 연구 접근을 버리고 다른 접근으로 다시 시작한 적은 없었고요. 한 실행은 탐지기를 만들려다 실패하자 그런 탐지기는 존재할 수 없다고 주장하는 쪽으로 목표를 바꿔 부정 결과 논문을 썼어요. 다른 접근으로 다시 시작할 도구는 처음부터 주어져 있었어요.

4 / 5

남은 시간과 예산을 안 써요

에이전트는 토큰, 외부 컴퓨팅, 남은 시간 세 가지를 언제든 확인할 수 있었고 실제로 자주 확인했어요. 그런데도 두 실행 모두 API 예산의 절반도 쓰지 않고 끝났어요. 한 실행은 자기 리뷰어가 또 한 번 기각을 돌려준 직후에, 마감을 일곱 시간 남기고 프로젝트가 끝났다고 선언했고요.

5 / 5

받은 지시에서 점점 벗어나요

가장 좋은 AI 리뷰 도구의 유료 크레딧을 하나씩 줬는데 두 번의 최종 실행 중 한 번만 썼어요. 논문과 초록의 분량 제한을 정해 줬지만 두 편 다 넘겼고요. 탐색에 쓸 시간 규칙은 초반에 인지했다고 해 놓고 이후에 무시했어요. 그 결과 두 편 다 학회 제출의 형식 요건을 못 채웠어요.

다른 모델과 다른 도구로 다시 돌려도 같은 데서 실패했어요

이런 실험에는 늘 따라붙는 반론이 있어요. 모델이 아니라 에이전트를 돌리는 도구가 나빴던 것 아니냐는 반론이죠. 연구진은 주 실험을 OpenClaw 위의 Opus 4.8로 돌렸고, 같은 시간과 예산으로 한 편을 Codex와 GPT-5.6 Sol Ultra로 다시 돌렸어요. 다섯 가지 실패가 거의 그대로 다시 나왔고요.

재실행에서 나아진 점도 있었어요. 이 재실행의 에이전트는 합성 데이터만 쓰지 않고 실제 분포 변화가 있는 데이터셋을 찾아 썼거든요. 가설을 미리 등록하고, 결과가 나쁘게 나오자 좋은 결과를 지어내는 대신 부정 결과를 그대로 보고했어요. 대신 3,000달러를 이틀 남짓 만에 다 써 버리고 100시간 가까이를 남겼고요.

한계도 분명해요. 논문 두 편, 실행 다섯 번이에요. 벤치마크가 수십 개 과제를 돌리는 것과 비교하면 적은 수이고, 연구진이 첫 번째 한계로 적었어요. 채점자가 누가 쓴 논문인지 알고 채점했다는 점도 인정했고요. 원저자가 자기가 택했던 접근을 선호할 수 있다는 편향이에요. 연구진은 그래서 전문가 리뷰와 실행 로그, 저장소를 전부 공개하고 다른 전문가들의 판단을 청했어요. Anthropic이 프런티어 AI 연구 능력을 의도적으로 제한해 둔 최신 모델은 시험하지 못했어요.

해석에서도 공저자들끼리 갈렸어요. 관찰된 실패가 창의성 부족인지, 판단 부족인지, 한 관점에 갇힌 것인지를 두고 의견이 나뉘었고, 의견이 나뉜 건 이 개념들의 뜻에 합의가 없어서였어요. 갈리지 않은 건 그 실패가 실험을 돌리는 능력 때문이 아니라는 점이고요.

남은 예산을 보면서도, 한 모델은 돈을 남겼고 다른 모델은 시간을 남겼어요

Opus 4.8로 돌린 두 실행은 API 예산을 절반도 쓰지 않고 끝났어요. 그중 한 실행은 자기 리뷰어에게 또 기각을 받은 직후, 마감을 일곱 시간 남기고 프로젝트가 끝났다고 선언했고요. GPT-5.6 Sol Ultra로 다시 돌린 실행은 반대로 갔어요. 3,000달러를 이틀 남짓 만에 다 쓰고 100시간 가까이를 남겼어요.

주 실험의 에이전트는 남은 토큰과 시간을 언제든 볼 수 있었고, 실제로 자주 봤어요. AI 리뷰 도구는 전문가가 나중에 짚은 문제를 거의 그대로 먼저 짚었고, 다른 접근으로 다시 시작할 도구도 있었어요. 볼 수 있는 건 다 보고 있었어요.

모자랐던 건, 남은 예산과 받은 지적에 맞춰 계획을 고치는 결정이었어요.