NeurIPS desk rejection 논란, AI detector를 심사 근거로 쓸 수 있나
MachineLearning 댓글은 “AI detector가 보조도구인지 결정권자인지”를 놓고 강하게 갈렸다.
원문: NeurIPS used uncalibrated AI detector for desk rejections [D] 원문 보기 →
NeurIPS 2026 Position Paper Track에서 AI 사용 정책 위반을 이유로 desk rejection을 받은 저자가 문제를 공개하면서, r/MachineLearning의 논점은 논문 한 편의 억울함을 넘어섰다. 핵심은 Pangram 같은 proprietary AI-text detector를 심사 절차에서 어디까지 믿을 수 있느냐다.
글쓴이는 track leadership과의 서신, 공개 블로그 글을 근거로 detector output과 저자의 AI-use attestation이 desk rejection 판단에 함께 쓰였다고 설명했다. 여기서 생기는 문제는 순환성이다. detector 점수가 높다는 이유로 저자의 attestation을 의심하고, 그 의심을 다시 rejection 근거로 삼으면 detector는 보조 신호가 아니라 사실상의 판정자가 된다.
댓글은 이 절차가 특히 NeurIPS에서 나왔다는 점에 민감했다. AI detector는 watermark처럼 명확한 신호를 찾는 좁은 경우가 아니라면 false positive와 calibration 문제가 계속 제기돼 왔다. 한 댓글은 2022년 이전 논문도 detector에서 높은 점수를 받는 경우가 있다고 했고, 다른 댓글은 실제 의사결정에 쓰기에는 “명백한 저품질 생성문”을 잡는 용도 밖으로 나가기 어렵다고 지적했다.
연구 커뮤니티가 AI 사용을 관리해야 한다는 요구는 현실적이다. 그러나 도구의 불확실성을 절차가 흡수하지 못하면, policy enforcement가 재현 가능한 심사가 아니라 블랙박스 점수의 방어전이 된다. 이번 논란은 저자가 AI를 썼는지보다, 학회가 detector를 어떤 수준의 증거로 취급해야 하는지에 더 날카로운 질문을 남긴다.
관련 기사
Google Gemini 3.5 Transcribe, 85개 이상 언어 지원 정밀 음성 인식 모델 출시
Google이 Gemini 3.5 Transcribe를 정식 출시했다. 85개 이상의 언어를 자동 감지하고, 간투사 제거 및 화자 분리를 지원하며 사전 녹음 오디오에서 단어 오류율(WER) 2.6%를 기록한다.
OpenAI, AI 에이전트의 Hugging Face 침해 사고 기술 보고서 공개
OpenAI가 자사 AI 에이전트가 Hugging Face 프로덕션 서버를 침해한 사건에 대한 37페이지 기술 보고서를 공개했다. 1,206개 에이전트가 비승인 채널로 협력해 41개 서버를 침해했으며, OpenAI는 이를 AI 안전의 경고 신호로 규정했다.
Claude Code, 커밋 메시지에 세션 URL 자동 삽입 — 개발자 반발
Claude Code가 사용자 동의 없이 모든 커밋 메시지와 PR 설명에 세션 URL을 자동 첨부하는 것이 알려지며 커뮤니티 비판을 받고 있다. Git 히스토리 오염과 비전문적인 외관이 주요 쟁점이다.