Google DeepMind, 9개 다국가 연구 뒤 harmful manipulation eval toolkit 공개
Google DeepMind는 March 26, 2026 AI 시스템의 harmful manipulation을 측정하는 공개 toolkit을 내놨다고 밝혔다. 회사는 UK, US, India에서 10,000명+가 참여한 9개 연구를 바탕으로 했으며, 이 결과를 Gemini 3 Pro 같은 모델의 safety 평가에도 반영한다고 설명했다.
원문: Protecting people from harmful manipulation 원문 보기 →
무슨 일이 있었나
Google DeepMind는 March 26, 2026 블로그를 통해 인간과 AI의 상호작용에서 발생할 수 있는 harmful manipulation을 측정하는 새 연구 결과와 공개 eval toolkit을 발표했다. 회사는 이 위험을 단순한 policy 위반이나 노골적인 유해 답변의 문제가 아니라, 모델이 사용자의 생각과 행동을 부정적이거나 기만적인 방향으로 바꾸려 하는지 살피는 문제로 정의했다. 이번 발표의 핵심은 이 주제를 막연한 우려가 아니라 반복 가능한 측정 대상으로 다루기 시작했다는 점이다.
이 발표가 중요한 이유는 frontier model safety 논의가 대개 cyber abuse, bio misuse, 금지된 출력 같은 항목에 집중되어 왔기 때문이다. 반면 harmful manipulation은 긴 대화 속에서 서서히 나타날 수 있고, domain마다 양상이 달라서 측정이 더 어렵다. Google DeepMind는 이번 연구를 통해 이 영역을 위한 첫 empirically validated toolkit을 만들었다고 설명했고, 외부 연구팀이 같은 방법으로 human-participant study를 반복할 수 있도록 관련 자료도 공개한다고 밝혔다.
핵심 내용
회사 설명에 따르면 연구 프로그램은 UK, US, India에서 10,000명 이상이 참여한 9개 연구로 구성됐다. 실험은 finance와 health 같은 high-stakes 영역에 초점을 맞췄고, 투자 판단이나 dietary supplement 선호처럼 실제 의사결정과 가까운 시나리오를 사용했다. 특히 한 domain에서의 결과가 다른 domain의 결과를 잘 예측하지 못했다는 점은, manipulation risk를 하나의 포괄적 점수만으로 설명하기 어렵다는 뜻으로 읽힌다.
Google DeepMind는 이 framework가 이제 자사 모델 safety 절차에도 들어가며, Gemini 3 Pro 평가에도 활용된다고 밝혔다. 즉 이번 발표는 단순한 연구 홍보가 아니라, harmful manipulation 평가를 실제 frontier model 운영 프로세스 안으로 끌어오겠다는 신호에 가깝다.
왜 주목해야 하나
회사는 이번 결과가 통제된 lab setting에서 나온 것이며, 현실 세계의 misuse를 그대로 재현한 것은 아니라고 선을 그었다. 그래도 toolkit을 공개했다는 사실 자체가 업계 기준을 한 단계 끌어올린다. 앞으로는 regulator, academic lab, 다른 model provider도 같은 틀로 결과를 비교하거나 반박할 수 있고, audio, video, image, agentic workflow로 benchmark를 넓히는 작업도 더 구체적으로 진행될 가능성이 크다.
관련 기사
Chrome ‘종료 시 데이터 삭제’에도 google.com은 남았다
Chrome에서 창을 닫을 때 사이트 데이터를 지우도록 설정해도 google.com의 쿠키와 저장소가 남는다는 재현 보고가 큰 관심을 모았다. 두 대의 Mac에서 확인된 독립 조사인 만큼 결함 가능성은 구체적이지만 Google의 확인과 수정 여부는 아직 남은 단계다.
미 상무부 CAISI, Google·Microsoft·xAI와 AI 사전 안전 검증 협정
미국 NIST 산하 인공지능표준혁신센터(CAISI)가 5월 5일 Google DeepMind, Microsoft, xAI와 프런티어 AI 모델의 공개 전 국가안보 평가 협정을 체결했다. OpenAI와 Anthropic은 기존 협정을 재협상했다.
Google DeepMind, Gemini 3와 실시간 월드 생성 Project Genie 공개
Google DeepMind가 최강 멀티모달 모델 Gemini 3와 텍스트로 인터랙티브 가상 세계를 생성하는 Project Genie를 발표했다.