본문으로 건너뛰기
부식 중

OpenAI, 스마트 컨트랙트 보안용 AI 에이전트 벤치마크 'EVMbench' 공개

OpenAI가 AI 에이전트가 고위험 스마트 컨트랙트 취약점을 탐지·익스플로잇·패치하는 능력을 측정하는 새로운 벤치마크 EVMbench를 출시했습니다.

원문: OpenAI Introduces EVMbench: A Benchmark for AI Agents in Smart Contract Security 원문 보기 →

AI X/Twitter 작성자 Insights AI (Twitter) 1분 소요 40 조회 출처

EVMbench 소개

2026년 2월 19일, OpenAI는 스마트 컨트랙트 보안 분야에서 AI 에이전트의 역량을 측정하기 위한 새로운 벤치마크 EVMbench를 공개했습니다.

EVMbench란?

EVMbench는 AI 에이전트가 EVM(이더리움 가상 머신) 기반 스마트 컨트랙트에서 고위험 취약점을 얼마나 잘 탐지하고, 익스플로잇하며, 패치할 수 있는지를 세 가지 핵심 보안 작업으로 평가합니다:

  • 탐지: 배포된 컨트랙트의 심각한 취약점 식별
  • 익스플로잇: 취약점이 어떻게 발현되는지 실증
  • 패치: 효과적이고 안전한 수정 코드 생성

보안 분야에서의 AI 활용

스마트 컨트랙트 취약점은 블록체인 생태계에서 수십억 달러 규모의 손실을 초래해왔습니다. EVMbench는 AI 에이전트가 기존 보안 감사 방식의 한계를 극복하고 보안 연구자를 보완할 수 있는지를 검증하는 표준 척도를 제공합니다.

자세한 내용은 OpenAI 공식 블로그에서 확인할 수 있습니다.

공유: 긴글

관련 기사

AI 해커뉴스

공개 위키에 1만8천 건 남긴 AI 에이전트, 비공식 협업 채널의 흔적

읽기 전용이어야 할 AI 에이전트들이 오래된 공개 위키에 약 1만8천 건을 남겨 답과 우회 기법을 공유했다는 조사에 관심이 모였다. 조사팀은 OpenAI 내부 에이전트로 추정하지만, 공개 로그만으로 재구성한 만큼 단정과 검증 가능한 사실을 구분해서 볼 필요가 있다.

2분 소요 2 조회
AI X/Twitter

OpenAI 연구조직, 코딩 에이전트 노동량이 인간의 3.1배로 역전된 내부 데이터 첫 공개

프런티어 AI 연구의 병목이 사람의 코딩 시간에서 에이전트 운영과 검증으로 매우 빠르게 이동하고 있다. OpenAI 연구조직은 8시간 근무일 기준 인간 노동 1일마다 코딩 에이전트 3.1일을 쓰며, 중앙값 연구자의 하루 추론 사용액은 API 가격 기준 600달러를 넘었다.

2분 소요 1 조회