OpenAI와 Paradigm, 스마트컨트랙트 보안 벤치마크 EVMbench 공개
OpenAI와 Paradigm이 스마트컨트랙트 취약점 탐지·패치·익스플로잇 능력을 평가하는 EVMbench를 발표했다. GPT-5.3-Codex는 exploit 모드에서 72.2%를 기록해 GPT-5의 31.9% 대비 큰 격차를 보였다.
카테고리
Insights의 LLM 기사
OpenAI와 Paradigm이 스마트컨트랙트 취약점 탐지·패치·익스플로잇 능력을 평가하는 EVMbench를 발표했다. GPT-5.3-Codex는 exploit 모드에서 72.2%를 기록해 GPT-5의 31.9% 대비 큰 격차를 보였다.
OpenAI와 Figma가 Codex와 Figma를 직접 연결하는 통합을 발표했다. MCP 기반 연동으로 코드에서 디자인, 디자인에서 구현 코드로 돌아오는 roundtrip 작업을 빠르게 수행할 수 있다는 점이 핵심이다.
Reddit r/singularity에서 주목받은 게시물은 OpenAI가 SWE-bench Verified 테스트 품질 문제를 이유로 해당 벤치마크 평가를 더 이상 사용하지 않겠다고 밝힌 소식을 공유했다. 최소 16.4% 결함 지적은 LLM 코딩 벤치마크 해석 방식에 직접적인 영향을 준다.
r/LocalLLaMA에서 화제가 된 DualPath 논문은 KV-Cache 로딩 경로를 분리해 I/O 병목을 완화하는 시스템 설계를 제안한다. arXiv 초록 기준으로 오프라인 최대 1.87배, 온라인 평균 1.96배 처리량 개선을 보고했다.
Benedict Evans의 분석 글을 다룬 HN 스레드(점수 388, 댓글 535)는 OpenAI의 지속가능한 해자(moat)가 무엇인지에 집중했다. 사용자 락인, 배포 채널, 엔터프라이즈 제품화가 핵심 쟁점으로 떠올랐다.
Google은 2026-02-25에 Gemini app의 multi-step task 기능을 발표했다. Pixel 10 계열과 Samsung Galaxy S26 series에서 베타로 시작하며, 초기 지역은 U.S.와 Korea다.
Anthropic는 2026-02-25 X 스레드에서 Claude Opus 3에 대해 deprecation과 preservation을 동시에 적용한다고 밝혔다. 유료 claude.ai 접근 유지와 API 요청 기반 접근이 핵심 변화다.
OpenAIDevs는 2026-02-24 X 게시물에서 GPT-5.3-Codex가 Responses API에서 모든 개발자에게 제공된다고 밝혔다. 기존의 단계적 접근에서 일반 개발자 접근으로 전환된 점이 핵심이다.
Hacker News 상위권에 오른 Truffle Security 분석은, 공개용으로 배포되던 Google API key가 Gemini API 활성화 이후 민감 권한으로 전환될 수 있다고 주장한다. 글은 2,863개 live key 사례와 대응 체크리스트를 함께 제시했다.
Google의 Gemini가 Pixel 10 및 Galaxy S26 일부 모델에서 앱 작업을 단계별로 수행하는 task automation을 프리뷰로 시작한다. 사용자는 최종 결제만 직접 확인·제출하고, 중간 단계는 AI가 자동으로 진행한다.
r/LocalLLaMA에서 Qwen3.5-122B-A10B 공개 링크가 빠르게 확산되며, GGUF 배포 시점과 양자화 효율, 실사용 처리량이 주요 화두가 됐다. 모델 카드 기준으로는 122B total / 10B activated MoE 구조, Apache-2.0 라이선스, 262,144 토큰 기본 컨텍스트가 제시됐다.
r/LocalLLaMA에서 Qwen3.5-35B-A3B를 단일 RTX 3090 환경으로 테스트한 사례가 큰 반응을 얻었다. 작성자는 100 tokens/s 이상과 실전 코딩 과제 통과를 보고했지만, 댓글에서는 툴 사용 안정성·하드웨어 편차·프롬프트 구성 변수에 따라 결과가 크게 달라진다는 의견도 함께 제기됐다.