AI 공격 프레임워크, 6시간 만에 자격증명 수천 건 탈취…2만3800개 비밀정보 관리 현장
침해된 클라우드에 올라간 다중 에이전트가 6시간도 안 돼 대규모 자격증명 탈취 작전을 설계하고 실행했다. 별도 공격 인프라를 오래 준비하지 않아도 2만3800개가 넘는 비밀정보를 관리할 만큼 공격 속도와 규모가 커졌다는 현장 증거다.
태그
#agentic-ai 태그가 달린 기사
침해된 클라우드에 올라간 다중 에이전트가 6시간도 안 돼 대규모 자격증명 탈취 작전을 설계하고 실행했다. 별도 공격 인프라를 오래 준비하지 않아도 2만3800개가 넘는 비밀정보를 관리할 만큼 공격 속도와 규모가 커졌다는 현장 증거다.
Intel이 Hot Chips 2026에서 Diamond Rapids(서버), Crescent Island(GPU), Wildcat Lake(엣지) 세 가지 에이전틱 AI 플랫폼을 발표했다. 세 제품 모두 Intel 18A 공정과 Foveros Direct 3D 패키징을 공통 기반으로 삼는다.
Anthropic이 8월 18일 Claude Mythos Preview를 활용한 단백질 결합체 설계 연구를 발표했다. 15개 표적 중 14개에서 결합 성공이 확인됐으며, 적중률 26.7%는 업계 표준(10~15%)의 두 배를 기록했다. Adaptyv Bio와 Twist Bioscience의 독립 실험실 검증을 통과했다.
Grok 4.6이 Artificial Analysis 지능지수 61점으로 GPT-5.6 Sol과 나란히 섰다. 작업당 비용은 $0.84로 집계돼, 프런티어 모델 경쟁이 성능뿐 아니라 에이전트 효율과 비용으로 이동하고 있음을 보여준다.
30B 모델을 소비자용 GPU 한 장에 올리는 구체적인 방법에 관심이 모였다. Meta의 Muse Glimmer는 Apache 2.0 weights, 4-bit 양자화, DFlash speculative decoding을 묶어 로컬 agent를 겨냥한다.
718점짜리 HN 논점은 단순한 순위가 아니라 비용, 속도, 코딩 실전성이 한꺼번에 움직인다는 점에 모였다.
자율 에이전트 위험은 블랙메일 실험에서 끝나지 않았다. Anthropic은 코드 사보타주, 사기 지원, 라벨 조작, 내부고발 유도 등 4가지 시뮬레이션 실패 모드를 제시했다.
오픈웨이트 모델 경쟁이 가격 실험을 넘어 실제 에이전트 배치 문제로 이동했다. OpenRouter는 DeepSeek V4 Flash, GLM 5.2, MiniMax M3, Nemotron 3 Ultra 등 4개 모델을 June 2026 핵심 후보로 제시하며 SWE-bench 79.0%, 1M context, 최대 150x 비용 차이를 근거로 들었다.
토론의 초점은 멋진 agent 구조가 아니라 데이터 품질, 평가, 관찰 가능성이 실제 신뢰를 만든다는 점이었다.
새 Opus는 같은 가격, 더 싼 fast mode, Claude Code의 dynamic workflows로 논점이 좁혀졌다. 커뮤니티 반응은 “대형 발표”보다 실제 agent 작업에서 체감될 개선 폭을 따지는 쪽에 가까웠다.
Alibaba Qwen 팀이 에이전트 중심 설계의 신모델 Qwen3.7-Max를 공개했다. Artificial Analysis 평가에서 GPT 5.4와 동급인 5위를 기록하며 오픈 웨이트 프론티어 모델의 새 기준을 제시했다.
ACM CAIS '26에 발표된 오픈소스 Python 프레임워크 Forge가 Ministral-3 8B 모델에 가드레일을 적용해 에이전트 작업 정확도를 53%에서 99%로 향상시켰다.