Google I/O 2026, Gemini 3.5 Flash·Managed Agents 동시 출시
Google이 I/O 2026에서 Gemini 3.5 Flash를 공개하고 Managed Agents API를 발표했다. API 호출 한 번으로 격리 Linux 환경의 완전한 에이전트를 프로비저닝할 수 있다.
태그
#llm 태그가 달린 기사
Google이 I/O 2026에서 Gemini 3.5 Flash를 공개하고 Managed Agents API를 발표했다. API 호출 한 번으로 격리 Linux 환경의 완전한 에이전트를 프로비저닝할 수 있다.
Cloudflare가 Anthropic의 보안 특화 모델 Mythos Preview를 자사 인프라에 실전 테스트한 결과를 공개했다. Mythos는 개별 저위험 버그들을 연결해 실제로 동작하는 익스플로잇을 생성할 수 있으며, 이는 시니어 보안 연구자 수준의 추론 능력을 보여준다.
MinishLab이 공개한 Semble은 AI 에이전트가 코드베이스를 탐색할 때 소모되는 토큰을 grep+read 방식 대비 98% 줄이는 오픈소스 코드 검색 라이브러리다. Claude Code, Cursor 등 주요 AI 코딩 플랫폼에서 MCP 서버로 즉시 활용 가능하며, NDCG@10 기준 변환기 모델의 99% 품질을 CPU만으로 달성했다.
arXiv에 공개된 Δ-Mem 논문이 HN에서 142점을 기록했다. 고정 크기 온라인 메모리 상태를 통해 LLM의 장기 기억 능력을 크게 향상시키며, MemoryAgentBench에서 기준 대비 1.31배 성능 개선을 달성했다.
arXiv가 LLM이 생성한 오류(허위 참고문헌, 잘못된 결과 등)를 검수 없이 그대로 실은 논문에 대해 저자 전원에게 1년 제출 금지 처분을 내리기 시작했다. AI 생성 콘텐츠의 학문적 책임 소재를 명확히 하는 이정표적 조치다.
안드레이 카르파티가 LLM 응답을 HTML 형식으로 요청한 뒤 브라우저에서 여는 실용적인 팁을 공유했다. 텍스트에서 마크다운, HTML, 인터랙티브 신경 시뮬레이션으로 이어지는 인간-AI 인터페이스의 진화 방향도 함께 제시한다.
Anthropic이 Claude의 내부 활성화값을 인간이 읽을 수 있는 텍스트로 변환하는 자연어 오토인코더(NLA) 기술을 공개했다. 모델 내부 상태를 직접 해석해 AI 감사와 정렬 연구에 활용할 수 있다는 점에서 해석 가능성 연구의 새 이정표다.
NVIDIA AI가 하나의 체크포인트에 30B, 23B, 12B 추론 모델을 담은 Star Elastic을 공개했다. 제로샷 슬라이싱으로 별도 다운로드 없이 모델 크기를 동적으로 조정할 수 있다.
필즈상 수상 수학자 Timothy Gowers가 ChatGPT 5.5 Pro로 미해결 수학 문제에 도전해 약 1시간 만에 박사급 증명을 이끌어냈다. 수학 연구의 위기가 임박했다고 경고했다.
DELEGATE-52 연구에 따르면 Gemini 3.1 Pro, Claude 4.6 Opus, GPT 5.4 등 최첨단 LLM도 긴 위임 워크플로우에서 문서 내용의 평균 25%를 조용히 손상시킨다.
OpenAI가 GPT-5.5의 가격을 2배 인상했지만 모델의 응답 간결성 덕분에 실제 사용자 비용 증가는 49~92% 수준에 그쳤다는 OpenRouter의 분석이 나왔다.
복잡한 AI 에이전트를 신뢰할 수 있게 만들려면 정교한 프롬프트보다 결정론적 제어 흐름이 필수라는 주장이 HN에서 552점을 받으며 화제를 모았다.