본문으로 건너뛰기

카테고리

LLM

Insights의 LLM 기사

RSS 피드
LLM

Anthropic Mythos, 은행 패치 속도보다 빠른 취약점 탐색을 드러냈다

Reuters 분석은 Mythos가 은행권에 먼 미래의 위험이 아니라 바로 지금의 patch timing 문제를 들이민다고 본다. 미국, Canada, Britain의 officials가 이미 금융권과 만났고, Anthropic은 이 모델이 high severity·critical severity 취약점을 thousands 단위로 찾아냈다고 설명했다.

2분 소요 43 조회
LLM

LiteCoder, Terminal Bench Pro 31.5%로 코드 agent를 끌어올렸다

LiteCoder가 terminal 특화 모델만 내놓은 것이 아니라 11,255개 trajectory와 602개 Harbor 환경까지 함께 풀었다. 30B 모델은 Terminal Bench Pro에서 Pass@1 31.5%를 기록해 preview의 22.0%에서 크게 올라왔고, 작은 코드 agent도 아직 더 밀어 올릴 여지가 있다는 주장을 숫자로 뒷받침한다.

2분 소요 41 조회
LLM

AI agent에 셸과 파일시스템까지, Cloudflare Sandboxes가 GA로

Cloudflare가 agent 인프라를 데모 단계에서 끌어냈다. Sandboxes와 Containers가 정식 제공 단계에 들어가면서, 지속형 코딩 워크플로를 위한 7가지 업그레이드가 한 번에 묶였고, PTY 터미널부터 credential injection, 상태 유지형 interpreter, background process, file watch, snapshots, higher limits까지 들어왔다.

2분 소요 44 조회
LLM 레딧

LocalLLaMA가 들썩인 Gemma-4 audio 지원, llama-server에서 STT가 바로 돈다

LocalLLaMA가 이 thread를 크게 띄운 이유는 local agent stack에서 가장 귀찮은 별도 음성 파이프라인 하나를 치울 수 있다는 기대 때문이다. 게시물은 llama.cpp의 llama-server가 Gemma-4 E2A와 E4A 모델로 STT를 처리할 수 있게 됐다고 전했고, 댓글은 곧바로 Whisper와 Voxtral 비교로 넘어갔다.

2분 소요 53 조회
LLM 해커뉴스

Hacker News가 본 Claude Code Routines, 반복 작업을 cloud 쪽으로 밀어 넣는 autopilot

Hacker News는 아이디어 자체에는 빠르게 반응했지만, 댓글은 곧바로 현실적인 질문으로 이동했다. Anthropic의 Claude Code Routines는 prompt, repo, connector를 묶어 schedule, API call, GitHub event로 실행하는 cloud automation인데, community는 이런 자율성이 usage limit와 만나면 어디까지 실용적인지부터 따져 보기 시작했다.

2분 소요 35 조회