Claude Code Remote Control 공개, HN은 모바일 원격 개발 경험과 안정성 이슈를 동시에 논의
Anthropic이 Claude Code Remote Control을 공개하면서 로컬 세션을 모바일과 웹에서 이어서 사용하는 방식이 화제가 됐다. HN 커뮤니티는 로컬 실행과 보안 모델을 긍정적으로 평가하면서도, 초기 버전의 연결 안정성과 UX 완성도에는 개선이 필요하다고 지적했다.
카테고리
Insights의 LLM 기사
Anthropic이 Claude Code Remote Control을 공개하면서 로컬 세션을 모바일과 웹에서 이어서 사용하는 방식이 화제가 됐다. HN 커뮤니티는 로컬 실행과 보안 모델을 긍정적으로 평가하면서도, 초기 버전의 연결 안정성과 UX 완성도에는 개선이 필요하다고 지적했다.
r/singularity에서 공유된 METR 후속 글은 2025년 “AI 사용 시 20% 감속” 결과 이후, 최신 도구 환경에서는 생산성 효과가 달라질 수 있음을 보여준다. 다만 연구팀은 강한 선택 편향 때문에 정밀한 추정은 어렵다고 명확히 밝혔다.
GitHub가 Copilot의 크로스 에이전트 메모리 기능을 공개 프리뷰로 제공한다고 밝혔습니다. Copilot coding agent, Copilot CLI, Copilot code review에서 레포지토리 단위 지식을 공유하며, 실험 결과 정밀도·재현율 및 사용자 지표 개선이 보고됐습니다.
LocalLLaMA 커뮤니티에서 Qwen3.5-35B-A3B 모델 카드가 빠르게 확산됐다. MoE 구조, 긴 context, 다양한 serving 프레임워크 호환성이 핵심 포인트로 언급된다.
r/LocalLLaMA 커뮤니티에서 Alibaba의 Qwen 공식 채팅 인터페이스에서 Qwen3.5 모델이 목격됐다는 제보가 올라왔다. Qwen3 시리즈 이후 다음 세대 LLM 출시가 임박했다는 신호로 해석되고 있다.
Opper가 53개 주요 LLM을 대상으로 "Car Wash" 논리 테스트를 실시했다. "세차장이 50미터 앞에 있는데 걸어갈까, 운전해 갈까?"라는 단순한 질문에 단 11개 모델만 정답을 맞혔다.
Zhipu AI의 GLM-5가 Extended NYT Connections 벤치마크에서 81.8점으로 Kimi K2.5 Thinking(78.3)을 넘어서 오픈 가중치 모델 중 최고 성능을 기록했습니다.
Guide Labs가 생성하는 모든 토큰을 입력 문맥, 개념, 훈련 데이터로 추적할 수 있는 최초의 '본질적으로 해석 가능한' 언어 모델 Steerling-8B를 출시했습니다. 1.35조 토큰으로 훈련되었습니다.
스티브 울프럼이 Wolfram Language와 Wolfram Alpha를 모든 LLM이 활용할 수 있는 '기반 도구'로 공식 제공한다고 발표했습니다. LLM의 자연어 능력과 Wolfram의 정밀 계산 능력을 결합하겠다는 구상입니다.
Google DeepMind가 2월 19일 Gemini 3.1 Pro를 공개했다. 전작 대비 ARC-AGI-2 점수가 31.1%에서 77.1%로 2배 이상 향상됐으며, 100만 토큰 컨텍스트 창과 SWE-Bench Verified 80.6%를 기록했다.
앤트로픽이 중국 AI 기업들이 2만 4,000개 이상의 허위 계정으로 Claude에서 1,600만 건의 훈련 데이터를 무단 추출했다고 고발했습니다.
Anthropic이 Microsoft 365 애드인 Claude in PowerPoint를 출시했다. 자연어 명령으로 슬라이드를 생성·편집하며 기존 디자인을 유지하는 기능을 제공한다. Pro·Max·Team·Enterprise 구독자 대상 리서치 프리뷰로 제공된다.