Cursor, Cursor 3로 multi-agent workspace를 개발 흐름의 중심에 배치
Cursor는 4월 3일 X 게시물에서 Composer 2 사용량을 일시적으로 늘리며 새 Cursor 3 interface를 밀었다. 핵심은 IDE 안 AI 패널이 아니라 local·cloud·remote 환경에서 여러 agent를 조율하는 workspace로 제품의 중심을 옮긴 점이다.
카테고리
Insights의 LLM 기사
Cursor는 4월 3일 X 게시물에서 Composer 2 사용량을 일시적으로 늘리며 새 Cursor 3 interface를 밀었다. 핵심은 IDE 안 AI 패널이 아니라 local·cloud·remote 환경에서 여러 agent를 조율하는 workspace로 제품의 중심을 옮긴 점이다.
LocalLLaMA의 한 구현 보고는 Apple Silicon용 native MLX DFlash runtime으로 Qwen 계열 inference를 2배에서 3배 이상 가속했다고 주장한다. 중요한 점은 speedup뿐 아니라 greedy baseline과 bit-for-bit identical output을 유지했다고 설명한 부분이다.
Claude는 2026년 4월 9일 advisor strategy를 Claude Platform beta로 공개했다. Sonnet 또는 Haiku가 단일 Messages API request 안에서 Opus에 계획 조언을 요청할 수 있게 하며, Anthropic은 이 구성이 Sonnet 단독 대비 SWE-bench Multilingual을 2.7포인트 높이고 task당 비용은 11.9% 낮췄다고 설명한다.
r/MachineLearning에 올라온 Dante-2B 진행 보고는 Italian 형태와 token 효율을 위해 tokenizer부터 다시 설계한 2.1B bilingual LLM의 1단계 학습 결과를 공유한다.
GitHub는 April 24, 2026부터 Copilot Free, Pro, Pro+ 사용자의 상호작용 데이터를 사용자가 opt out하지 않는 한 AI 모델 학습과 개선에 활용하겠다고 밝혔다. Business와 Enterprise 플랜은 제외되지만, 개인 요금제 Copilot 사용 데이터가 모델 개발로 다시 흘러가는 범위는 크게 넓어진다.
Google Cloud Tech는 2026년 4월 10일 BigQuery의 autonomous embedding generation preview를 소개했다. BigQuery는 source text가 바뀔 때 embedding column을 자동 갱신하고, 이후 vector index와 AI.SEARCH 흐름으로 바로 연결할 수 있게 한다.
Databricks AI Research는 2026년 4월 10일 Memory Scaling for AI Agents를 공개하며, real-world agent 성능은 더 긴 reasoning보다 external memory 축적과 retrieval 품질에 더 크게 좌우될 수 있다고 주장했다. 글은 labeled 예제, user log, organizational knowledge로 정확도와 효율이 함께 개선되는 결과를 제시한다.
Claude는 2026년 4월 10일 Claude for Word beta를 Team과 Enterprise plan에 공개했다. 이 add-in은 Word sidebar 안에서 초안 작성과 수정 작업을 수행하면서 formatting을 유지하고 결과를 tracked changes로 돌려준다.
LocalLLaMA에서 주목받은 글은 SGLang b12x+NEXTN, PCIe switch topology, 공개 raw benchmark JSON을 바탕으로 듀얼 RTX PRO 6000 Blackwell에서 Qwen3.5-122B NVFP4가 약 198 tok/s를 기록했다고 공유했다.
vLLM은 NVIDIA가 Qwen3-VL 기반 첫 MLPerf vision-language benchmark 제출에 자사 framework를 사용했다고 밝혔다. 함께 링크된 NVIDIA blog는 이 결과를 Blackwell Ultra 성능 강화 흐름 속에 배치하며 일부 workload에서 최대 2.7배 throughput과 60% 이상 token cost 절감을 주장한다.
LocalLLaMA의 고득점 스레드는 llama.cpp에 merge된 PR #19378을 계기로 <code>--split-mode tensor</code> 기반 multi-GPU 실행이 더 현실적인 옵션이 됐다고 봤다. 다만 현재 성숙도는 CUDA 중심이며, ROCm은 돌아가도 layer split보다 느릴 수 있고 Vulkan은 성능과 안정성 모두 과제로 남아 있다.
Hacker News에서 주목한 SkyPilot 글은 coding agent가 코드를 건드리기 전에 논문과 경쟁 구현을 읽도록 하면 llama.cpp CPU inference 최적화 품질이 실제로 올라간다고 주장했다. 4대의 cloud VM과 약 29달러 비용으로 TinyLlama 1.1B 기준 x86 text generation을 15%, ARM을 5% 끌어올렸다는 점이 핵심이다.