본문으로 건너뛰기

카테고리

LLM

Insights의 LLM 기사

RSS 피드
LLM X/Twitter

GitHub, Copilot CLI의 plan mode·/fleet·autopilot 기반 unit test 생성 workflow 시연

GitHub는 2026년 3월 28일 Copilot CLI가 plan mode, /fleet, autopilot 조합으로 터미널에서 robust한 test suite를 만들 수 있다고 밝혔다. 관련 GitHub docs는 /fleet를 병렬 subagent 실행으로, autopilot을 autonomous multi-step completion으로 설명하고 있어, 이번 post는 CLI 안에서의 multi-agent testing workflow를 보여 주는 구체적 사례다.

2분 소요 40 조회
LLM 레딧

r/LocalLLaMA가 주목한 TurboQuant on MLX, KV cache compression이 FP16 speed에 근접

r/LocalLLaMA에서 주목받은 March 28, 2026 게시물은 TurboQuant KV cache compression을 MLX와 custom Metal kernel에 이식한 구현 기록이다. 작성자는 Qwen2.5-32B on M4 Pro 48GB에서 4.6x compression과 0.98x FP16 speed를 주장했지만, repo README의 7B 수치는 더 보수적이어서 실제 이득이 model과 integration 방식에 크게 좌우된다는 점도 함께 드러난다.

2분 소요 50 조회
LLM

OpenAI, 더 빠른 coding·subagent용 GPT-5.4 mini·nano 출시

OpenAI가 March 17, 2026 GPT-5.4 mini와 nano를 공개했다. mini는 GPT-5 mini보다 2x 이상 빠르면서 coding, reasoning, multimodal understanding, tool use를 끌어올렸고, nano는 classification·data extraction·ranking·간단한 coding subagents용 초저비용 모델로 배치됐다.

2분 소요 47 조회
LLM X/Twitter

Google Cloud, Gemini CLI와 MCP servers로 앱 마이그레이션·배포 자동화 시연

GoogleCloudTech는 2026년 3월 27일 Gemini CLI가 Model Context Protocol(MCP) servers를 사용해 full-stack application을 migrate하고 deploy하는 데모를 공개했다. Google의 2025년 9월 11일 Gemini CLI extension 글과 2025년 12월 11일 MCP support 발표를 함께 보면, 이 데모는 Cloud Run용 /deploy, Google 서비스용 managed MCP endpoint, 그리고 IAM·audit logging·Model Armor 같은 enterprise control 위에서 돌아간다는 점이 드러난다.

2분 소요 39 조회
LLM X/Twitter

Cursor, enterprise network 안으로 self-hosted cloud agents 확대

Cursor는 2026년 3월 25일 cloud agents를 고객 인프라 안에서 그대로 실행할 수 있다고 밝혔다. Cursor 제품 글은 이제 일반 제공되는 self-hosted 구성으로 code, tool execution, build artifact를 고객 네트워크 안에 유지하면서도 isolated remote environment, multi-model support, plugin/MCP 확장성을 그대로 제공한다고 설명한다.

2분 소요 45 조회
LLM 레딧

r/LocalLLaMA가 주목한 TurboQuant, KV cache 압축으로 local LLM 한계 낮추나

r/LocalLLaMA에서 주목받은 TurboQuant는 KV cache를 3-bit로 압축해 memory 사용량을 최소 6배 줄일 수 있다는 Google Research 결과를 다시 끌어올렸다. 관건은 이 기법이 실제 local inference stack에 통합돼 long-context 성능과 운영 비용을 얼마나 바꿀 수 있느냐다.

2분 소요 53 조회