본문으로 건너뛰기

카테고리

LLM

Insights의 LLM 기사

RSS 피드
LLM X/Twitter

Vercel, Chat SDK 공개… Slack·Discord·GitHub 에이전트를 단일 TypeScript 코드베이스로

Vercel은 2026년 3월 19일 내부 agent 배포에서 드러난 채팅 플랫폼 통합 병목을 줄이기 위해 Chat SDK를 만들었다고 밝혔다. 공식 글은 이 도구를 Slack, Teams, Google Chat, Discord, Telegram, GitHub, Linear, WhatsApp까지 단일 코드베이스로 연결하는 오픈소스 public beta TypeScript 라이브러리로 설명한다.

2분 소요 48 조회
LLM X/Twitter

Together AI, tool calling·reasoning·VLM fine-tuning 확대… 대형 MoE 학습 처리량 6배 향상

Together AI는 2026년 3월 19일 fine-tuning 서비스가 tool calling, reasoning, vision-language model 학습을 지원하고 MoE 아키텍처에서 최대 6배 높은 처리량을 낸다고 밝혔다. 공식 글은 최대 1T 파라미터급 모델 지원 방향과 함께 100GB 데이터셋, 사전 비용 추정, 학습 중 ETA 제공을 설명한다.

2분 소요 40 조회
LLM X/Twitter

Cloudflare, Workers AI에 Kimi K2.5 투입… agent 코딩·보안 검토 비용 77% 절감 제시

Cloudflare는 2026년 3월 20일 Kimi K2.5를 Workers AI에 올려 Cloudflare 개발자 플랫폼 위에서 end-to-end agent를 구축·운영할 수 있다고 밝혔다. 공식 블로그는 256k context, multi-turn tool calling, vision inputs, structured outputs와 함께, 내부 보안 검토 agent가 하루 7B 토큰을 처리하면서 비용을 77% 줄였다고 설명한다.

2분 소요 43 조회
LLM X/Twitter

OpenAI, Responses API에 container pool 추가… hosted shell·code interpreter 10배 가속

OpenAI Developers는 2026년 3월 21일 skills·hosted shell·code interpreter용 컨테이너 기동이 새 container pool 덕분에 약 10배 빨라졌다고 밝혔다. 업데이트된 hosted shell 문서는 `container_auto`와 `container_reference`를 통해 활성 컨테이너를 재사용할 수 있고, 20분 비활성 상태 후 만료된다고 설명한다.

2분 소요 42 조회
LLM 레딧

r/LocalLLaMA가 재조명한 Nemotron Cascade, 작은 activated params로도 강한 coding 성능

r/LocalLLaMA의 새 스레드는 NVIDIA의 Nemotron-Cascade-2-30B-A3B가 중형 Qwen 3.5 계열보다 더 강한 coding 결과를 낼 수 있다고 주장하며 주목을 끌었다. community benchmark와 NVIDIA의 model card를 함께 보면, local inference 비용과 reasoning 성능 사이의 새로운 균형점을 찾으려는 흐름이 읽힌다.

1분 소요 50 조회
LLM 해커뉴스

Hacker News가 주목한 tinybox, 120B급 offline AI를 shipping product로 밀어 올리다

2026년 3월 21일 Hacker News에서 다시 부각된 tinygrad의 tinybox는 local training과 inference를 겨냥한 120B급 offline AI workstation 구성을 전면에 내세웠다. 구체적인 GPU 사양과 가격이 함께 공개되면서 on-prem AI 수요를 어떻게 제품화할지에 대한 관심이 커졌다.

1분 소요 45 조회
LLM X/Twitter

Ollama, MiniMax-M2.7:cloud 제공… coding·agent workflow 겨냥

Ollama는 2026년 3월 18일 MiniMax-M2.7을 cloud 경로로 제공하며 Claude Code와 OpenClaw에서 바로 실행할 수 있다고 밝혔다. Ollama 라이브러리 페이지는 이 모델을 coding·agent workflow·professional productivity용 모델로 소개하며 SWE-Pro, VIBE-Pro, Terminal Bench 2, GDPval-AA, Toolathon 성적을 함께 제시한다.

2분 소요 50 조회