Hacker News가 LiteLLM 침해를 AI supply-chain 리스크 경고로 읽다
빠르게 확산된 HN thread는 LiteLLM incident를 단순 package 사고보다 크게 해석했다. AI developer infrastructure도 이제 cloud infra와 같은 supply-chain 리스크를 안지만, dependency discipline은 더 느슨하고 secret surface는 더 넓다는 지적이다.
카테고리
Insights의 LLM 기사
빠르게 확산된 HN thread는 LiteLLM incident를 단순 package 사고보다 크게 해석했다. AI developer infrastructure도 이제 cloud infra와 같은 supply-chain 리스크를 안지만, dependency discipline은 더 느슨하고 secret surface는 더 넓다는 지적이다.
NVIDIA가 2026년 3월 23일 OpenShell을 공개했다. 회사는 autonomous agent마다 sandbox를 분리하고 security policy를 infrastructure layer에 두는 방식으로, agentic workflow를 더 안전하게 운영할 수 있다고 설명했다.
Microsoft Research가 2026년 3월 4일 15 billion parameter open-weight 모델 Phi-4-reasoning-vision-15B를 공개했다. 회사는 이 모델이 multimodal reasoning, math·science task, computer-use scenario에서 경쟁력 있는 성능을 내면서도 compute cost를 낮추는 데 초점을 맞췄다고 설명했다.
OpenAI는 2026년 3월 17일 X에서 GPT-5.4 mini가 ChatGPT, Codex, API에 출시됐다고 밝혔다. 회사는 mini를 더 빠른 coding과 multimodal 작업용 모델로 소개했고, 함께 공개한 공식 글에서는 API 전용 GPT-5.4 nano도 추가했다.
LocalLLaMA의 기술 토론은 FlashAttention-4 논문을 실제 배포 관점으로 풀어내며, Blackwell에서의 큰 성능 향상과 Python 기반 kernel 개발 속도 개선, 그리고 A100·consumer GPU 사용자가 당장 누리기 어려운 현실을 함께 짚었다.
Perplexity는 2026년 3월 12일 Computer for Enterprise를 공개했다. SOC 2 Type II, SAML SSO, audit logs, admin controls를 기반으로 browser 작업과 code execution을 isolated cloud environment에서 실행하는 것이 핵심이다.
Cloudflare는 3월 19일 X에서 Kimi K2.5의 Workers AI 지원을 발표했다. 단순 모델 추가가 아니라, agent workload의 지연과 비용을 줄이기 위한 platform 기능도 함께 내놓은 출시다.
Hacker News에서 주목받은 Skylar Payne의 글은 AI 시스템이 커질수록 팀들이 DSPy의 핵심 패턴을 다시 구현하게 된다고 주장한다. 동시에 HN 토론에서는 Python 중심성, prompt optimization의 위치, evals 설계 비용이 adoption을 늦추는 현실적 이유로 함께 지적됐다.
OpenAI가 2026년 2월 2일 Codex app을 공개했다. macOS용 desktop interface를 통해 multiple agents를 병렬로 감독하고 skills와 Automations를 관리하도록 설계됐으며, 2026년 3월 4일에는 Windows 지원도 추가됐다.
Cloudflare는 2026년 3월 20일 Kimi K2.5를 Workers AI에서 제공해 agent를 자사 플랫폼 위에서 end-to-end로 실행할 수 있다고 밝혔다. 연결된 Cloudflare 블로그는 256K context, multi-turn tool calling, vision, structured outputs 지원과 함께 한 내부 agent workload에서 비용을 77% 줄였다고 설명한다.
Together AI는 2026년 3월 19일 자사 fine-tuning 서비스가 tool call, reasoning, vision-language workflow를 기본 지원한다고 밝혔다. 연결된 Together AI 블로그는 100B+ parameter 모델, 최대 100GB 데이터셋, 대형 MoE 모델에서 최대 6배 처리량, 학습 전 비용 추정과 실행 중 ETA 제공까지 포함된다고 설명한다.
r/LocalLLaMA의 Mi50 벤치마크 글은 llama.cpp에서 ROCm 7 nightly와 Vulkan을 비교하며, 짧은 문맥에서는 Vulkan이 강하지만 긴 문맥과 MoE에서는 ROCm이 앞선다는 관찰을 제시했다.