LLM Hacker News Jun 28, 2026 1 min read
로컬 LLM 관심은 이제 “돌아가나”에서 “두 노드를 어떻게 한 기계처럼 묶나”로 옮겨갔다. 이 가이드는 Framework Strix Halo 보드 두 대와 Intel E810 RoCE v2 구성을 vLLM serving까지 연결한다.
로컬 LLM 관심은 이제 “돌아가나”에서 “두 노드를 어떻게 한 기계처럼 묶나”로 옮겨갔다. 이 가이드는 Framework Strix Halo 보드 두 대와 Intel E810 RoCE v2 구성을 vLLM serving까지 연결한다.
r/LocalLLaMA에서 화제가 된 DualPath 논문은 KV-Cache 로딩 경로를 분리해 I/O 병목을 완화하는 시스템 설계를 제안한다. arXiv 초록 기준으로 오프라인 최대 1.87배, 온라인 평균 1.96배 처리량 개선을 보고했다.