Taalas, 모델 특화 실리콘으로 저지연 AI 추론 전략 제시
Hacker News 고반응 스레드에서 Taalas의 모델 특화 실리콘 접근이 주목받았다. 회사는 하드와이어드 Llama 3.1 8B 기반으로 사용자당 17K tokens/sec 성능을 주장했다.
카테고리
Insights의 LLM 기사
Hacker News 고반응 스레드에서 Taalas의 모델 특화 실리콘 접근이 주목받았다. 회사는 하드와이어드 Llama 3.1 8B 기반으로 사용자당 17K tokens/sec 성능을 주장했다.
Anthropic은 2026년 2월 4일 Claude를 광고 없는 대화 공간으로 유지하겠다고 밝혔다. 회사는 사용자 신뢰와 모델 유용성을 핵심 기준으로 제시하며, 수익은 구독과 enterprise 계약 중심으로 유지하겠다고 설명했다.
Hacker News에서 높은 관심을 받은 Gemini 3.1 Pro 출시 소식. Google은 개발자·기업·일반 사용자 채널 전반에 Preview를 확장하며, ARC-AGI-2 점수 77.1%를 강조했다.
LocalLLaMA에서 주목받은 PR #19726은 ik_llama.cpp의 IQ*_K 계열 quantization 경로를 mainline llama.cpp로 포팅하는 초안으로, CPU backend 구현과 초기 KLD 비교를 함께 제시했다.
OpenAI는 2025-08-07에 GPT-5를 공개하며 ChatGPT와 API 동시 제공 전략을 발표했다. GPT-4o 대비 환각 45% 감소, HealthBench Hard 44.6 등 핵심 벤치마크 지표를 제시해 제품·개발자 양쪽에서의 전환 신호를 만들었다.
Hacker News에서 높은 반응을 얻은 Step 3.5 Flash는 196B total parameter와 약 11B active parameter를 내세운 MoE foundation model로 소개됐으며, 256K context와 coding/agent benchmark 수치를 함께 공개했다.
NVIDIA는 2026년 2월 12일, Baseten·DeepInfra·Fireworks AI·Together AI가 Blackwell 기반 추론 스택으로 token cost를 크게 낮추고 있다고 밝혔다. 발표에는 Hopper 대비 최대 10배 절감, 개별 고객사별 지연시간·비용 개선 수치가 포함됐다.
LocalLLaMA 인기 글은 13.6M 파라미터 matmul-free 모델을 2스레드 CPU에서 약 1.2시간 만에 학습했다고 보고했다. 작성자는 연산 병목이 ternary 코어가 아니라 출력 헤드에 집중된다고 주장했다.
Hacker News 고득점 글은 Anna's Archive의 새 `llms.txt`를 조명했다. 핵심은 CAPTCHA가 걸린 일반 웹 탐색 대신 Git 저장소, 토렌트, JSON 엔드포인트 같은 대량 접근 경로를 사용하라는 운영 지침이다.
NVIDIA는 2026년 2월 17일 인도 주요 SI가 NVIDIA AI를 기반으로 차세대 enterprise agents를 구축 중이라고 발표했다. Wipro·TCS·Infosys·Tech Mahindra·Accenture 사례와 함께, 인도 AI/GenAI 지출이 2028년 92억 달러를 넘길 것이라는 IDC 전망이 제시됐다.
Anthropic는 2026년 2월 13일 금융 서비스 전용 Claude offerings를 발표했다. KYC 분석, SEC/FINRA 규정 준수, 지점 운영 자동화 시나리오를 포함하며, AIG·Commonwealth Bank of Australia·iA Financial Group·Norges Bank Investment Management가 초기 고객 사례로 제시됐다.
LocalLLaMA 인기 글은 MiniMax-M2.5의 로컬 실행 가이드를 공유하며, GGUF 양자화·메모리 요구사항·agentic 워크로드 비용 구조를 둘러싼 실무 논의를 촉발했다.