Meta의 Muse Spark, 멀티모달 추론과 병렬 에이전트를 앞세워 공개
Hacker News에서 Meta Superintelligence Labs의 첫 Muse 모델인 Muse Spark 공개가 크게 주목받았다. 이 모델은 tool use, visual chain of thought, 병렬 에이전트 기반 Contemplating mode를 전면에 내세운다.
태그
#multimodal 태그가 달린 기사
Hacker News에서 Meta Superintelligence Labs의 첫 Muse 모델인 Muse Spark 공개가 크게 주목받았다. 이 모델은 tool use, visual chain of thought, 병렬 에이전트 기반 Contemplating mode를 전면에 내세운다.
Show HN에 올라온 Parlor는 브라우저의 음성·카메라 입력을 Gemma 4 E2B와 Kokoro로 처리해 로컬에서 바로 음성 응답을 돌려준다. Apple M3 Pro 기준 2.5~3.0초 수준의 end-to-end latency를 공개한 점이 눈에 띈다.
LocalLLaMA의 데모 글은 Gemma 4 E2B와 Kokoro TTS를 이용해 음성·비전 대화를 전부 로컬에서 처리하는 Parlor를 소개했다. README 기준 Apple M3 Pro에서 end-to-end latency는 약 2.5~3.0초, decode speed는 약 83 tokens/sec다.
xAI가 Grok Imagine의 Quality mode에서 세계 지식과 프롬프트 이해력을 강화했다고 설명했다. 회사는 복잡한 장면, 물리 법칙, 객체 관계, 브랜드·지역·문화 참조를 더 정확히 해석할 수 있다고 주장한다.
Together AI는 2026년 4월 3일 Alibaba Cloud의 Wan 2.7이 자사 플랫폼에 들어온다고 밝혔다. 함께 공개된 제품 글은 text-to-video를 지금 바로 제공하고, image-to-video·reference-to-video·video edit를 같은 API·인증·과금 표면 위로 확장하겠다고 설명한다.
Google AI는 2026년 3월 26일 실시간 voice·vision agent를 만드는 개발자를 위해 Gemini 3.1 Flash Live를 출시한다고 밝혔다. Google은 더 자연스러운 대화 속도, noisy environment에서의 더 나은 task completion, 복잡한 instruction 처리 개선을 강조했고, Live API 문서는 low-latency multimodal streaming과 tool use, 70개 언어 지원을 설명한다.
Alibaba Cloud는 Qwen3.6-Plus를 1M context window, agentic coding, multimodal reasoning을 앞세운 실사용형 모델로 소개했고, HN은 이를 빠르게 핵심 AI 토론으로 끌어올렸다.
Google DeepMind가 Gemini 3 research를 바탕으로 한 open model family Gemma 4를 공개했다. E2B·E4B는 edge device, 26B·31B는 consumer GPU 기반 local workflow를 겨냥하며 function calling, multimodal reasoning, 140개 언어 지원을 전면에 내세웠다.
Meta는 2026년 3월 26일 X에서 TRIBE v2를 공개하며 sight·sound·language에 대한 human brain response를 예측하는 foundation model이라고 설명했다. 논문과 demo는 zero-shot generalization, 70,000 voxels 규모 예측, 공개된 paper·code·model weights를 핵심 포인트로 제시한다.
Google DeepMind는 2026년 3월 26일 Gemini 3.1 Flash Live가 Gemini Live와 Google Search Live에 순차 적용되고, 개발자는 Google AI Studio에서 바로 사용할 수 있다고 밝혔다. Google은 이 모델을 자사 최고 품질의 audio model로 규정하며, 더 낮은 latency와 향상된 tonal understanding, 그리고 ComplexFuncBench Audio 90.8% 성능을 강조했다.
Google은 2026년 3월 26일 Search Live를 AI Mode 제공 지역 전체로 확대했다. 이번 rollout은 voice와 camera 기반 search를 200개 이상 국가·지역으로 넓히고, Gemini 3.1 Flash Live를 실제 Search 인터페이스에 깊게 연결했다는 점에서 중요하다.
Mistral이 2026년 3월 16일 Mistral Small 4를 공개했다. 119B total parameters, 6B active parameters, 256k context window, Apache 2.0, configurable reasoning_effort를 결합해 reasoning·coding·multimodal 작업을 한 모델에 모았다.