Azure, Microsoft Foundry에서 GPT-5.4 일반 제공 시작
Azure가 GPT-5.4를 Microsoft Foundry에서 일반 제공한다고 발표했다. Microsoft는 더 안정적인 multi-step execution과 governance controls를 내세우면서 GPT-5.4 Pro, 가격, 초기 배포 옵션도 함께 공개했다.
카테고리
Insights의 LLM 기사
Azure가 GPT-5.4를 Microsoft Foundry에서 일반 제공한다고 발표했다. Microsoft는 더 안정적인 multi-step execution과 governance controls를 내세우면서 GPT-5.4 Pro, 가격, 초기 배포 옵션도 함께 공개했다.
Google AI Developers가 Android 개발 전용 LLM 평가 체계인 Android Bench를 공개했다. 첫 결과에서는 Gemini 3.1 Pro가 1위를 차지했고, benchmark, dataset, test harness도 함께 공개됐다.
OpenAI Developers가 GPT-5.4 API용 프롬프팅 가이드를 업데이트했다. tool use, structured outputs, verification loops, 장기 워크플로우 패턴을 정리해 production-grade agents의 안정적인 실행을 지원하는 데 초점을 맞췄다.
LocalLLaMA의 한 글은 RX 9070 XT에서 llama.cpp `--ubatch-size`를 64로 낮췄더니 Qwen3.5-27B의 prompt processing 속도가 크게 뛰었다고 보고했다. 핵심은 64가 만능값이라는 것이 아니라, prompt ingestion과 token generation이 `n_ubatch`에 전혀 다르게 반응할 수 있다는 점이다.
r/LocalLLaMA에서는 `llama.cpp` pull request #19504가 병합된 뒤 Qwen3.5와 Qwen-Next에서 token generation 속도가 좋아졌다는 보고가 올라왔다. PR은 `GATED_DELTA_NET` op의 CPU/CUDA 구현을 추가한다.
Hacker News에서 주목받은 Unsloth의 Qwen3.5 가이드는 27B와 35B-A3B를 포함한 로컬 실행 경로를 메모리 요구량, thinking 제어, llama.cpp 명령 중심으로 정리한다.
Mistral이 Apache 2.0 기반의 멀티모달 오픈 모델군 Mistral 3를 발표했다. 14B, 8B, 3B dense 모델과 41B active, 675B total 규모의 Mistral Large 3를 함께 제시했다.
병합된 llama.cpp PR은 MCP 서버 선택, tool calls, prompts, resources, agentic loop를 WebUI 스택에 추가하며 로컬 추론을 한층 더 완전한 에이전트 워크플로로 밀어 올린다.
LocalLLaMA의 인기 글은 Open WebUI의 Open Terminal을 조명한다. Docker 또는 bare metal 실행 계층을 통해 로컬 모델이 명령 실행, 파일 편집, 결과물 반환을 채팅 안에서 수행하게 한다.
LocalLLaMA에서는 모델 템플릿을 분석해 reasoning·tool-call 형식을 더 적은 커스텀 파서 코드로 지원하려는 llama.cpp autoparser 병합을 주목하고 있다.
Hacker News에 올라온 Nvidia PersonaPlex 7B의 Swift/MLX 포팅기는 로컬 speech-to-speech 에이전트에서 모델 성능만큼 스트리밍·버퍼링·인터럽트 처리도 중요하다는 점을 보여준다.
Google의 2026년 2월 Gemini 업데이트는 Gemini 3.1 Pro, Deep Think, Nano Banana 2, Veo Templates, 새 Canvas 기능을 한 번에 묶어 내놓았다. 이번 드롭은 Gemini 앱을 단순 채팅창이 아니라 reasoning, image, music, video workflows의 전면 인터페이스로 밀어 올리려는 전략을 보여준다.