OpenAI, AWS 안으로 들어왔다… GPT-5.5·Codex가 Bedrock에 붙는 이유
핵심은 모델 하나 더 늘었다는 소식이 아니다. OpenAI는 GPT-5.5, Codex, Amazon Bedrock Managed Agents를 AWS 제한 미리보기로 묶어, 기업이 보안·ID·조달 체계를 바꾸지 않고 frontier AI를 들이는 길을 열었다.
카테고리
Insights의 LLM 기사
핵심은 모델 하나 더 늘었다는 소식이 아니다. OpenAI는 GPT-5.5, Codex, Amazon Bedrock Managed Agents를 AWS 제한 미리보기로 묶어, 기업이 보안·ID·조달 체계를 바꾸지 않고 frontier AI를 들이는 길을 열었다.
LocalLLaMA가 가장 먼저 붙든 건 숫자보다 형태였다. Mistral Medium 3.5는 reasoning, coding, agent 작업을 한 모델에 묶으면서도 “이건 직접 돌려볼 수 있겠다”는 감각을 줬고, 그 지점이 스레드를 달궜다.
LocalLLaMA는 이 질문을 샤워실 잡담으로 넘기지 않았다. 스레드는 왜 오늘의 LLM이 잠재 벡터에 reasoning을 숨기지 않고, 여전히 언어 형태로 드러내는지에 대한 진짜 논쟁으로 번졌다.
HN은 문자열 장난보다 신뢰 붕괴에 먼저 반응했다. 최근 커밋에 대문자 <code>HERMES.md</code>가 들어가면 Claude Code 요청이 플랜 쿼터 대신 extra usage로 빠졌고, 커뮤니티는 보이지 않는 라우팅 규칙이 실제 돈을 태우는 구조를 문제 삼았다.
엔터프라이즈 AI의 병목은 모델 품질보다 재시도, 승인, 실행 이력에 더 자주 생긴다. Mistral은 이번 X 글에서 Python으로 짠 흐름을 Le Chat에서 실행하고 Studio에서 추적하는 Workflows를 공개 미리보기로 열었다고 적었다.
LocalLLaMA가 이 글을 반긴 이유는 'Gemma 4가 왠지 약하다'로 끝나지 않았기 때문이다. nullable JSON Schema가 빈 type 필드로 납작해지는 구체적 실패 지점을 잡아냈고, 작은 Jinja 수정으로 tool calling이 다시 살아났다.
최상단 댓글은 CP 밈으로 바로 달려갔지만, 글이 오래 붙은 이유는 따로 있었다. GDN chunked prefill에서 forward 2~3배, backward 2배라는 구체적 수치가 long-context와 엣지 추론 얘기로 곧장 이어졌기 때문이다.
HN은 이 글을 법률 잡학으로 넘기지 않았다. Claude Code 유출이 불씨가 되자, AI가 대부분 써버린 코드를 팀이 실제로 출하할 때 무엇이 내 것인지라는 질문이 바로 실무 문제로 튀어나왔다.
Axios에 따르면 OpenAI와 Anthropic은 취약점 탐지·악용 능력이 강한 신형 모델을 두고 미 하원 국토안보위원회에 비공개 브리핑을 했다. AI 위험 논의가 추상적 미래론에서, 전력망과 병원 같은 인프라 방어 문제로 옮겨가고 있다는 신호다.
멀티모달 에이전트는 아직 비전·오디오·텍스트 모델을 따로 엮느라 비용과 지연을 치른다. NVIDIA는 Nemotron 3 Nano Omni로 30B 파라미터, 256K 문맥, 동일 반응성 기준 영상 추론 시스템 용량 최대 9.2배를 내세웠다.
로컬에서 굴릴 수 있는 오픈웨이트 코딩 모델은 아직 드물다. Poolside는 33B 총량·3B 활성 MoE인 Laguna XS.2를 1GPU 구동 모델로 내놓았고, 기술 글에서는 SWE-bench Pro 44.5%를 제시했다.
LocalLLaMA가 바로 반응한 이유는 체감 포인트가 분명해서다. 작은 GBNF 제약만으로 Qwen3.6의 reasoning drag를 줄이고, 긴 작업의 토큰 낭비와 시간을 같이 깎았다는 주장이 나왔다.