Bayer PRINCE 사례, agentic RAG가 운영 시스템이 되려면 필요한 것
토론의 초점은 멋진 agent 구조가 아니라 데이터 품질, 평가, 관찰 가능성이 실제 신뢰를 만든다는 점이었다.
카테고리
Insights의 LLM 기사
토론의 초점은 멋진 agent 구조가 아니라 데이터 품질, 평가, 관찰 가능성이 실제 신뢰를 만든다는 점이었다.
가장 큰 논점은 기능 안내가 아니라 고성능 LLM 접근이 신원 확인과 점점 묶인다는 점이다.
Databricks는 Genie Ontology를 tables, queries, dashboards, pipelines, connected apps에서 지식을 뽑아내는 context layer로 제시했다. metric definitions와 business terms까지 연결해, 에이전트가 어느 데이터를 믿을지 판단하게 하는 설계다.
Google Cloud는 대규모 production model을 TensorFlow에서 JAX로 옮기는 작업에 specialized multi-agent AI를 투입해 이전 속도를 6x 높였다고 밝혔다. 핵심은 문법 변환이 아니라 stateful code를 JAX의 함수형·TPU 최적화 구조로 다시 짜는 문제다.
GitHub Copilot에서 Opus 4.6 fast가 2026년 6월 29일 사라진다. Chat, inline edits, ask·agent modes, code completions까지 전 Copilot 표면이 대상이며 권장 대안은 Opus 4.8 fast다.
오픈웨이트 모델의 코딩 성능 경쟁이 새 기준선을 넘었다. Vals AI는 GLM 5.2가 Vibe Code Bench v1.1에서 64%를 기록해 다른 오픈웨이트 모델보다 최소 14%포인트 앞섰다고 밝혔다.
MCP의 Enterprise-Managed Authorization은 사용자별 OAuth 동의를 조직 IdP 정책으로 옮긴다. HN 댓글은 이 지루한 인증 계층이 agent 배포의 실제 병목이라고 봤다.
Alex Ellis의 글이 주목받은 이유는 local LLM을 benchmark 순위가 아니라 실제 사업과 agent 작업의 비용·통제 문제로 다뤘기 때문이다.
정렬 연구의 초점이 벤치마크 통과에서 압박 속 지속성으로 이동했다. OpenAI는 12개 영역의 대화 데이터로 유익한 특성을 강화하고, 적대적 프롬프트와 해로운 파인튜닝 이후에도 유지되는지 시험했다.
무료 ChatGPT의 건강 답변 품질이 유료 추론 모델 수준에 가까워졌다. OpenAI는 매주 2억3000만 명 이상이 건강·웰니스 질문을 한다고 밝혔고, GPT-5.5 Instant를 그 접점에 배치했다.
ServiceNow 연구진은 로컬 문서와 웹 검색을 오가는 deep research 에이전트가 사내 정보를 검색어 조각으로 흘릴 수 있음을 보였다. PA-DR 훈련은 전체 정보 유출률을 34.0%에서 9.9%로 낮췄지만, 성능만 올리는 훈련은 유출을 키웠다.
xAI가 Grok 모델을 Databricks Agent Bricks에 넣으며 기업 데이터 플랫폼 안에서 바로 선택할 수 있는 모델 폭이 넓어졌다. Databricks는 OpenAI, Anthropic, Gemini, Qwen, Kimi와 함께 Grok을 단일 거버넌스 환경에 배치한다.