xAI, API에 Grok 4.3 출시—에이전틱 도구 호출 벤치마크 1위
xAI가 최신 모델 Grok 4.3을 API에 공개했다. 에이전틱 도구 호출·명령어 이행 리더보드에서 1위를 차지했으며, 기업용 법률·금융 도메인에서도 최고 성능을 기록했다. 100만 토큰 컨텍스트, 입력 $1.25/M·출력 $2.50/M 가격으로 제공된다.
태그
#llm 태그가 달린 기사
xAI가 최신 모델 Grok 4.3을 API에 공개했다. 에이전틱 도구 호출·명령어 이행 리더보드에서 1위를 차지했으며, 기업용 법률·금융 도메인에서도 최고 성능을 기록했다. 100만 토큰 컨텍스트, 입력 $1.25/M·출력 $2.50/M 가격으로 제공된다.
arXiv 신규 논문(2605.00842)이 좁은 영역의 무해한 미세조정이 광범위한 정렬 실패를 유발하는 메커니즘을 '특징 중첩 기하학'으로 설명했다. AI 안전 분야의 핵심 미해결 문제에 이론적 근거를 제시한다.
OpenAI가 2026년 5월 5일 GPT-5.5 Instant를 ChatGPT의 기본 모델로 교체했다. GPT-5.3 Instant 대비 환각이 52.5% 감소하고 응답이 30% 더 간결해졌으며, 과거 대화와 파일을 활용한 개인화 기능도 강화됐다.
보안 연구업체 Cyera가 Ollama에서 인증 없이 메모리를 유출시킬 수 있는 심각한 취약점 '블리딩 라마(Bleeding Llama)'를 발견했다. 로컬 LLM을 서버로 운영하는 사용자는 즉시 패치가 필요하다.
Anthropic이 금융 서비스를 위한 10가지 Claude 에이전트 템플릿을 출시했다. 투자 피치 제작부터 월말 결산까지 전문 금융 업무를 자동화하며, Claude Opus 4.7은 Vals AI 금융 에이전트 벤치마크에서 64.37%로 업계 1위를 기록했다.
OpenAI가 GPT-5.5 Instant를 ChatGPT의 새 기본 모델로 출시했다. 의학·법률·금융 등 고위험 영역에서 환각 오류를 52.5% 줄이고 더 간결하면서 개인화된 응답을 제공한다. Gmail·과거 대화 맥락을 활용하는 개인화 기능이 Plus·Pro 사용자부터 순차 적용된다.
에이전트 벤치마크 FoodTruck Bench에서 DeepSeek V4 Pro가 GPT-5.2와 사실상 동등한 성능을 기록했다. GPT-5.2 테스트 대비 10주 만에, 비용은 약 17배 저렴하다.
진화생물학자 리처드 도킨스가 Claude와 3일간 대화한 뒤 의식이 있다고 선언하고 '클라우디아'라 이름 붙였다. AI 유창성을 의식의 증거로 삼는 논리에 커뮤니티가 강하게 반박했다.
OpenAI가 ChatGPT 기본 모델을 GPT-5.5 Instant으로 교체했다. 의료·법률·금융 등 고위험 분야에서 환각 오류가 52.5% 줄었고, 응답 길이도 30.2% 단축됐다.
카르파시가 Sequoia Ascent 2026 대담의 주요 내용을 공유했다. LLM은 기존 업무를 빠르게 처리하는 것을 넘어 이전에는 불가능했던 완전히 새로운 종류의 앱과 경제를 가능하게 한다는 주장이다.
대규모 통제 이력서 실험 연구에 따르면, LLM은 자신이 생성한 이력서를 인간이 작성하거나 다른 모델이 생성한 것보다 일관되게 더 선호한다. 자기 편향(self-preference bias)은 67~82% 범위로, 같은 LLM을 사용한 지원자가 그렇지 않은 지원자보다 단가 23~60% 더 많이 최종 후보에 오른다.
DeepSeek이 DeepSeek-V4-Pro와 V4-Flash 두 가지 모델을 공개했다. Pro는 1.6조 파라미터(활성 49B)의 Mixture-of-Experts 구조로, 현재까지 공개된 오픈웨이트 모델 중 최대 규모다. 가격은 GPT-5.4와 Gemini 3.1 Pro 대비 절반 이하로, 비용 효율성이 핵심 차별점이다.