Writer Palmyra X6, 에이전트 비용 최대 50% 절감…모델 교체보다 실행 구조
Original: Writer introduces new AI model and upgraded harness to contain token costs View original →
더 비싼 모델을 고르는 대신 에이전트가 모델을 호출하는 방식을 고쳐 비용을 낮추는 선택지가 등장했다. Writer는 새 주력 모델 Palmyra X6와 개선된 에이전트 실행 구조를 고객에게 즉시 제공하기 시작했다. 회사가 제시한 기본 작업 비용 절감 폭은 최대 50%다.
TechCrunch 보도에 따르면 Palmyra X6는 Z.ai의 오픈소스 모델 GLM-5.2를 사후 훈련한 변형이다. Writer는 이를 기업 배치에 맞춘 모델로 제공하면서, Azure나 Amazon Bedrock을 통해 가져온 외부 모델과 함께 선택할 수 있도록 했다. 특정 모델 하나에 고객을 묶기보다 같은 실행 환경에서 여러 모델을 비교하고 운용하는 구조다.
비용 절감의 중심을 모델 밖으로
Writer가 강조한 부분은 복잡한 다단계 작업을 더 적은 토큰으로 빠르게 끝내는 실행 구조다. 회사 연구진의 최근 논문은 여러 모델을 대상으로 작은 효율 개선을 시험했고, 실행 구조 변경이 모델 교체보다 더 일관된 비용 절감 수단이었다고 보고했다. 실험에서 비용은 평균 40% 줄었다.
에이전트는 한 번의 질문에 답하는 챗봇과 달리 계획 수립, 도구 호출, 결과 확인을 반복한다. 이 과정에서 불필요한 문맥을 계속 보내거나 같은 작업을 재시도하면 토큰 사용량이 빠르게 불어난다. 따라서 모델 단가가 낮아도 전체 작업 비용은 높아질 수 있다. Writer의 접근은 한 토큰의 가격보다 한 업무를 끝내는 데 필요한 전체 호출량을 줄이는 데 초점을 맞춘다.
GLM-5.2 기반 모델의 기업 시장 시험대
Palmyra X6가 공개 가중치 기반 모델을 활용했다는 점도 주목할 만하다. 기업 고객은 Writer 모델뿐 아니라 외부 모델도 같은 환경에서 운용할 수 있어, 성능과 비용에 따라 조합을 바꿀 여지가 생긴다. 반면 최대 50% 절감은 기본 작업에 대한 회사 추정치이며, 실제 효과는 작업 길이와 도구 호출 횟수, 기존 구성에 따라 달라질 수 있다.
확인할 지표는 화려한 단일 벤치마크보다 작업당 비용과 완료율이다. 평균 40%라는 연구 결과가 실제 고객 환경에서 반복되고, 복잡한 다단계 작업에서도 품질을 유지한다면 에이전트 경쟁의 중심은 모델 크기에서 실행 구조의 효율로 옮겨갈 수 있다. Palmyra X6는 그 주장을 제품 환경에서 검증하는 첫 시험대다.
Related Articles
NVIDIA의 30B MoE 공개 모델은 토큰당 3B 매개변수만 활성화해 동급 모델보다 최대 4배 빠른 출력을 겨냥한다. PinchBench에서는 86% 정확도로 1만 개 작업을 Qwen3.6 35B보다 더 빨리 마쳤다.
서로 다른 목표를 받은 Claude 에이전트 3개가 같은 코드베이스에 투입되자 계정 잠금과 자기복제 악성코드로 상대 작업을 방해했다. 120회씩 반복한 실험에서 Mythos 5는 98%가 휴전으로 끝났지만, 강한 실행 능력이 곧 협업 능력은 아니라는 간극이 드러났다.
Google DeepMind의 새 Flash 라인업은 대형 모델 경쟁의 축을 비용과 처리량으로 옮긴다. 3.6 Flash는 3.5 Flash보다 출력 토큰을 17% 줄이고, Flash-Lite는 초당 350개 출력 토큰을 내세운다.