본문으로 건너뛰기

NVIDIA Switchyard 공개…에이전트 단계마다 약한·강한 모델을 나눠 호출하는 오픈소스 프록시

Original: NVIDIA Switchyard Routes Agent Tasks Across Weak and Strong Models View original →

Read in other languages: English日本語
LLM Aug 16, 2026 By Insights AI (Twitter) 1 min read Source
NVIDIA Switchyard 공개…에이전트 단계마다 약한·강한 모델을 나눠 호출하는 오픈소스 프록시

한 에이전트가 여러 모델을 골라 쓰는 프록시

복잡한 계획에는 강한 모델을, 반복 실행에는 더 작고 저렴한 모델을 붙이는 구성이 NVIDIA NeMo의 독립 오픈소스 도구로 공개됐다. Switchyard는 에이전트가 사용하는 API 형식을 유지한 채 요청을 여러 제공자와 모델로 라우팅한다. 모든 단계를 같은 최고급 모델에 보내는 비용 구조를 바꾸려는 시도다.

“Not every step in an agent workflow needs the same model.” — NVIDIA AI

원문 트윗은 복잡한 추론과 계획에는 프런티어 모델을, 대량의 특화 실행에는 Nemotron Lightning을 쓰는 구성을 제시했다. 게시물은 160개의 좋아요, 25회의 재게시, 약 1만3천 회의 조회를 기록했다. 숫자보다 중요한 부분은 Switchyard가 단순한 모델 추천표가 아니라 실제 요청 경로에 들어가는 프록시라는 점이다.

세 가지 API 형식을 한 경로에서 변환

공개 저장소에 따르면 Switchyard는 OpenAI Chat Completions, OpenAI Responses, Anthropic Messages 형식 사이를 변환한다. Claude Code, Codex CLI, OpenClaw가 기존 호출 방식을 유지하면서 vLLM, NVIDIA NIM, Ollama 또는 OpenAI 호환 엔드포인트를 사용할 수 있다. 라우팅 방식은 무작위 분배, LLM 분류기, 대화 중 신호를 이용한 단계별 라우터, 약한 모델의 답을 심판한 뒤 강한 모델로 올리는 에스컬레이션을 포함한다.

운영 측면에서는 요청 수, 오류, 지연 시간, 토큰, 라우팅 오버헤드를 Prometheus 지표로 기록한다. 따라서 A/B 시험과 비용·성능 비교를 같은 프록시에서 수행할 수 있다. 라이선스는 Apache 2.0이며, 저장소는 현재 1,600개가량의 GitHub 스타를 모았다. 다만 프로젝트 스스로 프리알파이자 실험용이라고 표시하며, 1.0 이전에 API와 알고리즘이 크게 달라질 수 있다고 경고한다.

다음에 확인할 것

실제 가치는 라우터가 품질을 얼마나 덜 잃고 비용과 지연 시간을 줄이는지에 달렸다. 공개 벤치마크에서 단일 강한 모델 대비 정확도, 토큰 비용, 라우팅 지연이 함께 제시되는지 봐야 한다. 장애가 난 백엔드의 우회, 장기 대화의 모델 일관성, 도구 호출 형식의 완전한 호환성도 프로덕션 채택을 가를 지표다.

Share: Long

Related Articles

LLM 4d ago 1 min read

에이전트에게 더 많은 자유를 주는 대신 탐색과 검증을 의도적으로 제한하자 코드 리뷰 품질은 최대 2.17배로 높아지고 토큰 사용량은 5~15분의 1로 줄었다. 200개 실제 PR과 1,505개 검증 의견을 사용한 Alibaba 연구팀의 결과는 모델 크기보다 워크플로 설계가 중요할 수 있음을 보여준다.