본문으로 건너뛰기

카테고리

LLM

Insights의 LLM 기사

RSS 피드
LLM X/Twitter

OpenAI와 Perplexity, Realtime API 기반 voice agent 운영 교훈 공개

OpenAI Developers는 2026년 3월 30일 Perplexity가 Realtime API 기반 voice 경험을 production에서 운영하며 얻은 교훈을 공개했다고 밝혔다. 게시물에 따르면 Perplexity는 월 수백만 건의 voice session을 처리하고 있으며, context chunking, audio format 표준화, noisy environment에서의 turn-taking 조정 방식을 바꿨다.

2분 소요 35 조회
LLM X/Twitter

Google, Gemini 3.1 Flash Live 출시 확대… Gemini Live·Search Live·AI Studio 동시 전개

Google DeepMind는 2026년 3월 26일 Gemini 3.1 Flash Live가 Gemini Live와 Google Search Live에 순차 적용되고, 개발자는 Google AI Studio에서 바로 사용할 수 있다고 밝혔다. Google은 이 모델을 자사 최고 품질의 audio model로 규정하며, 더 낮은 latency와 향상된 tonal understanding, 그리고 ComplexFuncBench Audio 90.8% 성능을 강조했다.

2분 소요 45 조회
LLM 레딧

r/LocalLLaMA, Qwen3.5-27B를 llama.cpp와 OpenCode에 붙이는 실전 구성 주목

2026년 3월 r/LocalLLaMA에서 126 points와 45 comments를 모은 글은 Qwen3.5-27B를 llama.cpp로 구동하고 OpenCode에 연결하는 실전 가이드를 조명했다. 이 글이 주목받은 이유는 quant 선택, chat-template 수정, VRAM 예산, Tailscale 네트워킹, tool-calling 동작처럼 로컬 coding 환경을 실제로 좌우하는 운영 디테일을 다뤘기 때문이다.

2분 소요 50 조회
LLM 레딧

r/MachineLearning이 끌어올린 94개 LLM 엔드포인트 비교, 오픈 모델 격차는 얼마나 좁혀졌나

3월 1일 r/MachineLearning에서 주목받은 벤치마크 정리는 94개 LLM 엔드포인트를 비교하며 오픈 모델이 proprietary 최상위권에 거의 한 자릿수 격차로 따라붙었다고 주장했다. 핵심 메시지는 이제 모델 선택이 “누가 제일 똑똑한가”보다 가격, 속도, 배포 유연성까지 함께 보는 운영 문제로 바뀌었다는 점이다.

2분 소요 40 조회
LLM X/Twitter

OpenAI, ChatGPT에 File Library 추가해 업로드·생성 파일 재사용 강화

OpenAI는 2026년 3월 23일 ChatGPT에 File Library를 추가해 업로드하거나 생성한 파일을 대화 사이에서 다시 찾고 재사용할 수 있게 한다고 밝혔다. 공식 release notes에 따르면 Library는 web에서 제공되며, recent files와 file search는 iOS·Android에서도 지원되고, Plus·Pro·Business 사용자에게 글로벌 rollout 중이며 EEA·스위스·영국은 곧 지원된다.

1분 소요 57 조회
LLM 레딧

Reddit가 주목한 TurboQuant, 정확도 손실 없이 3-bit KV cache 압축을 노리는 Google 접근

2026년 3월 r/singularity에서 공유된 Google Research의 TurboQuant 글은 114 points와 18 comments를 얻었다. Google은 이 방법이 needle 계열 작업에서 KV cache 메모리를 최소 6배 줄이고, 학습 없이 3-bit cache 압축과 H100 기준 최대 8배 attention-logit 속도 향상을 보여준다고 설명한다.

2분 소요 48 조회