Lyria 3.5, Flow Music에 적용… 가사·보컬·템포 제어 강화
음악 생성 모델 경쟁이 음질보다 편집권으로 옮겨가고 있다. Google은 Lyria 3.5를 Flow Music에 적용하며 가사 품질, 보컬 표현, tempo와 duration 제어를 전면에 세웠다.
태그
#google 태그가 달린 기사
음악 생성 모델 경쟁이 음질보다 편집권으로 옮겨가고 있다. Google은 Lyria 3.5를 Flow Music에 적용하며 가사 품질, 보컬 표현, tempo와 duration 제어를 전면에 세웠다.
관심은 로봇이 말을 알아듣는지를 넘어, 걷고 숙이고 집고 협업하는 전신 행동을 한 모델 계열로 묶을 수 있는지에 모였다.
Google의 새 Gemini Flash 라인업에서 관심은 모델 이름보다 토큰 효율과 agent workflow 비용에 모였다. 3.6 Flash는 3.5 Flash보다 출력 토큰을 17% 줄였고, Cyber 모델은 CodeMender와 묶였다.
agentic RL 학습의 병목은 모델 계산보다 환경 대기 시간인 경우가 많다. Google Tunix는 asynchronous rollout과 producer-consumer pipeline으로 TPU idle time을 줄이는 JAX-native post-training library를 전면에 세웠다.
AI 생성물 출처 표시가 실험 단계를 넘어 대규모 배포로 이동했다. Google은 SynthID가 이미지와 영상 1000억 건, 오디오 6만 년 분량에 워터마크를 적용했고 검증은 5000만 회를 넘었다고 밝혔다.
Google의 개인 AI 에이전트가 Mac, MCP, 5개 외부 앱 연결로 확장된다. Canva, Dropbox, Instacart, OpenTable, Zillow Rentals까지 붙으면서 Spark는 챗봇보다 작업 실행 도구에 가까워졌다.
Google의 새 on-device 최적화는 모델을 다시 학습하지 않고도 속도를 끌어올리는 방식이다. Pixel 9·10의 Gemini Nano v3에 frozen Multi-Token Prediction을 붙여 token 생성 50% 이상, standalone drafter 대비 130MB 절감을 제시했다.
Google 지원을 받은 UC San Diego 연구진이 퇴역 스마트폰 메인보드를 모아 저탄소 클라우드 컴퓨팅 플랫폼을 만든다. 계획된 2,000대 Pixel 클러스터는 수업·채점·연구 워크로드를 처리하며, 25~50대가 현대 서버 1대급 역할을 맡는 구조다.
피부 증상을 검색어로 설명하기 어려운 사람에게 AI가 단순 진단 후보를 넘어 다음 행동 판단까지 도움을 줄 수 있다는 대규모 실험 결과가 나왔다. Google Research는 JAMA Dermatology 논문과 CHI 연구를 묶어, 2,345명 규모 평가에서 AI 기반 정보 도구의 효과와 한계를 함께 제시했다.
Google DeepMind가 26B MoE open model DiffusionGemma를 공개했다. 256-token 블록을 병렬로 다듬는 text diffusion 방식으로 전용 GPU에서 최대 4x 빠른 생성을 노린다.
검색 AI의 오답 책임을 어디까지 물을 수 있느냐가 HN 논쟁의 중심이었다. 뮌헨 법원은 AI Overview가 단순 링크가 아니라 Google의 자체 진술이라고 봤다.
기업 RAG의 약점은 답을 모르는 것이 아니라, 필요한 근거가 다른 저장소에 흩어졌을 때 너무 일찍 멈추는 데 있다. Google Research는 충분한 문맥을 검사하고 다시 검색하는 Agentic RAG로 factuality 데이터셋 정확도를 최대 34% 높였다고 밝혔다.