Gemini, Google Photos로 image prompt를 개인화한다
Google이 Gemini image generation을 긴 prompt 작성에서 계정 context 활용으로 옮겼다. 미국 Google AI Plus, Pro, Ultra 구독자는 Google Photos와 Nano Banana 2를 연결해 개인 사진과 취향을 반영한 이미지를 만들 수 있다.
카테고리
Insights의 AI 기사
Google이 Gemini image generation을 긴 prompt 작성에서 계정 context 활용으로 옮겼다. 미국 Google AI Plus, Pro, Ultra 구독자는 Google Photos와 Nano Banana 2를 연결해 개인 사진과 취향을 반영한 이미지를 만들 수 있다.
HN은 Cloudflare Email Service를 agent feature보다 “또 하나의 email sender”로 해석했다. 댓글은 Workers integration, SES 대안, spam, MTA-STS, sending limit 같은 낡지만 중요한 문제로 모였다.
HN은 Codex의 새 방향을 “무엇을 할 수 있나”보다 “어디까지 컴퓨터를 맡겨도 되나”로 읽었다. desktop agent, non-developer workflow, sandbox, 민감한 file 접근이 댓글의 핵심이었다.
Vercel은 apps와 agents를 위한 durable execution을 first-party primitive로 만들고 있다. Workflows는 1,500+ customers의 100M+ beta runs 뒤 GA가 됐고 queues, workers, retry infrastructure를 줄이는 방향이다.
Cursor는 better coding model이 developer work의 형태를 바꾼다는 주장을 usage data로 뒷받침했다. 500-team study에서 high-complexity tasks는 68% 늘었고, documentation은 62%, UI/styling은 15% 증가했다.
OpenAI가 Codex를 coding workspace에서 desktop agent로 넓히고 있다. thread는 Mac app 제어, image 생성, work preference 기억, 90+ plugins 연결을 한 번에 묶었다.
HN이 크게 반응한 이유는 실패 패턴이 너무 익숙했기 때문이다. client-side key, 지연되는 cost reporting, hard stop이 아닌 budget alert가 한꺼번에 겹쳤다. Google AI Developers Forum 글은 Firebase AI Logic을 켠 뒤 몇 시간 만에 Gemini API 사용량이 €54,000+까지 갔다고 설명했고, 댓글은 small team에게 cloud billing 안전장치가 충분한지로 번졌다.
Google이 Gemini in Chrome에 Skills를 넣어 반복 prompt를 한 번 저장하고 현재 page나 선택한 tabs에서 다시 실행하게 했다. Mac, Windows, ChromeOS의 English-US desktop 사용자부터 rolling out되며 calendar 추가나 email 발송 같은 작업에는 확인 절차가 붙는다.
coding agent가 단순 PR 보조를 넘어 GPU kernel 최적화까지 들어갔다. Cursor는 NVIDIA와의 실험에서 235개 CUDA 문제를 3주간 풀어 38% geomean speedup을 냈다고 밝혔다.
AI Max가 beta를 벗어나면서 Google Ads의 오래된 Search automation 흐름이 9월부터 바뀐다. Dynamic Search Ads, automatically created assets, campaign-level broad match가 AI Max로 넘어가고, Google은 full feature suite 사용 시 평균 7% 더 많은 conversions 또는 conversion value를 제시했다.
Google의 새 speech model은 음성 품질보다 더 어려운 문제인 제어성을 전면에 둔다. Gemini 3.1 Flash TTS는 audio tags, 70+ languages, 1,211 Elo, SynthID watermarking을 함께 내세우며 Gemini API, Google AI Studio, Vertex AI, Google Vids로 풀렸다.
이 글이 먹힌 이유는 agent builder들이 이미 겪고 있는 감각을 정확히 찔렀기 때문이다. model이 API를 호출하고 file을 바꾸고 script를 실행하고 MCP tool까지 건드리는 순간, 문제는 출력 품질이 아니라 실제 실행을 누가 어디서 막느냐가 된다.