Gemini 3.7 Flash、コード精度43.6%・業務自動化30.4%・価格半額で提供開始予定
Original: Gemini 3.7 Flash Raises Coding Scores While Halving Launch Price View original →
3週間で性能と価格を更新
Gemini 3.7 Flashは、3.6 Flashの公開からわずか3週間で登場した。コード生成、複雑な文書処理、業務フローの評価を引き上げながら、導入価格を従来の半分に設定する。2026年末までは入力100万トークン0.75ドル、出力100万トークン3.75ドルで提供される。エージェントの常用モデルを狙うFlash系列だけに、短い更新周期は実運用への影響が大きい。
“Gemini 3.7 Flash is here. It’s stronger for coding, knowledge work, and web development.” — Google DeepMind
Google DeepMindの公式アカウントはGeminiの研究、モデル更新、ロボット、科学成果を扱う。リンク先のGoogle記事では、FrontierCode 1.1 Mainが34.4%から43.6%、DeepSWE v1.1が49.0%から65.3%へ上がった。WebDev ArenaのEloも1538から1588へ改善している。
文書処理と自動化にも差
複雑な文書を扱うGDP.pdfでは22.0%から34.0%、実務フローを測るAutomationBenchでは17.0%から30.4%となった。一般的なチャット性能より、デバッグ、課題解決、複数段階の計画、ツール呼び出しで再試行を減らせるかが焦点になる。Googleは指示追従、初回のコード精度、行き詰まった際の意図確認も改善したとしている。
開発者はGoogle Antigravity、Google AI StudioのGemini API、Android Studioから利用できる。Gemini Enterpriseにも入り、160カ国以上のGoogle AI Pro・Ultra利用者向けGemini Sparkにも採用される。化学、生物、放射線、核、サイバー攻撃の悪用に対する保護策も更新された。
次に確認したいのは、年末の導入期間後の価格と、外部評価での再現性だ。慎重な計画やツール利用が成功率を高めても、遅延や消費トークンが増えれば総費用は変わる。元の投稿と、数値を掲載したGoogleのモデル解説を参照できる。
Related Articles
936ポイントを集めた議論の焦点は、単なる新モデルではなく、3週間という更新間隔と3.6 Flashの当初価格の半額に設定された期間限定価格だった。コーディング、文書処理、業務自動化の指標は上がったが、実運用ではタスク完了までの総コストを測る必要がある。
Grok 4.6がArtificial Analysisの知能指数で61を獲得し、GPT-5.6 Solと並んだ。評価1タスク当たり$0.84という結果は、最先端モデルの競争軸が最高点だけでなくエージェント効率と総費用へ移っていることを示す。
GoogleはGemini in Google SheetsがSpreadsheetBench全体で70.48%を記録し、human expert能力に近づいたと発表した。同社はこの結果をproduct-specific tuningと強化されたverbalization、coding capabilityの成果だと説明している。