Google DeepMind 三连发:Gemini 3.6 Flash / Flash-Lite / Flash Cyber,长视野工程任务 token 砍 65%

发布时间:2026/7/23 19:00:04
Google DeepMind 三连发:Gemini 3.6 Flash / Flash-Lite / Flash Cyber,长视野工程任务 token 砍 65% 一、VB Frontier AI Model API 定价对比图(2026 年 7 月底短名单)Google 给三款新模型的定价,落在全球主流 AI 模型中低区间——但token 用量本身就低,意味着企业在标价之外还能再省一截(任何价位下,token 用得少就付得少)。Gemini 3.6 Flash 定价:输入 1.50/输出7.50(每百万 token,API 渠道)。Gemini 3.5 Flash-Lite 定价:输入 0.30 / 输出 2.50——便宜得惊人。对比一下,Google 上一代Gemini 3.5 Flash 是 9.00,Gemini 3.1 Pro Preview 是 2 / 12。前代Gemini 3.1 Flash-Lite仍保持 Google “最便宜“的位置——1.50,但速度比新的 3.5 Flash-Lite 慢 2 倍。对更看重速度的企业来说,新的 3.5 Flash-Lite 是更划算的选择。下面是完整对比表(2026 年 7 月底短名单):ModelInput ($/1M)Output ($/1M)Total ($/1M)SourceMiMo-V2.5 Flash0.100.300.40Xiaomideepseek-v4-flash0.140.280.42DeepSeekdeepseek-v4-pro0.4350.871.305DeepSeekMiniMax-M30.301.201.50MiniMaxLongCat-2.0 — limited-time promo0.301.201.50LongCatGemini 3.1 Flash-Lite0.251.501.75GoogleQwen3.7-Plus0.401.602.00Alibaba CloudMiMo-V2.50.402.002.40XiaomiGemini 3.5 Flash-Lite0.302.502.80GoogleLongCat-2.0 — standard0.752.953.70LongCatMiMo-V2.5 Pro (≤256K)1.003.004.00XiaomiGLM-5.21.404.405.80Z.aiGPT-5.6 Luna1.006.007.00OpenAIGrok 4.52.006.008.00xAIMiMo-V2.5 Pro (256K)2.006.008.00XiaomiGemini 3.6 Flash1.507.509.00GoogleQwen3.7-Max2.507.5010.00Alibaba CloudGemini 3.5 Flash1.509.0010.50GoogleGemini 3.1 Pro Preview (≤200K)2.0012.0014.00GoogleGPT-5.6 Terra2.5015.0017.50OpenAIGPT-5.42.5015.0017.50OpenAIKimi K33.0015.0018.00Moonshot AIGemini 3.1 Pro Preview (200K)4.0018.0022.00GoogleClaude Opus 4.85.0025.0030.00AnthropicGPT-5.55.0030.0035.00OpenAIGPT-5.5 Instant (chat-latest)5.0030.0035.00OpenAISakana Fugu Ultra (≤272K)5.0030.0035.00Sakana AIGPT-5.6 Sol5.0030.0035.00OpenAIClaude Fable 5 / Claude Mythos 510.0050.0060.00AnthropicGemini 3.5 Flash Cyber 是专为安全研究员和 red teamer 修 bug设计的垂直款,暂无报价。3.6 Flash 与 3.5 Flash-Lite立即可用——通过 Gemini API,以及 Google AI Studio、Android Studio、消费者端 Gemini app、Google Search。3.5 Flash Cyber 即将”独家开放给政府和可信任伙伴”,通过 Google 去年发布的 AI 代码修 bug agentCodeMender。跟之前的 Gemini 一样,这些都是专有、闭源模型,只能通过 Google 官方 API 及合作伙伴获取,不提供 MIT、Apache 2.0 之类的开源许可。一个被开发者社区关注到的明显缺位:Google 之前暗示今年夏天发布的、更大、更强、更旗舰的Gemini 3.5 Pro呢?毕竟前代旗舰 Gemini 3.1 Pro 在 2026 年 2 月就发布了,期间 OpenAI 和 Anthropic 已经推出了好几代比 Google 强得多的旗舰更新。Google 技术员工Logan Kilpatrick在 X 上回应了一个相关询问,写道:“Gemini 3.5 Pro 目前在和合作伙伴测试,我们计划在它准备好后尽快广泛发布。”Google 的这次发布信号清晰:AI 的近期未来在 agentic 能力——能自主长时间运行的系统。如果说早期的大语言模型像庞大、吃油、能拉重载但成本惊人的货运列车,那新的 Flash 系列就是一队灵活、超高效的混合动力送货车。二、效率提升 17% ~ 65%:更少 token,在第三方 benchmark 上照样强结果在引擎盖下面,Gemini 3.6 Flash 拿下了一组显著的效率提升。根据独立第三方 AI 基准组织 Artificial Analysis 的Artificial Analysis Index,输出 token 用量比前代 Gemini 3.5 Flash 减少 17%。在专门测长视野软件工程的DeepSWE基准上——衡量 agent 从零完成多步工程任务的能力——token 节省最高达 65%。这种减少意味着模型用更少的推理步和 tool calls,就能完成同样的多步 workflow。可以把 token 效率类比为汽车的燃油经济性:当 AI 模型走弯路解题时,会烧掉更多计算燃料,把开发者的最终成本推高。3.6 Flash 通过精简内部逻辑,更快、更便宜地到达正确答案。Google 资料里没有具体说明用了哪些架构或算法层面的改动来实现这种 token 效率,但指出模型”用更少的推理步和 tool calls 完成多步 workflow”,并表现出”更低的 verbosity(冗长度)“。Google 发布的官方 model cards 显示:Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 都具备 100 万 token 的输入上下文窗口,最大输出 64,000 token,知识截止日期都是 2026 年 3 月。三、低成本下的可靠 benchmark 表现技术改进也延伸到了具体能力。Gemini 3.6 Flash 在 DeepSWE 上得分 49%,相比 3.5 版的 37% 显著提升。它也把机器学习工程能力推得更高:MLE-Bench 上拿到 63.9%,前代只有 49.7%。此外,Google 把 computer use 集成进 Gemini API 和 Gemini Enterprise 的客户端内置工具,OSWorld-Verified 得分 83.0%,从 78.4% 涨上来。Credit: Google模型在知识工作上也更熟练——在GDPval-AA v2这类 benchmark 上把分数从1349 推到 1421。为在能力升级的同时守住安全,Google 部署了增强的 Frontier Safety 防护。这些防护加固模型对 jailbreak 的抵抗,并缓解化学、生物、放射、核(CBRN)领域以及网络攻击滥用的风险。工程团队训练模型对有益用途最小化拒绝,在严格安全与实用之间求平衡。四、面向低成本 coding、agentic、cybersecurity 三类用例的模型Google 把新品拆成三款,分别针对不同运营需求。Gemini 3.6 Flash是三件套里的重型主力。它处理复杂 coding、精细知识工作、多模态处理,精度更高。企业客户用它做高难度任务:复杂文档解析、精细的图表与数据分析、长篇报告起草。模型在multi-agent 编排框架下执行复杂代码迁移,延迟更低、质量更高,优于早期版本。另外,3.6 Flash 还帮着用 canvas 界面开发 3D workflow 的摄影纹理提取器。Gemini 3.5 Flash-Lite瞄准高吞吐、绝对最低延迟不可妥协的场景。Google 给它定的是3.5 系列里最快的标签。按 Artificial Analysis 测,模型每秒输出 350 token——对 agentic 搜索、海量文档处理工作负载极其有效。Artificial Analysis 指出这约为前代 Gemini 3.1 Flash-Lite 速度的 2 倍。开发者可以配置 3.5 Flash-Lite:高吞吐低延迟任务用最低 thinking level;复杂多步 sub-agent 工作负载用更高 thinking level。虽然挂着”lite”标签,它在多关键 agentic 与 coding 评测上反超标准版 Gemini 3 Flash——SWE-Bench Pro 上 54.2% 对比 49.6%,OSWorld-Verified 上 74.0% 对比 65.1%。Gemini 3.5 Flash-Lite vs. Gemini 3 Flash performance on two benchmarks. Credit: Google模型能从海量数据集提取产品特征、生成交互式 web 设计概念、规模化跑小票翻译。第三款 Gemini 3.5 Flash Cyber是高度专门化部署。Google 专门 fine-tune 了它来找和修网络安全漏洞。它直接集成进 Google 的 CodeMender agent。实战中,多个 3.5 Flash Cyber agent 并发工作,产出一份综合漏洞报告,在CyberGym 基准上接近前沿水平——甚至摸到了 Anthropic 备受炒作的Mythos 模型的边界。Gemini 3.5 Flash Cyber performance on CyberGym compared to other leading AI models. Credit: GoogleGoogle 没给 3.5 Flash Cyber 标具体数字,只说它被 fine-tune 成”比大模型更低的单 token 价“。五、纯商业授权新一代 Gemini 模型的许可框架,对开发者和企业用户影响深远。Google 把 3.6 Flash 和 3.5 Flash-Lite 部署在商业、专有 API 模型下。不像 MIT License 或 GNU GPL 这样的开源许可,开发者拿不到底层模型权重、训练数据或源代码。MIT 或 GPL 许可给用户自由:下载代码库、修改内部架构、自托管部署、独立分发软件基础设施。相对地,Google 的 API 路线意味着开发者本质上是在按严格计量制”租用”智能。每一条 prompt 和生成的响应都流经 Google 的托管服务器,按 3.6 Flash 的严格定价结构 $1.50/百万输入 token 计费。这种商业绑定限制了部署灵活性。企业无法在不与 Google Cloud 签专门、高阶企业协议的情况下,把模型完全 air-gap 在自有本地安全硬件上。开发者被 Google 的 acceptable use policies、任意设置的 rate limits、网络要求所束缚,形成对 Google 基础设施正常运行时间和服务条款的永久依赖。Gemini 3.5 Flash Cyber 的许可甚至更严。考虑到网络安全 AI 的双重用途本质——攻击者能像防御者用它来打补丁一样容易地武器化它——Google目前只在有限访问试点项目下提供该模型,类似于 Anthropic 的Mythos 模型 Project Glasswing 项目开启的潮流,以及 OpenAI 推进GPT-5.6 阶梯式发布时延续的方式。在这种情况下,Google 把 3.5 Flash Cyber独家开放给政府和可信任伙伴。这种严格把关防止开放访问,把系统级安全放在广泛开发者创新之上。六、前方展望Google DeepMind 持续快速迭代,但产品线里的缺口仍然明显。Flash 系列在速度和成本上出色,但行业急切等待 Gemini 3.5 Pro 的部署——以判断 Google 的绝对前沿能力。与此同时,公司确认Gemini 4 的预训练已经启动。在下一代重大旗舰发布落地之前,开发者必须用高效但有意收敛的 Flash 架构来优化自己的系统。