谷歌今日推出三款新AI模型:Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber,但这并非市场预期。自今年5月谷歌I/O大会上发布Gemini 3.5 Flash并承诺一个月内推出Pro版本后,谷歌悄然错过了自己的截止日期。据彭博社报道,Gemini 3.5 Pro因未达到内部目标而被推迟,尤其是在编码任务上表现不佳。6月底通过更新训练数据(模型学习所依赖的海量数据集)进行的修复尝试结果令人失望。消息公布后,Alphabet股价下跌约4.4%,单日市值蒸发约2000亿美元。
谷歌上一次发布Pro级模型还是2月份的Gemini 3.1 Pro。Flash系列是谷歌的速度优化型模型——快速、经济高效,专为AI代理构建,这类程序能半自主地处理文档管理、数据管道处理或网页浏览等任务。Pro模型则是重型选手:更慢、更贵,但专为复杂推理设计,原始算力比速度更重要。
各模型能力与定位
Gemini 3.6 Flash是本次主要发布模型。据Artificial Analysis Index,其输出token(AI处理的基本单位,约0.75个单词)比3.5 Flash减少17%,且价格更低:每百万输入token 1.5美元,每百万输出token 7.5美元,相比3.5 Flash的9美元输出价格有明显优势。对于大规模运行代理的企业,成本差异会迅速累积。在基准测试中,3.6 Flash在DeepSWE v1.1(测试长时间软件工程任务,如构建和调试完整代码库)上达到49%,而3.5 Flash为37%;在MLE-Bench(机器学习工程测试)上得分63.9%对比49.7%;在OSWorld-Verified(AI控制电脑屏幕完成真实任务的测试)上以83.0%领先,超越Claude Sonnet 5(81.2%)和GPT-5.6 Luna(72.6%)。
但竞争对手在部分领域仍领先:GPT-5.6 Luna在DeepSWE上得分67%,在Terminal-Bench 2.1(测试代理终端编码)上得分84.7%;Claude Sonnet 5在GDPval-AA v2(基于Elo评级的知识工作基准)上以1607分领先3.6 Flash的1421分。我们测试了该模型的编码能力,结果不理想——简单的编码测试生成了不可用的文件,HTML格式错误,元素渲染不正确,后续尝试修复也未能成功。
我们请Deepseek将第一个模型转换成可玩版本,仅修复bug。它识别出11个bug并实施了8个关键修复,最终生成了一款不错的游戏。
Deepseek的小调整修复了游戏,说明Gemini的核心思路正确,但细节和不准确导致结果不可用。如果打算用该模型进行长时间编码,可能需要忍受廉价但性能不佳的模型。
谷歌发布的第二个模型Gemini 3.5 Flash-Lite专为高吞吐量设计:每秒350个输出token,每百万输入token 0.3美元,每百万输出token 2.5美元。它面向大规模文档处理或代理搜索系统等管道,在关键编码任务上超越旧版3 Flash(Terminal-Bench 2.1得分54% vs 31%),尽管价格更低。它还可作为会话压缩器(分析长会话并提取关键元素,避免代理被噪声淹没),适用于依赖Hermes和Openclaw的用户。
第三个模型Gemini 3.5 Flash Cyber不会公开提供。谷歌将其限制于政府和经审查的合作伙伴,用于发现和修复软件漏洞——这是一种双重用途能力,谷歌认为不宜广泛发布。与此同时,谷歌DeepMind团队已开始推进下一代模型。谷歌在官方公告中确认已启动“迄今为止最雄心勃勃的预训练运行,针对Gemini 4”,团队正在积极宣传。预训练是模型在任务特定微调之前从海量数据集学习的基础阶段,意味着Gemini 4正在构建中,而非规划中。
目前,Gemini 3.6 Flash和3.5 Flash-Lite已在Gemini应用、Google AI Studio和API中上线。Gemini 3.5 Pro将在“准备就绪时”发布,具体时间未知。We have started our most ambitious pre-training run yet, for Gemini 4, and are excited by the progress : )
— Logan Kilpatrick (@OfficialLoganK) July 21, 2026
