谷歌与 OpenAI 同日推进“更快的 AI”路线,但两家的落地节奏并不相同。谷歌已经正式上线 Gemini 3.7 Flash,并面向开发者开放;OpenAI 则预览了 GPT-5.6 Sol Ultrafast,这一高速模式目前仍只向部分客户邀请测试。
Gemini 3.7 Flash已全面开放
谷歌将 Gemini 3.7 Flash 定位为面向编程和 AI 代理场景的通用模型。该模型支持文本、图像、视频、音频和 PDF 输入,也可以调用工具并控制计算机,目标是处理多步骤任务,减少人工干预。
按照谷歌披露的数据,Gemini 3.7 Flash 最多可接收 100 万输入 token,输出上限为 6.4 万 token。谷歌称,这一版本在软件工程、网页开发和复杂知识任务上的表现较前代提升,同时响应速度更快。
谷歌举例称,在其测试的编码任务中,Gemini 3.7 Flash 用时 2 分 13 秒完成,而上一代 Flash 模型耗时超过 5 分钟。谷歌同时强调,新模型并非以降低质量换取速度。
价格继续下探
除速度外,谷歌也把低成本作为卖点。根据文中信息,Gemini 3.7 Flash 在今年年底前的定价为:
- 每百万输入 token 收费 0.75 美元
- 每百万输出 token 收费 3.75 美元
- 这一价格约为 Gemini 3.6 Flash 初始价格的一半
上述优惠价格将在 12 月 31 日后上调至每百万输入 1.50 美元、每百万输出 7.50 美元。
在性能对比上,谷歌援引自家基准测试称,Gemini 3.7 Flash 在 18 个测试类别中的 11 项领先,包括 Code Arena 网页开发评分 1588 Elo,以及企业工作流测试 AutomationBench 的 30.4%。不过,这些结果基于谷歌自身方法得出。
OpenAI主打更快接入速度
OpenAI 此次展示的并不是全新模型,而是 GPT-5.6 Sol 的 Ultrafast 模式。报道指出,这一模式由 Cerebras 提供算力支持,运行速度可达到 GPT-5.6 Sol 标准模式的约 14 倍。
Cerebras 的晶圆级芯片据称可实现每秒 750 个 token 的生成速度,约合每秒 560 个英文单词。OpenAI 试图突出这一速度对语音代理等实时场景的意义,例如在通话过程中更快完成推理与回应。
不过,与谷歌直接开放不同,GPT-5.6 Sol Ultrafast 目前仅在 OpenAI API 中向少数客户提供,后续会随着算力扩展逐步开放给更多企业用户。OpenAI 也尚未公布这一高速模式与其他模型的系统性正面对比成绩,现阶段更多引用的是客户反馈。
竞争焦点转向实时代理
这次同步发布反映出 AI 厂商竞争重点正在变化。市场关注点正从单纯比较“谁更聪明”,转向“谁足够快,能支撑实时代理”。对需要连续执行任务、即时响应用户的产品来说,速度正在成为更直接的体验指标。
从当前可用性看,谷歌占据先手。Gemini 3.7 Flash 已在 160 多个国家和地区上线,开发者可以直接调用;OpenAI 的超高速模式则仍处于受邀阶段,短期内覆盖范围有限。










