Gemini 3.7 Flash 实测:代码大幅进步,推理与写作仍有短板

Gemini 3.7 Flash 实测:代码大幅进步,推理与写作仍有短板

N
News Editor
2026-08-16 16:02:49
Google 于 8 月 13 日发布 Gemini 3.7 Flash,并在首日向 160 多个国家开放。Decrypt 实测显示,这款模型在零样本代码生成上较 3.6 Flash 明显提升,2 分 13 秒就生成可运行浏览器游戏;但在创意写作、隐喻推理、逻辑题和高阶数学任务中,表现并不稳定。Google 给出的基准测试称其在 18 个类别中有 11 项领先 Claude Sonnet 5 和 GPT-5.6 Terra,不过文中也指出这些数据来自 Google 自家方法论。

Google 于 8 月 13 日推出 Gemini 3.7 Flash,并在首日面向 160 多个国家正式开放。按照 Decrypt 的介绍,这款模型支持最高 100 万输入 token、64,000 输出 token,可读取图像、视频、音频和 PDF,也支持调用工具并驱动计算机。

Gemini 3.7 Flash 实测:代码大幅进步,推理与写作仍有短板 2

Flash 过去并不是处理高难度问题时的首选。它更常被用于文本分类、在上下文过长前压缩代理会话,或为不值得动用旗舰模型的文档生成摘要。Decrypt 认为,若按这类任务衡量,3.7 Flash 是一次实打实的升级;若放到更广范围对比,它属于表现合格,但写作能力仍会被一些可免费下载的软件超过。

Google 的基准成绩与 Decrypt 的测试范围

Google 自家的基准测试表显示,3.7 Flash 在 18 个测试类别里有 11 项领先 Claude Sonnet 5 和 GPT-5.6 Terra。文中提到的两个核心数字分别是:Code Arena 网页开发榜单的 1,588 Elo,以及 AutomationBench 的 30.4%。不过 Decrypt 也强调,这两项成绩都来自 Google 的方法论,因此更适合被视为 Google 自身的主张,而不是已经被完全坐实的结论。

基于这些说法,Decrypt 对模型进行了多项测试,覆盖代码生成、创意写作、联想推理、逻辑和数学,并据此评估它是否符合 Google 给出的定位。

代码生成:首次输出就能运行

代码测试衡量的是零样本代码生成能力,也就是模型能否在没有示例可参考、没有自我修复机会的前提下,只根据一条指令生成可运行软件。Decrypt 的做法是给出一个浏览器游戏提示词,然后直接运行返回结果,不追加提示,不反馈错误,也不给第二次尝试。

Gemini 3.7 Flash 在 2 分 13 秒内通过测试。Decrypt 表示,这个游戏首次运行就能玩,语法干净,碰撞与计分逻辑成立,视觉效果也高于这个价位模型通常会给出的水平。

这里真正有参考意义的对比对象不是旗舰模型,而是 7 月 21 日发布的 Gemini 3.6 Flash。Decrypt 称,3.6 Flash 当时甚至无法生成可运行文件,HTML 结构有问题,部分元素无法渲染,后续要求它修复自身输出也没有效果。

Decrypt 最后把那份失败结果交给 DeepSeek,后者找出了 11 个 bug,并给出 8 处修复,使游戏能够运行。三周后,同一产品线已经不再需要外部“救场”,结果也接近 Decrypt 在 7 月评测中看到的 GPT-5.6 Sol 水平。

在这一项上,Decrypt 直接判定 Gemini 3.7 Flash 获胜,并认为这是最足以支撑用户切换的理由。不过文章也补充,这个模型更擅长执行明确规格,而不是自行发明规格;提示词如果含糊,得到的游戏也会含糊。

创意写作:结构守得住,关键规则没守住

创意写作部分同时测试两件事:文学质量,以及模型能否在数千字内持续遵守一个结构规则。提示词设定为:让 Jose Lanz 从 2150 年返回 1000 年,并要求形成一个封闭因果循环——他试图阻止的未来,必须正是由他的介入所创造。

决定测试是否通过的关键规则在最后一句:他在回到家之前,不能理解自己做了什么。

Gemini 3.7 Flash 交出的文本,在 Decrypt 看来算是“还不错”。故事里,Jose 向比利牛斯山的一处裂缝发射一门熵炮,意外铸成一座奴役 22 世纪伊比利亚的方尖碑;但他在提早 1000 年、仍站在泥地里的时候,就已经意识到整个循环的真相,并说出「It was the base of the Cinder Spire.」

Decrypt 认为,这个故事的情节机械结构其实相当完整。文中写到古代修士曾目睹一颗坠落之星,后来又解释那其实就是 Jose 抵达时的闪光;他带来用于消除异常的武器,反而成了锻造异常之物的原因。结尾句「It had simply been waiting for him to complete it」也贴合提示词要求的宿命感。

问题在于,对熟悉此类文本的人来说,这篇故事的“AI 味”很重。Decrypt 举例说,几乎每个名词都会挂上两个形容词,比如「hyper-luminescent towers」「damp, moss-choked earth」「thick, obsidian hair」。在它看来,这更像模型在顺着最高概率词往下接,而不是有意识地做选择,也因此会出现像「humming with a low-frequency hum」这样的重复碰撞。

Decrypt 拿它与 Qwopus3.5-27B-v3 做了比较。后者是基于 Qwen3.5-27B 的社区微调模型,提炼了 Claude Opus 风格的推理方式,可以在单张消费级 GPU 上运行,单次查询不产生费用。这个模型遵守了 Gemini 没有遵守的那条规则。

在 Qwopus 的版本中,Jose 在 San Millán de la Cogolla 杀死了一名修士。Decrypt 说明,这是一座位于拉里奥哈、在公元 1000 年前后确有重要性的修道院。直到 Jose 回到 2150 年,并在一份蜡封抄本中发现自己的 DNA,他才理解自己做了什么。

不过 Qwopus 也并非完全干净。它在正文上方直接吐出了完整的规划草稿,连拼写错误都保留下来;最后一部分还破坏了前面 8 个章节一直搭建的封闭循环,让 Jose 再次回去修正事情。

综合来看,Decrypt 仍把这一项判给 Qwopus。Gemini 的成稿更整洁,结尾也更克制,但它没有完成提示词围绕的那条核心指令,而一个运行在游戏 GPU 上、免费的模型写出了更好的故事。

联想推理:会搭结构,但会把隐喻直接说破

联想推理测试关注模型能否在不自我解释的情况下,在不相关概念之间建立联系。提示词要求先描写一根细枝,再用这段描写解释对工人的剥削和对富人的崇拜,最后让这套论证自然溶解成一段关于生菜的描写。

这类任务最常见的失败方式,是把隐喻明说出来。只要直接点名,隐喻本身就被拆掉了。

Gemini 在第二段开头就这么做了:「This is the precise mechanics of the modern proletariat.」Decrypt 认为,在这句话之前,整段其实运转得还不错。

它提到,文中部分意象是成立的。比如工人只能分到「just enough bark to stay rigid for another week of output」,而那些掉落的细枝又被训练得相信,只要足够坚硬,其中任何一根都可能变成树干。只不过写出前一句的同一段里,也出现了一个「bound to an vast, top-heavy corporate hierarchy」的工人表述。

仅从逻辑和结构看,这一部分并不差。真正的问题出在“溶解”动作本身。Decrypt 指出,Gemini 是在叙述转场,而不是完成转场:那些等级结构「crumble, dissolving into the quiet, humble reality of the organic world underneath」,然后一颗生菜就这样直接出现,和前文没有建立起连接。

相比之下,GPT-5.6 Sol 让细枝腐烂成土,再从土里长出生菜,文本写道:「Rain enters the grain. Fibers loosen, darken.」文章中的论点也被埋进了物体之中,把财富改写成一种德性语言,其中一句是「The mansion signifies intelligence.」

Decrypt 认为,这一项 GPT-5.6 Sol 赢得很明显。Gemini 生成了一些不错的单句,但它解释了自己的隐喻,然后跳过了提示词真正要测试的过渡过程。

逻辑题:像是在套用记忆里的桥题答案

逻辑测试衡量的是非数学推理,尤其是模型究竟是在阅读眼前的问题,还是在把题目模式匹配到自己记忆中的版本。Decrypt 给出的“过桥”提示是:4 个人共用一支火把,过桥时间分别为 1、2、5 和 10 分钟,然后问所有人最快多久能全部过桥。

关键在于提示词故意省略了一条经典限制:题目从未说桥上同一时间只能有两个人。因此答案应是 10 分钟——所有人一起过桥,按最慢者速度计算。

Gemini 给出的答案却是 17 分钟,走的是教科书版本里那套记忆化的五步流程。它还把那条限制直接当作事实写了出来,却没有检查题目里是否真的出现过。

Decrypt 认为,它可见推理过程的问题甚至比答案本身更大。推理轨迹里一度说,让最慢的两个人一起过桥会低效,因为还得有人把火把带回来;可在最终答案里,它又真的让这两个人一起过桥。也就是说,它在同一个回答内部出现了自相矛盾,却仍以完全确定的口吻给出结果。

文章还提到,Claude Fable 5 在 7 月也给出过同样错误的数字。但它一开始就说明自己是在「assuming the classic constraint that the bridge holds only two people at a time」,这让错误至少是可被发现的。

这一项没有真正的赢家。Decrypt 只因为透明度,才把比较结果偏向 Fable;而 Gemini 在代理任务中表现出的那种错误自信,在这个可以手算验证的题目里再次出现。

数学题:找到方法,却没把结果算完

数学测试针对的是远超普通消费者需求的符号数学,同时也考察一个更简单的问题:模型有没有把要求做完。提示词要求构造一个 19 次、奇、首一、实系数多项式,其一次项系数为 -19,图像至少分裂成 3 个不可约分支,然后求 p(19)。

Decrypt 说,两款模型找到了同一扇门。Gemini 和 Qwen 3.7 Max Preview 都识别出 Dickson 多项式,解出约束将其参数固定为 1,并正确推出闭式表达。

但 Gemini 到这里就停下来了。它把 p(19) 留成了一个包含平方根 19 次幂的未求值表达式,没有真正给出数值,也没有证明提示词同时要求展示的分支数量。更特别的是,它还把这些内容包进了一个带 CSS 和阴影效果的 HTML 页面里,而题目并没有要求这种排版。

Qwen 则把工作做完了。它给出完整的 10 个分量分解:1 个线性、9 个二次;再把递推展开到 1,876,572,071,974,094,803,391,179,并做了模运算交叉验证。Decrypt 表示,他们又用 SymPy 独立核验了这个数值,结果成立。

因此,这一项的胜负非常直接。Decrypt 认为,唯一重要的标准就是是否完成任务;Gemini 开头没问题,却停在了算术收尾之前,这个停下的位置相当奇怪。

价格、定位与 Decrypt 的结论

在总结部分,Decrypt 认为,如果用户本来就在 Google 生态里,Gemini 3.7 Flash 值得切换。它在代码能力上比被替代的旧版本强出很多,速度也足以支撑代理工作,成本低到在大规模运行时几乎可以视作舍入误差。

文章把它的长处概括为执行力和结构控制。给它一份细致规格,它可以把东西搭出来,维持故事结构,并在数千字范围内保持因果逻辑连贯。

弱点则集中在创造力和推理能力。Decrypt 认为,它的写作可预测到一眼就能看出是机器所写;而在推理题里,它会在没有标出错误前提的情况下,直接断言错误答案。

价格是 Decrypt 最看重的卖点。按文中数据,Gemini 3.7 Flash 的价格为每 100 万输入 token 0.75 美元、输出 3.75 美元;相较 GPT-5.6 Sol 每 100 万输入 token 5 美元的费率,输入价格低了 85%,也只有 3.6 Flash 上线时价格的一半。

反对它的理由,文章也写得很清楚:一个运行在游戏 GPU 上的免费 27B 模型,就已经写出了更好的故事,而且不收任何费用。Google 的这一介绍期价格将在 12 月 31 日到期,届时输入价格将翻倍至 1.50 美元,输出价格升至 7.50 美元。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
210

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。