DeepSeek V4 Pro与Grok 4.6同日登场,首轮实测难分高下

DeepSeek V4 Pro与Grok 4.6同日登场,首轮实测难分高下

N
News Editor
2026-08-12 23:48:41
DeepSeek V4 Pro与马斯克旗下Grok 4.6在同一天发布,双方都把重点放在长任务、多工具调用、代码修改与结果验证等智能体能力上。公开评测中,DeepSeek在CyberGym、AutomationBench等项目领先,Grok 4.6则在多项知识工作测试中拿到第一。价格方面,DeepSeek每百万输出Token为0.87美元,Grok 4.6为6美元,均明显低于多款顶尖模型。首批开发者实测显示,两款模型在网页、前端和游戏生成任务中各有胜负。

DeepSeek V4 Pro与马斯克押注的Grok 4.6在同一天亮相,直接把新一轮模型竞争推向正面交锋。两款产品瞄准的是同一类能力:让模型在长任务中持续调用工具、修改代码、验证结果,最后交付可直接使用的成品。

公开评测成绩同步刷新

DeepSeek V4 Pro正式版最受关注的,是在多项智能体测试中给出的分数。

在网络安全智能体测试CyberGym中,DeepSeek V4 Pro拿到83.3分,高于Fable 5的83.1分和Opus 4.8的78.3分。在AutomationBench自动化任务测试中,DeepSeek V4 Pro拿到31.8分,超过Fable 5的29.1分与Opus 4.8的27.2分。

在Terminal-Bench 2.1中,DeepSeek V4 Pro拿到87.9分,超过Opus 4.8的85.0分,距离Fable 5的88.0分只差0.1分。

DeepSeek V4 Pro与Grok 4.6同日登场,首轮实测难分高下 3

其他高难度Agent测试中,DeepSeek V4 Pro也继续拉开与Opus 4.8的差距。带工具的「人类最后考试」项目中,DeepSeek V4 Pro为60.0分,Opus 4.8为57.9分,Fable 5为63.0分。此前相对薄弱的软件工程智能体DeepSWE,DeepSeek V4 Pro从预览版的12.8分升至62.7分,接近原来的4.9倍;这一成绩也高于Opus 4.8的58.0分,距离Fable 5的70.0分还差7.3分。

另一边,Grok 4.6的对比对象则包括Fable 5和GPT-5.6 Sol。

综合智能指数上,Grok 4.6拿到61分,距离Fable 5的62分只差1分。编码测试中,Grok 4.6在CursorBench拿到69.9%,高于GPT-5.6的67.2%,距Fable 5的70.5%相差0.6个百分点;在FrontierCode中,Grok 4.6为61.3%,高于GPT-5.6的60.6%,低于Fable 5的63.6%。

到了更接近真实交付场景的知识工作测试,Grok 4.6在三项评测中都排在第一。GDPval-AA v2中,Grok 4.6为1753 Elo,Fable 5为1741,GPT-5.6为1728;AA-Briefcase中,Grok 4.6为1577 Elo,Fable 5为1574,GPT-5.6为1502;专业法律任务Harvey LAB中,Grok 4.6为15.8%,Fable 5为11.3%,GPT-5.6为2.5%。

DeepSeek V4 Pro与Grok 4.6同日登场,首轮实测难分高下 4

价格战同步打响

除性能外,这次同日发布还有一个共同点:价格明显下探。

按每百万输出Token计算,Grok 4.6定价为6美元,GPT-5.6 Sol为30美元,Claude Opus 5为25美元,Fable 5为50美元。DeepSeek V4 Pro则为0.87美元,约为Grok 4.6的1/7、GPT-5.6 Sol的1/35、Claude Opus 5的1/29、Fable 5的1/57。

首批实测进入真实任务场

在跑分之外,首批开发者测试已经开始把DeepSeek V4 Pro和Grok 4.6拉进真实任务。

DeepSeek V4 Pro与Grok 4.6同日登场,首轮实测难分高下 5

第一轮测试中,DeepSeek V4 Pro仅通过一条提示词,就在浏览器里从零搭出一颗完整的3D交互式地球。拖动、旋转、缩放等基础交互可用,全球数据流、动态航线与地理标记也铺在地球表面。进一步看,大气层散射、云层渲染、昼夜光影和整套UI界面也都具备。

AI博主「向阳乔木」随后用DeepSeek V4 Pro连续跑了3个小任务,并把其中两道题的相同提示词交给Grok 4.6,直接比较最终成品。

第一个任务是调用3个Skill开发并部署一个网站。DeepSeek V4 Pro完成了整套流程,从页面设计到完成度,整体表现稳定。第二个任务是复刻60种设计风格,并生成一整套Bento卡片集中展示。DeepSeek V4 Pro在字体、配色和版式上做出了明显区分,整体视觉效果较好。第三个任务是从零生成一款3D打砖块游戏,成品可以直接上手,也加入了立体场景、背景音乐和动态音效。

当相同提示词被交给Grok 4.6后,在3D打砖块这一项里,两款模型表现接近。Grok生成的游戏在视觉效果、场景完整度和可玩性上都与DeepSeek V4 Pro相近。到了60种Bento设计这一项,Grok 4.6则扳回一局,部分页面在排版、配色和视觉层次上更成熟。

DeepSeek V4 Pro与Grok 4.6同日登场,首轮实测难分高下 6

Flappy Bird与前端测试各有胜负

更直接的对比发生在Flappy Bird任务中。开发者Jun Song给出同样的提示词,让DeepSeek V4 Pro和Grok 4.6分别从零生成一款游戏。

两款模型走出了不同路线。DeepSeek V4 Pro消耗超过2万Token,成本为0.019美元;Grok 4.6使用约5000 Token,成本达到0.03美元。

从最终成品看,这一轮DeepSeek V4 Pro表现更强。游戏画面里加入了山脉远景、层叠云朵,水管带有渐变和体积感,角色穿过水管时还会弹出「+1」浮动动画。按原文描述,从场景层次到操作反馈,DeepSeek V4 Pro的端到端构建完成度高于Grok 4.6。

DeepSeek V4 Pro与Grok 4.6同日登场,首轮实测难分高下 7

在开发者Hamza进行的另一项前端测试中,DeepSeek V4 Pro再次胜过Grok 4.6,页面完成度和最终视觉效果都更好。

不过,DeepSeek V4 Pro也并非全部占优。原文提到,在一组鹈鹕对比测试中,V4 Pro相较Flash版本画面完成度更高,大象造型也更美观,但鹈鹕的运动方向被画反了。

当测试难度继续提升,分别让DeepSeek V4 Pro、GPT-5.6 Sol和Claude Opus 5使用Three.js生成同一棵樱花树时,差距变得更明显。无论是树干与枝叶细节,还是光影、景深和整体氛围,DeepSeek V4 Pro都不如另外两款模型。

同一天追近头部模型

几轮公开成绩和实测结果放在一起看,原文判断DeepSeek V4 Pro与Grok 4.6已经打到同一水平线,彼此差距有限。

DeepSeek V4 Pro与Grok 4.6同日登场,首轮实测难分高下 8

Rick De Oliveira对这两款模型同日爆发的评价是:「强大,而且实惠。」

按原文描述,从网络安全、知识型任务到Agent自主解决问题,两款模型都在多个场景里以更低价格逼近OpenAI和Anthropic的顶尖产品。原文还提到,马斯克已经预告Grok 4.7即将推出,目标是超过所有顶尖AI;OpenAI与Anthropic后续也将迎来新一轮回应。

本文参考资料包括DeepSeek定价页、xAI新闻页,以及vista8和Jun Song在X平台发布的测试内容。原文来自微信公众号「新智元」,作者为ASI启示录,编辑为摩西、桃子。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
510

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。