OpenAI 今天凌晨直接上线了代号 Duct Tape 的神秘图像模型——GPT-Image-2,没有发布会预热,只甩出一张排行榜:Text-to-Image 竞技场得分 1512,比第二名 Nano-banana-2 高出 242 分。在大模型跑分历史里,头部模型之间分数咬得极死,零点几分的提升就够发篇论文,242 分的断层意味着规则已经被重写。
双模式拆解:画图之前先思考十秒
GPT-Image-2 内部拆成两个模式。即时模式(Instant Mode)面向所有用户,几秒出图,底层视觉理解极强,适合高频单次需求。付费用户才能用的思考模式(Thinking Mode)才是杀手锏:渲染之前先花十几秒做逻辑推理和联���搜索。比如你让它“上网搜大家对 Duct Tape 的评价,做一张带二维码的海报”,旧模型只能吐出乱码假二维码,思考模式下它会先爬 Reddit 和推特上的真实评论,规划版面层级,最后生成扫码可用的真实二维码——整套研究、策划、文案、排版流程一次完成。对比第二名 Nano-banana-2,后者虽然也能联网,但做出来的往往是生硬粘贴百科句子,遇到抽象商业指令就不知所措,像个懂执行不懂策略的实习生。
实测四关:从穿衣搭配到米粒刻字
第一关:视觉理解与业务闭环。上传一张自拍,告诉它“我要去海岛度假,搭几套衣服”。它直接输出 8 套夏装图鉴,排版像专业电商 Lookbook,每件单品带正确文字标注。接着要求“看第一套上身效果”,它把自拍里的人扒出来换上衣服,还给出侧面、半身不同视角。服装搭配渲染和模特试衣外包的竞争优势正在瓦解。
第二关:一致性叙事。上传一张你和朋友的合照,输入“把我们变成主角,画三页日式漫画,剧情你定”。几秒后输出三页带标准分镜的黑白漫画,两个角色在不同分镜里的近景特写、远景奔跑、背影都保持脸部特征和衣服褶皱完全一致。这证明模型已跳出单张图像生成,具备连续叙事的导演能力。
第三关:多语言排版零错误。让它做法文时尚杂志封面、日文餐厅菜单、俄语注释——一次成型,一个拼写错误都没有,而且每种语言都搭配了当地的文化美学和字体设计。日常海报、宣传册、信息流广告不再需要人工拉参考线。
第四关:极端画幅与微距控制。要求 3:1 的超宽图和 1:3 的竖长图,不仅没崩坏,还生成首尾相连的 360 度全景图。官方演示的米粒测试更疯狂:只用一句大白话“一堆米,其中一粒上写着 GPT Image 2”,没有加任何微距或超高分辨率修饰词。放大数十倍后,真的在一堆米里找到那颗刻字的微粒,文字顺着米粒弧度嵌入,物理逻辑完美。这说明模型对空间位置的理解达到了像素级精度,以后可以精准修改设计稿任何微小局部。
定价按 Token 计费:越画越便宜
GPT-Image-2 延续按 Token 计费路线。每百万输出 Token 30 美元——比上一代 gpt-image-1.5 的 32 美元还降了。一张图约消耗 1000–1500 输出 Token,实际成本约 0.03–0.045 美元(约人民币 2 毛)。如果走 Batch API 模式,输出降到 15 美元,单张成本不到 1 毛。更关键的是缓存输入(Cached inputs):��成批量连贯图像时,第一张的视觉元素会被缓存,第二张起输入成本从 8 美元暴跌到 2 美元(只收 25%)。这种工业级计费逻辑才是流水线画师的真正噩梦。
团队揭秘:CLIP 作者 + Luma AI 联合创始人带队
多语言排版难题的解决,靠的是团队里 CLIP 核心作者 Gabriel Goh——CLIP 奠定了图文跨模态语义映射的基石。极端画幅和 360 度全景图背后的 3D 空间能力,来自前 Luma AI 联合创始人兼 CTO Alex Yu,专攻 3D 神经渲染。多页漫画一致性则来自 MIT CSAIL 毕业的 Boyuan Chen 和 Kiwhan Song,研究方向是世界模型与具身智能。加上 O 系列推理模型重要作者 Nithanth Kudige 和斯坦福视觉实验室背景的 Kenji Hata——这群人把逻辑推理、3D 渲染、图文对齐和物理规律缝进了同一个模型。
官方坦承模型仍有边界:折纸指南、解魔方、极度密集沙粒等场景会触及极限。但对商业应用而言,这些已是微小瑕疵。过去被明码标价的排版、修图、抠图技能,现在变成一句话即可调用的基础指令。设计职业的护城河已经实质瓦解,产业链要面对的问题是:如何适应这条全新的生产线。

