商汤在 WAIC 2026 上发布了新模型 SenseNova U1 Pro。按照现场介绍,这是一套面向复杂多模态任务的交付系统,围绕目标完成理解、规划、信息组织、多模态生成、检查修正和最终交付,内核是理解、生成、行动的原生统一。
发布现场展示了一张由 U1 Pro 生成的超长 8K 图片,主题为“WAIC 九周年 2018—2026”。画面从左到右按时间展开,覆盖了每一届的亮点内容。原文提到,这张图原图大小为 51M,放大后字迹仍然清晰。
从这次展示看,U1 Pro 的能力被概括为三点:原生 8K 输出,重点不只是更高像素,而是在超大画幅里继续维持文字、构图和细节;图文交错思维,模型可以围绕目标连续完成草图、细化、着色、检查和调整;面向成品交付,商汤瞄准的信息图、城市规划、影视分镜、学术海报和商业设计等场景,希望减少反复抽卡式生成,提升可直接使用的结果比例。
文章将这一变化概括为一个更直接的问题:一张图能不能少靠人来收拾残局,而是由模型把整套工作做完。
四项实测:从超长画幅到商业海报
为了检验 U1 Pro 的效果,文中给模型设置了四道题,覆盖超长图、复杂海报、风格化场景和商业海报。

二十四节气 8K 长图
第一个测试是让 U1 Pro 围绕二十四节气,生成一张横向展开的 8K 长图。这个任务考察的是细节控制能力,包括 24 个节气名称和顺序不能出错,每个节气都要对应合适的物候和季节色彩,24 个竖向单元既要彼此区分,又要保持统一视觉风格,同时完成从春到冬的自然色彩过渡。
文中给出的观察是,U1 Pro 把 24 个节点纳入同一套横向版式,并没有把结果处理成 24 张彼此无关、尺寸相同的壁纸。每一格的山水高度、植物位置和留白都在变化,画面呈现出屏风与长卷结合的节奏。
实验室视觉海报
第二个测试是一张实验室视觉海报,主题为《机器如何观察和理解人类》。提示词要求画面中央出现一位背对镜头、略微侧身的人物,头部和上半身叠加检测框、坐标轴、几何圆、运动轨迹、视线追踪、空间网格和数据节点。
文章提到,常见生图模型在遇到“科技”“机器人”等关键词时,往往会选择科技蓝色调,但 U1 Pro 避开了这一处理。它采用暗金线条、黑色背景和纸张颗粒感,形成较完整的视觉层级。画面中心明确,信息量较高,但没有完全失控。
琉璃质感古风建筑山河图
第三道题是一幅带有琉璃质感的古风建筑山河图。要求同时出现青绿色山脉、蓝色河流、瀑布、宝塔、山门、亭台、廊桥、宫殿、桃花林、松树、祥云,以及一座具有东方结构语言的未来建筑。

材质方面,山体被要求呈现出琉璃、玉石和珐琅共同烧制的效果,表面有流动高光、釉面层次和金色描边;水面需要通透感和反射;建筑不能做成廉价的 3D 模型。文中的结论是,U1 Pro 能够把琉璃山体、水系、古建和未来建筑组织成一个相对完整的世界,体现出其对复杂风格要求的执行力。
可直接交付的电影海报
最后一个任务转向商业化场景,要求生成一张原创电影海报,整体为高完成度、可直接用于上映宣传的成片海报,气质介于东方诗意、悬疑史诗与现代艺术电影之间,并具有强烈视觉冲击力和高级审美。
文章称,最终结果仍然保持了清晰文字,整体效果接近可以直接商用的成片海报。
结合四项测试,文中认为 U1 Pro 的长处不只在 8K 分辨率,还在于它更擅长围绕一个完整目标组织画面,把信息、版式、人物、材质和风格放进同一次任务里。结构图、可商用图等类型也被认为在它的能力范围内。

从一次生成到检查修正
文章指出,实测中的几张图片共同体现出的,不只是画质提升。无论是二十四节气长图,还是复杂海报与琉璃山河,U1 Pro 都需要同时记住多组要求,并在同一张画面里持续处理信息、构图、风格和细节。
这对应了当前生图工具中的一个现实问题:不少模型已经支持通过自然语言反复修改,但任务稍微复杂一些,结果仍然容易失控。改对一个局部,其他区域会跟着变化;画面乍看专业,文字和结构却经不起检查;多轮修改后,纹理、人物和背景也可能逐渐偏离。
商汤 CEO 徐立在现场将这一问题概括为:“能交互,不等于能交付。”
按照文中的描述,U1 Pro 选择的方向,是把一次生图过程拉长成一套连续的创作流程。这里的“思考”,并不是向用户展示一长串文字推理,而是更接近图像与文字交错进行的连续创作。
在商汤联合创始人、首席科学家林达华与量子位的交流中,他表示,商汤在 U1 阶段已经观察到连续创作的雏形。模型可以先画草图,再补充细节、着色,逐步生成完整图像。团队也因此看到,视觉模型有机会接近设计师的工作方式,把生图能力推向内容设计的真实生产环节。

进入 U1 Pro 后,这套流程被扩展成一条闭环:理解目标、规划任务、组织信息、生成内容、检查问题、持续修正,最后完成交付。
以最开始展示的“WAIC 九周年 2018—2026”长卷为例,模型需要先消化 9 年资料,再决定事件如何分布、年份之间怎样衔接、山水和城市如何组织、文字信息放在哪里,最后保持统一的东方视觉风格。
原生 8K 的技术处理:32×32 大 Patch 与自适应噪声控制
8K 直出是 U1 Pro 这次发布中最醒目的标签之一,但文章同时指出,分辨率大幅提高带来的难度也会同步增加。原因是分辨率越高,视觉 Token 数量越多,Attention 的计算量和显存占用也随之上升。
针对这一问题,商汤采用的一个关键方案是使用 32×32 的大 Patch。林达华表示,常见生图模型可能采用 16×16 Patch,如果一个 Patch 对应一个或一组 Token,那么边长扩大一倍后,视觉 Token 总数可以降到原来的四分之一。

这相当于把一张图划分成更大的格子。格子变少,计算压力会下降,但与此同时,大格子也更容易丢失细节。
为解决这一问题,团队加入了自适应 Noise Control,对细节区域采用更有针对性的训练策略;Patch 之间保留一定重叠,同时在空间采样、Loss 设计和模型结构上进行优化。文章称,这些手段共同控制了上下文规模,避免 8K 带来爆炸式增长,同时尽量保住小字、纹理和结构。
按文中的总结,U1 Pro 的思路是先通过放大格子减少总量,再借助重叠和更精细的训练,把大格子内部的细节找回来。
商汤对产品范式变化的判断
从行业角度看,文章认为 U1 Pro 更值得关注的地方,在于它对应了一次产品范式变化。文中借用了 AI Coding 的演进路径进行说明。
第一阶段是 Copilot,帮助专业开发者补全代码;接着是 Vibe Coding,用户用自然语言表达需求;再往后,Coding Agent 开始拆解任务、写代码、调用工具、测试和修复,承担完整工程。模型价值也从“写了多少行代码”,转向“能不能把项目做出来”。

在这一框架下,多模态内容也被描述为经历类似变化:第一阶段是单点生成;第二阶段是意图驱动,用户可以持续修改;第三阶段则指向系统级内容交付。模型不只是生成一张图,还要理解目标、组织信息、保持长程一致性、检查错误,并交付可以使用的结果。
文章称,Coding 给商汤带来的启发是,一项技术一旦突破工业红线,真正带来生产力变化,就有机会打开更大的商业空间。商汤据此判断,图文交错思维和理解生成统一,也可能为视觉设计打开一条差异化赛道。
不过,文中也提到,U1 Pro 目前还不能说已经完美。异步生成意味着用户要用等待时间换更高完成度;编辑能力、成本和稳定性仍需真实项目验证;专业设计场景也不会只依赖一张最终图片,图层、矢量元素、版本管理和团队协作同样重要。
文章最后给出的判断是,当生图告别反复抽卡,开始对结果负责,多模态 Agent 的竞争才算真正开始。

