多名用户近日发现,Grok 网页版正在测试名为 Imagine Agent Mode(beta) 的新功能。根据用户在 X 上发布的截图,Grok 的交互界面不再停留在传统聊天框,而是换成了“无限画布”形式,Agent 可在画布中按步骤生成并组合图片、视频等内容。xAI 目前尚未发布官方公告,该功能是否会全面上线,仍未确定。
无限画布取代聊天框,工作流模板已出现
从已流出的截图看,Grok 侧边栏新增了 “Imagine” 入口。进入后,页面中央是一块开放式画布,右侧则列出多种默认工作流模板,包括 Create Worlds、Short Film、UGC Product Stories 和 Brand Identity。用户只需用一句话描述需求,Agent 就会在画布上依次生成所需素材,而不是只返回单次文本或单张图片。
目前被用户“试出”的能力,已经覆盖多张图片的同步生成与编辑、静态图片转视频并自动拼接、视频裁剪、淡入淡出以及成品导出。这意味着该模式的重点不只是内容生成本身,还包括对多个生成步骤的串联处理。短句输入,后面则是一整套流程。
可处理多步创作任务,目标不止单条输出
TestingCatalog 提到,Imagine Agent 可以执行更复杂的多步指令,例如“生成一部 1 分钟短片”“生成一整套漫画”或“生成 UGC 产品图文包”。另有用户展示了完整流程:Agent 先批量生成 3 组产品图和 3 组模特照片,再自动将这些内容组合成社交媒体素材包。
与常见的生成工具相比,这类能力的变化在于,系统不只是响应单个提示词,而是会按顺序组织任务、决定先做什么、后做什么,再把结果拼成可直接使用的成品。素材生成和编排,放进了同一个界面里。
建立在Grok Imagine既有能力之上
报道提到,Grok Imagine 于今年 2 月 推出 1.0 版本,30 天内生成超过 12.45 亿支视频。该产品使用 Aurora 引擎,支持 720p 分辨率、10 秒视频和原生音效。这次曝光的 Agent Mode,则是在原有生成能力之上加入工作流编排功能。
这也是 xAI 在 Grok Build 推出并行 Agent 之后,首次把 Agent 架构延伸到创意生成场景。现阶段外界看到的仍是测试界面,报道也提到,这可能只是区域性测试或先行版本,未必会以当前形态正式实装。

