GPT-6 Astra发布后,3D圈最受关注的问题之一变得更尖锐:通用模型已经能在Blender里建模,市场还需要专门做AI 3D生成的模型吗?

这场讨论很快被演示效果推高。Astra可以在Blender中搭出房屋,再导入Unreal Engine 5,变成可进入的漫游场景。社交媒体上,也有人借助Blender MCP,仅凭文字提示,让Astra从零生成一整条医院走廊。
但把任务推进到具体资产,尤其是角色和复杂道具时,差异就开始显现。文章提到,把同一张参考图分别交给Astra和Meshy后,Meshy生成的金发剑士保留了更清晰的发丝、五官、斗篷、皮带、护甲层次,以及盾牌上的叶片纹样;Astra生成的结果则更接近基础结构,头发像整块头盔,身体也更像由几何体拼接而成。
在这种对比下,问题不再只是「能不能建模」,而是「能不能稳定生成可直接进入生产流程的3D资产」。
不到两年,ARR从100万美元增至1亿美元
据Meshy披露,公司年度经常性收入(ARR)已从100万美元增长至1亿美元,用时不到两年。
ARR指企业当前可持续、可重复的订阅或合同收入按年折算后的规模,一次性收入通常不计入其中。这个指标衡量的不是围观热度,而是已经形成多大规模的持续付费收入,因此常被视为SaaS公司的核心指标。
如果放到传统软件行业,这样的速度并不常见。文章援引Bessemer Venture Partners在《The State of AI 2025》中的总结称,两类高速增长AI公司中,一类「新星」平均约4年达到1亿美元ARR,同时保持约60%的毛利率;另一类更少见的「超新星」,平均约1.5年达到1亿美元ARR。
按这一时间尺度看,Meshy不到两年完成ARR百倍扩张,已经接近「超新星」式增长。

文中还拿两家AI公司作参照。估值110亿美元的语音生成公司ElevenLabs,从首款产品上线到1亿美元ARR用了约20个月;AI视频公司HeyGen从100万美元ARR增长至1亿美元用了29个月。Meshy不到两年的速度,比HeyGen更快。
而3D本身又是更难商业化的一类模态。声音和视频生成后通常就能直接使用,3D资产还要经过拓扑、贴图、尺寸等环节,才能进入游戏引擎或用于3D打印。
通用模型带火3D,专业模型仍在补最难的一环
Astra之所以能在3D圈迅速刷屏,文章将其能力拆成三部分:Computer Use负责操作Blender,Coding把需求转成脚本,空间理解则帮助模型判断物体结构和位置。
这套能力更适合可拆解为几何关系的任务,例如CAD、参数化建模和程序化生成。墙体、楼梯、门窗等对象,可以通过代码逐步搭建出来。
但角色、复杂道具并不完全适用这一路径。发丝走向、斗篷褶皱、盾牌纹样,很难被压缩成几条几何规则,它们更依赖模型从大量真实资产中学习形状和细节。
这正是Meshy这类专业3D模型的定位:输入文字或图片,直接生成带形状和纹理的3D资产。
文章提到,北京大学OpenDCAI团队曾推出开源框架3AGameFactory,让AI编程智能体自行拆解游戏需求,再判断每件资产应当现场生成、通过程序搭建,还是从开源素材库获取。其中,角色和关键道具交给了Meshy。

资产生成后,还要经过网格清理和尺寸校验;角色还需要完成骨骼绑定与动作处理,才能真正进入游戏。项目负责人、博士生Bohan Zeng将最大的困难概括为:「看起来正确」与「真正可用」之间,仍然隔着一道鸿沟。不少问题只有在资产被放进可玩场景之后才会暴露。
Meshy与Astra协作搭建废墟场景的演示,也体现了类似分工:通用模型负责拆解场景、准备参考图,再通过API调用Meshy逐件生成资产,随后导入Blender完成摆放、尺寸调整和灯光布置。
文章的判断是,Agent降低的是3D创作门槛,但资产质量会成为更关键的门槛。能发起项目的人越多,对角色和道具的需求就越大;而能把「看起来对」变成「真正能用」的专业3D模型,反而更难被替代。
专业3D模型的壁垒:形状、细节、颜色与图案
文章将Meshy的壁垒归纳为三层,最终都落在资产质量上。
第一层是形状
以一只机械猫头鹰为例,参考图中的多层甲片、胸腔齿轮和雕花底座,在生成结果中仍保留了独立结构,没有糊成一整块轮廓。对美术师来说,这意味着后续修改可以从一个更接近原设计、且具备结构的资产开始。
据文中披露,在Meshy自建的3D几何对齐基准中,Meshy 7在单张图片输入下,造型比例、空间分布和表面细节三项指标均领先其他受测模型。其中,表面细节得分为59.8%,其他模型约为49%至55%,上一代Meshy 6 Lite为52.7%。
第二层是细节
文章举例称,Meshy 7.1生成的兽人角色,护臂绳结有清晰起伏,裙摆边缘还能看到编织和磨损痕迹,而且这些细节存在于几何结构中,即使在无纹理渲染下也能直接看到。

据Meshy披露,7.1将几何生成分辨率从2048³提升至4096³;在其Detail Richness基准的4K渲染条件下,得分为23.1%,高于其他受测模型。
更高分辨率意味着模型可以表达更细的凹槽、褶皱和表面纹理,同时也会提高训练、推理和网格提取的要求。
第三层是颜色和图案
以一台老式收音机为例,真正难处理的不是方形外壳,而是铭牌上的英文、旋钮旁的数字刻度,以及面板上不同材质的变化。文章称,用Meshy转成3D模型后,两处铭牌文字仍可辨认,刻度也保留了分段和数字。
在Meshy发布的端到端纹理对齐测试中,Meshy 7综合得分为66.2%,高于其他受测方案。
这些提升背后,是围绕3D资产持续进行的模型优化。文章称,Meshy 7改进了图像编码器与训练数据,让输入图片和目标几何更准确对应;Meshy 7.1扩大了几何生成规模,并改进网格提取,让更细结构能够落到可交付的Mesh上。
团队还在探索直接生成网格。采用Flow Matching路线的Meshy T2,能够生成顶点及连接关系,并按预算控制网格复杂度,在速度和资产结构之间做平衡。
谁在为AI 3D付费
技术指标之外,商业问题更直接:谁会为这类能力持续付费?文章给出了两个已经较为明确的场景。
游戏开发
3D资产本来就是游戏开发中的高成本环节。按照游戏美术外包公司Juego Studios公布的价格区间,一件风格化3D道具约为300至2000多美元,一个3A品质角色可能超过5000美元。

除了成本,工期也是压力来源。角色和道具数量一多,3D美术很容易成为项目进度瓶颈。
文章称,三七互娱已经将Meshy接入生产流程。遇到复杂角色和怪物时,团队先用Meshy分别生成头部、肢体等部件,再导入3D软件完成组装和精修。这种方式可以在人工雕刻开始前,先获得完成度超过60%的高模基础。
在复杂的次世代和古风项目中,基础模型阶段的雕刻工作量减少30%至40%。对于简单道具和角色,则可以直接生成完整模型,清理后继续加工。在部分休闲和移动游戏项目中,一件资产的建模时间从5天缩短至约2.5天。
对需要几十件甚至上百件资产的项目来说,这种效率提升会被持续放大,也让美术师能把更多时间放在风格和最终精修上。
3D打印
另一个明确场景是3D打印。文章援引拓竹披露的数据称,截至2025年底,MakerWorld全球站和中国站合计注册用户约5000万,月活达到千万量级。
与之相比,平台活跃创作者只有约30万,优质模型接近200万个。这意味着浏览、下载和打印模型的人,远多于能够原创模型的人。
打印机卖得越多,内容供给缺口就越明显。多数人可以买到打印机,但仍不会建模;想打印真正属于自己的手办,往往还得等别人先把模型做好。

文章称,Meshy瞄准的正是这一环:让不会建模的人,也能把自己的想法变成可打印的3D模型。随着Meshy将多色3D打印能力做进产品,拓竹、创想三维、Elegoo、FlashForge、xTool等打印品牌也陆续进入其客户名单。
把这些案例放在一起,文章将Meshy的收入来源拆成三层:第一层是个人订阅,面向独立开发者、教师和打印爱好者;第二层是企业API,三七互娱、网易游戏和Nexon等游戏公司将生成能力接入原有管线后,需求会随着项目数量和资产数量增加;第三层是硬件生态,模型生成需求可能随着打印机销量和活跃用户规模继续增长。
文中认为,企业API和硬件生态,是Meshy收入持续放大的关键。
从AI for Work走向AI for Fun
文章认为,不到两年做到1亿美元ARR,说明AI 3D已经是一门成立的生意。但当前收入主要仍来自「帮助人完成3D工作」,也就是服务游戏美术、建模师和设计师这类专业用户。
如果AI 3D还要继续增长,下一个问题就是:除了帮助专业人士生产资产,它能不能让更多普通人直接创造和消费3D内容?
这也是Meshy从AI for Work走向AI for Fun的原因。文章提到,Meshy新推出了实时互动多模态内容架构Mora,试图沿着这条路线推进。
在Mora中,用户可以走进一个房间,与场景互动,寻找解开空间谜题的路径;也可以进入拳击场,把老板的照片放到拳击台上,再进行互动。

这些互动能够实时发生,依赖的是一套分层架构:Coding Agent负责搭建游戏结构和运行逻辑;Meshy生成空间和3D资产,同时向实时视频模型输出控制信号;视频模型再根据这些信号实时生成画面和声音。
在这套架构里,3D承担的是整个世界的骨架。
文章还提到,谷歌DeepMind发布的Genie 3已经可以根据文字实时生成可探索场景,但纯粹依靠视频生成的世界,空间一致性仍是难题。玩家走远后再回来,桌上的物体可能已经换了位置,甚至直接消失。
Mora的思路则是先用3D固定空间,再让实时视频模型负责画面表现。房间位置、门的连接关系、物体摆放位置,都由3D结构确定;玩家推开的门、放上拳击台的照片,也都对应空间中真实存在、可持续交互的对象。
到了这里,3D已经不只是生产流程中的一项资产,而是可玩世界的地基。文章认为,这条路线真正打开的是AI 3D的用户边界。过去,一个点子要变成能玩的游戏,中间隔着建模、编程、美术和游戏引擎;Mora把这些工作分给不同模型后,普通人不需要掌握完整游戏开发流程,也有机会把一句话、一个念头变成可以走进去的世界。
文章最后给出的结论是,通用模型越擅长理解空间、编写逻辑,能够发起的项目就越多,对高质量3D资产和稳定3D空间的需求也会越大。前者负责理解意图、组织任务,后者负责生成真正可用、可控、可交互的3D世界。通用模型能力增强,并不必然挤压专业3D模型,反而可能带来更多可承接的需求。
本文来自微信公众号「量子位」(ID:QbitAI),作者为「关注前沿科技」。

