微软公布两款自研模型 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,并披露一组内部数据:客服中心将语音模型切换为 MAI-Voice-2-Flash 后,算力成本下降 89%。两款模型目前已进入公开预览,分别面向高端图像生成和大规模语音处理。
微软重排模型协作关系
这轮自研模型推进并非突然发生。路透社今年 4 月报道称,微软与 OpenAI 原本的独家授权安排已被改写为非独家。The Information 在去年 9 月也披露,微软开始在部分产品中引入 Anthropic 的模型。
微软 CEO Satya Nadella 7 月 23 日在 X 发文,标题为《前沿扩散与控制》。他写道,当前趋于饱和的前沿能力,已经可以通过针对高频场景优化的模型,以更低成本大规模提供;“只要自家模型表现持平或超越前沿替代方案,就开始把流量导向 MAI”。
他同时表示,来自 OpenAI 与 Anthropic 的前沿模型,仍是整套协调系统的一部分。不过,微软也提出一项“模型独立性”原则:评测系统“即使拿掉任何一个模型,都应继续往上爬”。按照这一思路,配套系统、记忆和技能要尽量放在模型之外,控制权则保留在微软自己的系统层。
按这一结构,微软处于协调者位置,OpenAI 与 Anthropic 的前沿模型更像可替换部件,而微软自家模型则开始承接越来越多的日常流量。
把内部训练方法包装成 Azure 商品
支撑这套布局的,是微软在另一篇公告中披露的方法论“hill-climbing”策略。微软的描述是,让数据、模型与产品“配套系统”形成持续迭代的飞轮,而不是只靠单次训练决定结果。
微软举出的代表性案例是 GitHub Copilot 中的轻量模型 MAI-Code-1-Flash。微软称,该模型在 VS Code 中的代码采用率比 GPT-5.4 Mini 和 Claude Haiku 4.5 高约 10%,同时 token 消耗少 10%。
随后,微软又将这一模型投入 Excel 的强化学习环境继续训练。按照微软公布的结果,这个小模型可以运行在旧款 H100,甚至 A100 GPU 上,在多数 Excel 任务中打平 GPT-5.6。微软称,这意味着无需动用最新一代芯片处理这些任务,也让新的 GB200 集群可以更多用于训练,而不是单纯承接请求。
微软并未把这套方法只留在内部。通过 Foundry 和所谓的 Frontier Tuning,企业客户可以使用自有数据训练专属模型。微软把这套以降低成本为卖点的内部实践,直接包装成 Azure 新商品对外销售。
微软还特别强调,这些模型训练自“干净、可追溯的企业级数据,不经第三方模型蒸馏”。在训练数据来源持续受到追问的背景下,这一表述显然也是面向企业客户和监管者释放的信息。
内部成绩单覆盖 Bing、PowerPoint、OneDrive 与医疗场景
在产品部署层面,微软也给出多项内部指标。Bing Image Creator 已全面切换到 MAI-Image-2.5;在 PowerPoint 中,与 OpenAI 的 GPT-Image-2 相比,GPU 成本下降 84%;OneDrive 切换模型后,存储率提升 26%,延迟下降约 25%。
医疗场景是部署最敏感的一环。微软表示,服务 17 万名医疗人员、上一季度处理 2,800 万笔患者记录的 Dragon Copilot,在跨 58 种语言的转录流程中改用 MAI-Transcribe-1.5 后,转录和语言识别错误率相对下降 50%。
至于这次上线的两款新模型,MAI-Image-2.5-Pro 的定价为每百万文字输入 token 5 美元、每百万图片输出 token 106 美元。广告集团 WPP 全球创意长 Rob Reilly 在微软公告中称其为“生成媒体工具的一次重大跃进”。
MAI-Voice-2-Flash 则被微软描述为比前代快一倍、成本低 32%,主要面向客服中心这类处理量大、但不要求极致表现的场景。
外界评价分化,数据也主要来自微软内部评测
社交平台上的反应并不一致。一名设计师在 X 上批评,微软“在听取用户意见这件事上向来做得最差”,并认为公司会因此在 AI 竞赛中落败。也有网友讽刺微软提出的“模型独立性”,称“拿掉微软之后,倒是希望这套系统还能继续往上爬”。
但也有开发者支持这种做法。有人直言,“为什么改个 Excel 栏位也要动用无所不知的大模型?”也有人把卖点概括为:“不要什么都丢给最大的模型,成本和表现就会一起变好。”
不过,质疑也并非毫无根据。采用率、存储率和 GPU 节省等数字,全部来自微软自身的内部评测,而非第三方基准测试;哪些指标被公开,决定权也掌握在微软手中。

