专注 React 工具开发的 Million 团队发布了 ReactBench v1。这是首个面向 AI 代码生成代理在真实 React 开发任务中的基准测试。结果显示,表现最好的 GPT-5.6 Sol 成功率也只有 43.1%,所有受测模型都没有超过五成,AI 在 React 生产级开发里的表现与完全替代开发者还有明显距离。
Million 曾开发 React Scan 与 Million.js。此次推出的 ReactBench v1,不再停留在“能否通过基础单元测试”这一层,而是把 AI 放进真实开源项目场景中,检查其生成代码是否达到生产环境要求。
基准测试覆盖 51 个真实任务
ReactBench v1 从真实开源项目中筛选了 51 项任务,也就是 51 个 Pull Requests,主要考察两类能力:Write React 与 Fix React。
为避免模型写出表面可运行、实际埋雷的代码,测试引入了名为 React Doctor 的验证器。该工具包含 400 多条检查规则,重点识别无效渲染、性能低下、无障碍设计缺失以及可维护性问题。官方给出的标准很直接:AI 代理不只要完成功能,还不能引入新的代码错误。
GPT-5.6 Sol 暂列第一,Claude Fable 5 紧随其后
按照官方公布的平均通过率 pass@1,当前主流顶级模型仍有很大提升空间。OpenAI 的 GPT-5.6 Sol(Medium / XHigh 配置)以 43.1% 的综合得分排在第一,Anthropic 的 Claude Fable 5(XHigh)为 41.2%。
官方表示,两者差距不大,现阶段还不能确认 Sol 已具备绝对优势。
所有模型成功率都低于 50%
这次测试里,没有任何模型的成功率达到 50%。数据还显示,在累计 4,455 次新功能开发测试中,各模型一共引入了 1,194 个 React 相关问题,其中 77.5% 属于严重程序错误或安全性问题。
从问题分布看,列表渲染以及 Hook 规则正确性,是模型最容易出错的地方。
成本差异明显,中阶模型性价比更受关注
除成绩外,报告也提到成本因素。GPT-5.6 Terra(Medium)得分为 38.0%,与头部水平相当接近;但在同为 XHigh 配置时,Fable 5 的单次测试成本约为 Sol 的 6.3 倍。
这意味着,对需要大规模生成代码的企业来说,中阶模型可能更具性价比。
React 高市占率放大代码缺陷风险
报告提到,React 目前约占使用 JavaScript 框架网站的 70% 市占率。开发团队表示,如果开发者过度相信 AI 生成的 React 代码,细小缺陷很容易在生产环境中被放大,甚至可能带来系统宕机、转化率下降和营收损失。
Million 团队称,推出 ReactBench 的目的,是为开发者提供一套更贴近真实场景的评估标准,检验 AI 代理能否写出安全、合规且高效的 React 代码。

