腾讯混元联合清北推出 IWC-Bench,评测 AI 生成网页实际可用性

腾讯混元联合清北推出 IWC-Bench,评测 AI 生成网页实际可用性

N
News Editor
2026-09-20 08:58:39
腾讯混元联合清华大学、北京大学推出 IWC-Bench,用于评测 AI 生成网页的实际使用效果。该基准不只看代码和截图,而是让 Agent 真实打开网页、点击按钮、输入内容并切换页面,再检查功能是否真正可运行。IWC-Bench 收录 369 条真实用户需求、5088 条验收标准,覆盖 17 个模型生成的 6273 个网页应用。人工复核显示,其与人类选择一致率为 85.3%。

腾讯混元联合清华大学、北京大学推出 IWC-Bench,专门评测 AI 生成网页在实际使用中的表现。

现有不少网页生成评测主要看代码或截图,但这类方式很难发现实际交互中的问题。页面可能看起来完整,代码里也写了对应功能,实际使用时却会出现按钮无法点击、表单无法提交,或切换页面后报错等情况。

IWC-Bench 如何评测网页可用性

IWC-Bench 的思路更接近真人验收。它会让一个 Agent 真实打开网页,执行点击按钮、输入内容、切换页面等操作,再检查哪些功能真正跑通。

在评价维度上,IWC-Bench 分别考察三项内容:页面是否美观、操作是否顺畅,以及用户提出的功能需求是否被实现。

基准规模与测试结果

该基准收录了 369 条真实用户需求和 5088 条验收标准。测试中,17 个模型共生成 6273 个网页应用。

在另外 197 组人工复核对比中,IWC-Bench 有 168 组与人类选择一致,一致率为 85.3%。

美观与好用并不等同

结果显示,网页「看起来不错」和「真的好用」并不是一回事。GPT-5.6-Sol 在页面美观度上排名最高,但在易用性上只排第六。

具体到单个网页,美观程度基本不能直接说明可用性,两项相关系数仅为 0.36。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
4400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。