腾讯混元联合清华大学、北京大学推出 IWC-Bench,专门评测 AI 生成网页在实际使用中的表现。
现有不少网页生成评测主要看代码或截图,但这类方式很难发现实际交互中的问题。页面可能看起来完整,代码里也写了对应功能,实际使用时却会出现按钮无法点击、表单无法提交,或切换页面后报错等情况。
IWC-Bench 如何评测网页可用性
IWC-Bench 的思路更接近真人验收。它会让一个 Agent 真实打开网页,执行点击按钮、输入内容、切换页面等操作,再检查哪些功能真正跑通。
在评价维度上,IWC-Bench 分别考察三项内容:页面是否美观、操作是否顺畅,以及用户提出的功能需求是否被实现。
基准规模与测试结果
该基准收录了 369 条真实用户需求和 5088 条验收标准。测试中,17 个模型共生成 6273 个网页应用。
在另外 197 组人工复核对比中,IWC-Bench 有 168 组与人类选择一致,一致率为 85.3%。
美观与好用并不等同
结果显示,网页「看起来不错」和「真的好用」并不是一回事。GPT-5.6-Sol 在页面美观度上排名最高,但在易用性上只排第六。
具体到单个网页,美观程度基本不能直接说明可用性,两项相关系数仅为 0.36。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

