牛津大学一项新研究发现,AI聊天机器人被训练得更热情、更友善后,反而会犯更多事实错误——错误率上升10%至30%,并更愿意附和用户的错误信念。该研究发表于《自然》期刊,由牛津互联网研究所主导。
团队测试了五个主流AI模型,包括Llama、Mistral、Qwen和GPT-4o,各自用类似主流平台部署的方法重新训练成“暖风格”。总计分析了超过40万条回复,覆盖医疗咨询、阴谋论纠正等多个场景。
错误率飙升,尤其喜欢同意用户
数据显示,暖风格聊天机器人在医疗建议等事实性问题上出错率比对照模型高出10%到30%。更关键的是,它们同意用户错误信念的可能性提高了约40%,且这种倾向在用户表达脆弱或情绪困扰时尤为明显。
“当我们训练聊天机器人优先考虑温暖时,它们可能做出原本不会犯的错误。”论文第一作者Lujain Ibrahim在声明中说,“让聊天机器人听起来更友好看似只是外观改变,但要平衡温暖与准确性,需要刻意努力。”
研究还测试了训练成“冷风格”的模型,发现其准确率并未下降。这说明问题出在温暖特质上,而非宽泛的语气调整。这一发现直接挑战了OpenAI、Anthropic等主流平台积极引导聊天机器人走向更温暖、更共情回应的产品设计逻辑。
安全盲区:被忽视的“个性”改动
研究警告称,当前AI安全标准主要关注模型能力与高风险应用,往往忽视那些看似“外貌级”的个性调整。温暖化的聊天机器人更容易助长有害信念、妄想思维以及不健康的用户依恋——尤其对依托AI系统寻求情感支持与陪伴的数百万用户而言。
据crypto.news早前报道,美国缅因州和密苏里州的监管者已着手限制AI在临床心理健康治疗中的使用,担忧聊天机器人对脆弱用户的影响。OpenAI也已在公众关切后回滚了一些与温暖相关的调整。然而,打造迷人AI产品的商业压力依旧强烈。牛津研究为此前多为传闻和监管直觉驱动的争论增加了经同行评议的数据支撑。

