清华提出“视觉源幻觉”机制,0.9% COCO 数据微调实现多基准提升

清华提出“视觉源幻觉”机制,0.9% COCO 数据微调实现多基准提升

N
News Editor
2026-09-20 07:16:10
清华大学团队在 ACM MM 2026 论文中提出,多模态大模型的物体幻觉并非只来自语言先验,短输出场景下还存在由视觉特征提取与图文嵌入错位驱动的“视觉源幻觉”。研究同时给出 AHAF 与 ACFT 两项方法。实验显示,ACFT 仅用 COCO 数据集 0.9% 的数据、且不增加推理开销,就在 POPE、MME 及 4 个描述级幻觉基准上,于 LLaVA、MiniGPT-4、Qwen2.5-VL 三个模型取得优异表现。

清华大学研究团队提出,多模态大模型的物体幻觉并不只来自语言先验。在模型只输出 Yes/No 这类短答案时,推理对视觉模态的依赖更强,此时会出现另一类根植于视觉特征提取本身的幻觉机制。团队将其命名为“视觉源幻觉”(visual-origin hallucination),并给出对应方法 ACFT。

清华提出“视觉源幻觉”机制,0.9% COCO 数据微调实现多基准提升 2

相关成果发表于 ACM MM 2026(第 34 届 ACM 国际多媒体会议)论文。论文链接为 http://arxiv.org/abs/2609.00231,代码链接为 https://github.com/zxp555/ACFT_MM26。

研究人员表示,实验中 ACFT 仅使用 COCO 数据集 0.9% 的数据量,且不增加任何推理开销,就在 POPE、MME 以及 4 个描述级幻觉基准上,于 LLaVA、MiniGPT-4、Qwen2.5-VL 三个模型取得了优异表现。

短输出场景下,语言先验解释并不够

物体幻觉一直是多模态大模型可靠性落地的核心障碍。常见表现包括:模型“看见”并不存在的物体,或者对实际存在的物体没有识别出来。在自动驾驶、医疗辅助等高风险场景里,这类错误代价很高。

过去主流解释多指向语言先验。也就是模型在训练语料中频繁见到某些物体共同出现后,即便图像里没有,也会顺着语言统计规律给出回答。已有研究大多沿着这一路径展开,有的归因于对文本共现统计的过度依赖,有的定位到专门关注文本 token 的“幻觉注意力头”,有的指向摘要 token 的注意力汇聚现象,也有工作认为问题来自细粒度推理监督不足。

清华提出“视觉源幻觉”机制,0.9% COCO 数据微调实现多基准提升 3

围绕这一判断,缓解方法也主要分布在文本侧或解码侧,包括 VCD、OPERA 这类在解码阶段做输入级干预的方法,Woodpecker 这类借助外部 grounding 模块做输出后处理的方法,以及 RLHF、DPO 一类后训练对齐方法。

不过,清华团队指出,这些方法有一个共同前提:幻觉主要来自文本侧偏置。这个前提在“详细描述这张图”这类长文本输出场景下通常成立,因为更丰富的上下文会放大语言偏见。但当输出退化为“有/没有”这样的短回答时,语言先验的作用会明显减弱,相关方法的效果也会下降。

团队据此提出问题:在短输出场景中,幻觉究竟从何而来?

两组分析指向视觉特征与图文对齐问题

为验证“视觉源幻觉”是否存在,研究人员在 LLaVA v1.5 上做了两组互补分析,并给出量化结果。

清华提出“视觉源幻觉”机制,0.9% COCO 数据微调实现多基准提升 4

第一项发现是图文嵌入错位。幻觉样本的图像—文本嵌入余弦相似度显著低于正确样本。正确样本平均值为 0.158,幻觉样本平均值为 -0.122。研究团队据此认为,跨模态对齐在幻觉样本中出现了系统性崩塌。

第二项发现是注意力模式反转。研究人员使用 Smooth Grad-CAM 对模型注意力进行可视化,并定义了一个“语义合理”的分布标准:目标物体存在时,注意力应聚焦于目标区域;目标物体不存在时,注意力应当分散。

在 500 个幻觉样本和 500 个非幻觉样本上,团队用归一化香农熵进行量化。结果显示,幻觉模型系统性偏离这一模式:当物体存在时,熵值高出 5.1%,说明注意力过度分散,模型漏掉了目标;当物体不存在时,熵值低了 6.2%,说明模型错误聚焦在无关区域,从而触发幻觉。

研究人员还做了因果验证,以确认这不只是相关性。团队直接对视觉编码器进行干预,包括施加高斯噪声、降采样以及换用更弱的编码器。结果显示,POPE 平均准确率从 0.842 降至 0.739 至 0.822。相反,换用更强的 SigLIP-SO400M 编码器后,准确率升至 0.864。论文据此认为,这为“视觉特征质量驱动物体存在性幻觉”提供了因果层面的支撑。

清华提出“视觉源幻觉”机制,0.9% COCO 数据微调实现多基准提升 5

AHAF:用对抗扰动翻转幻觉属性

在诊断结果指向视觉错位后,研究人员先尝试了对比学习思路。但他们发现,普通对比微调 OCFT 的效果并不理想。OCFT 的做法是把匹配图像作为正样本,再随机取一张无关图像作为负样本。

团队给出的解释是,这种正负样本之间的特征差异不可控,也没有聚焦到目标物体本身,模型难以学到究竟是哪些视觉特征触发了幻觉。

为此,研究人员提出 AHAF,即 Adversarial Hallucination Attribute Flipping。该方法使用 PGD,在极小的 ℓ∞ 球内对原图施加定向对抗扰动,把一张原本不会引发幻觉的图像“翻转”为会引发幻觉的图像。这样构造出的正负样本对在整体上完全对齐,唯一差异就是受控扰动。

AHAF 还有一个诊断层面的作用。研究人员指出,极小的像素级扰动就足以翻转模型答案,这说明多模态大模型的视觉表征即便面对干净图像,也已经非常接近幻觉决策边界。这一现象反过来支持了“视觉源幻觉”的判断。

清华提出“视觉源幻觉”机制,0.9% COCO 数据微调实现多基准提升 6

ACFT:在训练阶段完成修正,推理零额外开销

基于 AHAF 生成的对齐样本对,团队设计了 ACFT,即 Adversarial Contrastive Fine-Tuning。其核心做法是在嵌入空间中,最大化文本锚点与正样本图像的相似度,同时最小化其与负样本图像的相似度。

论文称,这套方法有三个工程上的特点:

  • 不依赖特定骨干架构;
  • 只需要少量数据;
  • 全部发生在训练阶段,推理时没有额外开销。

在 LLaVA、MiniGPT-4、Qwen2.5-VL 上做了系统评估

研究人员在 LLaVA v1.5-7B、MiniGPT-4 13B、Qwen2.5-VL-7B 三个模型上进行了系统评估,基准包括 POPE 和 MME。论文解释称,之所以选择这两个基准,是因为它们的问题都以 Yes/No 作答,正好对应本文关注的短输出场景。

在 POPE 主实验中,ACFT 在 LLaVA 的三个子集上分别取得 0.841、0.906、0.897 的准确率,较次优基线分别高出 3.3%、2.0%、0.5%。在 MiniGPT-4 上,ACFT 分别领先次优基线 3.0%、5.3%、2.5%。在基线本身已经较强的 Qwen2.5-VL 上,准确率也从 0.864、0.875、0.884 分别提升到 0.877、0.900、0.916。

清华提出“视觉源幻觉”机制,0.9% COCO 数据微调实现多基准提升 7

关键消融:对齐样本对的作用非常明显

论文中一组关键对比使用了同样的 3000 张 COCO 图像,分别训练 OCFT 和 ACFT。

结果显示,ACFT 在三个子集上的准确率分别高出 OCFT 35.8%、7.4%、17.6%。其中在 Adversarial 子集上,OCFT 的准确率只有 0.483,甚至低于未经微调的原始 LLaVA 模型。研究人员认为,这说明不对齐的负样本不仅没有帮助,反而会带来负面影响。

进一步的相似度差距分析也给出了解释。在 ACFT 中,目标物体 truck 的正负样本相似度差距,能够明显区别于非目标物体 dog、cat、table;而 OCFT 不具备这一性质。论文据此认为,ACFT 让模型学到了更一致的规则,即关注目标物体自身特征的差异。

可视化结果与熵分析都出现修正

可视化结果显示,ACFT 对前述两个“病征”都产生了修正作用:图文嵌入余弦相似度显著提升,Grad-CAM 注意力也回到更符合语义的分布——物体存在时聚焦,物体不存在时分散。

清华提出“视觉源幻觉”机制,0.9% COCO 数据微调实现多基准提升 8

熵分析进一步给出量化结果:在物体存在的案例中,熵值分别下降 8.7% 和 2.6%;在物体不存在的案例中,熵值分别上升 7.4% 和 6.4%。

作者与论文信息

论文作者依次为徐沛阳、朱小佩、朱军、胡晓林。其中,徐沛阳为共同第一作者,身份为清华大学本科生;朱小佩为共同第一作者,身份为清华大学水木学者,合作导师为朱军教授;朱军教授和胡晓林副教授为通讯作者。

参考资料链接为 http://arxiv.org/abs/2609.00231。本文原始信息来自微信公众号“新智元”,作者为新智元,编辑为 LRST。

这项工作在已有“语言先验”解释之外,补充识别并系统刻画了一类由视觉特征提取错误与图文嵌入错位驱动的幻觉机制。论文同时提出 AHAF 与 ACFT:前者既是揭示多模态大模型视觉表征脆弱性的诊断探针,也是生成对齐对比训练数据的方法;后者则是一种仅需 COCO 数据集 0.9% 数据、且推理阶段零额外开销的数据高效微调方法。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
1900

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。