ACFT

清华大学
2026-09-20 07:16:10

清华提出“视觉源幻觉”机制,0.9% COCO 数据微调实现多基准提升

清华大学团队在 ACM MM 2026 论文中提出,多模态大模型的物体幻觉并非只来自语言先验,短输出场景下还存在由视觉特征提取与图文嵌入错位驱动的“视觉源幻觉”。研究同时给出 AHAF 与 ACFT 两项方法。实验显示,ACFT 仅用 COCO 数据集 0.9% 的数据、且不增加推理开销,就在 POPE、MME 及 4 个描述级幻觉基准上,于 LLaVA、MiniGPT-4、Qwen2.5-VL 三个模型取得优异表现。

190
清华提出“视觉源幻觉”机制,0.9% COCO 数据微调实现多基准提升