【论文学习】MICCAI 2025 || Gut-VLM:面向大型视觉语言模型胃肠道图像分析的幻觉感知多模态基准

【论文学习】MICCAI 2025 || Gut-VLM:面向大型视觉语言模型胃肠道图像分析的幻觉感知多模态基准

Gut-VLM

Hallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language Models

MICCAI 2025

Gut-VLM:面向大型视觉语言模型胃肠道图像分析的幻觉感知多模态基准

构建一个同时保留“模型错误报告、错误位置标签和专家修正报告”的胃肠镜图文数据集,并让视觉语言模型学习发现和纠正自己的幻觉。

幻觉是指:模型生成的描述看起来合理,但与图像中的真实医学内容不一致。

例如,一张正常幽门图像,模型可能生成:图像中央存在红色异常。但医学专家查看图像后认为没有这种异常,这句话就是幻觉。

医学场景下这种错误尤其危险,因为模型可能:声称存在实际上不存在的息肉;把正常组织描述为炎症;错误描述病灶颜色或位置;错误判断是否出血、感染;错误描述异物或医疗器械。

Gut-VLM数据集怎么构建:论文使用 Kvasir-v2 胃肠镜数据集中的图像,共标注了1816张

  1. 第一阶段:GPT-4o生成报告

    先让 GPT-4 Omni 根据每张胃肠镜图像生成诊断性描述。

    提示词要求报告覆盖12个医学问题,包括:解剖部位;解剖标志物的颜色和位置;异常区域的颜色和位置;息肉数量;是否存在炎症;是否出血;是否存在异物;是否感染;是否存在医疗器械。

    得到的是未经审核的模型报告,其中可能同时包含正确句子和错误句子

  2. 第二阶段:专家识别和纠正幻觉

    4名胃肠科专家逐句审查GPT-4o报告。

    每个句子被标记为:Non-hallucinated:与图像一致;Hallucinated:包含与图像不一致的信息

    对于错误句子,专家还需要提供正确版本。

    最终,每张图像可能包含:

    胃肠镜图像 ├── GPT-4o原始报告 ├── 每句话的幻觉标签 ├── 专家修正后的句子 └── 完整的专家修正报告

论文发现GPT-4o生成的报告中:

  1. 只有30.39%的报告完全正确;

  2. 1.70%的报告所有句子都包含幻觉;

  3. 67.84%的报告同时包含正确句子和错误句子。

也就是说,接近70%的报告属于这种情况:一部分内容正确 + 一部分内容错误

这比整段报告完全错误更符合真实风险。因为混合型错误看起来更可信,也更难检测。

幻觉感知微调方法:论文比较了两种训练方式

  1. 普通微调

    普通方法只给模型看:

    输入:医学图像 目标:专家修正后的正确报告

    模型只学习“正确答案是什么”,不知道原模型曾经犯了什么错误。

  2. 幻觉感知微调

    作者提出的方法输入:医学图像 + GPT生成的错误报告

    要求模型分两步输出:

    第一步:找出哪些句子存在幻觉; 第二步:把错误报告修正为正确报告。

    模型不仅要学习正确答案,还要学习错误模式以及如何纠正错误

测试了4个开源视觉语言模型:

  1. LLaVA-1.6-7B;

  2. Qwen2-7B;

  3. DeepSeek-7B-VL;

  4. mPLUG-Owl-2B。

训练设置:

  1. Rank-8 LoRA;

  2. 训练5轮;

  3. batch size 8;

  4. 学习率 (1x10^{-4});

  5. A100 GPU。

比较三种模型:

  1. Pretrained:未经微调

  2. Finetuned:普通正确报告微调

  3. Finetuned-H:幻觉感知微调

摘要

视觉语言模型(Vision-Language Models,VLMs)在医学领域正变得越来越普及,它们能够弥合医学图像与临床语言之间的差距。现有VLM在理解医学图像和文本查询,并生成详细的描述性医学诊断报告方面展现出了出色的能力。

然而,幻觉问题仍然是VLM面临的一项重要挑战。这里的“幻觉”是指模型生成与图像视觉内容不一致的描述。这一问题在医学领域可能造成尤为严重的后果。

为了促进胃肠道(Gastrointestinal,GI)图像分析领域的VLM研究,并深入研究模型幻觉问题,我们构建了一个胃肠道图像—文本多模态数据集——Gut-VLM。

该数据集通过一个两阶段流程构建。首先,使用ChatGPT为Kvasir-v2数据集中的图像生成描述性医学报告。在这一过程中,ChatGPT会产生一些带有幻觉或错误内容的文本。随后,在第二阶段,由医学专家对这些报告进行系统审查,识别并纠正其中可能存在的不准确信息,从而保证数据标注具有较高的质量和临床可靠性。

与仅包含描述性文本的传统数据集不同,Gut-VLM还提供了用于标识幻觉句子的标签,以及这些错误句子所对应的修正内容。

减少VLM幻觉的一种常见方法,是在小规模、特定任务的数据集上对模型进行微调。然而,我们利用所构建的数据集采取了一种不同的策略。我们并非仅仅对VLM进行微调,使其生成医学文本报告,而是训练模型检测并纠正幻觉。我们将这种方法称为“幻觉感知微调”(hallucination-aware finetuning)。

实验结果表明,与仅针对描述性报告生成进行微调相比,幻觉感知微调能够取得更好的效果。此外,我们还使用多种评价指标,对多个当前先进的视觉语言模型进行了全面评估,从而建立了一个相应的评测基准。

GitHub代码仓库:bhattarailab/Hallucination-Aware-VLM

图一

图1:上图:数据标注流程概览;下图:[左]来自Gut- VLM 的数据样本,根据提示中提出的问题描述了底层条件,展示了幻觉文本(红色)与修正后的文本(绿色);[右]该数据集中ChatGPT-4 Omni生成响应的统计结果。

上半部分:数据标注流程

Kvasir-v2胃肠镜图像 + 医学提示词 ↓ GPT-4o生成报告 ↓ 得到可能含幻觉的描述 ↓ 胃肠科专家逐句检查 ↓ 修正后的报告 ↓ AI提取结构化诊断问答 ↓ 人工再次检查 ↓ 最终诊断问答标注

左下部分:一个具体错误案例

图像是一张正常盲肠胃肠镜图像 提示词是:请用一段文字描述该图像,并回答下面列出的所有问题 GPT-4o原始输出:这是一张正常盲肠的图像。图像中央存在一个小息肉,颜色偏黄。解剖标志物为结肠内壁,主要呈粉红色。没有观察到炎症、出血、感染、异物或医疗器械。

其中红色文字是幻觉:图像中央存在一个黄色的小息肉 但图像中实际上没有息肉。GPT-4o把正常的阑尾开口错误识别成了息肉。

另一个错误是:解剖标志物是结肠内壁,主要呈粉红色 专家认为这里的解剖标志物描述不准确

专家修正后的报告:这是一张正常盲肠的图像。图像中央可见颜色偏黄的阑尾开口。该图像的解剖标志物是盲肠。未观察到炎症、出血、感染或异物,也未发现医疗器械。图像中不存在息肉。

中下部分:12个诊断问题

GPT-4o生成报告时,需要覆盖12个问题,主要包括:

  1. 图像属于哪一种解剖结构?

  2. 图像中是否存在解剖标志物?

  3. 解剖标志物是什么颜色?

  4. 图像中是否存在异常?

  5. 如果存在异常,异常是什么颜色?

  6. 异常位于图像中的什么位置?

  7. 是否存在息肉?如果有,有多少个?

  8. 是否存在医疗器械?如果有,在哪里、有多少个?

  9. 是否存在炎症?

  10. 是否存在出血?

  11. 是否存在异物?

  12. 是否存在感染?

因此,它不是让GPT-4o自由描述,而是用固定问题约束报告内容。

右上部分:报告级统计

数据集中共有1816份GPT-4o报告。

报告类型数量比例含义
All correct55230.39%所有句子均正确
Hallucinated32约1.76%所有句子都包含幻觉
Mixed Responses123267.84%同时包含正确和错误句子

重要的发现:只有约30%的报告完全正确,约68%的报告是“正确信息与错误信息混合”。

混合型错误最危险,因为整篇报告不是明显胡说,而是:大部分内容正确 + 少数医学事实错误

右下部分:不同医学属性的准确率

柱状图表示GPT-4o在不同类型问题上的准确率,大致为:

  1. 解剖类别:约50%,最低;

  2. 异常或解剖标志物的颜色:约85%;

  3. 位置:约90%;

  4. 医学表现,如炎症、出血、感染:约90%;

  5. 息肉数量:约80%。

这说明错误不是均匀分布的:GPT-4o对颜色、位置和部分医学表现判断较好,但对具体解剖类别的识别明显较差。