文章主要内容和创新点主要内容本文介绍了Prompt4Trust,这是首个基于强化学习(RL)的提示增强框架,旨在解决多模态大型语言模型(MLLMs)在临床场景中部署的关键问题:对提示设计的敏感性以及高置信度下的错误响应。该框架通过训练一个轻量级的校准指导提示(CGP)生成器,生成上下文感知的辅助提示,引导下游任务MLLM生成置信度与预测准确性更匹配的响应。实验表明,Prompt4Trust在医疗视觉问答(VQA)基准PMCVQA上实现了最先进的性能(准确率45.95%),且参数规模显著小于现有方法(3.5B vs. 13B)。此外,该框架训练的CGP生成器无需额外微调即可零样本迁移到更大的MLLMs,验证了其可扩展性。其核心是基于临床需求的非对称奖励函数,优先惩罚高置信度错误、鼓励高置信度正确,确保模型在高置信度时准确性高,在不确定时表现保守,符合临床安全标准。创新点首个RL驱动的MLLMs置信度校准框架:首次将强化学习用于提示增强,专门优化MLLMs的置信度校准,而非仅关注任务准确率。临床导向的非对称奖励机制:奖励函数对高置信度错误施加更重惩罚,对高置信度正确给予更高奖励,优先保障临床决策中“高置信度即高准确性”的核心需求。上下文感知的动态提示生成:CGP生成器根据输入的医疗问题和选项动态生成提示,克服了固定提示无法适配不同场景的局限性。