| 多模态基础模型利用文本进行医学图像预测 |
| 来源:一起赢论文网 日期:2026-07-13 浏览数:121 【 字体: 大 中 小 大 中 小 大 中 小 】 |
|
多模态基础模型利用文本进行医学图像预测 多模态基础模型在医学图像解读方面表现出令人信服但存在矛盾的表现。然而,这些模型如何整合和优先处理包括图像和文本在内的不同数据模态,仍然了解不足。我们利用1090个多模态医疗案例评估了8个专有开源的多模态基础模型。我们表明图像预测主要由文本驱动,准确率随着信息性文本的增加单调提升。文本利用是一把双刃剑;即使是文本中轻微的错误诊断暗示,也会削弱基于图像的分类,显著降低模型此前仅凭图像回答的案例表现——引入误导性临床情景时,氧气准确率从84%降至28%。在长格式病例的医生评估中,当文本信息量高时,添加图像会降低或不提升性能(例如,GPT-4V在69个临床病理学会议中显示,添加图像时在高度信息性文本中显示准确率下降)。我们的结果表明,多模态AI模型可能在医学诊断推理中有用,但其准确性主要受文本驱动,无论好坏。 |
| [返回] |