首页 / 资讯详情

通用模型竟然比医疗专用模型更懂医疗?一篇 ACL 论文的两个反直觉发现 | GAIR Paper 123

雷锋网 2026-08-25 02:18 中文

摘要

Doubao 、DeepSeek 在三语数据集上的表现,普遍超过 GPT-4o 和 Gemini。 作者丨幸丽娟 编辑丨岑 峰 医疗,是大模型落地最特殊的场景之一。特殊在哪里?特殊在一个很微小的错误,就可能导致致命的后果;也特殊在你不能用直觉去判断它"行"还是"不行"——你觉得医疗专用模型肯定比通用模型更懂医疗?直觉上是。但实验数据不支持。你觉得英语训练出来的模型处理英语医疗数据肯定最好?直觉上是。但实验数据也不支持。这两重"反直觉",正是纽约大学阿布扎比分校和阿布扎比克利夫兰诊所的研究团队在ACL 2026 Findings上发表的论文揭示的核心真相。论文链接:https://aclanthology.org/2026.findings-acl.573.pdf论文代码:https://github.com/congboma/MedErrBench研究团队构建了首个面向医疗错误检测、错误定位和错误纠正的多语言评测基准MedErrBench,覆盖英语、中文和阿拉伯语三种语言,考验了 GPT-4o、Gemini、Llama、Qwen、DeepSeek等一系列主流模型,在多达十类典型医疗错误上的表现。论文一作马聪博( Congbo Ma)是纽约大学阿布扎比分校博士后研究员,所在的 Clinical AI Lab 长年与阿布扎比克利夫兰诊所等当地医疗机构保持合作。这种医工深度融合的研究模式,让团队既不缺技术能力,也拥有较为丰富的行业经验。而这正是构建一套"临床可信"的评测基准的前提。但这个评测基准数据集的构建,并不简单。它涉及英文,中文和阿拉伯语三语医学数据、十类错误的设计、与医疗系统的跨界协作、以及数轮标注标准的拉锯。这样一项环节较多、涉及多方协作的研究工作,究竟为什么必须要做?又为什么能做成? AI 科技评论采访了马聪博,她详细介绍了这项工作的必要性、构建过程、行业意义以及下一步的深入研究方向。01MedErrBench为什么非做不可?这项研究并非凭空而起,它始于两个方向的具体原因:第一个来自临床一线。马聪博 所在的 Clinical AI Lab 与阿布扎比多家医院的临床医生保持长期合作,他们基本上每两周都会跟医生开会讨论。在交流过程中,医生们提出:无论是给出诊断,还是撰写病例小结,如果能有一个系统自动标记出哪里可能存在错误,对辅助诊断会非常有用。临床实践中的真实需求,给了他们这一研究灵感。第二个来自对大模型行为的观察。研究团队发现,现有的大模型经常能生成非常流畅、甚至有医学术语支撑的解释或诊断,但这些看似专业的输出背后,隐藏着错误。在医学领域,哪怕一个词出错,后果都可能是致命的。团队意识到,需要一个专门针对"错误检测与纠正"的评测基准,给现有大模型在后面再加一道安全网。医疗纠错的价值,在于尽可能早地发现诊疗过程中的潜在错误,并在错误进一步影响临床决策之前提供提示。尤其在急诊等信息密集、决策节奏快的场景中,及时识别遗漏、矛盾或不合理之处,有助于降低医疗错误带来的风险,提升患者安全。马聪博 表示,如果这类系统能嵌入医疗流程,在急诊等容易漏诊的场景下提示潜在错误,将具有实际的临床价值。02MedErrBench是怎么建出来的?医疗作为容错

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。