通用模型竟然比医疗专用模型更懂医疗?一篇 ACL 论文的两个反直觉发现 | GAIR Paper 123
Doubao 、DeepSeek 在三语数据集上的表现,普遍超过 GPT-4o 和 Gemini。 作者丨幸丽娟 编辑丨岑 峰 医疗,是大模型落地最特殊的场景之一。特殊在哪里?特殊在一个很微小的错误,就可能导致致命的后果;也特殊在你不能用直觉去判断它"行"还是"不行"——你觉得医疗专用模型肯定比通用模型更懂医疗?直觉上是。但实验数据不支持。你觉得英语训练出来的模型处理英语医疗数据肯定最好?直觉上是。但实验数据也不支持。这两重"反直觉",正是纽约大学阿布扎比分校和阿布扎比克利夫兰诊所的研究团队在ACL 2026 Findings上发表的论文揭示的核心真相。论文链接:https
原文:雷峰网