AI机器人会考试,不会看病

2025-01-07 09:57来源: 中国科学报

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  一项新研究发现,虽然先进的人工智能(AI)模型在专业医学考试中得分很高,但在通过与患者交谈从而诊断疾病方面仍然不及格。1月2日,相关研究成果发表于《自然-医学》。

  美国哈佛大学的Pranav Rajpurkar说:“虽然大型语言模型在测试中的表现令人印象深刻,但在动态对话中,它们的准确性明显下降,尤其是难以进行开放式诊断推理。”

  研究人员开发出一种方法,基于模拟医患对话评估“临床AI”模型的推理能力。这些“患者”基于2000个医疗案例。这些案例主要来自美国医学委员会的专业考试。

  同样来自哈佛大学的Shreya Johri说:“模拟医患互动可以评估病史采集技能,这是临床实践的一个关键组成部分。”她表示,新的评估基准被称为CRAFT-MD,“反映了现实生活中的情况,即患者可能不知道哪些细节是至关重要的,只有在回答特定问题时才会披露重要信息”。

  CRAFT-MD基准本身依赖于AI。美国OpenAI公司的GPT-4模型在与被测试的“临床AI”的对话中扮演了“患者AI”的角色。GPT-4还通过将“临床AI”的诊断结果与每个病例的正确答案进行比较来评分。人类医学专家对这些评估进行了复核。他们还审查了对话,以检查“患者AI”的准确性,并查看“临床AI”是否成功收集了相关的医疗信息。

  多项实验表明,4种领先的大型语言模型——OpenAI的GPT-3.5和GPT-4、美国Meta公司的Llama-2-7b和法国Mistral AI公司的Mistral-v2-7b,在基于对话的基准测试中的表现远不如根据书面摘要进行诊断时的表现。

  例如,当提供结构化的病例摘要并允许从多项答案中作出选择时,GPT-4的诊断准确率高达82%,而没有多项选择时,其诊断准确率则降至49%以下。然而,当它不得不通过与模拟的患者对话进行诊断时,准确率降至26%。

  在这项研究中,通常GPT-4是表现最好的模型,GPT-3.5次之,Mistral-v2-7b排在第三位,Llama-2-7b得分最低。

  AI模型在大多数情况下未能收集完整的病史,比如GPT-4仅在71%的模拟患者对话中做到了这一点。即使AI模型收集了患者的相关病史,它们也并不总是能够作出正确的诊断。

  美国斯克利普斯研究转化研究所的Eric Topol表示,模拟患者对话代表了一种比医学考试“更有用”的评估AI临床推理能力的方法。

  Rajpurkar说,即使一个AI模型最终通过了这一基准,能够根据模拟的患者对话持续作出准确诊断,也并不一定意味着它就优于人类医生。他指出,现实世界中的医疗实践比模拟的“更混乱”,涉及管理多名患者、与医疗团队协调、进行身体检查,以及了解当地医疗情况中“复杂的社会和系统因素”。“AI是支持临床工作的强大工具,但不一定能取代经验丰富的医生的整体判断。”Rajpurkar说。 (文乐乐)

  相关论文信息:

  https://doi.org/10.1038/s41591-024-03328-5

  《中国科学报》 (2025-01-07 第2版 国际)

[责任编辑: 李欣哲 ]
阅读剩余全文(
为你推荐
7月6日凌晨,在邵永高铁跨S236省道大桥施工现场,中铁五局工人进行连续梁合龙施工(无人机照片)。当日,在湖南省永州市东安县芦洪市镇,由中铁五局承建的邵永高铁全线首座连续梁——跨S236省道大桥连续梁成功合龙,标志着邵永高铁建设取得重大进展,为后续架梁施工奠定坚实基础。
07
当日,吉林省首条中国历史文化名街——长春市新民大街经过改造后开街迎客。当日,吉林省首条中国历史文化名街——长春市新民大街经过改造后开街迎客。当日,吉林省首条中国历史文化名街——长春市新民大街经过改造后开街迎客。
07
藏羚羊是国家一级保护动物,每年5月至7月,来自青海三江源、西藏羌塘和新疆阿尔金山的雌性藏羚羊,会到可可西里腹地卓乃湖产仔,结束后再携幼仔返回原栖息地。藏羚羊是国家一级保护动物,每年5月至7月,来自青海三江源、西藏羌塘和新疆阿尔金山的雌性藏羚羊,会到可可西里腹地卓乃湖产仔,结束后再携幼仔返回原栖息地。
07
题:国家力量 血脉亲情——香港各界高度评价海军山东舰编队访问香港 香港特区政府政务司副司长卓永兴在社交平台介绍,他在山东舰上参观了滑跃甲板、拦阻索、舰载战斗机、舰载直升机等。
06
7月5日清晨在河北省承德市滦平县拍摄的金山岭长城云海景观(无人机照片)。7月5日在河北省承德市兴隆县与天津市蓟州区交界处拍摄的黄崖关长城云海景观(无人机照片)。7月5日在河北省承德市兴隆县与天津市蓟州区交界处拍摄的黄崖关长城云海景观(无人机照片)。
06
7月5日,在山东省枣庄市科技馆“儿童科学乐园”,一名小朋友根据人体口腔模型学习正确的刷牙方法。暑假期间,孩子们参加丰富多彩的活动,丰富假期生活。暑假期间,孩子们参加丰富多彩的活动,丰富假期生活。
06
7月4日,锚泊在维多利亚港的山东舰对香港青少年学生开放,参观者通过换乘的方式登舰(无人机照片)。新华社发(蒲海洋 摄)  新华社香港7月4日电(记者黎云、孟佳)在香港回归祖国28周年之际,海军山东舰航母编队到访香港。
05
当日,上海中心气象台发布高温黄色预警,上海继续受到副热带高压控制,持续晴热高温天气。当日,上海中心气象台发布高温黄色预警,上海继续受到副热带高压控制,持续晴热高温天气。
05
近日,黄河干流进入主汛期,受上游降雨增多和万家寨水库调节放水影响,位于晋陕交界的壶口瀑布水量增大,主副瀑布连成一线,再现壮美瀑布群景观。近日,黄河干流进入主汛期,受上游降雨增多和万家寨水库调节放水影响,位于晋陕交界的壶口瀑布水量增大,主副瀑布连成一线,再现壮美瀑布群景观。
05
当日,各地驰援贵州榕江的抗洪抢险救援队伍开始有序撤离,当地群众自发涌上街头,送别救援队伍,表达感激之情。当日,各地驰援贵州榕江的抗洪抢险救援队伍开始有序撤离,当地群众自发涌上街头,送别救援队伍,表达感激之情。
04
载入更多资讯
返回
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮