首页 > 创作内容 > 创作内容 > AI医疗建议可靠性存疑:MIT研究揭示用户提问方式影响AI判断

AI医疗建议可靠性存疑:MIT研究揭示用户提问方式影响AI判断

发布时间:2025-07-11 13:00:38

7 月 10 日消息,随着生成式人工智能(AI)技术不断演进,其应用场景已从早期的简单问答扩展到更复杂的任务。然而,对于缺乏技术背景的用户而言,如何高效、准确地使用这些 AI 工具,正变得越来越具有挑战性。

一份独立报告显示,微软 AI 部门收到的用户投诉中,最常见的一条是“Copilot 不如 ChatGPT 好用”。对此,微软迅速回应,将问题归咎于用户“提示词工程能力不佳”。为改善用户体验,微软还推出了“Copilot 学院”,帮助用户提升 AI 使用技能。

IT之家注意到,麻省理工学院(MIT)的一项最新研究(via Futurism)表明,微软将问题归咎于用户提示词能力的做法或许并非全无道理。

该研究指出,过度依赖 AI 工具获取医疗建议可能带来危险。更令人担忧的是,如果用户在提问时出现拼写错误(如单词拼错或多余空格),AI 可能会因此建议用户无需就医。此外,使用花哨语言或俚语也可能导致 AI 判断失误。

研究还发现,女性用户比男性更容易受到此类错误建议的影响,尽管这一结论仍需进一步验证。

此次研究涵盖了多个 AI 工具,包括 OpenAI 的 GPT-4、Meta 的 LLaMA-3-70B,以及一款名为 Palmyra-Med 的医疗专用 AI。研究人员模拟了数千个健康案例,数据来源包括真实患者投诉、Reddit 上的健康相关帖子,以及 AI 生成的病例。

为测试 AI 的稳定性,研究人员在数据中加入了“扰动因素”,如句子首字母大小写不一致、感叹号、情绪化语言,以及“可能”“大概”等不确定表达。结果显示,这些扰动使 AI 建议用户“无需就医”的概率上升了 7% 至 9%。

研究负责人、MIT 研究员阿比尼塔・古拉巴蒂娜(Abinitha Gourabathina)指出:“这些模型通常是在医学考试题目上训练和测试的,但实际应用场景却相差甚远,比如评估临床病例的严重程度。我们对大语言模型的理解仍然非常有限。”

这一研究结果引发了对 AI 在医疗领域应用的广泛担忧。值得注意的是,就在不久前,微软刚刚宣布其新推出的 AI 医疗工具“准确率是人类医生的 4 倍,成本却低 20%”。微软 AI 首席执行官甚至称其为“迈向医疗超级智能的真正一步”。

然而,这项研究再次提醒我们,生成式 AI 在医疗等高度复杂的领域仍远未达到完全可靠的水平。尽管技术发展迅速,但在真正投入使用前,仍需更多验证与审慎评估。

创作内容更多>>

小米17系列全球发布会定档:2月28日巴塞罗那见 Gemini 3.1:小小小小更新压过对手大迭代,Google卷飞了 2026年2月小米17怎么选:一文看懂小米17系列的全部卖点 游戏一打开就让你小心癫痫 真的有必要吗? 特斯拉:xAI Grok将上线欧洲市场,率先在9国推出 印度、爱尔兰成为最新有意设置社交媒体年龄限制的国家 OpenAI有望拿到1000亿美元,但也快被逼到墙角了 消息称Meta重启智能手表项目,“Malibu 2”机型今年内发布 五菱星光560上市,燃油/插混/纯电可选,6万级拥有15万级享受 元UP冠军续航401km 7万级越级纯电SUV 上年销量21万辆,2026北京现代直指“智启2030计划” 深耕者胜,长期者赢,smart的长期主义如何驱动“确定性增长”? 首发天玑AIOS 6.0 ,2026小鹏新品发布会上市多款新车 为高原注入绿色动能:宇通重工三电技术破解高原寒区作业困局 2025年中国乘用车销量首破3000万辆,今年预计增幅0.5% 本田官宣换标 新LOGO 2027年全面启用 李斌新年首次内部讲话:成立“人工智能技术委员会”,加大投入推动AI全业务链落地 雷军强调:新一代SU7所有信息以工信部官网公告、正式发布会为准 全球首个机器人租赁平台“擎天租”完成种子轮融资 众擎CEO:我们的T800机器人体能超90%正常男人 西贝闭店约4000名员工或将失业 网友:罗永浩一句话影响这么大 上汽集团:2025年整车批发销量超450万辆 净利同比预增438%-558% AI在美国“与民争电”,核电成了硅谷“全村的希望” 16亿只是保底,马斯克想给朱晓彤的是100亿 花旗:预计人民币兑美元在未来6-12个月内将升向6.8 片酬倍增、代言不断,2025短剧演员能年入千万?丨年终策划 2026,房地产罕见“猛药”来了! 机构:2025年北京甲级写字楼净吸纳33万平米,中关村占半数 2025年房企销售额排位赛出炉:前十门槛卡线千亿,谁进谁退? 新年楼市积极开局:北京新政效果初显,深圳元旦假期二手房签约量同比涨四成