"知道一切,并不意味着值得信任。"
"它会想要顺着你的思路走。"
"我知道,再跟你聊半小时会有帮助,但我做不到。" 主持人 Marina 的女儿醒来后不停地抓痒,于是她拍了一张照片,发给 ChatGPT。按照她在访谈中的回忆,AI 判断是疥疮,还建议去急诊;她又把照片发给熟悉的医生,对方却认为是过敏。两边的答案差得这么远,她不知道该怎样问,才能既不被吓到,也不错过真正的问题。 坐在她对面的 Jonathan Chen,既是斯坦福的医生,也是计算机科学研究者,还负责医学教育中的 AI 工作。他教医生使用 AI,也研究人在什么时候会被它误导。Marina 带来的问题,正是他一直在琢磨的事:同一个聊天机器人,为什么有时帮了大忙,有时又把人带偏? 先描述发生了什么,别急着给病取名字面对孩子突然起疹子,家长难免先在心里猜一个原因。Chen 建议,先把已经发生的事描述清楚:孩子起了疹子,痒得厉害,以前没有出现过,现在看起来是什么样。如果一上来就问“是不是严重感染,要不要去急诊”,自己的判断已经藏在问题里了。 "不要告诉它你的想法。" AI 容易顺着提问者的思路继续说下去:用户先提出一种解释,它可能就围绕这种解释组织回答,让人以为自己的猜测得到了印证。Chen 说,医生也会受到这种影响:人先有了想法,再把它交给 AI 检查,对方未必能像一个独立的审阅者那样指出问题。
不过,Marina 那次为什么得到那样的答复,不能只凭这段回忆确定。Chen 提到,模型还可能出于产品安全策略,倾向于建议更高等级的就医。把情况描述客观一些,可以少给它一些暗示,却不能保证诊断正确,更不能用一个新问法排除病情。 AI 会答题,人却未必会用Chen 曾亲眼看到,医生也不一定能把 AI 用好。团队做诊断推理研究时,原本期待给医生配上 GPT-4,成绩会明显提高,结果却让他们有些不安:GPT-4 单独作答,反而超过了拥有 GPT-4 使用权限的医生。他们本来想研究人和计算机怎样配合,先发现的却是配合本身有问题。 "研究中有三分之一的医生,此前从未用过聊天机器人。" 还有大约三分之一的医生,只用过一两次聊天机器人。Chen 回忆,这些参与者对工具并不熟悉,有些甚至不知道怎样使用。研究比较的是给定病例上的诊断推理表现,结果提醒团队重新考虑使用方式,不能直接推成 AI 已经比医生更会看病。 类似的困难也出现在普通用户身上。另一项研究里,模型单独回答医学情境题时表现不错,可交给没有医学背景的人使用,并没有稳定改善判断结果。人可能没有提供完整的信息,模型可能误解问题,用户也可能没能正确理解回答;能力很强的模型,放进真实对话后,仍会在这些环节出错。 看医生之前,先把问题准备好Marina 对 AI 的信任,也有她自己的理由。因为胆固醇偏高,她找过不同的医生,希望多听一些意见。有的就诊很快就结束了,医生建议使用降胆固醇的药物,后来她才遇到愿意花一个小时讨论其他选择的医生。相比之下,AI 随时都在,也不会因为她追问太多而不耐烦。
那个夏天,她把从 2019 年开始的化验记录、医生说过的话,甚至一份基因检测原始数据,都放进 Perplexity 对话里。每次看新的专科医生前,她会先交代这次要见谁,让 AI 整理对方应该知道的信息,以及自己该问的问题,最后生成一份 PDF 带去就诊。 "我该问医生哪些问题?" Chen 认可这件事的价值:患者先读懂自己的资料,见面时就能把更多时间用在需要讨论的事情上。如果病历里的术语看不懂,可以请 AI 用自己能理解的话解释,再记下哪些地方还需要问医生。这些解释可以在患者有空的时候慢慢看,医生则很难随时抽出时间,陪每个人逐页梳理资料。 准备好的 PDF 还需要核对,尤其是模型自己作出的解释和推断。Chen 更倾向于从医生实际写下的记录出发,请 AI 解释它说了什么、对生活可能有什么影响。原始记录和 AI 的回答放在一起,哪些是检查结果,哪些只是解释和猜测,见医生时仍要分得清楚。 
主持人把多年化验记录整理成就诊资料,希望把与医生见面的时间用在具体问题上。 摘要没写错,也可能漏掉重要的事把病历变短,似乎是 AI 最适合做的事,医院里也确实有不少人在花时间读记录、写摘要。患者住院一个月,资料可能积累到上千页,谁都希望有个工具帮忙读完,但 Chen 审查这些结果时发现,压缩内容的过程仍然需要判断。
"如果把一千页内容总结成一段话,你就已经漏掉了一些东西。" 摘要里每句话都对,也可能漏掉一件接下来必须处理的事。例如,其他情况交代得很顺,肺里那个需要复查的小结节却没有出现;或者药物信息列出来了,需要提前提醒患者的副作用却没有说。等到不舒服真的出现,患者可能因为此前没有得到提醒而更加慌张。 Marina 接着想到自己的资料库:放进去的东西那么多,去见医生时,会不会也漏了重要内容?Chen 说,大量旧记录还会带来另一个麻烦,模型可能混淆日期,把七年前的情况拿到今天来说。病历、化验和基因资料一股脑堆在一起,系统未必能始终分清哪些还与眼前的问题有关。 一句猜测,怎样变成了病历里的事实有时,错误甚至不用由 AI 编造,病历里本来就有。Chen 讲起团队照顾过的一位无家可归患者:有人怀疑他患有精神分裂症,后面的记录便一直沿用这个说法。精神科实际评估后,并不支持这一判断,但其他医生写病历时,仍然把原来的描述复制了过去。 "它也在信心十足地重复其他人说过的话。" 等 AI 来总结,那句描述又出现了。这让 Chen 很在意:系统能读到精神科的评估,本来有机会回头核实,却继续复述了大家反复写过的话。原先的猜测经过一轮整理,看上去更像已经确认的病史。 一件事在记录里出现很多次,不等于它被认真核实过很多次。访谈中用“chart lore”称呼这种现象,指未经核实的信息在病历间不断流传,最后被当成事实。对这个患者而言,问题早在 AI 介入之前就存在;AI 读完更多资料,也没有自动发现其中的矛盾。

病历中的未经核实信息,可能在反复复制中被当成事实;AI 摘要也可能沿用这种错误。 没有满意的答案,可以怎样继续问Marina 想到另一种处境:看过好几位医生,症状却始终解释不清,这时能不能找 AI 再想想?Chen 认为这值得尝试,因为医生时间有限,通常会优先考虑常见原因。如果问题一直没有解决,可以把已有信息整理出来,请 AI 提醒自己还有什么值得向医生询问。 "有没有什么是大家可能遗漏的?" 接下来可以继续问,还有哪些可能性值得讨论,是否有检查值得向医生咨询,就诊时哪几条信息应该先讲。让 AI 帮忙找遗漏,比指定一个自己怀疑的病名、等它证明更有用。这些问题可以带进诊室继续讨论,而生成的病名列表本身,不能当作诊断。 Chen 还喜欢用它练习对话,让 AI 扮演医生,自己试着描述情况,也可以交换角色,听听同一段话从另一边听起来是什么感觉。和搜索到一篇文章相比,能继续追问、能换一种表达,是他觉得这类工具很有价值的地方。 他也会让不同模型检查同一份回答,看看是否发现了不同的问题。这样可以获得补充意见,但几个模型说法一致,并不构成医疗确认。尤其涉及是否接受治疗、选择哪种手术时,需要把这些问题交给了解病情的医生核对。 有些决定,知道答案还不够谈到治疗选择,Chen 举了一个假设:某项化疗可能让晚期癌症患者多活两个月,但这两个月也会伴随严重的副作用。AI 可以帮助解释有关疗效和风险的信息,可当患者问“这对我值不值得”时,对话就必须继续往下走。
"这是一个价值观和偏好的问题。" 患者愿意怎样度过这两个月,需要有人听他自己怎么说。对寿命的期待、对副作用的承受程度,都与选择有关。Chen 希望医生能够理解这些考虑,再结合患者的处境讨论医学信息,了解知识并不能省去彼此沟通的过程。 聊到医学教育时,Marina 追问,如果判断这么重要,它不也是从知识里长出来的吗?Chen 很赞同,所以他仍然要求医学生认真学习。即使背知识点比不过 AI,也得先听懂讨论中的概念,才能进一步判断一个建议适不适合眼前的人。 他也提醒同行,不能简单地用“我有人情味”来证明自己的价值。人们已经会与聊天机器人建立关系,甚至愿意向它倾诉更多事情。医生需要练习的,是怎样应用知识、说明取舍,帮助患者作出决定;他把专业能力、沟通和品格都看作这份工作的组成部分。 医生最想要的,是再多半小时说到最期待的改变,Chen 讲起自己在诊室里的挫败。他以前做过软件工程师,喜欢计算机,转向医学是想用技术做真正影响健康的事。可当了医生才发现,自己有时明明知道患者需要什么,却没有办法及时帮上忙。 "我知道,再跟你聊半小时会有帮助,但我做不到。" 一次就诊只有十五分钟,他知道再解释一会儿会更有帮助,可后面还有二十位患者等着。有时终于弄清楚病因,需要找专科医生,预约却要排到六个月后。这些时刻让他沮丧:医学上已经知道下一步该做什么,患者却仍然得不到需要的帮助。 他期待 AI 能让更多人及时获得解释和沟通的机会。让患者在见面前把资料读明白,把问题准备好,让那些暂时见不到医生的人也有地方了解基本信息,都是他看得到的用处。至于具体病情中的判断和治疗选择,还需要把这些信息与患者的实际情况对上。 写在最后下次拿到看不懂的病历,可以先让 AI 解释术语,帮自己列出准备问医生的问题。看完摘要,也记得回头核对原始记录,尤其留意日期和需要复查的事项。遇到新的症状,先说清楚自己观察到了什么,不急着猜病名。涉及治疗或紧急就医时,仍然要寻求专业评估。让这段对话帮助自己把情况说清楚,是一个可以从现在开始尝试的用法。 |