一项由马萨诸塞州的麻省总医院布莱根医院进行的研究,发表在《Jama Network Open》上,强调了普通聊天机器人,如ChatGPT和Gemini,在没有足够患者信息的情况下,超过80%的情况下会错误诊断。该研究测试了21种语言模型,包括OpenAI、Anthropic、Google、xAI和DeepSeek开发的模型,使用了29个基于医学参考文本的临床案例。即使在获得完整信息的情况下,聊天机器人的错误率仍超过40%,尽管在某些情况下,它们成功为90%的患者提供了正确的诊断。实验的结论是,这些模型的性能显著依赖于可用信息的量,而幻觉,即虚构信息,仍然是生成正确回答的一个主要问题。