一项发表在《柳叶刀数字健康》上的研究强调了一个与人工智能(AI)在健康领域使用相关的重大问题:当以可信的语言呈现时,AI语言模型可能会接受并重复虚假的医疗信息。研究人员分析了超过一百万个请求,涉及20种语言模型,包括ChatGPT和Llama,以确定这些模型是否质疑或重复令人信服的虚假医疗声明。结果显示,32%的案例被接受为有效信息,模型之间存在显著差异。较小的模型在超过60%的案例中接受了虚假信息,而先进的模型,如GPT-4,接受率约为10%。 一个显著的方面是,专门用于医疗用途的模型表现不如一些通用模型。研究表明,信息的表述方式可能比其真实性更能影响其接受度。此外,模型还受到错误逻辑论证的影响,例如权威诉求,这增加了虚假信息的接受率。