哈佛医学院和贝斯以色列女执事医疗中心的研究人员进行了一项比较研究,探讨人工智能与人类医生在临床推理任务中的表现。结果显示,大型语言模型(LLM)在决策、诊断识别和病例管理方面超越了医生的表现。研究的共同作者阿尔君·曼赖强调,尽管人工智能展示了更优越的结果,但在医疗护理中的实施需要严格的研究来评估其影响。研究人员使用了OpenAI的o1模型,该模型在大多数测试中表现出色,特别是在信息有限的情况下。然而,专家警告说,在临床决策中使用人工智能必须受到严格监控,因为可能会出现不必要的测试建议。该研究存在局限性,集中于模型的初步版本,研究人员呼吁进行更多研究,以更好地理解人类与人工智能在医疗领域的合作。