ハーバード・メディカル・スクールとベス・イスラエル・ディーコニス・メディカル・センターの研究者たちは、臨床推論のタスクにおける人工知能と人間の医師の比較研究を行いました。結果は、大規模言語モデル(LLM)が医師の意思決定、診断の特定、ケース管理においてパフォーマンスを上回ったことを示しています。研究の共同著者であるアルジュン・マンライは、AIが優れた結果を示したにもかかわらず、医療におけるその実装には影響を評価するための厳密な研究が必要であると強調しました。研究者たちは、特に情報が限られた状況で優れたパフォーマンスを発揮したOpenAIのo1モデルを使用しました。しかし、専門家たちは、臨床的な意思決定におけるAIの使用は注意深く監視されるべきであり、不要なテストの提案が生じる可能性があると警告しています。この研究には制限があり、モデルの初期バージョンに焦点を当てており、研究者たちは医療分野における人間とAIの協力をよりよく理解するための追加研究を求めています。