マサチューセッツ州のマス・ジェネラル・ブライガムによる研究が、Jama Network Openに発表され、ChatGPTやGeminiのような一般的なチャットボットが、患者に関する十分な情報がない場合、80%以上のケースで診断を誤ることを明らかにしました。この研究では、OpenAI、Anthropic、Google、xAI、DeepSeekが開発した21の言語モデルをテストし、医療の参考文献に基づく29のクリニカル・ vignetteを使用しました。完全な情報にアクセスできた場合でも、チャットボットは40%以上のエラー率を示しましたが、いくつかのケースでは90%の患者に対して正しい診断を提供することに成功しました。実験の結論は、これらのモデルのパフォーマンスが利用可能な情報の量に大きく依存しており、情報の創造、つまり情報の捏造が正確な回答を生成する上での大きな問題であるということです。