ChatGPT Health の無料/有料品質差、医学ベンチマークで最大38%の開き
OpenAI が ChatGPT Health のベンチマーク結果を公開。無料版(GPT-5.5 Instant)と有料版(GPT-5.6 Sol)で、健康アドバイスの完全性・有用性に大きな差。300 万人以上が週単位で ChatGPT に医療相談をしている中、品質格差の影響を考察。
続きを読むOpenAI が ChatGPT Health のベンチマーク結果を公開。無料版(GPT-5.5 Instant)と有料版(GPT-5.6 Sol)で、健康アドバイスの完全性・有用性に大きな差。300 万人以上が週単位で ChatGPT に医療相談をしている中、品質格差の影響を考察。
続きを読むインド・CRASH Labが開発したRadLE 2.0ベンチマーク。人間の放射線科医を超えると期待されたAIが、実は間違った診断でも高い信頼度を示す。Claude Fable 5や他モデルも、『知らないことを知らない』リスクが明らかに。
続きを読む