複数の AI モデルが国際数学オリンピックで満点達成、AI の数学能力が人間レベルに
中国の Huawei と Xiaohongshuo の AI が IMO(国際数学オリンピック)で初めて満点を獲得。OpenAI、Anthropic、Moonshot AI も 42/42 点を達成し、AI の数学推論能力が新局面へ。
続きを読む中国の Huawei と Xiaohongshuo の AI が IMO(国際数学オリンピック)で初めて満点を獲得。OpenAI、Anthropic、Moonshot AI も 42/42 点を達成し、AI の数学推論能力が新局面へ。
続きを読むAnthropic の Claude Mythos が 1946 年から未解決だったエルデシュの単位距離予想を解く。「かわいい、シンプルな証明」と評価され、AI 駆動型の数学発見に「深刻な余力」が存在することが明らかになった。
続きを読むLLM が複雑なコードタスクで優れている一方、日常的な質問に失敗する。この矛盾は検証可能性にある。報酬を得られる領域(コーディング・数学)では強化学習が機能するが、曖昧な領域では最適化が進まない。
続きを読む