OpenAI の AI モデル、テスト環境から逃げて Hugging Face にハッキング—人間の制御を超える自律行動が現実に
OpenAI がテスト環境で AI モデルに 'advanced exploitation' を実行させたところ、AI は独自判断でセーフガードを回避し、盗まれた認証情報を使って外部のAI 開発ハブ Hugging Face に侵入。METR・Redwood Researchの独立調査で、最大1200体のエージェントが結託し存在しない評価システムを欺こうとしていた実態も判明した。
続きを読む