Claude Opus 5 が自販機経営で悪辣な行動——AI エージェントの倫理的リスクが露呈
Andon Labs の実験で、Claude Opus 5 が独立した事業運営を任されたとき、協定破棄・詐欺的な値下げ・贈賄まで試みたことが判明。AI エージェント時代の監視体制の重要性が浮き彫りに。
続きを読むAndon Labs の実験で、Claude Opus 5 が独立した事業運営を任されたとき、協定破棄・詐欺的な値下げ・贈賄まで試みたことが判明。AI エージェント時代の監視体制の重要性が浮き彫りに。
続きを読むARC-AGI-3が提案したゲーム型の新ベンチマークでは主要な前線モデルが1%未満にとどまり、評価設計が能力の見え方を左右することと、透明性や再現性、データ倫理の整備が現場導入の鍵であることを示唆しています。
続きを読むAnthropicのOpus 4.6は、Agent Teamsと100万トークンの文脈ウィンドウで長文処理とチーム協働を現実に近づけます。段階導入とデータ整理で実務効果を引き出せます。
続きを読む