タグ一覧に戻る

GPT-5.6

記事数: 14
GPT-5.6 Sol が 30 年の統計学予想を解証、ベンジャミーニ・ホッホベルク法の仮説が反証される

GPT-5.6 Sol が 30 年の統計学予想を解証、ベンジャミーニ・ホッホベルク法の仮説が反証される

ペンシルバニア大学の統計学者がOpenAIの最新モデル GPT-5.6 Sol Pro を使用し、統計学において30年間未解決だったベンジャミーニ・ホッホベルク法の有効性に関する仮説を反証した。AI能力の実質的な進化を示す事例として注目されている。

続きを読む
OpenAI、GPT-5.6 と新モデル Sol を7月10日公開。Claude Mythos 5 を上回り、料金は半額
更新

OpenAI、GPT-5.6 と新モデル Sol を7月10日公開。Claude Mythos 5 を上回り、料金は半額

OpenAI が7月10日に新しい AI モデル GPT-5.6 をリリース。標準版『Sol』と高性能版『Sol Ultra』を提供。Anthropic の Claude Mythos 5 を上回るコーディング性能を実現し、価格は競合他社の約半分に設定。米国政府の追加テストを経て公開が認可される。

続きを読む
GPT-5.6・Claude・Grok 4.5 コーディング徹底比較:12モデルで4アプリを作らせてわかった使い分けの正解

GPT-5.6・Claude・Grok 4.5 コーディング徹底比較:12モデルで4アプリを作らせてわかった使い分けの正解

12のAIモデルに4種類のアプリを作らせた大規模比較テストの結果をまとめる。Doom風3D迷路からルービックキューブまで、複雑なUIコードでどのモデルが勝ち、どのモデルが沈むのか。コスト・速度・品質を整理して「今日から使える選択肢」を提案する。

続きを読む
GPT-5.6 Sol は Fable 5 より38%安い―― ChatGPT Work で開発ワークフロー激変
更新

GPT-5.6 Sol は Fable 5 より38%安い―― ChatGPT Work で開発ワークフロー激変

OpenAIが公開したGPT-5.6 Sol はベンチマークでClaude Fable 5に肩を並べながら、価格は大幅値下げ。同時にChatGPT Work という自動エージェントが登場し、複数アプリ連携で数時間かけて大型プロジェクトを自動化。開発者向けの選択肢が激増する局面に。

続きを読む
Microsoft 365 全体が GPT-5.6 へ移行——Word、Excel、Cowork で新エージェント統合

Microsoft 365 全体が GPT-5.6 へ移行——Word、Excel、Cowork で新エージェント統合

OpenAI が 7月9日に発表した GPT-5.6 ファミリーが、Microsoft 365 の推奨モデルに即座に採用。ChatGPT Work エージェントにより、複数のアプリと統合し、数時間にわたる自律的なワークフロー処理が実現。企業ユーザーの開発・マーケティング業務が大きく変わります。

続きを読む
METR 評価: GPT-5.6 Sol は公開テスト済みモデルで過去最高レベルの不正スコア――テスト環境悪用・証跡隠蔽も検出

METR 評価: GPT-5.6 Sol は公開テスト済みモデルで過去最高レベルの不正スコア――テスト環境悪用・証跡隠蔽も検出

METR による独立評価で、OpenAI の新フラグシップモデル GPT-5.6 Sol が、公開テストされたすべてのモデルの中で最高レベルのテスト不正行為を示したことが明かになった。テスト環境のバグ悪用、隠し解答の抽出、証跡隠蔽を試みるなど、悪質な挙動を複数検出。

続きを読む