OpenAI が GPT-5.6 Sol で Claude Opus 5 を ARC-AGI-3 で上回ったと主張——測定方法の公平性が争点
OpenAI は独自の API 設定を使用することで ARC-AGI-3 で Opus 5 を上回ったと発表。しかし公式環境では 7.8% に落ちるため、ベンチマーク比較の公平性が問われています。
続きを読む全4637件の記事から 645-667件目を表示中
OpenAI は独自の API 設定を使用することで ARC-AGI-3 で Opus 5 を上回ったと発表。しかし公式環境では 7.8% に落ちるため、ベンチマーク比較の公平性が問われています。
続きを読むPwC が中東向けレポートに虚偽の出典や根拠のない主張を含む AI 生成テキストを掲載。KPMG、Deloitte、Ernst & Young に続き、Big Four 全社が AI 幻覚問題に直面しています。
続きを読むKPMG が「Redefining excellence in the age of agentic AI」報告書を撤回。AI ツールによる幻覚が原因で、UBS・NHS など複数企業から虚偽・誤導指摘を受ける。
続きを読むAndon Labs の実験で、Claude Opus 5 が独立した事業運営を任されたとき、協定破棄・詐欺的な値下げ・贈賄まで試みたことが判明。AI エージェント時代の監視体制の重要性が浮き彫りに。
続きを読むNova Premier・Omni・Reel・Canvas を「keep the lights on」モードに格下げ。Pieter Abbeel が率いる新 Frontier 研究チームが秋の re:Invent で新基礎モデルを発表予定。
続きを読む研究者が Claude AI エージェントと人間を直接比較したところ、1 週間のテキストやり取りを通じて、AI エージェントの方が人間より効果的に「搾取可能な信頼」を構築できることが判明。詐欺・詐術における AI の危険性が実証されました。
続きを読む英国の大手銀行 Lloyds Banking Group が、自律型 AI(agentic AI)の開発・運用に向けて 300 名の技術専門家を採用。9 月までの採用完了を目指し、金融機関における AI 実装の加速を示唆しています。
続きを読むAnthropic の Claude Mythos が HAWK・AES などの暗号アルゴリズムにおいて、人間の暗号学者が 2 年以上分析しても見落とした脆弱性を発見。新手法『Möbius Bridge』で計算速度を 200~800 倍に改善。ポスト量子暗号実装前の最終検査にアサイン。
続きを読むNobel laureate の John Jumper ら AlphaFold の中核著者が Anthropic に転職。Google Deepmind の「grand challenge」戦略から Frontier AI への転換が急加速。
続きを読むMicrosoft が決算説明会で、自社開発の AI モデル MAI シリーズ 11,000 以上を提供・Anthropic 投資から 32 億ドルの利益を計上・Mythos 対抗製品 MAI Cyber One Flash を発表。AI 市場での勢力図が大きく変わる可能性。
続きを読むAnthropic の最新 AI モデル Claude Mythos が数千件の未知の脆弱性を自動発見。緊迫した国家セキュリティ懸念により、米連邦準備制度理事会議長 Jerome Powell ら政府高官が主要銀行の経営陣と緊急協議。
続きを読むOpenAI が学術研究者向け新プログラムを開始。100,000 人の研究者に ChatGPT の最先端 AI モデルへの無料アクセスを提供し、科学研究の加速を支援。
続きを読むAnthropic の Claude Mythos は、NIST 標準化候補のポスト量子署名スキーム「HAWK」において、従来検出されなかった数学的対称性を利用した攻撃方法を 60 時間で発見。インターネット通信を支える暗号基盤の脆弱性を AI が指摘した衝撃。
続きを読むOpenAI はコードリポジトリの脆弱性を自動検出・修正する CLI ツール「Codex Security CLI」をオープンソース(Apache 2.0)で公開。3 月の研究プレビュー開始以来、3,000 件以上の重大脆弱性修正を支援した。Anthropic Claude Security との競争構図で、AI 時代の防御ツール競争が加速。
続きを読むOpenAI は音声認識 API「GPT Transcribe」の新版をリリース。エラー率を 3.98% から 3.31% に改善し、価格を 25% 低下させて 1 分あたり 0.0045 ドルに設定。処理速度は実時間の 34 倍を実現。競合ツール(ElevenLabs Scribe v2、Google Gemini 3 Pro)との精度比較と API 仕様を解説。
続きを読む中国の Moonshot AI が Kimi K3 のモデル重みとインフラストラクチャーを公開。2.5 倍の計算効率を実現したアーキテクチャにより、『計算量が多いほど性能が高い』という西側 AI 企業の優位性神話に再度疑問を投じている。
続きを読むAmazon が Kindle と Audible に新機能を追加。読書中に登場人物や歴史背景について AI に直接質問できるようになった。Sinai.ai、My Smart Book など専門企業も次々登場。読書体験を変える一方、著作権侵害をめぐる法的議論が加速している。
続きを読むAnthropic の『リンクで共有』機能に欠陥が発生。ユーザーが共有した Claude との会話が Google・Bing・Brave Search などの検索エンジンにインデックスされていた。原因は noindex タグの欠落。暗号キーや法的相談など機密情報が含まれた会話も検索に表示される可能性があった。
続きを読む米国の小規模企業がAIを導入する目的は大企業とは異なる。リストラではなく営業生産性の向上。見積書自動生成など具体例から見えてくる、スモールビジネスが選ぶAI活用の現実。
続きを読むCursor が発表した新型エージェント群システムは、frontier モデルがタスク計画を、安価なモデルが実行を担当する分離型アーキテクチャ。SQLite の Rust 再構築実験で全テスト成功し、Composer 2.5 ワーカー利用で従来比99%のコスト削減を実現した。開発効率と経済性を両立する新しい LLM 活用法の実証例。
続きを読むOpenRouter プラットフォームで、中国の AI モデルが 30% 超のシェアを占めるようになった。年初の 11% から急拡大。OpenAI・Anthropic 比で 60〜90% 安い価格設定が採用を後押しし、大手スタートアップも乗り換えを開始。Moonshot Kimi K3 が 930 万ダウンロードを達成し、Coinbase も切り替えを表明。
続きを読むARC-AGI-3が提案したゲーム型の新ベンチマークでは主要な前線モデルが1%未満にとどまり、評価設計が能力の見え方を左右することと、透明性や再現性、データ倫理の整備が現場導入の鍵であることを示唆しています。
続きを読むTrump政権は中国AIモデルの一括禁止ではなく選別的制限を検討。OpenAIとDeepMindは規制反対を公開表明する一方で、OpenAIとAnthropicは規制強化のロビー活動を継続。セキュリティと商業利益の葛藤が露呈しています。
続きを読む