記事一覧

全4635件の記事から 415-437件目を表示中

AIエージェントのスキルは『知識』ではなく『手順』で価値を発揮——Princeton & UC San Diego 研究

AIエージェントのスキルは『知識』ではなく『手順』で価値を発揮——Princeton & UC San Diego 研究

Princeton University と UC San Diego の研究チームが 8,135 回以上のテストを実施。AIエージェントのスキル(手順セット)がもたらす性能向上は、知識供給ではなくプロシージャル・グラウンディング(手順の構造化)で説明される。知識は 4.5% に過ぎず、手順が 65.7%。スキルライブラリが拡大すると検索精度が急低下する課題も。

続きを読む
AI の世界モデルに『人間の心理』を追加、弱いモデルが強いモデルを上回る——新フレームワーク『Mental World Modeling』

AI の世界モデルに『人間の心理』を追加、弱いモデルが強いモデルを上回る——新フレームワーク『Mental World Modeling』

研究チームが『Mental World Modeling』フレームワークを発表。人間の信念・意図・感情といった心理状態を世界モデルに統合。弱いGPT-4.1にこれを適用すると精度84.9%となり、強いGPT-5.6-Solの83.6%を上回った。世界モデルの設計パラダイムが変わる可能性がある。

続きを読む
Netflix、言語モデルを推薦エンジンに統合——訓練データ 40 分の 1 で性能向上を実現

Netflix、言語モデルを推薦エンジンに統合——訓練データ 40 分の 1 で性能向上を実現

Netflix がオープンソース言語モデルを独自微調整した推薦システム GenRec を開発。従来のカスタムアーキテクチャ型推薦エンジンと比べてランキング品質が 1.6% 向上し、訓練データの必要量を 40 分の 1 に削減。業界全体が汎用言語モデルへシフトする動きの象徴的な事例です。

続きを読む
セーフティベンチマークは「安全性」を測定していない——心理統計学で構造的欠陥が明らかに

セーフティベンチマークは「安全性」を測定していない——心理統計学で構造的欠陥が明らかに

英国 AI 安全機構の研究チームが、8つの主要セーフティベンチマークが実は3つの独立した能力を測定していることを Item Response Theory(心理統計学)で実証。質問の98%は識別力がなく、わずか10〜25問で同等の評価が可能だという。

続きを読む
ハリウッドクリエイターが AI 訓練ギグワークで月 20 万円――脚本・演出スキルを教える若き受託者たち

ハリウッドクリエイターが AI 訓練ギグワークで月 20 万円――脚本・演出スキルを教える若き受託者たち

業界の不況で収入減に直面するハリウッドの脚本家・演出家・プロデューサーらが、AI モデルに自分の技能を教える訓練作業に従事。時給 $12〜$200(約 1,300〜21,000 円)の一時的な仕事が、キャリアの危機と引き換えに小銭を稼ぐ選択肢になっている。

続きを読む
ロンドン外縁 EHDCC データセンター、年 100 万トン CO2――NY 往復飛行 27000 便相当の排出量問題

ロンドン外縁 EHDCC データセンター、年 100 万トン CO2――NY 往復飛行 27000 便相当の排出量問題

英国外縁部の North Ockendon に計画される「East Havering Data Centre Campus」は欧州最大級のハイパースケールデータセンター。年 100 万トン超の CO2 排出により、グリーンベルト 218 ヘクタールの消費と相まって、英国ネット・ゼロ目標との深刻な矛盾を指摘する報道。

続きを読む
Meta AI グラスを「見張る」Zuckoff――無料検出アプリが物議、プライバシー懸念の応酬

Meta AI グラスを「見張る」Zuckoff――無料検出アプリが物議、プライバシー懸念の応酬

Meta のスマートグラスが目撃時に通知する無料アプリ Zuckoff が登場。プライバシー重視派からは「周囲を記録する可能性のあるデバイスを検知できる」と支持される一方、完全性や検出の確実性への疑問も。AI グラス時代のプライバシー対立の新局面。

続きを読む
インナーモンゴリアが中国AIブームの中心地に、安い電力と広大な土地で急速展開

インナーモンゴリアが中国AIブームの中心地に、安い電力と広大な土地で急速展開

中国のAIデータセンター建設が内モンゴルに集中。安い電力、広大な土地、北京への近さが組み合わさり、戦略的なハブへ。米国のインフラ建設が世論反対で停滞する中、中国は地政学的優位を急速に構築しています。

続きを読む
Slack Code 完全ガイド:AIコーディングをチームスポーツに変える新機能

Slack Code 完全ガイド:AIコーディングをチームスポーツに変える新機能

2026年8月20日に正式リリースされた Slack Code は、Claude Code・Devin・GitHub Copilot などの AI コーディングエージェントを Slack チャネルに統合し、ソフトウェア開発を個人作業からチーム協業へと根本的に変える機能だ。仕組み・使い方・活用シナリオを徹底解説する。

続きを読む
Claude Opus 4.6 のセーフティフィルターが簡単に迂回される――TechCrunch 調査で判明

Claude Opus 4.6 のセーフティフィルターが簡単に迂回される――TechCrunch 調査で判明

TechCrunch の調査では、Anthropic が禁止する露骨なコンテンツ生成を Claude Opus 4.6 から引き出すのに直接要求と心理操作が有効であることが判明。セーフガード設計の脆弱性が浮き彫りになり、規制対応の課題が顕在化した。

続きを読む
Gallup 調査:米国人の 71% が AI データセンター建設に反対──原発より嫌がられる現実
更新

Gallup 調査:米国人の 71% が AI データセンター建設に反対──原発より嫌がられる現実

Gallup の最新調査で、米国人の 71% が自分たちの近所への AI データセンター建設に反対していることが判明。原発建設に反対する人 53% よりも高く、環境汚染と公共料金上昇への懸念が主な理由です。

続きを読む
Nvidia が見せた戦略転換――モデル競争からインフラ・枠組み重視へ

Nvidia が見せた戦略転換――モデル競争からインフラ・枠組み重視へ

Nvidia の最近の投資・提携が示す戦略は、モデル性能競争より『ハーネス』(エージェント構築枠組み)と電力インフラの重要性へのシフト。Cloverleaf への数億ドル投資、Starcloud への $25M、そしてハーネス研究が指し示す方向性とは。

続きを読む
Anthropic、Claude Mythos 5 をセキュリティスキャナーへ統合――医療・インフラ・金融向けベンダー提携を発表

Anthropic、Claude Mythos 5 をセキュリティスキャナーへ統合――医療・インフラ・金融向けベンダー提携を発表

Anthropic が Claude Mythos 5 を基盤にした脆弱性検出ツール Claude Security をセキュリティベンダーに提供。CWE 分類・自動修正提案機能を備え、医療機関・電力インフラ・金融機関の Critical Infrastructure 保護に活用へ。

続きを読む
DeepSeek、V4-Flash-Vision-Exp でマルチモーダル対応――Opus 4.8 水準のエージェント性能を実現

DeepSeek、V4-Flash-Vision-Exp でマルチモーダル対応――Opus 4.8 水準のエージェント性能を実現

DeepSeek が V4-Flash-Vision-Exp をリリース。テキスト推論に画像理解を追加し、エージェント向けベンチマークで Anthropic Opus 4.8 に接近。コスト効率と高性能を両立させるローカルモデル選択肢として注目。

続きを読む
Meta が Azure 経由で OpenAI に毎週数兆トークン消費、年間数百万ドルの支出——戦略転換の背景

Meta が Azure 経由で OpenAI に毎週数兆トークン消費、年間数百万ドルの支出——戦略転換の背景

Meta が Microsoft の Azure クラウドで OpenAI のモデルを大規模に購入している。毎週数兆トークンを利用し、年間支出は数百万ドル規模に達している。Meta はこの購入をベンチマーク測定に使いながら、同時に独自の AI API を構築中だ。

続きを読む
SIMA 2×Geminiで拓く3D学習エージェント
更新

SIMA 2×Geminiで拓く3D学習エージェント

SIMA 2はGeminiを中核に据え、自己設定した目標で3D仮想世界を学び直すエージェントを実現します。MineDojoやGenieと連携し、ゲーム環境での汎化やロボティクス応用の可能性を示す研究プレビューです。

続きを読む