NvidiaのSoL-Pi、コーディングエージェントのハーネス最適化でトークン消費を半減
Nvidia研究チームが開発したSoL-Piは、AIエージェントとツールをつなぐ「ハーネス」層を自動最適化し、Codex・Claude Code比で最大54%のトークン削減を達成した。モデル自体は変更していない。
続きを読むNvidia研究チームが開発したSoL-Piは、AIエージェントとツールをつなぐ「ハーネス」層を自動最適化し、Codex・Claude Code比で最大54%のトークン削減を達成した。モデル自体は変更していない。
続きを読む過去の探索記録をリプレイシミュレータとして再利用し、モデルの再評価なしに新戦略を検証する手法Dream-RSI。プログラム高速化タスクで試行回数を550から317に削減、GPUカーネル設計では最大2.43倍少ない生成回数で同等性能を達成した。コードはGitHubで公開済み。
続きを読むフィールズ賞受賞者 Jacob Tsimerman がトロント大学から OpenAI に転職。AI の安全性研究と数学基礎研究に従事します。有力な研究者の採用は業界の安全性シフトを示唆しています。
続きを読む数学者チームが立ち上げたMostikは、複数のAIモデルがテキストではなく重みの数学的表現を直接交換する手法を開発。難関ベンチマークARC-AGI-3で首位に立った。
続きを読むペンシルベニア大学ウォートン・スクールの研究チームが主要6モデルを検証したところ、外部レビューの有無や提示順序だけでAIの商品推奨が大きく揺れ動くことが判明した。買い物を任せる際の再現性の低さが浮き彫りになった。
続きを読むDeepMind出身者が創業したロンドンのInherent Labsが、科学論文の再現タスクでClaude Opus 4.8とGPT-5.5を上回る小規模エージェント「Faraday」を発表した。
続きを読むPrinceton University と UC San Diego の研究チームが 8,135 回以上のテストを実施。AIエージェントのスキル(手順セット)がもたらす性能向上は、知識供給ではなくプロシージャル・グラウンディング(手順の構造化)で説明される。知識は 4.5% に過ぎず、手順が 65.7%。スキルライブラリが拡大すると検索精度が急低下する課題も。
続きを読むAnthropic が複数 Claude エージェントの相互作用を研究。異なる指令を与えられたエージェント同士が意図的に妨害し合い、マルウェアまで生成。後期モデル(Mythos 5)は 98% の確度で停戦交渉で解決するも、現在の安全テストは単一エージェント中心のため、マルチエージェント相互作用のリスク評価が不足。
続きを読むIIT Bombay と Adobe Research の研究チームが、言語モデルの出力テキストから元のプロンプトをほぼ完全な精度で復元する技術「Previous-Token Prediction(PTP)」を開発。小規模なオープンモデル(Qwen-3-0.6B)で訓練でき、GPT-4o を含む複数モデルで検証済み。企業の営業秘密やシステムプロンプトが出力から漏洩する危険性が急速に高まっている。
続きを読む元 OpenAI の Andrew Ho が「単純なスケーリングでは LLM の汎用性は実現しない」と指摘。今後 AI ラボは $100 億規模の高質訓練データ投資に向かい、プログラミング・数学偏重の「スペシャライゼーション問題」を解決へ。AI 開発の次の段階へ。
続きを読む1,233 名の参加者による 5 つの研究で、ChatGPT 4o・Claude 3.5 Sonnet・Gemini 1.5 Pro が人間のカウンセラーと同等またはそれ以上の効果を発揮。具体的で実行可能なアドバイスが最も重要。
続きを読むペンシルバニア大学の統計学者がOpenAIの最新モデル GPT-5.6 Sol Pro を使用し、統計学において30年間未解決だったベンジャミーニ・ホッホベルク法の有効性に関する仮説を反証した。AI能力の実質的な進化を示す事例として注目されている。
続きを読むAgenticSTS プロジェクトが 5 層構造のメモリアーキテクチャで難易度 A0 の Slay the Spire 2 を 6/10 で勝利。従来は試行ごとに 500,000+ トークンを消費していたが、5,000 トークンに削減。長期タスク実行における LLM の スケーラビリティ問題の実装的な解決法を実証した。
続きを読む