タグ一覧に戻る

コーディングAI

記事数: 3
Grok 4.5 一般公開、Cursor データで訓練も『自己申告ベンチマーク』に懐疑の声
更新

Grok 4.5 一般公開、Cursor データで訓練も『自己申告ベンチマーク』に懐疑の声

SpaceXAI(旧xAI)が Grok 4.5 を一般公開しました。Cursor の実開発セッションを学習に取り込み、Harvey 法律ベンチマークで1位を獲得。価格は入力$2/出力$6(100万トークンあたり)と Opus 4.8 の半分以下ですが、独立系ベンチマークでの検証はまだなく、Cursor ユーザーのコードが無断で学習に使われた可能性も指摘されています。

続きを読む
Claude Fable 5 実践ガイド:コーディングからゲーム生成まで、今日から試せる使い方まとめ

Claude Fable 5 実践ガイド:コーディングからゲーム生成まで、今日から試せる使い方まとめ

6月9日に公開されたAnthropicの最強モデルClaude Fable 5。SWE-Bench Proで80.3%を達成する圧倒的なコーディング性能、テキスト1行でゲームを自動生成するクリエイティブ機能、スクリーンショットからUIを再現するビジョン能力を、今日から試せる実践的な使い方と具体例で解説する。

続きを読む
GLM-5.1リリース——長時間エージェントタスクで既存モデルを上回る新世代AI

GLM-5.1リリース——長時間エージェントタスクで既存モデルを上回る新世代AI

ZhipuAI が GLM-5.1 を MIT ライセンスでオープンソース公開。SWE-Bench Pro で 58.4% を達成し、600 回反復の最適化や 8 時間連続でのデスクトップ構築など、長時間エージェントタスクで突出した能力を示している。

続きを読む