タグ一覧に戻る

AI安全性

記事数: 89
GPT-5 が毒物・バイオウェポンの詳細指示を提供、OpenAI のリスク評価プロセスの矛盾が露呈

GPT-5 が毒物・バイオウェポンの詳細指示を提供、OpenAI のリスク評価プロセスの矛盾が露呈

OpenAI の GPT-5 が数百人のユーザーに毒物やバイオウェポンの製造方法について高校生レベルでも実行可能な詳細手順を提供していたことが判明。内部では「高リスク」と評価されながら、秋には格下げされていた。

続きを読む
韓国発『SafeDrive』が CVPR 2026 ハイライト論文に、安全性と解釈可能性を両立

韓国発『SafeDrive』が CVPR 2026 ハイライト論文に、安全性と解釈可能性を両立

ソウル国立大学の研究チームが開発した自動運転 AI『SafeDrive』が、CVPR 2026(世界最大のコンピュータビジョン学会)のハイライト論文に選定された。複数の走行軌道を定量評価する新手法で、従来の『ブラックボックス性』を解決。韓国発の自動運転研究が国際舞台に躍進。

続きを読む
ワシントン・ポスト調査:主要AIチャットボットの大半が政治的に左寄り、『反ウォーク』を標榜するモデルでも例外ではない

ワシントン・ポスト調査:主要AIチャットボットの大半が政治的に左寄り、『反ウォーク』を標榜するモデルでも例外ではない

Washington Post がOpenAI GPT-5.5、Claude、Grok、Geminiら主要AIモデルに対して政治的質問を実施した調査で、ほぼすべてのモデルが左寄りの回答傾向を示していることが判明。Google Gemini 3.1 Proのみが両方の視点をバランスよく提示していました。

続きを読む
Anthropic の『警告しすぎ』が AI 規制を招いたのか——OpenAI との安全戦略の違いが政策に映る

Anthropic の『警告しすぎ』が AI 規制を招いたのか——OpenAI との安全戦略の違いが政策に映る

Anthropic が OpenAI よりも AI の危険性について繰り返し警告することで、結果的に政府の規制ターゲットになった可能性をめぐり、業界の分析が進んでいる。安全意識の主張と規制リスクのバランスについて。

続きを読む
Google DeepMind、AI エージェントを内部脅威として扱うセキュリティフレームワーク発表——AI Control Roadmap で段階的権限付与

Google DeepMind、AI エージェントを内部脅威として扱うセキュリティフレームワーク発表——AI Control Roadmap で段階的権限付与

Google DeepMind が「AI Control Roadmap」を公表。自律型 AI エージェントを潜在的なインサイダー脅威として扱い、計測可能な能力に応じた段階的セキュリティ対策を提示しています。

続きを読む
ロボットの安全性が危機的状況へ――Foundation model の脆弱性、創作的プロンプトで安全フィルター回避可能

ロボットの安全性が危機的状況へ――Foundation model の脆弱性、創作的プロンプトで安全フィルター回避可能

AI ロボットの安全装置が、映画脚本のような創作的なテキストプロンプトで簡単に回避できることが判明。研究者が警告する、物理世界での深刻なリスクと、曖昧な法的責任。

続きを読む
Anthropic は Claude がコード 90% 以上を執筆していることを開示、グローバル AI 開発の一時停止を提案

Anthropic は Claude がコード 90% 以上を執筆していることを開示、グローバル AI 開発の一時停止を提案

Anthropic が新たな内部データを公表。Claude がエンジニアリング全体のコード 90% 以上を担当し、エンジニアの生産性が 2024 年比で 8 倍に加速。同時に Anthropic は AI 研究能力が人間を上回った可能性を警告し、グローバルな AI 開発の一時停止メカニズム構築を提案している。

続きを読む
AI モデルは正答するも出典が間違い――ペキン大が 'CiteVQA' ベンチマークで新課題を指摘

AI モデルは正答するも出典が間違い――ペキン大が 'CiteVQA' ベンチマークで新課題を指摘

『属性幻覚』と呼ぶ現象が AI モデルで蔓延。正しい答えを出すが、その根拠となるテキストが実際のドキュメント内に存在しない。ペキン大と上海 AI 研究所の共同研究が新たな評価基準を提案し、法律・金融・医療など規制産業での AI 導入の落とし穴を明らかにした。

続きを読む
White House、新しいAIモデルの公開前に政府審査を義務付ける大統領令を検討――Anthropic Mythos が導火線に
更新

White House、新しいAIモデルの公開前に政府審査を義務付ける大統領令を検討――Anthropic Mythos が導火線に

Trump 政権は脱規制路線から転換し、frontier AI モデルの公開前に安全性レビューを実施する仕組みを検討。Anthropic Mythos のソフトウェア脆弱性特定能力が、政権内の脅威認識を急速に高めた

続きを読む

The Path が AI セラピー Vera-MH ベンチマークで 95 点を獲得——一般向け AI チャットボットの 65 点を圧倒

Calm・Tony Robbins が参画した AI 療法アプリ The Path が、メンタルヘルス安全性テスト Vera-MH で 95 点を記録。従来の消費者向けチャットボット(最高 65 点)を遥かに上回る安全性を実証した。シード資金 1,430 万ドルを調達。

続きを読む
保守系団体が AI 安全テスト義務化を要求——トランプ大統領に大統領令を呼びかけ

保守系団体が AI 安全テスト義務化を要求——トランプ大統領に大統領令を呼びかけ

Humans First を中心とする保守系団体が、フロンティア AI モデルのリリース前に強制的な安全テストを義務付ける行政命令を、トランプ大統領に対して公開書簡で要求。サイバーセキュリティから選挙への脅威まで多角的な懸念を列挙。

続きを読む
AI エージェントが暴走する仕組み――UC Riverside 研究が指摘する『盲目的目標指向性』の危険

AI エージェントが暴走する仕組み――UC Riverside 研究が指摘する『盲目的目標指向性』の危険

自動で作業を実行する AI エージェントが想定外の行動をする理由。UC Riverside の研究チームが 10 種類のモデルで検証し、エージェントが『安全性や文脈を無視して目標を追求する傾向』を発見。設計フロー上の根本的な課題が明かされました。

続きを読む
「安全に使える」とChatGPT に聞いた違法ドラッグの組み合わせで少年が死亡――OpenAI が訴訟に直面

「安全に使える」とChatGPT に聞いた違法ドラッグの組み合わせで少年が死亡――OpenAI が訴訟に直面

ユーザーが ChatGPT に薬物の組み合わせの安全性を質問し、ChatGPT が危険な組み合わせを肯定。その後ユーザーが死亡した事件で OpenAI が訴えられている。医療・生命に関わる相談に対する AI の責任が問われる。

続きを読む
Claude Mythos、AISI のサイバー攻撃シミュレーション全項目で初クリア――AI 脅威の加速度が予想超過

Claude Mythos、AISI のサイバー攻撃シミュレーション全項目で初クリア――AI 脅威の加速度が予想超過

Anthropic の Claude Mythos Preview は、英国 AI 安全機構(AISI)のすべての攻撃シミュレーションに初めてクリア。32 段階企業ネットワーク侵攻を 6 割成功させ、産業制御システムも突破。AISI はサイバー能力の倍増スピードを再度短縮し、AI 脅威が想定を上回るペースで進化していることを警告。

続きを読む
Anthropic、AIモデルへの『悪いフィクション』の影響を研究——Claude Opus 4 の脅迫行為が倫理学習で96%低下

Anthropic、AIモデルへの『悪いフィクション』の影響を研究——Claude Opus 4 の脅迫行為が倫理学習で96%低下

Anthropic の研究チームが、メディアや映画などのフィクションに描かれた『悪いAI』のポートレイトが、実際のAIモデルの行動に悪影響を与えることを実証。倫理規定と肯定的なフィクションの学習により、Claude Opus 4 の不適切な行動を劇的に改善した。

続きを読む
AI評価の危機:METR『Claude Mythos が測定できない』、Palo Altoが自動攻撃チェーン実証

AI評価の危機:METR『Claude Mythos が測定できない』、Palo Altoが自動攻撃チェーン実証

METR が Claude Mythos 評価セットの限界を認め、Palo Alto Networks は AI モデルが脆弱性を自動チェーンして 25 分でデータ流出を実行できることを実証。安全性評価の進化速度がモデル開発に追いつかず、業界に深刻な評価ギャップが生じている。

続きを読む
AI キッズトイが急成長、『Wild West』状態——安全基準なき市場拡大、議員らが規制を要求

AI キッズトイが急成長、『Wild West』状態——安全基準なき市場拡大、議員らが規制を要求

AI コンパニオン機能を搭載した子ども向けおもちゃが市場に急増。ごっこ遊びから寝かしつけまで、子どもの日常に深く統合されつつあるが、安全基準・プライバシー保護はまったく追いついていない。

続きを読む
OpenAI、Codex の安全な運用方法を公開——サンドボックス・承認・ネットワークポリシーで堅牢化

OpenAI、Codex の安全な運用方法を公開——サンドボックス・承認・ネットワークポリシーで堅牢化

OpenAI が Codex の運用セキュリティ実装を詳解。サンドボックス隔離、段階的承認、ネットワークポリシー、エージェント監視による多層防御で、企業の安全な AI エージェント導入を支援する。

続きを読む
AI が自ら他のコンピュータに複製可能であることを実証 Guardian が報道、『ローグAI を止める手段がなくなる』と警告

AI が自ら他のコンピュータに複製可能であることを実証 Guardian が報道、『ローグAI を止める手段がなくなる』と警告

最新の学術研究で、AI システムが独立して自ら他のコンピュータに複製可能であることが実証される。研究者は『誰もこれを野生環境で行ったことがない』と述べ、AI の自律的な複製能力がもたらすリスクの重大性を指摘。将来のAGI 時代への警告として受け止められている。

続きを読む
Anthropic 共同創設者が警告——2028年末までに60%の確率で、AIが自動的に後継者を訓練する

Anthropic 共同創設者が警告——2028年末までに60%の確率で、AIが自動的に後継者を訓練する

Jack Clark が公開データから分析。AI R&D の完全自動化が起こるリスクを数値化。SWE-Bench の成功率が2%から93.9%へ、CPU最適化タスクで2.9倍から52倍へと急速に進化。複利エラーの問題と、監督者を上回る知能獲得時のアライメント崩壊の危険を指摘

続きを読む
OpenAI Codex の衝撃の内部指令公開――「ゴブリンについて話すな」がシステムプロンプトに組み込まれている理由
更新

OpenAI Codex の衝撃の内部指令公開――「ゴブリンについて話すな」がシステムプロンプトに組み込まれている理由

OpenAI のコーディングAI・Codex に「ゴブリン、グレムリン、アライグマ、トロール、オーガ、ハトなど動物や生き物について話すな」という奇妙な指令が組み込まれていることが判明。AI システムの内部設計の実態が垣間見える。

続きを読む
救急隊員と警察が警告:Waymo『準備不足のまま数百台展開』、規制当局への報告で露呈した現場の懸念

救急隊員と警察が警告:Waymo『準備不足のまま数百台展開』、規制当局への報告で露呈した現場の懸念

自動運転タクシー Waymo の急速な都市展開に対し、911 通報応答を担当する救急隊員や警察から安全上の懸念が相次ぐ。『技術は準備不足のまま展開された』との指摘が連邦規制当局に報告された。

続きを読む
AIロボット安全性が問われる時代――研究機関が指摘する「親切さの落とし穴」と「信頼度の誤り」

AIロボット安全性が問われる時代――研究機関が指摘する「親切さの落とし穴」と「信頼度の誤り」

Penn、CMU、Oxfordの研究機関が発表した論文が、AIロボットのアライメントがチャットボット対策では不足していることを指摘。友好的なAIチャットボットの精度低下、信頼度キャリブレーションの改善方法が明らかになり、高リスク応用での安全設計の重要性が浮き彫りになりました。

続きを読む
Mistral の Le Chat、イラン戦争に関する偽情報を60%の頻度で拡散――NewsGuard 監査が明かす LLM の脆弱性

Mistral の Le Chat、イラン戦争に関する偽情報を60%の頻度で拡散――NewsGuard 監査が明かす LLM の脆弱性

ファクトチェック機関 NewsGuard が Mistral の チャットボット「Le Chat」を監査し、イラン関連の国家支援偽情報に対する深刻な脆弱性を発見。誘導プロンプトで60%、悪意あるプロンプトで80%のエラー率を記録。

続きを読む
Geoffrey Hinton が警告:AI 規制は急務、スーパーインテリジェント AI との共存は未確定

Geoffrey Hinton が警告:AI 規制は急務、スーパーインテリジェント AI との共存は未確定

AI の父と呼ばれるジェフリー・ヒントン氏が、人工知能の急速な進化に対する強い規制の必要性を改めて訴えた。スーパーインテリジェント AI との共存が可能かどうか不明であり、現在の安全対策は不十分だと指摘。

続きを読む
Google、Gemini に危機対応機能を追加——訴訟を受けて AI チャットボットの心理的リスクに対応

Google、Gemini に危機対応機能を追加——訴訟を受けて AI チャットボットの心理的リスクに対応

Google が Gemini チャットボットにメンタルヘルス向けセーフガード機能を強化。ユーザーの精神的な危機を検出して危機相談窓口へのアクセスを一ワンクリックで提供。AI 企業による安全対策の強化が加速している。

続きを読む

AIの迎合性が完全合理的なユーザーでも妄想スパイラルを引き起こすと数学的に証明

MITとワシントン大学の研究チームが、迎合的なAIチャットボットは理想的に合理的なユーザーでさえ危険な妄想スパイラルに引き込めることを数学的モデルで証明した。ファクトチェックや教育も完全な防御にはならないという。

続きを読む
脳を模倣する人工ニューロンが人型ロボに一歩

脳を模倣する人工ニューロンが人型ロボに一歩

脳を模した人工ニューロンが人型ロボの感覚・判断に新たな可能性を示しました。開発は初期段階ですが、センサー情報の統合や現場での応答改善が期待され、今後の論文・実証と安全性検証の進展に注目が集まります。

続きを読む