AI透かし技術SynthIDがモデルの安全動作を弱める、セキュリティ研究者が指摘
Google開発の透かし技術SynthIDが、プロンプトインジェクションと組み合わさるとLLMの拒否行動を弱めることが研究で判明。エージェントのツール呼び出しにも影響しうるといい、レッドチーム演習の重要性が指摘されている。
続きを読むGoogle開発の透かし技術SynthIDが、プロンプトインジェクションと組み合わさるとLLMの拒否行動を弱めることが研究で判明。エージェントのツール呼び出しにも影響しうるといい、レッドチーム演習の重要性が指摘されている。
続きを読むAIエージェントへのプロンプトインジェクションに使われてきた「ASCII smuggling」を、フィッシング業者がメールフィルター回避に転用。Microsoftはピーク時に1日237万通の配信を検出した。
続きを読むカルガリー大学の研究者が、AIエージェントの長期記憶に虚偽情報を書き込み、数日後に実害を発生させる新手の攻撃を報告。単発の入力チェックでは検出できない点が課題となる。
続きを読むIIT Bombay と Adobe Research の研究チームが、言語モデルの出力テキストから元のプロンプトをほぼ完全な精度で復元する技術「Previous-Token Prediction(PTP)」を開発。小規模なオープンモデル(Qwen-3-0.6B)で訓練でき、GPT-4o を含む複数モデルで検証済み。企業の営業秘密やシステムプロンプトが出力から漏洩する危険性が急速に高まっている。
続きを読むセキュリティ企業 PromptArmor が Atlassian AI エージェント Rovo の脆弱性を報告。PDF に隠されたプロンプトから、Jira・Confluence の機密情報が盗み取られる可能性があります。
続きを読むAnthropic が Opus 5 の Auto Mode による二層防御を検証。129個のテストシナリオで成功率0%を達成し、AIエージェント運用時のセキュリティ懸念を実質的に解決した。
続きを読むGoogleのGemini搭載翻訳が単語レベルの操作で挙動を変える可能性がThe Decoderで報告されましたが、Googleの安全対策の公表と利用者の確認や二重チェックを習慣化すれば、翻訳の利便性を保ちながら安全性を高められると期待できます。
続きを読む