深潮 TechFlow メッセージ。7月25日、Anthropic は、ブラウザ上のエージェントのシナリオにおいて、自社の Opus 5 モデルがプロンプトインジェクション攻撃に対してほぼ免疫を持つと発表した。129 件のテストシナリオで攻撃が成功したのは 0 件;Gray Swan の汎用プロンプトインジェクションテストでは、15 回の試行後の成功率が Opus 4.8 の 5.5% から 2.0% に低下した。成功率 0 を達成したのは、Claude Cowork などの製品で Auto Mode が有効になっている場合のみで、このモードは入力スキャンと実行時の遮断という 2 層の防御を重ね合わせる。プロンプトインジェクションは、AI エージェントが直面する最大級のセキュリティリスクの1つと見なされており、今回の改良は本件が特定のシナリオで有効に軽減されたことを示す可能性がある。
原文表示