Deep潮 TechFlow сообщает, что 25 июля Anthropic объявила, что её модель Opus 5 в сценариях работы браузерных агентов практически невосприимчива к атакам с внедрением подсказок. В 129 тестовых сценариях частота успешных атак составила ноль; в тестах Gray Swan на универсальное внедрение подсказок после 15 попыток успешность снизилась с 5,5% у Opus 4.8 до 2,0%. Нулевая успешность достигается только при включении Auto Mode в продуктах вроде Claude Cowork, при котором задействованы два уровня защиты — сканирование входных данных и перехват исполнения. Внедрение подсказок считается одной из главных угроз безопасности, с которыми сталкиваются AI-агенты; это улучшение, вероятно, означает, что проблему удалось эффективно смягчить в конкретных сценариях.

Посмотреть Оригинал
На этой странице может содержаться сторонний контент, который предоставляется исключительно в информационных целях (не в качестве заявлений/гарантий) и не должен рассматриваться как поддержка взглядов компании Gate или как финансовый или профессиональный совет. Подробности смотрите в разделе «Отказ от ответственности» .
  • Награда
  • комментарий
  • Репост
  • Поделиться
комментарий
Добавить комментарий
Добавить комментарий
Нет комментариев
  • Закреплено