Anthropic 称Opus 5 在浏览器场景下几乎免疫提示词注入攻击

所谓提示词注入,是攻击者通过网页中的隐藏文本等被篡改的输入,试图绕过 AI 模型的指令


7 月 25 日,Anthropic 宣布其 Opus 5 模型在浏览器智能体场景中几乎免疫提示词注入攻击。在 129 个测试场景中,攻击成功率为零;在 Gray Swan 通用提示词注入测试中,15 次尝试后的成功率从 Opus 4.8 的 5.5% 降至 2.0%。

零成功率仅在 Claude Cowork 等产品开启 Auto Mode 时实现,该模式叠加了输入扫描与执行拦截两层防御。提示词注入被视为 AI 智能体面临的最大安全隐患之一,此次改进或标志着该问题在特定场景下得到有效缓解。

🗒 标签: #Anthropic #Opus #AI
📢 频道: @GodlyNews1
🤖 投稿: @GodlyNewsBot
 
 
Back to Top