热点事件历史事件
SceneJail以视频场景攻击多模态模型
1 篇报道1 个报道来源3 天前更新
先了解这件事
AI 综述
2026年9月30日,arXiv报道了SceneJail,一种面向视频多模态大语言模型的自适应黑盒越狱框架。该方法通过构造兼容场景,并搜索与场景相关的提示词发起攻击。在包含8个Video-MLLMs的评测中,SceneJail-F平均攻击成功率最高达91.5%,比最强基线高29.1个百分点。将有害查询分布到连续帧中的SceneJail-S,在严格图像过滤条件下仍达到72.3%的攻击成功率。
AI 根据报道生成 · 1 天前更新
最新进展9月30日 11:47
SceneJail在8个视频多模态模型评测中最高达到91.5%攻击成功率。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv · 多模态、视频与世界模型精选SceneJail 利用视频场景上下文攻击多模态大语言模型
SceneJail 提出一种自适应黑盒越狱框架,通过构造兼容场景并搜索场景相关提示词,攻击视频多模态大语言模型。该方法在包含八个 Video-MLLMs 的评测中,SceneJail-F 的平均攻击成功率最高达 91.5%,较最强基线高 29.1 个百分点。将有害查询分布到连续帧的 SceneJail-S 在严格图像过滤下仍达到 72.3% 的攻击成功率。