arXiv · 多模态、视频与世界模型· Wenyu Chen·· 3 天前精选AI 评分79
SceneJail 利用视频场景上下文攻击多模态大语言模型
SceneJail: Exploiting Video Scenario Context to Jailbreak Multimodal LLMs
AI 导读
SceneJail 提出一种自适应黑盒越狱框架,通过构造兼容场景并搜索场景相关提示词,攻击视频多模态大语言模型。该方法在包含八个 Video-MLLMs 的评测中,SceneJail-F 的平均攻击成功率最高达 91.5%,较最强基线高 29.1 个百分点。将有害查询分布到连续帧的 SceneJail-S 在严格图像过滤下仍达到 72.3% 的攻击成功率。
推荐理由
论文将视频场景从有害查询的载体提升为攻击面,为 Video-MLLM 安全评测和防御设计提供了可复用的测试思路。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org