arXiv · 多模态、视频与世界模型· Sindhuja Penchala·· 3 天前AI 评分35
多模态学习能否通过事发前行为线索预判暴力?
Can We Anticipate Violence? Multimodal Learning from Pre-Incident Behavioral Cues
AI 导读
研究基于 XD-Violence 的 443 个样本,利用面部区域外观、时间对齐音频和人体运动特征,在排除事件本身的前提下识别暴力发生前的短时风险。对 Swin-Tiny、ViT-Tiny 和 DeiT-Tiny 的消融实验显示,多模态组合效果更好。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org