热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >三类视觉Token分配,能直接解决高压缩时序碎片化 | ECCV‘26

三类视觉Token分配,能直接解决高压缩时序碎片化 | ECCV‘26

来源:互联网 更新时间:2026-08-03 12:07

多模态大模型在长视频理解中面临一个关键挑战:视频越长,视觉token数量越多,推理成本越高。一种直接思路是剪掉一部分视觉token,但剪枝方法需要针对具体任务设计。近日,来自华威大学、阿姆斯特丹大学和亚马逊AGI的研究团队提出SemVID,一种面向视频时序定位(Video Temporal Grounding, VTG)的training-free token剪枝框架,核心主张是保住支撑时间定位的“证据链”。该工作已被ECCV 2026会议录用。

与以往主要服务于VideoQA的token剪枝方法不同,VTG任务要求模型不仅回答“视频里有什么”,还要定位“事件从什么时候开始、什么时候结束”。传统剪枝如果只保留最显著的画面,模型可能知道事件存在,却无法判断准确边界。SemVID提出两个剪枝目标:Evidence Retention(保留与query语义高度相关的token,尤其是事件边界附近的关键证据)和Connectivity Strength(保留跨帧连接,让证据能沿时间传播)。

在方法上,SemVID分两步决定保留哪些视觉token。首先,同时考虑query相关度和帧间变化信号,确定每一帧保留多少token,确保预算分配涵盖完整时间轴和证据链。其次,在每帧内部显式保留三类语义角色不同的token:Object token(保留与query相关的对象证据)、Motion token(保留动作转折点,连接事件前后状态)和Context token(保留场景锚点,维持场景连续性)。

实验在Charades-STA和ActivityNet-Grounding上使用Qwen3-VL和Qwen2.5-VL进行评测。结果显示,在相同token预算下,SemVID在mIoU、ER和CS指标上整体优于现有剪枝方法,尤其在低保留率下仍能稳定保持较高mIoU。消融实验进一步显示,去掉Motion Token后mIoU和CS下降最明显,说明动作变化token是连接事件前后状态的关键。

可视化对比表明,SemVID即使在12.5%的极低预算下,仍能稳定聚焦在动作发生前后的语义相关区域。研究团队也指出,当前motion token主要依赖帧间特征变化刻画运动,在镜头移动、背景剧烈变化或遮挡较多的场景中,仍可能受到干扰。

论文标题:Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding
论文作者:Jiaqi Li, Shuntian Zheng, Yixian Shen, Jia-Hong Huang, Xiaoman Lu, Minzhe Ni, Yu Guan
作者单位:University of Warwick;University of Amsterdam;Amazon AGI
论文地址:https://arxiv.org/abs/2603.05663
代码地址:https://github.com/JiaqiLi404/SemVID

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc