来源:互联网 更新时间:2026-08-03 12:07
多模态大模型在长视频理解中面临一个关键挑战:视频越长,视觉token数量越多,推理成本越高。一种直接思路是剪掉一部分视觉token,但剪枝方法需要针对具体任务设计。近日,来自华威大学、阿姆斯特丹大学和亚马逊AGI的研究团队提出SemVID,一种面向视频时序定位(Video Temporal Grounding, VTG)的training-free token剪枝框架,核心主张是保住支撑时间定位的“证据链”。该工作已被ECCV 2026会议录用。
与以往主要服务于VideoQA的token剪枝方法不同,VTG任务要求模型不仅回答“视频里有什么”,还要定位“事件从什么时候开始、什么时候结束”。传统剪枝如果只保留最显著的画面,模型可能知道事件存在,却无法判断准确边界。SemVID提出两个剪枝目标:Evidence Retention(保留与query语义高度相关的token,尤其是事件边界附近的关键证据)和Connectivity Strength(保留跨帧连接,让证据能沿时间传播)。
在方法上,SemVID分两步决定保留哪些视觉token。首先,同时考虑query相关度和帧间变化信号,确定每一帧保留多少token,确保预算分配涵盖完整时间轴和证据链。其次,在每帧内部显式保留三类语义角色不同的token:Object token(保留与query相关的对象证据)、Motion token(保留动作转折点,连接事件前后状态)和Context token(保留场景锚点,维持场景连续性)。
实验在Charades-STA和ActivityNet-Grounding上使用Qwen3-VL和Qwen2.5-VL进行评测。结果显示,在相同token预算下,SemVID在mIoU、ER和CS指标上整体优于现有剪枝方法,尤其在低保留率下仍能稳定保持较高mIoU。消融实验进一步显示,去掉Motion Token后mIoU和CS下降最明显,说明动作变化token是连接事件前后状态的关键。
可视化对比表明,SemVID即使在12.5%的极低预算下,仍能稳定聚焦在动作发生前后的语义相关区域。研究团队也指出,当前motion token主要依赖帧间特征变化刻画运动,在镜头移动、背景剧烈变化或遮挡较多的场景中,仍可能受到干扰。
论文标题:Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding
论文作者:Jiaqi Li, Shuntian Zheng, Yixian Shen, Jia-Hong Huang, Xiaoman Lu, Minzhe Ni, Yu Guan
作者单位:University of Warwick;University of Amsterdam;Amazon AGI
论文地址:https://arxiv.org/abs/2603.05663
代码地址:https://github.com/JiaqiLi404/SemVID
Ondo将于今日上线股票永续合约
暗黑4S14野蛮人终局BD攻略
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
区块链OTC交易所有哪几家比较正规?
Binance新增15种bStocks代币化证券为杠杆抵押资产
彩云天气怎么看分钟级降雨预报 彩云天气精准预报方法【技巧】
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
异环伊洛伊阵容怎么搭配
潜水员戴夫丛林DLC接吻的鱼任务攻略
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
Windows环境下Claude Code从C盘迁移至D盘的完整操作教程
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
币安投票上币与下币机制解析:买票争议与规则边界
合集38个项目筹集5.406亿美元 Figure融资2亿
硬刚苹果!华为9月新品阵容出炉:Mate 90系列、全新三折叠
微软Copilot AI漏洞可致敏感数据泄露,企业用户需及时更新
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc