来源:互联网 更新时间:2026-07-05 14:39
问它“这张图里有什么”,它能答得头头是道。但要问“图中那只熊猫的左后腿在哪里”,它就开始含糊了。这可不是某个模型偶尔犯的错,而是整个视觉-语言大模型领域长期存在的通病——全局理解能力强,局部定位能力弱。
最近,谷歌DeepMind在最新论文中提出的TIPSv2方案,就是专门来啃这块硬骨头的。

研究团队在调查中发现了一个反直觉的现象:在精细分割任务上,参数量少的“学生模型”表现经常碾压体量更大的“教师模型”。原因何在?关键在于蒸馏过程移除了遮盖机制,这迫使模型必须学习整张图的所有细节,形成了一种“全区域监督”。受此启发,TIPSv2方案正是围绕这一核心发现,做出了三项关键改进。
传统的预训练方法只对图像中被遮盖的区域计算损失,那些可见区域则处于“放养”状态,导致局部语义容易漂移。iBOT++则要求模型同时对所有可见区域进行精确监督,这相当于把训练从“猜谜游戏”升级为“全文精读”。可别小看这一项改动,仅此一项,零样本分割性能就直接提升了14.1个百分点。
传统的自监督训练需要在显存里维护两份几乎相同的大模型,开销极大。TIPSv2发现,图文对比损失本身已经能足够稳定主干网络,因此指数移动平均(EMA)只需作用于最后的投影头,主干网络不再需要复制。这一招效果显著,训练参数量直接缩减了约42%,速度更快,性能却几乎无损。
在训练时,模型会被随机喂入不同粒度的文本描述:网页简短描述、中等详细描述,以及由Gemini生成的长篇描述。这种难易交替的“食谱”,既防止了模型因任务太简单而“偷懒”,又确保了图像细节不会在训练中丢失。
最终的效果相当扎实。TIPSv2在9大任务、20个权威数据集上完成了冻结评估,结果显示:其在零样本语义分割任务上刷新了业界最优成绩;在图文检索与分类任务中,击败了参数量比自身大56%的对比模型;在纯视觉任务上也全面跻身前列。
目前,TIPSv2的代码与模型权重已全面开源。对于医疗影像分析、自动驾驶感知、工业缺陷检测等需要高精度图像理解的团队来说,这套方案无疑值得认真评估。
论文地址:https://www.alphaxiv.org/abs/2604.12012
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
腾讯ima怎么创建共享知识库?
腾讯ima怎么把微信内容一键导入知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
区块链OTC交易所有哪几家比较正规?
2026热门直线加速赛车手游推荐:高人气、爽快加速体验的精品榜单
kimi提示词专家使用方法新手指南
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
原神霜月三处月灵龛具体位置汇总
《幻兽帕鲁》不触发通缉捕捉传说商人方法
Windy卫星云图怎么看?云层变化识别技巧
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
为什么推特KOL都在BRC20赚钱 我一冲就亏?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
一加手机如何设置三指长按屏幕局部截图
合集38个项目筹集5.406亿美元 Figure融资2亿
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc