来源:互联网 更新时间:2026-07-05 14:39
问它“这张图里有什么”,它能答得头头是道。但要问“图中那只熊猫的左后腿在哪里”,它就开始含糊了。这可不是某个模型偶尔犯的错,而是整个视觉-语言大模型领域长期存在的通病——全局理解能力强,局部定位能力弱。
最近,谷歌DeepMind在最新论文中提出的TIPSv2方案,就是专门来啃这块硬骨头的。

研究团队在调查中发现了一个反直觉的现象:在精细分割任务上,参数量少的“学生模型”表现经常碾压体量更大的“教师模型”。原因何在?关键在于蒸馏过程移除了遮盖机制,这迫使模型必须学习整张图的所有细节,形成了一种“全区域监督”。受此启发,TIPSv2方案正是围绕这一核心发现,做出了三项关键改进。
传统的预训练方法只对图像中被遮盖的区域计算损失,那些可见区域则处于“放养”状态,导致局部语义容易漂移。iBOT++则要求模型同时对所有可见区域进行精确监督,这相当于把训练从“猜谜游戏”升级为“全文精读”。可别小看这一项改动,仅此一项,零样本分割性能就直接提升了14.1个百分点。
传统的自监督训练需要在显存里维护两份几乎相同的大模型,开销极大。TIPSv2发现,图文对比损失本身已经能足够稳定主干网络,因此指数移动平均(EMA)只需作用于最后的投影头,主干网络不再需要复制。这一招效果显著,训练参数量直接缩减了约42%,速度更快,性能却几乎无损。
在训练时,模型会被随机喂入不同粒度的文本描述:网页简短描述、中等详细描述,以及由Gemini生成的长篇描述。这种难易交替的“食谱”,既防止了模型因任务太简单而“偷懒”,又确保了图像细节不会在训练中丢失。
最终的效果相当扎实。TIPSv2在9大任务、20个权威数据集上完成了冻结评估,结果显示:其在零样本语义分割任务上刷新了业界最优成绩;在图文检索与分类任务中,击败了参数量比自身大56%的对比模型;在纯视觉任务上也全面跻身前列。
目前,TIPSv2的代码与模型权重已全面开源。对于医疗影像分析、自动驾驶感知、工业缺陷检测等需要高精度图像理解的团队来说,这套方案无疑值得认真评估。
论文地址:https://www.alphaxiv.org/abs/2604.12012
斋醮音乐指的是哪一种音乐形式 蚂蚁新村今日答案2026.9.13
2026年9月15日小鸡庄园答案
蚂蚁庄园今日答案2026年9月9日
2026年9月21日小鸡庄园答案
宋词名句“欲买桂花同载酒”下一句是什么 蚂蚁庄园今日答案9.3
支付宝疯狂碰友节这是红箭答案
2026年9月13日小鸡庄园答案
蚂蚁庄园今日课堂答题2026年9月13日
蚂蚁庄园答案2026年9月13日
小鸡庄园今天答案2026.9.15
小鸡答题今天的答案是什么2026年9月2日
蚂蚁庄园小课堂2026年9月3日最新题目答案
比海底更深的“超深渊带”是指水深超过多少米
支付宝疯狂碰友节这是小提琴答案
支付宝疯狂碰友节这是菠萝答案
2026年9月9日小鸡庄园答案
蚂蚁庄园小鸡答题今日答案2026年9月12日
蚂蚁庄园今日答案2026年9月13日
小鸡庄园今天答案2026.9.13
蚂蚁新村2026年9月13日答案最新
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc