来源:互联网 更新时间:2026-08-04 13:22
导读:视觉问答模型的准确率近来一路走高,但高分未必来自真正的视觉理解——如果基准图像和答案早已被模型“见过”,那它可能只是在复现记忆。浙江大学等团队提出的ReKey,思路很巧妙:保留原始真实场景,只更新决定答案的那一小块视觉线索,让每一轮评测都面对从未见过的内容。
一次人工标注之后,系统就能在每轮评测中随机生成新的视觉关键线索,并自动构造对应的问题与答案——不重新生成整张图,也不需要重建整套基准。

V*Bench 是评估细粒度视觉搜索能力的常用基准,包含了191张高分辨率真实场景图像。它的难点在于,问题往往不指向画面主体,而是指向远离图像中心、面积极小、容易被忽略的局部细节——论文把这类真正决定答案的内容称为“视觉关键线索”(visual key)。正因为答案只取决于这一小块内容,一旦它长期固定不变,模型就有机会靠记忆而非观察答对。
为了检验这一点,研究者设计了一个诊断实验:Relabel V*。保留原始图像,只重写问题,让新问题指向图中另一个同样小、同样偏离中心的视觉线索。结果很有意思:在全部191张图像上,8个受测VLM的准确率全部下降,降幅在9.5到18.8个百分点之间。

图像未改动,仅更换问题后,8个模型的准确率全都落在原始成绩之下,降幅9.5–18.8个百分点。
既然图像本身没变,这一下降只能来自问题与答案组合的更新。它不足以单独证明训练数据污染,但与模型从静态基准中获得记忆收益的假设是一致的。不过,这种做法有个明显的局限:每一轮都要人工重写全部问题,成本没法长期承担。ReKey要回答的正是这个问题——能不能只做一次人工准备,之后让视觉线索自动持续更新?
ReKey的思路是把人工投入压缩到一次性的准备工作上,之后交给自动流程反复产出新题。整个流程分四步:先由标注者在图上圈出可以被改动的小块区域(论文称为edit slot),随后系统随机采样一组新的视觉内容,用图像编辑模型写入该区域,最后依据这次采样的记录直接生成对应的问题和答案。

人工标注只发生在最左侧一次,右侧的采样、编辑与问答构造在每轮评测中自动重复。
标注者需要圈出的区域有两类:Replace slot指向图中已有的目标,用于改变它的颜色;Add slot指向一处合理的空白位置,用于插入原图中不存在的小物体。两类区域都要求紧凑、位置合理,并且在图中具有唯一指代。每轮评测开始时,随机种子决定启用哪个slot,并采样出新的颜色、物体或位置组合。采样记录既指导图像编辑,也直接确定新问题和标准答案。
这样一来,答案在图像生成之前就由采样过程确定了,不需要再让另一个模型检查生成结果并重新标注。每道题都能追溯到具体的slot、随机种子和采样内容。图像编辑由GPT-Image-2完成,编辑后的局部区域合成回原图。改动区域只占整张图约0.1%,而且标注者选定的区域与V*Bench原始问题所问目标的尺度相当,从而锚定了与原基准接近的视觉搜索难度。

同一场景中只有决定答案的帽子颜色被替换,背景杂乱度与小目标尺度保持不变。
如果此前的差距确实源于记忆,那么更新visual key之后,成绩应当回落到人工重写问题的水平。研究者用3个随机种子各生成一套ReKey实例,在8个VLM上重复评测:原始V*Bench平均准确率82.1%,ReKey上降至72.2%,平均下降9.9个百分点,所有模型均出现下降。降幅最大的集中在原始高分模型(Qwen3.6-Plus下降14.9个百分点、Gemini下降13.0个百分点),而原始成绩较低的MiMo和Llama各只下降4.4个百分点,这与记忆收益越多、更新后失去也越多的预期一致。

ReKey上8个模型成绩均低于原始V*Bench,平均下降9.9个百分点,整体贴近Relabel V*的水平。
Relabel V*(66.9%)提供了另一个参照。Qwen和GPT-5.5几乎正好落在这条基线上(分别高1.4和1.2个百分点),说明ReKey恢复出了与人工重写问题相当的难度;其余模型平均高出5.3个百分点,研究者归因于Relabel只有一套固定题目,而ReKey具备采样多样性。那么,会不会只是再生的题目更难?研究者用LLaVA-1.5-13B做了校准——它是V*Bench原始论文中最强的开源基线,锚定了该基准公布的难度,且污染风险较低,如果成绩大幅下滑就意味着任务本身变了。结果它只下降6.1个百分点,低于多数前沿模型,位置类问题几乎未变,而空间关系恰是对编辑痕迹最敏感的维度。这些证据指向同一结论:准确率的下降来自记忆优势的消除,而非题目难度的变化。
既然除标注之外的环节都已自动化,那能不能把最后这步人工也交给模型?研究者试着让GPT-5.5自动选择edit slot,结果并不理想:它给出的Replace区域只有33.6%能准确覆盖目标;Add区域虽然多数可用,但面积普遍偏大,约为人工标注的3倍——模型明显偏好宽敞、显眼、容易下笔的位置。用这些区域生成的题目系统性偏简单,8个VLM的准确率比人工标注版本高出8.4–18.5个百分点。

VLM选定的区域明显更宽敞显眼,面积约为人工标注的3倍,使自动标注版本的准确率高出8.4–18.5个百分点。
如果模型已经能稳定定位最隐蔽的视觉线索,那它可能已经具备了评测所要测量的感知能力;而让能力不足的模型选题,则容易把自身盲点带入基准。因此,ReKey只将slot选择保留为一次性人工步骤,其余环节都可以自动完成。
全部191张图像的slot标注约需16人时,而同一组标注可以跨随机种子反复使用。ReKey的意义不在于发布一次更大的静态数据集,而在于将高质量真实场景转化为可持续更新的评测协议:保留原有的视觉搜索环境,只更新真正决定答案的那一小块——只要visual key可以持续刷新,靠记忆答对就不再是稳定的策略。
Ondo将于今日上线股票永续合约
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
区块链OTC交易所有哪几家比较正规?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
异环伊洛伊阵容怎么搭配
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
潜水员戴夫丛林DLC接吻的鱼任务攻略
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Windows环境下Claude Code从C盘迁移至D盘的完整操作教程
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
币安投票上币与下币机制解析:买票争议与规则边界
合集38个项目筹集5.406亿美元 Figure融资2亿
微软Copilot AI漏洞可致敏感数据泄露,企业用户需及时更新
《探索流放之路物品等级的奥秘》 揭秘物品等级的效果和怎么查看
逆战未来s3出什么新角色 逆战未来S3赛季新角色爆料
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc