热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >​CVPR | PromptSG:开启语言引导行人检索新纪元,实现精准语义捕捉

​CVPR | PromptSG:开启语言引导行人检索新纪元,实现精准语义捕捉

来源:互联网 更新时间:2026-07-31 13:24

行人重识别领域这些年发展迅猛,尤其是在深度语义信息的加持下,各种方法层出不穷——姿态、服饰这类细粒度特征被反复挖掘,对齐和匹配精度确实越来越高了。但话说回来,目前的主流方法大多还是死磕单一图像模态,缺少直观且高效的语义引导。说白了,模型往往只盯着几个局部判别区域,没法全面覆盖那些真正有语义价值的部位。一旦想用掩模或人体关键点来帮忙,又得投入大量的人力去手动标注,成本实在太高。

好在视觉-语言模型 CLIP 的多模态理解能力给了我们新思路。来自中科院信工所的研究团队提出了一个叫 PromptSG 的方法——基于文本提示的语义引导,核心就是用自然语言描述去引导模型聚焦语义一致的区域。这项工作已经被 CVPR 2024 收录为 Highlight 论文。

动机

随着大型视觉语言模型(如 CLIP)的崛起,简单的文本提示(比如“一张 [类别] 的照片”)已经能实现相当惊艳的零样本分类。那么问题来了:我们能不能更进一步,用更具体的自然语言描述——例如“一个人的照片”——来直接激活模型对感兴趣区域的关注?

道理是这个道理,但直接把 CLIP 搬到行人重识别上并没那么容易。CLIP 生成的视觉表示往往缺少细粒度信息,而“一个人的照片”这种查询又太笼统,没有个性化的描述符,根本做不到个体身份识别。

之前有工作叫 CLIP-ReID,尝试在 CLIP 之上搞自动化的提示工程。不过它有两个硬伤:一是预定义的软提示很难完整刻画指定行人的整个视觉上下文;二是它把提示解耦了,推理时只用视觉嵌入,一旦遇到开放场景中没见过的身份就直接失效。结果呢?如下图(b)所示,模型关注的区域经常不全包含身体部位,甚至把汽车、路人这些背景杂音也圈了进去。

为了解决这些痛点,研究者直接尝试通过明确的文本提示来激活模型对关键区域的关注。具体做法是注入交叉注意力图,优化图像里的 patch tokens,从而判断哪些 patch 与对应的语义相关。这样一来,模型就能更精准地抓住与行人身份有关的语义信息。

但光有语义还不够。行人重识别里,外观信息同样至关重要。于是进一步引入了 Textual Inversion 技术,通过学习特定的 token 来表示视觉上下文。通过一个轻量级的 Inversion Network,把图像映射成伪 token,再嵌入到文本提示中,最终生成与原始图像紧密匹配的嵌入。

有意思的是,这套方法不需要额外提供掩模、边界框或者精确描述——成本和复杂度都大大降低了,落地起来更现实。

方法介绍

1. 个性化的身份特定提示学习

已有的研究表明,词嵌入空间表达能力足够强,能涵盖基础的图像概念。在此基础上,创新性地利用 Textual Inversion 技术学习伪 token,让它精准贴合查询图像的上下文。

具体地,构建一个由参数化 Inversion Network,目标是:把 CLIP 视觉空间中的全局视觉嵌入映射到文本空间中的一个伪 token。之后这个伪 token 被整合到自然语言句子中,形成对输入图像的语言提示——“一张 [伪 token] 人的照片”。为了保证学习到的伪 token 能准确传达图像的上下文信息,并有效捕捉同一身份的视觉细节,采用对称的有监督对比损失来实现 Inversion Network 的重建目标。

2. 基于文本的语义引导

核心思路简单直接:用语言精细地引导图像特征,显式地确定图像的哪个区域与语言提示对齐。直觉上,跟“人”这个语义紧密相关的图像块,在身份区分和识别中应该起到关键作用。基于此,设计了一个交互模块,在多模态环境下实现图像块与语言提示之间的高效交互。

具体操作是这样的:采用语言引导的跨注意力模块,用文本嵌入作为查询,视觉编码器输出的逐块嵌入作为键和值。给定一对图像和提示,先把图像输入视觉编码器,得到一系列块嵌入,其中全局视觉嵌入加上剩余局部块嵌入;同时把提示输入文本编码器得到文本嵌入。然后文本嵌入被投影成查询矩阵,图像块嵌入则通过三个不同的线性投影层映射成键矩阵和值矩阵。通过交叉注意力机制,计算注意力图,突出那些与语言描述高度相关的图像区域——这样,语义引导就完成了。

实验

1. 总体性能对比

为了全面验证 PromptSG,研究者将其与当前最先进的方法做了基准测试,这些方法主要分三类:基于 CNN 的、基于 ViT 的、基于 CLIP 的。实验结果显示,PromptSG 以相当大的优势超过了所有对比方法,在不同架构上都展现了强劲的稳健性和优越性。

2. 训练效率比较

对单阶段的 PromptSG 和两阶段的 CLIP-ReID 做了深入对比,重点关注可学习参数数量和训练速度。结果表明,PromptSG 在参数数量上对不同数据集的鲁棒性更好,并且训练速度提升了大约 2 倍。

3. 注意力图可视化

精选了一些有挑战性的例子——比如背景复杂或画面中包含多个人。对比了 CLIP-ReID(b)、未经图像组合训练的 PromptSG(c)以及完整的 PromptSG(d)。CLIP-ReID 的注意力图经常被背景元素(如车辆)干扰,很难聚焦到目标行人;未经个性化提示学习的 PromptSG 虽然更偏向于强调“人”相关的语义,但主要只集中在头部、手臂、腿这些大块区域,对外观特征的捕捉还差点意思。而完整的 PromptSG 不仅精准抓住了这些关键部位,还能深入挖掘帽子、背包等细微外观特征,从而更准确地识别不同个体。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc