热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai教程 >人眼看不出的伪造,AI如何识别?实测合合信息跨模态鉴伪与去反光技术

人眼看不出的伪造,AI如何识别?实测合合信息跨模态鉴伪与去反光技术

来源:互联网 更新时间:2026-07-21 07:25

一、AI进入真实业务,第一步不是“看懂”

生成式AI正在把内容生产和修改的门槛,往下拉了一大截。AI图片、AI视频、大模型生成的文本,如今已经大规模涌入社交平台、电商交易和日常办公场景。普通用户只需要输入几句提示词,就能生成看起来相当逼真的人物、商品、票据和文案。过去要改一张转账截图、伪造一张商品破损图,或者做一段换脸视频,多少还得懂点软件操作。现在呢?图像生成、局部重绘、视频驱动、大模型写作,这些工具摆在那里,普通用户花点时间就能上手。

更要命的是,这些东西往往还会被截图、压缩、裁剪,再经过二次转发,原本可能还有的生成痕迹,一路传下来就被削弱得差不多了。光靠肉眼,越来越难判断。

所以,当AI生成内容从娱乐创作,一脚踏进交易、审核和证据提交这些环节时,真假判断就不再是一个“好不好玩”的内容识别问题,而是直接关系到资金安全、平台治理和业务决策。市场需要的,不是“看起来像不像AI”的直觉经验,而是一套能检测生成痕迹、识别局部篡改,并且能输出风险结果的工具。

落到真实业务上,这就引出了两个基础问题:

  • 内容到底是不是AI生成的,或者有没有被篡改过;

  • 图像有没有因为反光、倒影这些干扰,导致信息丢失。

前者影响的是金融审核、保险理赔、电商风控和内容治理;后者则会降低证件、票据、白板和展品图像的识别质量。对大模型和Agent来说,后端推理能力再强,如果输入是错的、缺的,那也白搭。

2026世界人工智能大会期间,合合信息展示了AI跨模态鉴伪技术,以及旗下扫描全能王的“智能高清·去反光”技术。一个负责判断内容真假,另一个负责把被反光遮住的信息给恢复出来。

AI鉴伪这件事,已经不再停留在实验室的模型或者后台接口里,而是被做成了普通参观者可以直接上手体验的交互功能。用户上传样本或者直接选一个,系统就能给出真实性判断,还有相关的分析结果。

二、为什么越来越难判断AI伪造

很多人判断AI图片,还是习惯去找那些“多一根手指”、“文字乱码”、“边缘扭曲”之类的明显错误。但真正难对付的,往往不是整张图都是生成的,而是在一张真实图片上,改了那么一点点关键内容。

举个例子,一张支付截图,可能只替换了金额和时间;一张退款图片,可能只修改了商品污损的那一小块区域。整张图里,绝大部分像素、界面布局、视觉风格,都是真的。人眼很容易因为“整体看起来没问题”就忽略了局部的那点异常。

在大会现场有一个“AI较真大赛”,用户要从一堆转账、退款或者商品图片里,找出真实的那张。这种题目,根本不靠什么明显破绽,考的就是你能不能发现图片有没有局部编辑、字段替换,或者是生成痕迹。

在“电商仅退款”那个关卡里,我根据自己的判断,看了看衣服污渍和拍摄环境,结果选错了。系统判定那张图是伪造的,置信度给出了91.90%。

这不代表模型在所有情况下都比人强,但至少说明一点:双方用来判断的“信号”不一样。

人更依赖“高层语义”——比如场景合不合理、界面熟不熟悉、事件符不符合生活经验。而鉴伪模型呢,它还会去分析更底层的东西,比如局部纹理的连续性、噪声分布、压缩残差、边缘融合,还有光影的一致性。

一张真实截图里的金额区域,如果被局部重绘过,内容语义可能完全合理,但那个区域的噪声和压缩特征,很可能就跟周围不一样。人眼关注的是“1000元这个数字合不合理”,模型关注的却是“这几个数字是不是来自同一条成像和编码链路”。

这也是现代鉴伪从“找明显错误”走向“检测统计异常”的关键变化。这个变化在真实业务里特别重要。以电商退款为例,如果平台识别不出一张被局部修改过的商品破损图,那伪造材料就可能被当成真实凭证,直接影响商家责任认定。金融和保险场景里,被修改的转账截图、事故照片或者理赔材料,可能直接干扰审核结果。对内容平台来说,一段经过换脸或剪辑的视频,还可能被用来做虚假宣传、身份冒用和舆情操纵。

所以,鉴伪系统的作用,不是简单给内容贴个“真”或“假”的标签,而是在人工审核之前,先把高风险样本筛出来,提示一下哪些区域可能被改过,是什么类型的异常。它更像一道前置的风控环节,判断越准,后面的决策就越靠谱。

三、实测“扫描全能王AI鉴伪”

前面的AI较真大赛,更多是展示了人眼在面对局部伪造时的判断局限。接下来,通过扫描全能王的AI鉴伪小程序,来看这套能力在实际检测里到底怎么用,结果又是怎么呈现的。

扫描全能王AI鉴伪小程序提供了图片、视频和文本三个检测入口。图片支持JPG、PNG这些常见格式,视频支持MP4、MOV,文本可以直接输入,也支持上传PDF文档。

这次我重点测了图片鉴伪,上传了一张由ChatGPT生成的“狼、羊、白菜过河”信息图。这张图里有卡通人物、场景,还包括中文文字、箭头、步骤说明和逻辑关系,比单纯的人像要复杂得多。

检测过程中,小程序依次完成了内容来源分析、AI生成分析和篡改检测,最后给出的结果是:检测到AI生成痕迹,AI可能性100%,检测耗时2.43秒。

这张图没有典型的手部畸形或者人脸错误,主要就是插画、文字和排版。系统仍然能识别出AI生成痕迹,说明它的判断并不只是依赖某一个显眼的缺陷,而是对整幅图像的多类特征做了联合分析。

报告里还区分了两类任务:

  • AI生成检测:判断图像是不是由生成模型创建或编辑的;

  • 图片篡改检测:判断图像有没有经过PS、局部涂改、模板贴图这些人工修改。

这两者不是一回事。一张图可能全部由AI生成,也可能是真实照片经过AI局部重绘,还可能只改了改金额、时间或者人物区域。所以,实际系统通常需要同时处理“全局生成”和“局部篡改”两种情况。

从技术流程来看,图片鉴伪通常不会只输出一次普通的分类结果,而是先提取多层特征,再完成融合判断。

单个样本当然不能代表模型的整体准确率。更严格的测试,还需要覆盖真实照片、AI局部编辑图、传统PS合成图,还有截图、压缩、缩放之后的样本。但这次体验至少说明,复杂的鉴伪流程,已经被封装成了普通用户可以直接使用的产品能力。

随后,我又上传了一段AI生成的人像视频进行测试。

从视频里看,人物面部非常自然,肉眼很难分辨真假。但视频检测不能只看某一帧,还得结合前后画面,判断人物轮廓、表情、光影和背景细节在连续变化中是不是稳定。也就是说,单帧看起来真实,并不代表整段视频都没有异常。

当然,这只是一次体验,不能据此判断系统在不同生成模型、清晰度和压缩条件下的整体表现。不过,图片和视频两个测试放在一起,也能看出跨模态鉴伪的差异:图片主要判断一张画面里有没有生成或修改痕迹,视频则还要进一步分析时间维度上的连续性。这也引出了下面要讨论的问题——不同模态的数据结构不同,鉴伪时依赖的证据和检测方法,也完全不一样。

四、跨模态鉴伪难点

真正的跨模态鉴伪,不是简单地在界面上增加图片、视频和文本的上传入口,而是要针对不同的信息介质,建立不同的检测路径。

图片是二维空间信号,视频多了一条时间轴,文本则由离散的Token和语义关系组成。三者的数据结构不同,可用的证据也完全不同。

图片、视频和文本,分别提取语义、频域、噪声、时序和逻辑特征,再通过多模态证据融合,输出真实性概率、伪造类型、可疑区域,以及人工复核建议。从流程上看,三类模态并不是先后串行处理,而是分别进入对应的特征提取分支。图片侧更关注语义异常、频域伪影、噪声残差和局部编辑痕迹;视频侧增加了帧间一致性、运动轨迹和时空频域分析;文本侧则侧重语义连贯性、句法结构、表达概率和逻辑表征。不同证据完成对齐和加权后,系统再给出统一判断。

1.图片:语义之外,还要看频域和噪声

图片鉴伪通常会同时关注高层语义和底层成像特征。

高层语义包括人体结构、透视、文字排版和光影关系;底层特征则包括频率分布、噪声残差、压缩痕迹和局部纹理异常。

频域可以理解为换一个角度观察图像。空间域关注的是“某个像素是什么颜色”,频域关注的则是“图像中不同尺度的变化是如何分布的”。生成模型中的上采样、去噪和重建过程,可能会在高频区域留下不同于真实相机的统计特征。

噪声残差则更接近成像来源。真实照片通常要经历镜头、传感器、ISP处理和压缩编码;AI图片是神经网络直接合成的,两者的噪声形成机制不同。如果一张真实图只有局部被重绘过,那这个区域的噪声和压缩纹理,很可能就跟背景不连续。

公开研究AIDE采用多专家思路,同时分析视觉伪影和噪声模式,避免把判断完全建立在画面内容是否自然上。FakeShield则进一步尝试把真假判断、篡改区域定位和解释结合起来。

2.视频:单帧真实,不代表整段真实

很多生成视频在单帧上已经足够自然了,人物面部、服装和背景都可能看不出明显问题。但连续播放起来,一些细微的异常就开始暴露了。比如人物耳朵和脸部轮廓的轻微变化、首饰忽隐忽现、头发边缘抖动、背景文字发生漂移,或者口型与声音的节奏无法完全对应。

这意味着视频检测至少需要同时观察两个维度:

  • 空间维度:单帧中的面部结构、纹理、光影和生成痕迹;

  • 时间维度:前后帧之间的身份、动作、细节和光照是否连续。

从实际场景来看,一段视频可能并不是全部由AI生成的,而是只替换了人物面部、修改了其中几秒,或者将一段伪造画面插入到真实视频里。这种情况下,只检测少量关键帧,很可能漏掉异常,系统还需要判断问题出现在哪个时间区间。

比如在身份核验、视频客服和远程面签这些场景里,如果换脸区域只在人物转头或说话时出现异常,单独截取一张正面静止画面,可能很难发现。可以把它理解为两条检测线并行工作,一条看每一帧有没有生成或篡改痕迹,另一条看连续帧之间的变化是否自然。只有把空间信息和时间信息结合起来,才能覆盖更复杂的Deepfake和局部视频篡改。

3.文本:不能只靠词频和句长

文本鉴伪同样已经不能停留在表层统计了。

早期的方法,常常看词频、句长、标点数量和困惑度。但这些特征很容易受到人工修改的影响。一段大模型生成的文本,经过删减或语序调整之后,原有的统计特征就可能发生明显变化。所以,只凭句子是否工整、表达是否流畅来判断AI文本,可靠性并不高。

更深入的检测,通常会从多个层面分析文本:

  • 词汇层:用词分布、重复表达和词语选择概率;

  • 句法层:句式结构、语法模式和句子之间的连接方式;

  • 语义层:信息是否持续推进,论点与证据是否匹配;

  • 篇章层:段落结构、逻辑关系和长距离上下文是否自然;

  • 来源层:文本是否存在特定模型或生成方式留下的统计特征。

大模型生成的文本,往往结构完整、表达平稳,但部分内容可能存在信息密度过于均匀、段落展开方式相似,或者表述正确但缺乏具体来源等问题。检测模型需要综合分析这些高维特征,而不是简单判断文章写得像不像。

文本鉴伪在实际应用中还有一个难点:同一篇文章,可能同时包含人工撰写、AI生成和人工改写的内容。因此,系统除了输出整篇文本的生成概率,还需要进一步识别出可疑的段落,区分是完全生成还是局部续写等不同情况。

合合信息AI跨模态体系已经覆盖了图片、视频和文本,并针对不同介质建立了差异化的检测路径。虽然三类任务最终都在判断内容真假,但底层使用的证据,并不相同。

五、去反光不是修图,而是分离叠加在一起的两个图层

与AI鉴伪相比,WAIC现场展示的AI去反光,解决的是图像采集的质量问题。

现场演示用了大尺寸屏幕来展示处理画面,参观者可以直接观察玻璃反射被削弱前后的差异。隔着玻璃拍摄时,相机同时接收到了两部分信息:

  • 玻璃后方目标的透射内容,可以记为T;

  • 玻璃表面环境的反射内容,可以记为R。

最终拍到的图像,可以近似理解为T与R的叠加。

但真实情况要复杂得多。反射强度会随着角度、玻璃材质、覆膜、曝光和环境光发生变化,并不是简单降低亮度就能解决的。

从对比图可以看到,左侧存在多条灯带反射,部分反光横跨了人物的头饰、面部、服饰和背景。算法不仅要识别出R,还要避免破坏T中原本存在的浅色衣纹、仙鹤羽毛和人物轮廓。

这类任务主要有三个难点。

第一,反射和原图的边缘可能重叠。灯带穿过人物衣服时,模型不能简单地删除整条高亮区域,否则会把真实的纹理一起抹掉。

第二,真实高光和玻璃反光很难区分。丝绸、金属、白纸和颜料本身就可能存在亮部,模型需要判断这个高亮是来自物体材质,还是来自玻璃表面的环境反射。

第三,强反光可能已经造成了像素饱和。这时候,原始信息并不是被半透明遮挡,而是部分丢失了。模型需要控制恢复的范围,避免根据语义凭空生成不存在的线条和细节。

右侧的处理结果中,灯带和环境倒影被明显削弱了,同时保留了人物服饰、仙鹤羽毛和画面原有的色调。真正值得关注的,不是画面“更干净”,而是处理后没有出现明显的涂抹、过度锐化或者生成式重绘的感觉。

所以,扫描全能王强调的是“高保真还原”,核心是在去除反射的同时,约束结构、纹理和颜色的变化,而不是重新生成一张视觉上更漂亮的图片。

**合合信息团队获得了CVPR 2026 NTIRE“自然场景下的单图像去反射”赛道冠军。**这个挑战更关注真实环境中的复杂反射,而不是只在人工合成数据上测试,这对玻璃展柜、橱窗、白板和证件等场景,更有参考意义。

六、从个人工具到企业风控,价值在完整数据链路

AI鉴伪和去反光,并不是两个孤立的功能。它们分别位于可信数据链路的不同位置。

在金融、电商和保险场景中,AI鉴伪可以用于转账截图、退款材料、商品图片和理赔照片的前置筛查。系统不一定要直接做最终裁决,而是先给出真实性概率和可疑区域,再把高风险样本交给人工复核。

一个比较合理的业务流程是:

这样可以避免只依赖人工抽样,也能减少单一模型误判直接影响到业务结果。在内容平台中,跨模态鉴伪可以统一处理图片、短视频和文本。不同检测引擎输出的结果,还可以与账号行为、发布时间、来源信息结合起来,形成更完整的风险评分。去反光则更适合放在OCR和文档解析之前。塑封证件、会议白板、玻璃展柜和相框照片,都容易受到炫光影响。如果直接识别,可能会出现字符缺失、数字误判和笔画断裂。先完成反光抑制,再做透视校正、图像增强和文字识别,能提高后续处理的质量。

合合信息AIGC鉴伪技术,已经应用于金融、保险和电商等场景,图文鉴伪可实现日均数十万条内容核验;扫描全能王“智能高清·去反光”则覆盖了玻璃、白板、证件和自然拍摄等场景。未来AI能力的竞争,不会只发生在模型参数、生成效果和推理速度上,也会发生在数据进入模型之前。谁能更准确地识别虚假内容、更完整地恢复真实信息,谁就能为后续的大模型、Agent和业务系统,提供一个更可靠的起点。从这个角度看,AI鉴伪负责守住信息真实性,去反光负责守住信息完整性。它们共同构成的,不只是一个检测工具或图像增强功能,而是一层面向真实业务的“可信输入基础设施”。

当AI越来越多地参与审核、风控、知识生产和业务决策时,真正重要的已经不是它能不能给出答案,而是这个答案,是否建立在真实、完整、可追溯的信息之上。只有先让AI看见真实世界,AI才有可能对真实世界负责。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc