热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >用多模态技术在多媒体系统中实现场景分类

用多模态技术在多媒体系统中实现场景分类

来源:互联网 更新时间:2026-08-25 13:51

视频场景分类算法最近是真的火,在计算机视觉领域绝对是个热门话题。它作为许多复杂任务的前置算法,在我们多媒体实验室的好几个业务里都能派上用场,比如内容自适应转码、画质智能修复,还有视频质量评估(VQA)。核心思路是,先识别出图像属于哪种类型,然后针对性地选择最适合的模型,这样能精准地提升算法在实际业务中的效果。

语言和视觉,是人类感知世界最基础的手段,也是人工智能理解世界的两大支柱。而多模态,简单说,就是把图像、文本、音频这些不同类型的数据揉在一起处理。这样一来,模型的泛化能力更强,能做的事情也更多了,比如图像分类、图像问答、文本图像生成等等。这篇文章的核心,就是研究怎么把多模态算法用到多媒体系统的场景分类里,聊聊实际落地会遇到哪些挑战,再给出对应的解法。

背景

B站作为一个聚集了海量UP主投稿的视频社区,内容品类多、场景也多,质量参差不齐。随着用户年龄和兴趣圈层的不断扩展,UGC视频内容五花八门,画质有好有坏,这给多媒体分析与处理带来了不小的麻烦。拿画质修复来说,多媒体系统会想办法提升视频画质,让用户看着更舒服。但同一个视频里,往往有多种不同类型的场景,它们的画质差异可能很大。要是都用同样的增强方法去处理,效果肯定不是最好的。所以,特别需要一个能识别和分类视频场景的前置算法,让多媒体系统根据场景特点,自动选择最合适的画质修复算法,实现更精细、更高效的画质增强。

视频场景分类算法,可以通过识别单帧图像的特征来实现分类。

图1 图像分类算法简要流程

传统的图像分类方法,比如用SIFT(尺度不变特征变换)、HOG(方向梯度直方图)这些技术,从图像里提取颜色、形状、纹理这些关键信息。然后再用SVM(支持向量机)、决策树、随机森林、K近邻算法、朴素贝叶斯这些方法,对标注好的训练数据进行分类训练。虽然在某些任务上效果还行,但通常需要大量的手工调整和参数优化,处理大规模图像数据集时,性能也有限。

后来深度学习火起来了,CNN(卷积神经网络)这种端到端的模型,通过卷积、池化、全连接层这些操作,能从数据里学到更丰富的特征表示,不需要手动设计特征和分类器,分类效果也更好。不过,大多数基于深度学习的算法,都需要大量的标签数据来训练,而公开的数据集不一定适合实际业务场景,所以需要人工收集和标注更适合业务场景的大规模数据集。

近年来,多模态算法成了解决特定问题的重要研究方向。这类算法能处理视觉、语音、文本等多种模态的数据,并把它们映射到同一个空间里。这样不仅提高了模型的泛化能力,也让跨模态的分类算法成为可能,进一步扩展了人工智能在复杂场景下的应用潜力。同时,大模型的快速发展,也让预训练特征提取模型在各种场景下成为可能。

现有技术

图像分类是计算机视觉领域的核心任务,目标是把图像准确地分配到预定义的类别里。深度学习的快速发展,让图像分类算法受益于丰富的数据资源和强大的算法模型,取得了显著的进展。为了更好地理解这一领域,我们先从常用的图像分类数据库说起,然后聊聊现有的算法方案。

现有的数据库介绍

高质量的数据集是深度学习研究的重要组成部分,直接影响模型训练的准确性和鲁棒性。以下是图像分类任务中几个常用的数据库:

CIFAR-10


CIFAR-10 数据集由 CIFAR 研究所的研究人员开发,包含飞机、汽车、鸟等 10 个类别,由尺寸为 32 × 32 像素的彩色图像构成,类别之间相互独立,没有重叠。训练集有 50,000 个样本和 50,000 个标签,测试集有 10,000 个样本和 10,000 个标签,总共 60,000 张。

CIFAR-100


CIFAR-100 数据集由 100 个不同类别的 60,000 张 32 x 32 像素的彩色图像组成。训练集和测试集各有 50,000 张训练图像和 10,000 张测试图像。它的类别分为 20 个粗分类,每个粗分类下有 5 个细分类。比如,“人类”这个粗分类下的细分类包括:婴儿、男孩、女孩、男人和女人。

ImageNet


ImageNet 是 2009 年创立的计算机视觉领域大型视觉数据库,包含超过 1,400 万张标注过的图像,涵盖 2 万多个类别,其中有超过 100 万幅图像有明确的类别标注和主要物体的定位边框。在图像分类、目标检测和目标识别等任务中,它是一个重要的基准数据集。

这些现有数据库的分类标签,都是基于通用标准制定的,缺乏对特定业务场景的考虑,所以很难满足实际业务需求。为了更好地适应业务的具体目标,通常需要人工标注相应的分类标签。但人工标注分类标签,是个耗时费力的活儿,特别是在面对大规模数据集时,工作量和成本会成倍增长。所以,如何减少对大规模数据集的依赖,同时提升算法的准确率,成了这篇文章的研究重点。

现有的算法方案

基于卷积神经网络的方案

CNN 是一类能从图像中提取复杂特征,并将其映射到高维空间的神经网络模型,比如 LeNet5、GoogLeNet、VGG、ResNet、EfficientNet 等等。它的核心思路,是通过卷积、池化等操作来提取图像特征,最后通过全连接层对特征进行分类和回归。

图2 CNN 简要流程

拿 2015 年 ILSVRC(ImageNet 大规模视觉识别挑战赛)的冠军模型 ResNet(残差网络)来说,它利用残差块引入了跳跃连接(Skip Connections)。这种设计,在网络深度增加时,能保持训练效果,还能有效解决深度卷积网络中常见的梯度消失和梯度爆炸问题。

其实,大多数 CNN 的性能提升,往往依赖于对网络结构的不断优化,包括增加网络深度、扩展网络宽度(即增加卷积层的通道数),以及提高输入图像的分辨率。为了实现最佳性能,这个过程通常需要反复试验不同的模型架构和训练策略,同时还得引入大量的标注数据。

基于多模态的算法方案

多模态算法,是一种将不同类型数据映射到同一空间域的特征算法。可以理解成,一个人用多种感官去感知世界,并把信息整合起来进行理解和判断。下面聊聊多模态领域的经典算法。

CLIP


CLIP(对比语言-图像预训练)是 OpenAI 在 2021 年初发布的一种基于对比学习的多模态预训练模型。它被广泛应用于 DALL·E 2、Stable Diffusion 等重要的文生图大模型中,是多模态领域的经典之作。

CLIP 的创新之处在于,它把图像和文本映射到一个共享的多模态向量空间中,这样模型就能理解图像和文本之间的关系。它使用了双塔结构的神经网络,包括一个图像编码器和一个文本编码器。其中,文本编码器可以用 NLP 领域常用的文本 Transformer 模型,而图像编码器可以用 CNN 模型或者 ViT(视觉Transformer)模型。两个不同的编码器,分别负责把图像和文本转换为对应的嵌入向量。然后计算两个向量的余弦相似度,相似性越大(接近 1),意味着文本和图像越匹配;反之,相似性越接近 0,越不匹配。

图3 CLIP 神经网络结构

CLIP 的优势在于它强大的跨模态理解能力,能同时处理文本和图像数据,在多种任务上表现出色。通过对大规模数据进行训练,它具备了出色的泛化和迁移能力。在自然分布的数据集上,它在零样本任务(Zero-shot,即识别从未见过的数据)中表现出较强的鲁棒性。但当测试数据和训练数据差距较大时,性能会有所下降。具体到分类任务,CLIP 可以通过设置 prompt(提示词)来实现更灵活的分类标签。不过,只用人工设定好的 prompt,往往难以达到理想的业务效果。而且,人工设定的 prompt 可能完全不符合业务需求,需要反复调整才能获得最佳效果。

BLIP


在大模型出现之前,大多数预训练模型在训练完成后,对新的下游任务的适应能力有限,不能有效泛化。BLIP(引导语言-图像预训练)是一个专为多模态任务设计的框架,能统一视觉语言的理解和生成。它提出了一个多模态混合的 MED(多模态混合的编解码)模型架构和数据增强方法,以适应更广泛的下游任务。

在模型方面,为了预训练一个既有理解能力、又有生成能力的统一模型,MED 包含三种结构:单模态编码器、基于图像的文本编码器、基于图像的文本解码器。在数据方面,BLIP 改进了 CLIP 从互联网获取数据的方案,提出了 CapFilt(字幕生成和过滤)模块,既对给定的互联网图像生成文字,又通过判断原始文本、生成文本与图像是否匹配,过滤文本噪声,提升语料库质量。

算法设计方案

UGC 视频通常包含多个不同场景的视频片段,这些片段往往属于不同的类别。在进行视频分类时,首先通过场景切分,把视频划分为独立的场景片段,然后对这些片段进行分类。通过将场景切分技术与图像分类技术相结合,我们开发了一套适应特定任务需求的视频分类系统。这套系统能高效地对视频内容进行分类,满足多样化的应用场景。

标注数据集

作为一种在超大数据集上训练出来的模型,CLIP 算法能在没有特定任务监督数据的情况下,在自然分布数据集上表现出色。我们首先根据 CLIP 算法 prompt 的设计规则,设计出实际业务需求对应的 prompt 文本标签。然后,基于它的零样本能力,对少量未经标注的图像数据集进行预分类,生成伪标签。下图展示了预分类流程:先设定好业务需求的 prompt 文本标签,使用文本编码器提取这些标签的特征,得到文本向量。同时,把待检测的图像输入图像编码器,得到图像特征向量。最后,将图像向量和文本向量进行相似度检测,得出图像的类别。通过这种方式,我们就能为图像数据集进行初步分类了。

图4 数据预分类

基于人工设定的 prompt 文本标签,CLIP 在对陌生数据集进行分类时,没法做到完全准确。所以,需要把未准确分类的数据集进行数据清洗,剔除其中的噪声数据。经过这些步骤,能极大减少人工标签的工作量,只需要对预分类好的数据集进行数据清洗,而不是完全重新制作标签。

模型训练

CLIP 算法是一个通过 4 亿文本和图像对,以自监督方式训练出来的大规模图像-文本嵌入模型。这意味着,CLIP 的图像编码器和文本编码器都有较强的特征提取能力。我们在传统图像算法流程的基础上,用 CLIP 预训练好的图像编码器,替换掉传统的 SIFT、HOG 等作为特征提取器来提取图像特征,然后引入全连接层,用清洗好的训练数据集,对提取的图像特征进行分类训练。把训练后的模型重新应用到 4.1 中的标签制作里,不断迭代,最终得到能准确分类的模型。

图5 训练模型结构

ResNet 50 在计算机视觉社区得到了广泛采用和研究,其架构在各种图像分类竞赛中表现出色,实现了最先进的性能。我们以 ResNet 50 作为对比算法,进行了三分类任务的实验,其中包括自然场景(nature)、动漫/游戏场景(animation/game)、文稿内容场景(document)。实验中,总共有 5,920 张人工标注的图片,其中 90% 用于训练集,其余数据为验证集。

训练输入尺寸设置为 224 × 224,在 RTX 3090 上进行单机单卡训练。ResNet 50 训练了 300 个 epoch(每个 epoch 是对训练集中的全部样本训练一次),大约用了 180 分钟。而在相同条件下,对 CLIP 结合全连接层训练 600 个 epoch,只需要约 125 秒就能收敛。我们从准确率(Accuracy)、精确率(Precision)、召回率(Recall)、F1 分数(F1 score)四个维度,对包括 CLIP 零样本方案在内的三种方法,在相同验证集上进行了对比。验证结果如表 1 所示,基于 CLIP 结合全连接层的方案,在各项指标上都明显优于 ResNet 50 和基于 CLIP 的零样本方案。如果实际业务中对准确率要求不高,且没有足够的训练数据,CLIP 的零样本方案可能是个合适的选择。

表1 不同训练方案验证结果

视频场景分类

B 站的 UGC 视频通常由多个不同的视频片段拼接而成,每个视频往往涵盖了多种类型的场景。为了确保视频分类检测的准确性,我们专注于处理场景转换后的视频片段。一种常见的方法,是基于帧间内容变化的场景切换检测。该方法通过比较邻帧间的视觉内容差异,来识别场景切换点。一旦检测到场景切换,我们就从这些场景中抽取关键帧,并对这些帧进行图像分类。通过将分类预测得分归一化并按类别累加,最终确认每个场景的类别。

图6 基于场景切分的场景分类方案

总结与展望

在多模态算法快速发展的时代,分类算法也在不断演进和创新。预训练多模态算法,进一步提升了训练效率和准确性。我们结合实际的业务内容,重新审视了图像分类算法的技术发展,实现了一套基于多模态的场景分类算法方案。这套算法未来可用于多媒体实验室的画质智能修复、内容自适应转码和视频质量评估(VQA)等多媒体系统中。比如,在内容自适应转码项目中,使用与主观感受匹配度较高的 VMAF 作为画质评价的预设目标值,并通过深度学习准确预测视频转码参数。但问题是,对于不同类型的视频,要达到相同的目标 VMAF 值,人眼的主观感受是不同的。这时候,就可以根据分类出的场景不同,自适应决定不同的预设目标值,以期达到更精准的画质和码率控制。未来,多媒体实验室还将继续探索在多媒体系统中引入更多的大模型及多模态技术,进一步提高整个系统的性能。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc