热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >OPPO推出GlyphDraw2,基于大模型的端到端海报生成方案

OPPO推出GlyphDraw2,基于大模型的端到端海报生成方案

来源:互联网 更新时间:2026-08-23 14:37

**“**GlyphDraw2: Automatic Generation of Complex Glyph Posters with Diffusion Models and Large Language Models**”** 海报这东西,天生就醒目、直观,让人过目不忘,在宣传产品、推广活动、传递理念这些场景里,作用可不是一般的大。眼下文生图技术已经相当成熟,但具体到海报上的文字生成,还有不少可以深挖的空间。 针对这个痛点,OPPO联合港中文搞了个端到端的解决方案——GlyphDraw2。这套方案基于LLM,核心是一个三重交叉注意力机制的端到端文本渲染框架,目标是在复杂、背景丰富的海报中,精确地生成文字。从大量实验来看,这个方法确实能生成带复杂上下文的海报图像,效果相当能打。 论文地址:https://arxiv.org/pdf/2407.02252 Github地址:https://github.com/OPPO-Mente-Lab/GlyphDraw2 ### 摘要 这篇文章先聊了聊海报生成的重要性,以及现有技术卡在哪。然后提出一个基于三重交叉注意力机制的端到端文本渲染框架,可以生成高分辨率、支持可变宽高比的海报,在复杂背景里精确呈现文字。作者还贡献了一个超过1024像素分辨率的高清数据集,并通过实验验证了这套方法很管用。 ### 简介 文生图模型现在能耐挺大,能生成高度逼真的细节图像。不过,这项研究更专注解决扩散模型在文本渲染上的短板,想要赋予扩散系统端到端生成海报的能力。 用扩散模型生成海报,给工业设计领域提供了全新思路,工业应用前景不小。难点在于怎么控制图像生成,一种常用的做法是加一个额外的适配器模块来编码新条件,再通过交叉注意机制把编码特征融入扩散过程。 最近的研究主要围绕布局控制和文本准确性,但缺乏对端到端文本渲染扩散模型的全面研究。生成海报时,必须同时保证高文本渲染准确性和丰富的视觉背景,缺一不可。 本文介绍了一个基于对齐学习的可控文本生成框架,专门用于海报生成。贡献主要在四个方面:端到端的生成流程、充分利用用户提示、精准的文本布局、丰富的视觉背景,还附带一个高分辨率数据集,最终生成效果也很亮眼。 ### 相关工作 #### 文生图模型 近年来,文本到图像扩散模型在图像生成上表现很出色。不过,光靠文本条件还满足不了所有用户的需求,所以越来越多的研究开始尝试把新条件整合进扩散模型。一种流行的方式是用额外的模型来编码新条件,再把编码特征喂给扩散模型。像IP-Adapter和ControlNet就走的这条路,在空间控制、文本渲染和3D生成等方向已经得到广泛应用和研究。 #### 文本渲染 文本渲染在可控图像生成中非常关键,现有方法会利用字形和位置信息来学习绘制字符,或者用形状信息增强文本到图像扩散模型,也有用布局变换器和大型语言模型自动搞布局的。还有的模型通过设计和训练字符感知、字形对齐的文本编码器,提供更强大的条件指导。本文的研究重点则是自动生成布局,在提升生成文本准确性的同时,保证背景的视觉吸引力。 #### 基于LLM的文生图 最近不少研究开始用LLM来生成更精细的条件,比如布局规范、对象描述、样式表语言,然后指导图像生成。LayoutGPT和LayoutPrompter就用LLM生成每个对象的样式表语言,而TextDiffuser-2、LLM Blueprint、Reason Out your Layout则用LLM生成每个对象的边界框作为新条件。生成布局边界框主要有两种方法:一是对高级专有模型做提示工程,二是微调开源LLM。相比之下,微调LLM效率更高,更有利于开发端到端的海报生成模型。所以本文在海报布局信息上微调了LLM,让它生成边界框来指导文本元素在海报里的位置。 ### 数据集构建 想要扩展扩散模型,需要一个大而全的数据集,包含不同的字形分布、美观的布局和构图、吸引人的背景。为了实现双语海报生成的多样性,作者开发了两个大规模高分辨率图像数据集:一个用来训练文本渲染能力,另一个专门用于海报生成,主要包含中文字形。 本文为海报生成任务准备了两个数据集:通用数据集和海报数据集。通过数据预处理,从通用数据集中筛选出高质量图像,再用PP-OCR精确定位和识别图像里的文本元素。为了进一步提升数据集质量,还引入了美学评分和图像处理技术。对于海报数据集里的小文本区域,采用了特殊处理,包括加掩模和使用LaMa模型做图像恢复。详细的过滤策略和统计分布放在了附录里。 ### 方法 #### 模型概览 整个模型分成四个部分:1. 融合文本编码器(FTE),用来整合文本和图像特征;2. 三重交叉注意力(TCA),引入两个额外的交叉注意力层,提升字形渲染准确性;3. 辅助对齐损失(AAL),用于语义一致性学习,增强海报的整体布局和背景信息;4. 使用微调LLM策略进行推理,自动生成符合用户描述的字形和坐标位置,实现端到端海报生成。 #### 融合文本编码器 这个方法借鉴了之前的一些工作,比如Blip-Diffusion、Subject-Diffusion,也常用作全局条件控制策略。具体做法是:先把输入的字形条件渲染成字形图像,然后传给PP-OCR提取相应的字形特征。接着,跟AnyText的思路类似,字形特征会通过线性层做特征对齐,与相应位置的标题融合,实现即插即用的模块化,而且不需要微调文本编码器。 #### 三重交叉注意力 为了保证生成的字形准确,引入了ControlNet模块,在原始交叉注意力层之后又加了新的自适应交叉注意力层。另外,为了解决生成段落或更大文本块的问题,还引入了第二个交叉注意力层。最终TCA的输出是三个交叉注意力层输出的总和。 #### 辅助对齐损失 海报生成既要关注字形生成的准确性,又要保证背景和谐、图像背景丰富。本文的方法引入了额外的条件注入,包括ControlNet特征添加和TCA策略,通过增加解码器组件的数量来确保生成图像的可控性。但是可控性往往会牺牲可编辑性或文本一致性。所以引入了AAL来保持语义一致性,在重复的解码器块中应用AAL,最小化对整体布局和图像质量的影响。最终的损失函数里包含一个重要的超参数λ。 #### 使用微调LLM进行推理 要实现端到端海报生成,最后需要解决的一个关键问题就是消除手动干预——也就是预先定义图像布局的过程。现在完全依靠用户的标题描述,引入LLM来解决这个布局生成问题。为了方便调用,作者自己构建了指令数据,并对开源语言模型进行了微调。 ### 实验 #### 实现细节 本文的模型包含两个主要组件。第一个是可控的文本到图像海报模型,以SDXL为框架,结合PEA-Diffusion策略和CLIP编码器进行训练。这个模型有1.6亿个可训练参数,采用AdamW优化器和两阶段渐进式训练策略。第二个是基于LLM的布局生成模型,用Baichuan2进行训练,采用随机规则的布局生成方法来提高稳定性。两个模型分别在64个A100 GPU上训练。 #### 评估 评估集分成两部分,用来评估模型性能。第一部分是AnyText-Benchmark,包含1000张英文和中文图像。因为发现其中用于测试中文生成能力的1000张图像跟英文数据混在一起,所以移除了这部分,留下915张作为评估基准。从两个方面评估文本渲染质量:(1)位置词准确率(PWAcc),计算特定位置生成单词的准确性;(2)标准化编辑距离(NED),衡量两个字符串的相似度。注意,AnyText-Benchmark里大部分英文评估集只包含一个英文单词,评估英文句子时精度不够,所以需要构建更复杂的评估集。 评估集包括复杂基准和海报基准两个子集,总共有四个评估子集,覆盖中英文双语评估。复杂基准包含100个提示,中文提示随机组合排列字符,英文提示包含连续重复的长单词。海报评估集包含120个描述海报生成的提示,旨在评估布局准确性、稳健性和整体美学质量。评估使用三个指标:准确率、ClipScore和HPSv2。对比了多种方法,包括AnyText、ControlNet和StableDiffusion3(SD3)。 #### 结果 从结果看,本文模型在中英文文本渲染的准确性上明显优于AnyText,但在ClipScore指标上略低于GlyphDraw2。Acc指标基于PWAcc规则计算。 针对中文和英文分别设计了不同的评估集,包括复杂汉字和重复字母的英文单词等。评估指标包括准确率、ClipScore和HPSv2。实验表明,该模型在文本生成准确率方面表现优异,尤其在海报生成方面最佳。同时,使用LLM预测文本框位置可以实现无需用户指定文本位置的端到端海报生成。 模型有四种任务模式,前两种需要预测四个位置坐标,后两种只预测两个坐标。实验发现,模型参数越大,微调效果越好,输出归一化能提高准确率。最终选择了Baichuan2-13B模型,采用第三种任务模式。在自定义评估集上微调后,模型在标题、内容连续性和边界框大小等方面表现出优势。 #### 消融分析 通过消融实验发现,TCA模块、AAL策略、FTE模块和ControlNet的条件输入,都对生成海报的效果有影响。虽然该方法能生成自由分辨率的海报,但依然存在一些问题,比如文本边界框的预测精度较低,背景生成和文本渲染的平衡也比较困难。作者表示未来会探索一些解决方案来解决这些问题。 ### 总结 手动标注的高昂成本和有限可用性,对字形生成模型的实际部署构成了不小的挑战。本研究首先收集了包含中文和英文字形的高分辨率图像,然后构建了一个自动筛选过程来建立大规模数据集。接着建立了一个综合框架,融合文本和字形语义,利用各种信息层优化文本呈现的准确性和丰富性。数据集构建策略包括应用分辨率过滤标准、提取干净的包含字形的图像,并实施过滤规则来限制文本框的数量和大小。
关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc