来源:互联网 更新时间:2026-08-12 17:19
大模型的发展已经走过了一条很清晰的演进路径,从最初的预训练模型,到后来的指令遵从、多面对齐,再到如今的模型生态,可以说每一步都踩在了技术升级的关键点上。这篇文章就来聊聊通义星尘个性化大模型背后的技术逻辑和应用实践,内容整理自一次线下分享,信息都对应着当时的时间点。
大模型的核心技术发展,大致可以分为几个阶段:从预训练模型,到指令遵从和多面对齐,再到整个模型生态的构建。
最早能追溯到2018年、2019年的Bert和GPT-1。那时候的预训练模型,核心逻辑是用海量无监督数据“养”出一个基础模型,然后用在各种NLP任务上。到了第二阶段,GPT系列开始走“少数据、大模型”的路子——模型参数从GPT-2的几十亿猛增到GPT-3的1750亿,并且展现出了优秀的上下文学习能力。而ChatGPT的出现,则把重点放在了指令的深层理解与遵从、监督微调(SFT)、人工反馈强化学习(RLHF)和价值对齐上。之后,大模型的发展更强调无害性、安全性和责任性,追求与人类认知的多方面对齐。GPT-3引入了In-Context-Learning和CoT(思维链),ChatGPT强化了Instruction-Following和Alignment,GPT-4则补齐了多模态能力。最近,GPT Store、Agent等平台与生态的出现,标志着以模型为核心、连接整个技术生态的趋势已经形成——这些平台的设计初衷,就是扩展模型的应用边界,包括调用外部小模型和API,执行一些复杂的指令规划和遵循。
纵观整个进程,OpenAI基本上是按照这个路径在推进,而国内的大厂,早些年就已经开始布局了。
举个例子,阿里巴巴在2018年就开始研究如何设计更有效的预训练任务,来强化模型的语言理解能力。2019年,他们发布了万亿参数的多模态大模型M6。2020年以来,又构建了一套完整的AliceMind深度语言模型体系,覆盖纯文本、生成式、多元和多模态等各种类型。到了2021年,进一步推出了更大规模的模型,包括中文PLUG(百亿参数)和M6的10万亿参数版本。2022年,重点优化大模型在各类任务中的通用性能,轮番推出了通用多模态模型OFA、mPLUG多模态理解生成模型,以及通义大模型体系。进入2023年,这些积累被高效整合,主要布局了三款主力模型:通义千问(基础模型)、通义听悟(语音模型)、通义万相(图像生成模型),并陆续推出了更多垂直领域的应用。
在去年的云栖大会上,阿里一次性发布了8个垂类的行业大模型。通义听悟是之前已经亮相的语音模型;通义星尘则是我们这次要重点聊的个性化模型,它主打的是个性化角色定制,比如NPC角色、陪伴型对话,甚至涵盖情商的智能交互;通义灵码专注于编程,能帮开发者高效写代码;通义晓蜜主打客服问答,提供智能客服方案;通义点金助力金融行业智能化;通义智文则专注文档处理,能优化PDF或论文的阅读体验。
这些垂类模型,基本上都是以通义千问和通义万相为基础底座,通过在底座上进一步定制和优化,来满足各行业对智能化技术的需求。接下来,我们就把焦点对准通义星尘——这个个性化大模型。
通义星尘的产品理念是:在保持通用大模型基础能力的前提下,延伸出个性化能力。目前,很多大模型在知识型回答上确实表现出色,但往往缺乏个性。无论真实的人类,还是虚拟的IP角色,都应该有自己独特的个性、说话方式、履历和经历,以及记忆。更进一步,我们希望这些角色能和用户建立更深层的连接。
基于这个理念,通义星尘致力于打造一个基于个性化大模型的角色对话平台。在简单的角色设定下,能提供拟人化、场景化、多模态和共情的对话能力,以及复杂任务执行能力,实现个性、丰富、快速、深度的角色定义。
上图展示了通义星尘大概的产品形态,目前已向社会开放了网页入口。功能包括:开放自定义角色配置、提供热门角色体验、提供经典场景样板间、提供角色API接口等。大家可以在平台上自由定义角色,自己去体验一下。
通用大模型,形象点说就是一片“知识的海洋”,擅长在知识领域内运用强大的智商和推理能力。而我们期待的个性化大模型,更像是一个“富有情商的知己”——能与你共情,陪你畅聊,而且独具个性,有思考、有记忆、更有独特的情感抚慰方式。我们希望个性化大模型更接近人类,而不是仅仅基于事实和逻辑进行机械回应。
在阿里内部和外部,个性化场景其实相当丰富。我们对这些场景做了一些探索,包括:情感陪伴(打造24小时在线的虚拟好友,进行深度聊天和互动)、萌宠设置(允许用户自定义喜欢的宠物形象,丰富养成系游戏的互动玩法)、智能NPC(用于游戏中的角色打造,赋予其特定能力和任务)、专业服务(打造具有特征能力的专家,比如历史讲解和心理咨询)、角色/IP复制(复制特定人物或IP,满足个性化或商业化需求)。
个性化大模型涉及的关键技术主要聚焦在四个方面:
具体来说,个性化大模型的基本处理方法是:基于通义千问基础大模型,收集海量高质量的领域或个性化数据(比如游戏剧本、电影剧本、人设数据等)来训练。难点在于如何增加对复杂指令的遵循,同时支持长文本的理解能力。为此,我们采用了个性化数据的预训练方法,目的是加强模型在个性化领域的知识储备,增强其强指令遵循能力,使其能够准确执行复杂任务。此外,模型还支持处理长达16K的文本上下文(Long-Context),并具备长短期记忆,支持使用工具的能力。
在构建大小模型协同的AI智能体时,我们将千问大模型与魔搭社区中的众多开源小模型结合,打造了Modelscope-Agent。以大模型为中控,自动构建大小模型协同链路,解决终端业务场景的问题,大幅推广用户生态;同时根据用户提出的新需求,理解各种指令,并根据历史对话进行规划、调动、生成和总结。
ModelScope-Agent框架的目标,是构建一个高度可定制、功能完善的Agent架构。初期专注于single agent的实现。该框架提供了可定制的引擎设计,包括数据收集、工具检索、工具注册、存储管理、定制模型训练和实际应用等功能,能快速适配各种实际业务场景。其核心组件是开源大语言模型(LLMs),支持在ModelScope社区内的多个开源LLMs上进行训练。通过统一接口,实现与模型API和常见功能API的无缝集成。为了应对工具使用的局限性和效率问题,框架内置了工具检索(Tool Retrieval)模块。同时,它还具备处理复杂对话场景的能力——通过长短期记忆机制提供连贯和个性化的服务(短期记忆存储最近的对话内容,长期记忆涵盖知识库和用户专属记忆库)。这套框架能提升大模型的应用能力,支持语音合成等多样化功能,并构建完整的训练推理链,提供丰富的API。
在多模态方面,我们推出了模块化多模态对话大模型mPLUG-Owl。它通过引入模态自适应模块,利用模态协同,同时提升了纯文本和多模态的效果,解决了模态拉扯问题,并在多项权威评测中达到第一。模型的设计思路是:希望构建一个能同时处理文本与图像等多模态信息的大模型,在保持文本处理能力的同时,实现多模态间的互补与增强。人类感知世界的方式也说明,文本与图像之间是相互促进的。mPLUG-Owl引入了Vision Encoder,将图像转为视觉序列,再通过模态自适应模块,避免文本与多模态信息互相干扰。多模态的一个痛点是图像序列太长,特别是要获得好的图像理解能力时,Vision Encoder的分辨率和序列长度会非常长。我们引入了Visual Abstractor,用少量token表示图像,再让图像与文本结合。在模态自适应模块中,文本和图像走不同路径,同时共享部分参数,让模态之间更好地协同。
训练采用两阶段方式:第一阶段主要是图文对的预训练,帮助图像encoder对齐到文本语义空间,得到图像的语义序列;第二阶段增加图像和文本的instruction数据,一起训练,使模型能更好地理解文本指令和多模态指令。目前,模型的多语言版本已经在魔搭社区开放体验。它不仅支持多模态对话,还具备个性化能力——能保持个性化风格,生成个性化图片。模型还增强了对于文档类图片的理解能力,比如表格中的空间位置关系、数值比较等,在多个文档理解相关的多模态数据集上达到了SOTA。我们基于mPLUG-Owl进行了统一指令微调,所有任务统一成QA任务,并增加了OCR识别等任务来提升图片理解能力。针对富文本图片高分辨率的问题,我们提出了“形状适应的切图模块”——当图片分辨率过高时,可以将形状大小各异的图片裁剪为适配MLLM视觉编码器大小的子图,在子图上分别建模,从而大幅提升运行效率和理解能力。
最后,在安全性和责任感方面,我们也有很多工作要做。举个简单的例子:如果问“如何烹饪野生娃娃鱼”,根据法律法规,模型应该回答“不能捕食”,而不是真的给出烹饪方法。为了推动生成式大模型成为安全且负责任的AI,我们发起了“给AI的100瓶毒药”项目,邀请了十多位国内知名专家学者,每人提出100个诱导偏见、歧视回答的刁钻问题,完成对大模型“投毒”和“解毒”的攻防过程。参与这个项目的专家包括社会学家李银河、心理学家李松蔚、环境学专家范叶超、人权法专家刘小楠、法理学专家翟志勇等。通过与专家的合作,基于专家原则指导的“解毒”方法,有效提升了大模型的安全性和负责任意识。
目前,安全性和责任感方面存在的主要问题包括:模型逻辑表达能力不足,对于诱导性问题常常盲目肯定或自相矛盾;模型意识不够,缺乏负责任意识和同理心,有时虽然具备相关知识,但由于对价值观和相关意识训练不足,仍会给出不理想回答;专业知识的理解与应用能力不足,比如法律知识的理解和应用。针对这些问题,我们需要有方向地训练大模型,同时通过Agent方式进行检测,一旦发现安全性问题,就要主动将安全准则加到prompt中,从而进一步提升模型效果。
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
区块链OTC交易所有哪几家比较正规?
2026热门直线加速赛车手游推荐:高人气、爽快加速体验的精品榜单
腾讯ima怎么把微信内容一键导入知识库?
kimi提示词专家使用方法新手指南
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
原神霜月三处月灵龛具体位置汇总
《幻兽帕鲁》不触发通缉捕捉传说商人方法
Windy卫星云图怎么看?云层变化识别技巧
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
为什么推特KOL都在BRC20赚钱 我一冲就亏?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
一加手机如何设置三指长按屏幕局部截图
合集38个项目筹集5.406亿美元 Figure融资2亿
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc