来源:互联网 更新时间:2026-07-28 15:29
导读:本文将从以数据为中心的模型开发、基础设施建设、数据分析应用等多个方面,为你拆解大数据与AI一体化这个热得发烫的话题。
过去一年,大模型的发展速度堪称狂飙。算力和数据的堆叠,让模型具备了通用的理解和回答能力,终于把人们带进了那个梦想已久的人工智能阶段。举个例子,和现在的AI聊天,你不会觉得对面是个生硬的机器,而更像一个有温度的人。这为我们打开了全新的想象空间——以前的人机交互,靠的是键盘鼠标、格式化的指令,而如今,用自然语言就能让机器读懂你的意图并做出回应。
为了跟上这股浪潮,大量科技公司投身大模型研究。2023年被称为AI元年,就像当年iPhone开启了移动互联网时代一样,真正的突破来自“大算力+大数据”的组合拳。

从模型结构来看,Transformer其实已经问世很久了。GPT比BERT还早发表一年,但受限于当时的算力,效果远不如BERT,所以反而BERT先火起来,广泛用于翻译等任务。可今年焦点彻底转向了GPT,背后原因很简单——算力上来了。硬件厂商在封装和存储颗粒上的持续进步,让我们能把超高算力堆在一起,推动模型在更多数据上深入理解,最终带来了突破性成果。正是底层平台的强有力支撑,算法同学才能更高效地开发和迭代模型,加速整个演进过程。
一般模型开发周期是这样的:

很多人以为模型训练是其中最关键的环节。但事实上,在训练之前,有大量数据需要采集、清洗、管理。这个过程中,有非常多的验证步骤——有没有脏数据?统计分布是不是有代表性?模型出来后,还要做测试和验证,本质上也是数据的验证,通过数据来反馈模型效果。

业内有个共识:更好的机器学习 = 80%的数据 + 20%的模型。重心应该在数据这一头。

这也揭示了模型开发的演进趋势——从“以模型为中心”转向“以数据为中心”。深度学习早期以有监督学习为主,最关键的是标注数据。标注数据分训练集和验证集,通过训练让模型学习,再在测试数据上验证效果。但标注成本极高,所以大家把大量精力花在优化模型结构上,用结构变化提升泛化能力、减少过拟合——这就是以模型为中心的范式。
随着数据和算力的积累,无监督学习开始大行其道。海量数据让模型自己发现数据中的关系,此时就进入了以数据为中心的范式。在这种模式下,模型结构基本类似,都是Transformer的堆叠,真正比拼的是“怎么用好数据”。数据清洗、比对的工作量巨大,因为需要海量数据。如何精细控制数据,直接决定了模型收敛和迭代的速度。
阿里云一直强调AI与大数据的融合。基于这个理念,我们构建了一套平台体系:底层是高带宽的GPU集群提供高性能AI算力,以及CPU集群提供高性价比的存储和数据管理能力;之上是大数据AI一体化PaaS平台,包括大数据平台、AI平台、高算力平台和云原生平台等;引擎层则涵盖流式计算、大数据离线计算MaxCompute和PAI。

服务层则有大模型应用平台百炼和开源模型社区ModelScope。阿里一直在推动模型社区共享,希望以Model as a Service的理念,让更多有AI需求的用户能快速基于基础模型构建自己的应用。
下面用两个案例说明为什么需要大数据与AI联动。

在大模型问答系统中,首先要用到基础模型。需要把目标文档做embedding化,结果存在向量数据库中。文档量可能非常大,所以embedding化需要批处理能力。基础模型的推理服务本身也很耗资源,取决于模型大小和并行化策略。产生的所有embedding灌入向量数据库,查询时query也要向量化,然后通过向量检索把可能相关的知识提取出来。这要求推理服务有高性能。提取出向量后,需要将向量代表的文档作为context去约束大模型,在此基础上做出回答——效果远超自己搜索的结果,而且是自然语言回复。整个流程既需要离线的分布式大数据平台快速生成embedding,又需要大模型训练和服务的AI平台把流程串起来,才能构成一个完整的问答系统。

另一个典型场景是个性化推荐。模型需要很高的时效性,因为每个人的兴趣和个性都在变化。要捕获这些变化,需要流式计算系统对APP内的行为数据进行分析,提取特征后不停地让模型做在线学习(online learning)。新数据进来,模型就更新,然后以新模型服务用户。因此,这个场景既需要流式计算能力,也需要模型服务和训练的能力。
从上述案例可以看出,AI与大数据结合已成必然趋势。基于这个理念,首先需要一个工作空间,将大数据平台和AI平台纳入统一管理——这就是AI工作空间诞生的原因。

在这个AI工作空间里,可以支持Flink集群、离线计算集群MaxCompute,也能支持AI平台、容器服务计算平台等。

统一管理只是第一步,更关键的是通过工作流将它们串联起来。可以通过SDK、图形化界面、GUI、写SPEC等多种方式建立工作流。工作流中的节点可以是大数据处理节点,也可以是AI处理节点——这样就能把复杂流程衔接得很好。

要进一步提效降本,就需要Serverless云原生服务。上图详细描述了什么是Serverless。从“share nothing”(非云化方式)到“share everything”(极致云化),中间有很多层次。层次越高,资源共享程度越高,单位计算成本越低,但对系统压力也越大。

大数据和数据库领域这两年逐渐走向Serverless,也是基于成本考虑。原先即便在云上,也是以实例化形式存在——背后有CPU、核心数的影子。后来慢慢演变成Serverless:第一层是单租计算,在云上起一个cluster,里面部署大数据或数据库平台,但这个cluster是单租的,和其他人共享物理机,通过虚拟化出虚拟机来用,用户得到的是云上弹性的ECS,但大数据管理、运维方案需要自己做——EMR就是经典方案。之后从单租存储走向共享存储——数据湖方案。数据放在共享的大数据系统里,计算动态拉起集群,算完就消亡,但数据不消亡,因为存在可靠的远程存储端——典型就是数据湖DLF和Serverless EMR。最极致的是Share Everything——用BigQuery或MaxCompute时,看到的是平台和虚拟化的project管理,用户提供一个query,平台按量计费。

这会带来很多好处。比如大数据计算中有大量节点并不需要用户代码,它们本质上是内置operator(join、aggregator等),确定性很强,不需要重Sandbox,可以去掉虚拟化开销。而UDF带来灵活性,能处理丰富数据,在大数据量下有很好的扩展性,但也会带来隔离和安全性挑战。
无论是Google BigQuery还是MaxCompute,都走在Share Everything架构上。我们认为只有技术不断升级,才能把资源用得更紧实,降低算力成本,让更多企业消费得起数据,推动数据在模型训练上的使用。

正是有了Share Everything,我们不仅可以靠工作空间统一管理大数据和AI,通过PAI-flow串起来,还能以Share Everything方式统一调度。这样一来,企业AI+大数据的研发成本会进一步下降。在这点上还有很多工作要做。K8S本身的调度面向微服务,对大数据挑战很大——大数据任务调度粒度非常小,很多task只存活几秒到几十秒,对调度规模和压力有量级提升。我们主要解决如何在K8S上让调度能力scale out——推出的开源项目Koordinator就是为了提高调度能力,让大数据和AI在K8S生态上融合。

另一项重要工作是多租安全隔离。如何在K8S服务层、控制层做多租,如何在网络上做overlay多租,使得在一个K8S上服务多种用户,各用户数据和资源得到有效隔离。

阿里推出的容器服务ACS就是通过上述两个技术,把所有资源容器化暴露,让用户在大数据平台和AI平台上无缝使用。它是多租方式,能支撑住大数据的需求——大数据在调度上的要求比微服务和AI高几个量级。这个基础做好了,ACS产品就能帮客户更好地管理资源。

企业面临很多精细化管理需求。比如大模型研发时,各子团队会做发散性创新,探索基模型在不同场景的应用。但在某个时刻,需要集中力量办大事——把算力和资源集中起来训练下一个基模型。为此我们引入了多级quota管理:更高需求的任务到来时,可以有一个更高级别,把下面所有子quota合并集中。

AI场景有很多特殊性:大量同步计算,对延迟极度敏感,计算密度大,网络要求高。要保证算力,就需要供给数据、交换梯度(gradient),模型并行时交换量更大。为保证通讯无短板,需要基于拓扑感知的调度。举个例子,模型训练的All Reduce环节,如果随机调度,跨端口的交换机连接会很多;如果精细控制顺序,跨交换机连接就干净,延迟能很好保证,因为不会在上层交换机发生冲突。

经过这些优化,性能大幅提升。怎样把拓扑感知调度下沉到整个平台管理器,是AI加大数据平台管理需要考虑的问题。

前面讲的是资源和平台管理,数据管理同样关键。我们一直深耕数仓系统,比如数据治理、数据质量等。要将数据系统和AI系统关联,需要数仓提供AI友好的数据链路。比如AI开发用Python生态,数据端怎样通过Python SDK使用平台?Python最流行的是pandas这样的data frame数据结构。我们可以把大数据引擎的client包装成pandas接口,所有熟悉Python的AI开发者就能轻松使用背后的数据平台——这也是今年MaxCompute上推出的MaxFrame框架的理念。
数据处理系统对成本敏感,有时用更高密的存储系统存数仓,但为了不浪费系统,又会在上面布很多GPU。高密集群对网络和GPU要求苛刻,这两个系统很可能是存算分离的。数据系统偏治理、偏管理,计算系统偏计算,通过远程方式连接。为了让计算不等数据,我们做了数据集加速DataSetAcc——本质是一个data cache,无缝连接远程存储节点,帮助算法工程师在背后把数据拉到本地内存或SSD上,供计算使用。

通过上述方式,AI和大数据平台有机结合起来,才能去做创新。比如训练通义系列模型时,大量互联网数据需要清洗去重——正是因为我们把两套系统结合得好,很容易在大数据平台完成数据清洗,结果直接灌给模型训练。

前文主要讲大数据如何支撑AI模型训练。另一方面,AI也可以反过来助力数据洞察,走向“BI+AI”的数据处理模式。

在数据处理环节,AI可以帮助数据分析师更简单地构建分析。原来要写SQL、学习工具与数据系统交互。AI时代改变了交互方式——通过自然语言就能跟数据系统对话。比如Copilot编程助手辅助生成SQL,完成数据开发各环节,大幅提升效率。

另外,AI还能做自动数据洞察。比如一份数据中unique key有多少,适合用什么方式做可视化,都可以借助AI获得。AI能从各个角度观察数据、理解数据,实现自动数据探查、智能查询、图表生成、一键生成分析报表等——这就是智能分析服务。

在大数据和AI的共同推动下,近年来出现了许多令人振奋的科技进展。要想在潮流中占得先机,就必须做好大数据和AI的联动。只有两者相辅相成,才能实现更快的AI迭代加速和更深的数据理解。以上是本次分享的核心内容,谢谢大家。
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
Ondo将于今日上线股票永续合约
电视剧《罗曼诺夫后裔》剧情介绍
暗黑4S14野蛮人终局BD攻略
《三角洲行动》S10赛季卡邮件技巧详解-三种方法及风险提示
如何在火狐浏览器中彻底禁用自动更新功能?
区块链OTC交易所有哪几家比较正规?
手机qq浏览器误删文件如何找回-手机qq浏览器误删除文件怎样恢复
360浏览器如何设置网页缩放比例
《三角洲行动》GTI超人成就解锁攻略-满辐射状态击杀技巧详解
全链网:戴蒙或继续担任摩根大通首席执行官三年
什么是山寨币?山寨币指数如何查看?全球前10大山寨币盘点
Binance新增15种bStocks代币化证券为杠杆抵押资产
Sophon正在关闭其Layer2区块链并迁移到Base
全球十大加密货币APP v3.11.5正版下载
异环1.2前瞻什么时候
《三角洲行动》ASh-12战斗步枪改装攻略-省钱与击杀方案详解
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc