来源:互联网 更新时间:2026-08-27 13:53
Data+AI 已经成为数据架构领域最火热的技术方向,没有之一。把这个概念拆开来看,其实藏着两条截然不同但又紧密咬合的技术路径:一条叫“Data for AI”,另一条叫“AI for DataWarehouse”。前者讲的是怎么把海量结构化、半结构化和非结构化数据,跟深度学习、大模型训练做到深度协同——这里面技术挑战不少;后者则是反过来,用AI能力去改造数据仓库本身,而数据治理是目前大家最关心、也是最能看到效果的一个方向。能不能真正用AI把数据仓库的智能管理水平提上去,是另一个关键难题。
接下来,我就结合阿里云在
先梳理一下这个大方向。Data+AI 一体化,目前能清晰分出两个技术分支:
Data+AI 开发的全生命周期很长——数据分析、数据预处理、模型创建、训练、评估、预测、部署发布……涉及的角色也多元:业务人员、数据工程师、数据分析师、数据科学家,每个环节都环环相扣。
在这个全生命周期里,核心挑战集中在三个维度:
总之一句话:在行业标准还没落地的当下,所有技术产品实践,都是在不断尝试解决成本、效率、运维这三个方向上的具体问题。
这部分重点聊聊 MaxCompute 在 Data+AI 一体架构上的产品架构实践。
先看分层架构。底层是数据层,统一元数据服务、分布式存储、对象存储。其中半结构化数据(比如JSON)的优化处理,是个不小的挑战。中间层是计算层,包括数据处理、模型开发、训练和管理。平台提供了交互式开发的 Notebook、统一开发调度平台 DataWorks、可视化建模的 PAI Designer 等。亮点是自研的分布式计算框架 MaxFrame 和自定义镜像管理——它们支持统一的 Python 编程接口,能构建大模型应用的数据预处理算子,实现分布式高效计算,还能管理第三方包和模型镜像。
MaxCompute Data+AI 产品架构的核心功能,可以拆成四大组件:
MaxCompute 支持统一数据管理,通过 MaxFrame 做数据预处理,结果直接集成到 PAI 机器学习平台进行模型开发。然后使用 PAI-DLC 分布式AI训练平台进行分布式训练优化,再通过 PAI 的镜像管理能力管理各类模型,最后用 PAI-EAS 自动化推理组件实现在线模型部署与发布。整个链路是通的。
第一个核心能力是 Notebook,提供 Web 交互式开发环境,支持多引擎与 MaxCompute 集成,结果可以直接输送到机器学习平台。内置丰富函数库,数据安全也有保障。
第二个核心能力是自研的 MaxFrame。它支持统一 Python 编程接口,算子灵活兼容;还能实现大数据、离线、AI任务统一编排的 Data+AI 一体化 Pipeline。开箱即用的开发体验,复用 MaxCompute 计算资源和数据接口,在大规模数据处理、数据可视化、科学计算、ML/AI 开发等场景下都能用。
这里有个实际案例。我们用 MaxFrame 对开源大模型项目 RedPajama 提供的数据集做预处理——数据清洗、文档去重、水印去除、数据过滤等。结果呢?使用 MaxFrame 框架,比用开源算子做预处理,整体耗时节省了
第三个核心能力是非结构化数据处理。现在国内外都特别关注非结构化数据的接入和管理——毕竟 Data+AI 的重要需求之一就是处理非结构化数据。我们做了个抽象:把对象存储中的数据映射成表格式,通过 Python 编程接口或 SQL 语法就能便捷查询或检索。缓存加速、查询优化、列式数据裁剪这些能力,本质上是把智能数仓的AI特性用到了非结构化数据管理上。
目前应用最多的就是 MaxCompute 与 PAI 的组合。多类型数据存储、统一元数据管理、数据分析/AI数据预处理——MaxCompute 为经典机器学习场景提供了通用算法。而 PAI 平台套件(PAI-DLC 分布式训练、模型仓库、PAI-EAS 推理服务、AI 镜像管理)把整个链路顺畅地串联了起来。
这部分聊聊怎么用AI让云原生数仓更智能——也就是 AI for DataWarehouse 方向的产品探索。
分层存储是数仓产品的标配功能,但我们现在在尝试更进一步:智能推荐、自动分层。比如根据数据访问量自动推荐冷存或归档,或者根据存储时间和使用场景在冷热存储之间自动转化,最终目标就是不断降低存储成本。
物化视图本质上是一种预计算——把那些耗时操作(JOIN、AGGREGATE)的结果保存下来,查询时直接复用,加速计算。现在AI正在深度改造这个领域,比如提供物化视图推荐等智能化能力。
智能数仓这块,包括基于AI的数据治理:统一元数据管理、作业计算统计分析来助力SQL提速。作业管理优化的目标是“最多跑一次”——同样计算在新数据到来时,能根据已有数据结构自动加速或路由分发,不用每次都重新加载和计算。资源分配、查询计划优化也是重点。其中比较关键的是基于学习的查询优化器(learning-based query optimizer),利用大模型或传统机器学习的AI能力,提供更自动化的计算查询优化体验。
大数据里数据分布倾斜是个老问题,需要通过智能数据重分布实现自动化的数据分布优化,减少倾斜。最终目标:智能数仓全面自动化。
MaxCompute 成本优化器是一个产品组件,它根据近30天预付费资源请求情况,模拟当前资源配置下的满足度和作业延迟,然后生成推荐变配方案。
另外,DataWorks Copilot 智能助手——阿里云一站式数据开发治理平台 DataWorks 打造的AI助手,能辅助用户完成数据开发和数据分析。目前与 MaxCompute 做了整合,基于历史SQL和数据进行训练,提供 Copilot 能力。比如输入“统计一下今天的销售额”,就能生成相应SQL,实测准确率在80%以上。
最后一部分,分享一下 MaxCompute 在大数据+大模型应用上的最佳实践。
在 Data+AI 领域,数据预处理是最常见的场景,文本去重又是其中最重要的一环——从海量数据里找出真正有价值的内容。具体流程包括:数据读取、文本分词、计算Hash、近似最近邻搜索、原始文本去重。

文本去重的第一步,可以用开源或自定义的镜像部署到 MaxFrame 机器学习平台,平台会加载相应的分布式模型。
第二步,MaxCompute Notebook 对裸数据进行清洗、文本分词、Hash 计算等,然后提交到 MaxFrame 上分布式执行。整个链路在交互式开发环境里就能完成。
性能对比数据:对8亿条原始数据进行处理(包含多个算子),MaxCompute 相比开源算子在性能上提升70%以上,环境准备效率提升10%到30%。
第二个实践是基于大规模图片的处理——主要是非结构化数据处理。流程包括:基于 MaxCompute 创建弹性资源池,通过 MaxFrame 并发读取 OSS 数据,调用第三方算子进行图片渲染,实现分布式数据读取和计算。
最后总结一下 MaxCompute 4.0 的 Data+AI 整体产品架构。底层是统一元数据管理,能接入结构化、半结构化、非结构化数据存储。中间层是围绕 MaxFrame 的分布式AI数据计算框架——不同的 DAG 分别处理数据预处理、智能数仓、对接AI分布式训练 PAI-DLC、多类型镜像管理,这些子 DAG 都由 MaxFrame 的 DAG driver 框架统一调用编排。上层则是统一的交互式开发平台 MaxCompute Notebook,实现全栈大数据+AI 开发。底层统一开放、中间层多场景AI计算训练、上层统一交互——这套三层架构,随着业务实践的深入,很有希望成为未来 Data+AI 领域的行业技术标准。我们拭目以待。
以上就是本次分享的核心内容,希望能给正在探索 Data+AI 一体架构的朋友们一些启发。
腾讯ima怎么把微信内容一键导入知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
腾讯ima怎么创建共享知识库?
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
WorkBuddy微信版怎么获得积分?
5000元起的鼠标哪个最值得入手?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
车载冰箱重置到出厂设置几步?
SPX6900(SPX)币是什么?SPX币价格走势分析及未来展望
腾讯ima知识库怎么分类管理?
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
博世壁挂炉关闭暖气怎么操作
男生高性价比充电头?
管线机怎么接云米净水器
kimi提示词专家使用方法新手指南
5000-6000元鼠标有什么推荐?
WorkBuddy积分怎么获得?
Windy卫星云图怎么看?云层变化识别技巧
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc