来源:互联网 更新时间:2026-07-27 14:13
过去两周,有一组实验值得关注。
用小龙虾(OpenClaw)接上 Aloudata CAN 的语义层,从最基础的「上月销售额是多少」问起,一路做到库存全盘诊断、四象限分类、渠道风险分级、补货促销行动方案——四期视频,每一期给 Agent 加一层能力,看它能走多远。
录第四期的时候,Claude Code 源码泄露了。512,000 行 TypeScript,一个顶级 Agent 产品的完整工程图纸摊在桌面上。全世界都在解读它的架构。
这两件事让业界对一个问题的判断变得更加清晰:
不是猜的。是测出来的。
Agent 框架的爆发力有目共睹。但走进真实的企业,现阶段大多数跑起来的 Agent 在做什么——发邮件、填表单、整理会议纪要、生成周报摘要、从 CRM 里捞条记录。
写代码和写文章确实提效了。除此之外?都是浅活。
这些场景有个共同特征:
碰不了的原因,四期实验给了非常清晰的答案。
先说深水区长什么样。
第四期视频用了一个库存场景。一个真正有用的库存 Agent 应该做到:先拉出全品类的售罄率和库销比,交叉分析定位问题商品;然后基于分析结论推导策略——这批该清仓、那批该补货、折扣给几折、补多少件;最后调用业务系统的接口把方案推出去。
Agentic Analysis(自主分析)→ Agentic Strategy(推导策略)→ Agentic Action(执行动作)。人只在关键节点校准方向和确认执行。
四期实验下来,这个闭环能不能跑通,取决于四个因子。
是相乘,不是相加。任何一层拖后腿,整个链路效果就被系统性压低。模型用了最好的,Agent 效果还是不行——不是模型的问题,是别的因子在打折。
接下来逐个拆解。
Agentic Analysis → Agentic Strategy → Agentic Action 这个
第二期实验的数据很触目:同一个模型、同一个数据集,Text-to-SQL 对比语义层,五个最基础的取数问题——坪效差了 253 倍,连带率差了 38%,复购率差了一倍。而且 Text-to-SQL 同一个问题问两次,答案不一样。用公式的框架翻译:
但如果语义层的价值只是「查数准一点」,它在公式里的权重不会这么大。真正让语义层成为企业级 Agent 刚需基础设施的,是实验环境里看不到、但企业场景中无法回避的几个问题。
Claude Code 泄露的架构里,印象最深刻的不是它多强大,而是它多「节省」——工具定义按需加载,初始上下文只放名字和一句话简介;对话历史反复压缩蒸馏;大结果写磁盘,只给模型一个文件路径。整个框架超过一半的工程量花在「怎么少往 context window 里塞东西」。为什么?因为 context window 就是 Agent 的工作台,空间是死的。每塞一段无关信息,就在挤压 Agent 用来思考和推理的空间。Claude Code 的工程师拿着 200K token 的窗口都如此精打细算。
有人会提出「把指标定义写进 Skill」这个方案——它本质上是要求 Agent 用最稀缺的资源(认知预算)承担一本字典的工作。5 个指标没问题,50 个开始吃力,500 个直接崩溃。
改成字典检索好一些,定义不常驻 prompt,按需检索。但
而且真实企业动辄几百上千个指标,口径还不是一成不变的。字典里要持续维护语义的频繁变更,还要期待没有错漏,AI 一定能找到,查对。
语义层的做法则是
实验环境里数据集是固定的,表结构不会变,也没有「定义谁说了算」的组织问题。在企业里这些全是现实。
口径写进 prompt——定义散落在各个 Skill 里,开发者写的,业务不知道。某天坪效的口径变了,prompt 没人更新,Agent 用错误定义跑了两周才被发现。谁的责任?说不清。维护口径字典——好一些,至少集中了。但一份文档没有审批流、没有版本号、没有变更通知。业务改了定义数据团队不知道,数据改了实现业务不知道。
没有这套机制,没有哪个业务负责人敢把 Agent 的分析结果直接用于经营决策——不是不信模型,是出了问题没人兜底。
实验用的是 6 张表、标准星型模型。企业不是。企业的数据散在不同的系统里,每个系统有自己的数据模型和命名习惯。一个「客户综合价值」可能要关联 CRM 的画像、ERP 的交易、WMS 的退货、客服的投诉。让每个 Agent 自己理解这些跨多表的关联和 join 路径,等于要求每个 Agent 各自重建一遍语义层——不现实,而且会产生 N 个互相矛盾的「私有语义层」。
而且企业数据源不是静态的。ERP 升级换表名,业务系统迭代加字段,数仓重构改分层——大企业里这是月度事件。Agent 直写 SQL,每次 schema 变更都可能让所有相关 Agent 同时失效。语义层在这里是稳定契约:底层表怎么变,上层语义接口不变。没有这层抽象,Agent 的维护成本随数据源数量和变更频率指数级增长。
再加上权限和合规——不同角色看到的数据边界不同,监管审计要追溯每次数据访问的完整链路。语义层是在语义级别做权限和审计的唯一归口。
企业数据量级和个人实验完全不同。所有 Agents 各自对着数据湖写 naive SQL,不考虑分区裁剪、不复用物化视图、不做查询路由,计算成本会失控。
语义层因为理解业务语义,可以做查询级的优化——知道「月度收入」已经有物化好的聚合表就不再回扫明细表,知道「华北」的范围就能在查询计划中提前裁剪。这在单个查询上差异不大,但当多 Agent 协作架构下海量 Agents 每天发起成百上千万次数据请求时,语义级优化和无优化之间可能是十倍、百倍的算力成本差。
这就是为什么它是公式中放大效应最显著的因子——不是锦上添花,而是没有它,Agent 根本上不了企业深水区场景的生产环境。
第一期实验里,Agent 接上语义层后可以查数、看趋势、按渠道拆解。很有用,但每一步它给的都是一个数字。
第三期,我们给它装了四个分析 Skill——异常检测、趋势预测、压力测试、报告编排。
第四期是更大的跳跃。我们装了一个库存策略 Skill,里面不是更深的统计方法,而是供应链运营的决策框架——四象限分类、生命周期判断、季节匹配、折扣规则、补货优先级。
一句「帮我看看库存有没有问题」,Agent 跑完全盘扫描后输出了这些:5 个品类的四象限分类(畅销、滞销、过季、断货);连衣裙被标了 P0 紧急清仓;裤子和上衣紧急补货;最终输出 19 个行动项的完整方案——清什么、补什么、折扣多少、补多少件、什么时候复查。
这两期实验验证了 Skill 在公式中的作用——分为两层:
当然,从实验到生产,Skill 管理本身也是一层不小的工程——企业级场景需要分类分级和权限控制、版本管理、变更审计链,以及 Skill 之间的冲突检测与依赖解析。这些 Skill 治理基础设施是从 Demo 走向生产的必经之路。
大模型只会越来越强,模型很重要,但不是差异化的来源。两周的测试里最让人意外的,不是「好模型效果好」而是同一个模型,换一种框架和 Skill 配置,效果天差地别。
框架解决的核心问题是什么?管理 Agent 的认知预算——上下文窗口就这么大,好的框架让模型在有限的台面上高效调度。前面语义层那一节已经拆解过 Claude Code 架构在认知预算管理上的工程量——那些精细到几千 token 都要省的设计,说明框架绝对不是一层「胶水代码」。
但 3 月 31 日之后,框架层的设计思想和工程模式不再是黑箱。
模型在进化,框架正在趋同,Skill 可以累积和迭代——这三个因子起码大于 0。但没有语义层,「数据」这个因子就是负数:Agent 基于错误数据自主推导策略、自主执行动作,结果比不做还糟。
当四个因子到位,深水区的闭环就能跑通:自主分析 → 推导策略 → 执行动作。在实验中已经看到前两环运转的样子。第三环——Agent 通过接口直接调用下游系统完成调价、补货、调拨——需要业务系统的开放和治理体系的成熟,更长期,但方向确定。
行业趋势已经非常清晰,Agent 正在从「人触发、单次执行」走向「持续运行、主动感知」。当 Agent 能主动发现异常,主动启动归因,主动建议策略调整,语义层提供的数据确定性就不再是「重要」,而是生死线。
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
Ondo将于今日上线股票永续合约
区块链存储板块是什么?有哪些?一文详解
暗黑4S14野蛮人终局BD攻略
免费网络收音机软件有哪些?高评分收音机APP推荐
《三角洲行动》S10赛季卡邮件技巧详解-三种方法及风险提示
电视剧《罗曼诺夫后裔》剧情介绍
如何在火狐浏览器中彻底禁用自动更新功能?
区块链OTC交易所有哪几家比较正规?
夸克浏览器AI画质增强功能在旧款手机上无法开启怎么办?
手机qq浏览器误删文件如何找回-手机qq浏览器误删除文件怎样恢复
360浏览器如何设置网页缩放比例
《三角洲行动》GTI超人成就解锁攻略-满辐射状态击杀技巧详解
全链网:戴蒙或继续担任摩根大通首席执行官三年
什么是山寨币?山寨币指数如何查看?全球前10大山寨币盘点
Binance新增15种bStocks代币化证券为杠杆抵押资产
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc