来源:互联网 更新时间:2026-07-18 08:06
就在最近,黄仁勋在一场26分钟的深度对话里,全程没提GPU、算力、模型参数这些老生常谈的话题。他把所有注意力都集中在一个命题上:程序员必须从“写代码”切换到“造Agent”。

LangChain团队基于Nemotron 3 Ultra模型,配合Harness系统级优化,在Deep Agents基准测试中拿下了0.86分,和当前最高分0.87只差0.01分。但关键是,单次推理成本从43.48美元降到了4.48美元,压缩了近90%。模型权重没动,真正发生质变的,是模型之外的工程层。
在和LangChain创始人Harrison Chase的这场公开对话里,黄仁勋全程没聊GPU、芯片迭代、大模型参数这些传统焦点。他盯住了一个更本质的问题:当Agent已经能自主调用工具、编排流程、闭环执行任务,企业的工程重心到底该放在哪?
答案很清晰,也很坚定:减少重复性编码,加大面向目标交付的Agent构建力度。
他打了个比方:掌握打字技能固然重要,但这不等于成了作家。同理,写得出语法正确的Python代码,只是基础能力,已经不能等同于交付一个能跑、能验证、能维护的Agent系统。工程师的核心职责正在迁移——得去定义Agent能看见什么、能用哪些工具、怎么恢复异常、最终输出该由谁验收。
生成式AI解决了“能写出来”的问题,但Agent工程要回答的,是“能不能跑通、对不对、失败了怎么办、过程能否审计”。
黄仁勋反复强调一个概念:Harness。它涵盖的远不止是Prompt工程,还包括工具描述规范、记忆管理、上下文裁剪、任务分解逻辑、重试策略、效果评测框架,以及权限管控体系。模型只管推理,Harness负责把推理变成可交付、可度量、可追责的工作流。
公开信息已经证实,LangChain在Deep Agents评测中没动Nemotron 3 Ultra的模型权重,只是重构了系统级Prompt、精细化工具接口说明和中间件逻辑。结果很明显:得分从初始水平直接跳到0.86,和闭源最强模型0.87只差0.01。但单次评测开销从43.48美元骤降到4.48美元,降幅接近90%。

这张图一目了然:同一模型放在不同的Harness架构里,实际能力释放程度差异巨大。评估Agent系统时,光看模型榜单已经严重失准。对开发团队来说,“执行轨迹”正变得越来越像“测试日志”——它不仅能定位分数损失点,还能把一次偶发失败沉淀成可复现、可回归的验证用例。持续积累的Prompt模板、工具契约、轨迹样本和评测数据集,迟早会变成组织独有的Agent工程资产。
黄仁勋点出了一个关键:成本骤降带来的根本性改变,不是让旧任务变便宜,而是彻底重塑开发节奏和决策逻辑。Agent完成一项复杂任务,经常需要多轮推理、跨工具协同,甚至并行探索多种路径。如果每次尝试成本都高,团队自然会保守——压缩评测频次、限制策略探索范围。
成本下探释放了三种能力:
合理的推演路径是:当开源模型加上Harness调优的成本足够低,企业会普遍采用“前沿模型先行探路,高频任务后续固化”的双轨策略。问题刚出现、边界模糊时,依赖前沿模型快速验证上限;等任务反复出现、验收标准稳定后,再收敛成轻量、专用、高确定性的Agent实例。这里的“专用化”,不局限于模型微调层面。真正构筑护城河的,是企业私有的工具语义体系、业务术语词典、权限策略图谱、历史执行轨迹和真实验收反馈数据——它们共同定义了Agent对这家公司的“理解深度”。
黄仁勋抛出了一个更具前瞻性的判断:未来企业的核心能力,会越来越多地构建在Harness这个新基础设施上。传统时代,业务流程固化在ERP、CRM和刚性审批流里;Agent时代,部分流程会进化成“输入目标+可用工具+权限约束+验收标准→系统自主规划执行路径”。Harness,就是承载这些动态业务规则的新容器。
这也解释了为什么开放技术栈被反复强调:企业需要完全掌控自己的记忆库、轨迹数据库、评测资产和调优记录,并自主决定部署位置和运行环境。但当Agent能直接调用终端命令、读写数据库、调用内部API时,它已经超越了聊天机器人,成为具备真实行动力的软件进程。
NemoClaw蓝图整合了Deep Agents Code、Nemotron 3 Ultra和OpenShell运行时。模型负责认知推理,Harness负责任务调度和上下文治理,OpenShell在沙箱中执行代码,对网络访问、凭证使用、文件操作和日志输出实施细粒度策略管控。

黄仁勋划了一条明确红线:Agent不得持有长期有效密钥。更安全的做法是,由运行时根据当前任务上下文和预设策略,动态授予最小必要权限,确保Agent只在指定时间窗口、限定作用域内访问必需资源。
落地到工程层面,至少需要清晰回答四个问题:
缺失这些边界控制,Agent能力越强,潜在风险面就越广。
Harrison Chase提了一个敏感问题:当Agent用自然语言协作、行为模式越来越像人,我们该不该给它拟人化身份?黄仁勋的回应很冷静:自然语言确实是高效交互界面,但不能因此模糊权责边界。Agent可以设定角色名和职能标签,但不能因为语气笃定就被默认可信,更不能因为“像同事”就绕过权限校验和结果验证。
判定任务是否完成,必须依赖外部可观测证据:单元测试是否全绿、代码Diff是否符合预期、数据是否落库到指定位置、审批链是否完整留痕。它宣称“已完成”,只是一个待验证的中间输出。适度拟人化有助于团队建立协作直觉,但工程治理必须坚持去人格化原则:每次工具调用绑定明确身份,每项高危操作触发策略审查,每个最终产出经独立验证器确认。
业内已有企业试点为Agent分配“虚拟员工编号”和“组织汇报关系”,但据可查资料,这类实践仍属早期探索,尚未形成通用标准或行业共识。
黄仁勋对职业演进的判断延续了他一向的供给端视角:当数字服务的单位生产成本持续下降,社会需求不会停滞在原有规模,反而会催生大量此前因成本过高而被搁置、因优先级不足而被延后的新型需求。对程序员来说,真正的变革不在于“是否还要写代码”,而在于工作重心的结构性迁移。
模板填充、格式转换、重复性调试这些机械劳动,会加速由Agent承接;而任务建模、系统架构、评测体系设计、权限治理体系搭建、异常处理机制设计,正成为更高阶的核心能力。这一转变未必保障所有岗位原封不动。随着软件供给能力指数级提升,新兴角色会从“亲手执行每一步”转向“设计一套可持续交付结果的系统”。个体能否受益,取决于能否成功跨越这次职责边界的迁移。
把黄仁勋的论述整合成一张完整的工程全景图:
任一层缺失,Agent都难以脱离Demo阶段。

这个架构也隐含了团队落地路径:先锚定真实业务任务构建可量化评测,再驱动模型和Harness协同运转;接着补齐沙箱环境、身份认证、全链路日志和人工接管机制;最后才进入规模化部署和成本精细化运营阶段。模型能力会持续进化,但企业真正需要长期深耕的,是与自身数据资产、工具生态、权责体系深度耦合的工程环境。黄仁勋所说的Harness,极有可能成为下一代软件企业的核心基础设施层。
这场访谈最有价值的地方,是黄仁勋把行业焦点从“谁家模型更强”拉回到“系统如何构建”。LangChain公布的实测数据提供了有力佐证:0.86分和0.87分的微小差距,4.48美元和43.48美元的巨大成本落差——胜负手不在模型本身,而在Harness。
当Agent从演示走向真实生产,企业竞争的本质,会从“是否接入先进模型”转向“能否将自身业务流程、权限规则与验收标准,稳定、可靠、可迭代、可审计地封装进一套Agent系统”。Harness,就是那个承托一切的容器。谁先建成它,谁的Agent才能真正入职上岗,而不是永远停留在聊天框里。
七麦数据官网网页地址 七麦数据官方入口在线首页
问卷星官方网站入口地址 问卷星网页版在线使用
币安Binance官方中文网站 币安App最新版下载及新手注册指南
闲鱼的严选验货在哪里看?闲鱼严选和验货宝哪个可靠
PokePay加密卡2026完整指南:申请开卡全攻略+多场景应用技巧
淘宝直播如何看回放在哪里看?怎么查看淘宝直播回放
摩托车活塞环性能如何
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
豆包AI专业版使用教程【新手必看】
索尼限时赠送PS Plus Premium七日会员,需手
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
《梦幻西游》特殊鬼怪怎么抓-隐藏变异鬼应对要点
币圈十大实用工具:从实时行情监控到数据分析、资产管理
王者荣耀「西行封妖记」【孙权-仙扇使者】6月25日上线!
闲鱼严选和验货宝哪个可靠?闲鱼的验货宝怎么样,,
币安杀入美股市场,重头戏bStocks还没来
陈姓和杨姓网名大全男生(精选100个)
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc