热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >黄仁勋最新访谈:下一代软件公司的操作系统是_Harness

黄仁勋最新访谈:下一代软件公司的操作系统是_Harness

来源:互联网 更新时间:2026-07-18 08:06

就在最近,黄仁勋在一场26分钟的深度对话里,全程没提GPU、算力、模型参数这些老生常谈的话题。他把所有注意力都集中在一个命题上:程序员必须从“写代码”切换到“造Agent”。

LangChain团队基于Nemotron 3 Ultra模型,配合Harness系统级优化,在Deep Agents基准测试中拿下了0.86分,和当前最高分0.87只差0.01分。但关键是,单次推理成本从43.48美元降到了4.48美元,压缩了近90%。模型权重没动,真正发生质变的,是模型之外的工程层。

26分钟避谈GPU:黄仁勋在警惕什么?

在和LangChain创始人Harrison Chase的这场公开对话里,黄仁勋全程没聊GPU、芯片迭代、大模型参数这些传统焦点。他盯住了一个更本质的问题:当Agent已经能自主调用工具、编排流程、闭环执行任务,企业的工程重心到底该放在哪?

答案很清晰,也很坚定:减少重复性编码,加大面向目标交付的Agent构建力度。

他打了个比方:掌握打字技能固然重要,但这不等于成了作家。同理,写得出语法正确的Python代码,只是基础能力,已经不能等同于交付一个能跑、能验证、能维护的Agent系统。工程师的核心职责正在迁移——得去定义Agent能看见什么、能用哪些工具、怎么恢复异常、最终输出该由谁验收。

生成式AI解决了“能写出来”的问题,但Agent工程要回答的,是“能不能跑通、对不对、失败了怎么办、过程能否审计”。

Harness:被长期低估的“智能工作台”

黄仁勋反复强调一个概念:Harness。它涵盖的远不止是Prompt工程,还包括工具描述规范、记忆管理、上下文裁剪、任务分解逻辑、重试策略、效果评测框架,以及权限管控体系。模型只管推理,Harness负责把推理变成可交付、可度量、可追责的工作流。

公开信息已经证实,LangChain在Deep Agents评测中没动Nemotron 3 Ultra的模型权重,只是重构了系统级Prompt、精细化工具接口说明和中间件逻辑。结果很明显:得分从初始水平直接跳到0.86,和闭源最强模型0.87只差0.01。但单次评测开销从43.48美元骤降到4.48美元,降幅接近90%。

这张图一目了然:同一模型放在不同的Harness架构里,实际能力释放程度差异巨大。评估Agent系统时,光看模型榜单已经严重失准。对开发团队来说,“执行轨迹”正变得越来越像“测试日志”——它不仅能定位分数损失点,还能把一次偶发失败沉淀成可复现、可回归的验证用例。持续积累的Prompt模板、工具契约、轨迹样本和评测数据集,迟早会变成组织独有的Agent工程资产。

成本降低10倍,改写的不是预算表,而是研发范式

黄仁勋点出了一个关键:成本骤降带来的根本性改变,不是让旧任务变便宜,而是彻底重塑开发节奏和决策逻辑。Agent完成一项复杂任务,经常需要多轮推理、跨工具协同,甚至并行探索多种路径。如果每次尝试成本都高,团队自然会保守——压缩评测频次、限制策略探索范围。

成本下探释放了三种能力:

第一是“多试”

——同步比对模型选型、Prompt结构、工具链组合和重试机制;

第二是“常测”

——把评测深度嵌入CI/CD流程和线上监控体系;

第三是“广布”

——把过去只服务核心场景的Agent,规模化部署到长尾业务流程里。

合理的推演路径是:当开源模型加上Harness调优的成本足够低,企业会普遍采用“前沿模型先行探路,高频任务后续固化”的双轨策略。问题刚出现、边界模糊时,依赖前沿模型快速验证上限;等任务反复出现、验收标准稳定后,再收敛成轻量、专用、高确定性的Agent实例。这里的“专用化”,不局限于模型微调层面。真正构筑护城河的,是企业私有的工具语义体系、业务术语词典、权限策略图谱、历史执行轨迹和真实验收反馈数据——它们共同定义了Agent对这家公司的“理解深度”。

未来企业的数字基座将筑于Harness之上,但密钥绝不可直交Agent

黄仁勋抛出了一个更具前瞻性的判断:未来企业的核心能力,会越来越多地构建在Harness这个新基础设施上。传统时代,业务流程固化在ERP、CRM和刚性审批流里;Agent时代,部分流程会进化成“输入目标+可用工具+权限约束+验收标准→系统自主规划执行路径”。Harness,就是承载这些动态业务规则的新容器。

这也解释了为什么开放技术栈被反复强调:企业需要完全掌控自己的记忆库、轨迹数据库、评测资产和调优记录,并自主决定部署位置和运行环境。但当Agent能直接调用终端命令、读写数据库、调用内部API时,它已经超越了聊天机器人,成为具备真实行动力的软件进程。

NemoClaw蓝图整合了Deep Agents Code、Nemotron 3 Ultra和OpenShell运行时。模型负责认知推理,Harness负责任务调度和上下文治理,OpenShell在沙箱中执行代码,对网络访问、凭证使用、文件操作和日志输出实施细粒度策略管控。

黄仁勋划了一条明确红线:Agent不得持有长期有效密钥。更安全的做法是,由运行时根据当前任务上下文和预设策略,动态授予最小必要权限,确保Agent只在指定时间窗口、限定作用域内访问必需资源。

落地到工程层面,至少需要清晰回答四个问题:

  • 它代表谁的身份执行操作?
  • 哪些指令被允许执行?
  • 出错时怎么终止或回滚?
  • 谁有权完整复盘整个执行链路?

缺失这些边界控制,Agent能力越强,潜在风险面就越广。

勿将Agent视作同事,它首先是受控的生产软件

Harrison Chase提了一个敏感问题:当Agent用自然语言协作、行为模式越来越像人,我们该不该给它拟人化身份?黄仁勋的回应很冷静:自然语言确实是高效交互界面,但不能因此模糊权责边界。Agent可以设定角色名和职能标签,但不能因为语气笃定就被默认可信,更不能因为“像同事”就绕过权限校验和结果验证。

判定任务是否完成,必须依赖外部可观测证据:单元测试是否全绿、代码Diff是否符合预期、数据是否落库到指定位置、审批链是否完整留痕。它宣称“已完成”,只是一个待验证的中间输出。适度拟人化有助于团队建立协作直觉,但工程治理必须坚持去人格化原则:每次工具调用绑定明确身份,每项高危操作触发策略审查,每个最终产出经独立验证器确认。

业内已有企业试点为Agent分配“虚拟员工编号”和“组织汇报关系”,但据可查资料,这类实践仍属早期探索,尚未形成通用标准或行业共识。

程序员的核心能力清单正在被重写

黄仁勋对职业演进的判断延续了他一向的供给端视角:当数字服务的单位生产成本持续下降,社会需求不会停滞在原有规模,反而会催生大量此前因成本过高而被搁置、因优先级不足而被延后的新型需求。对程序员来说,真正的变革不在于“是否还要写代码”,而在于工作重心的结构性迁移。

模板填充、格式转换、重复性调试这些机械劳动,会加速由Agent承接;而任务建模、系统架构、评测体系设计、权限治理体系搭建、异常处理机制设计,正成为更高阶的核心能力。这一转变未必保障所有岗位原封不动。随着软件供给能力指数级提升,新兴角色会从“亲手执行每一步”转向“设计一套可持续交付结果的系统”。个体能否受益,取决于能否成功跨越这次职责边界的迁移。

最后缺失的不是更强模型,而是一整套Agent工程栈

把黄仁勋的论述整合成一张完整的工程全景图:

  • 模型层

    :专注基础推理能力;
  • Harness层

    :承担计划制定、记忆管理、工具调度;
  • 运行时层

    :实现安全隔离与受控执行;
  • 评测与护栏层(Evals & Guardrails)

    :保障输出质量与合规底线。

任一层缺失,Agent都难以脱离Demo阶段。

这个架构也隐含了团队落地路径:先锚定真实业务任务构建可量化评测,再驱动模型和Harness协同运转;接着补齐沙箱环境、身份认证、全链路日志和人工接管机制;最后才进入规模化部署和成本精细化运营阶段。模型能力会持续进化,但企业真正需要长期深耕的,是与自身数据资产、工具生态、权责体系深度耦合的工程环境。黄仁勋所说的Harness,极有可能成为下一代软件企业的核心基础设施层。

结语

这场访谈最有价值的地方,是黄仁勋把行业焦点从“谁家模型更强”拉回到“系统如何构建”。LangChain公布的实测数据提供了有力佐证:0.86分和0.87分的微小差距,4.48美元和43.48美元的巨大成本落差——胜负手不在模型本身,而在Harness。

当Agent从演示走向真实生产,企业竞争的本质,会从“是否接入先进模型”转向“能否将自身业务流程、权限规则与验收标准,稳定、可靠、可迭代、可审计地封装进一套Agent系统”。Harness,就是那个承托一切的容器。谁先建成它,谁的Agent才能真正入职上岗,而不是永远停留在聊天框里。

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc