来源:互联网 更新时间:2026-07-18 07:53
视觉AI智能体正在从概念走向落地,变成一种切实可行的方式,将物理世界中的视频数据自动转化为工厂、城市、仓库乃至交通系统里的运营智能。这种转变的加速,背后有一个清晰的趋势:AI工作负载正在向数据生成的位置靠拢。
Gartner的预测给出了具体的数字:到2028年,超过三分之二的企业管理数据将在数据中心或云端之外生成和处理;到2029年,全球超过三分之二的企业将部署边缘AI,而2025年这个比例仅为10%(1)。但问题在于,边缘数据的增长并不会自动带来智能的跃升。同一份报告指出,高达90%的现有边缘数据其实从未被处理过。
那么,如何将这些海量数据转化为有用的行动?答案是视觉AI智能体。它们需要能够理解视频内容、适应现实世界的各种条件,并且把洞察与实际的运营工作流连接起来。这些智能体通常运行在摄像头、机器和传感器附近,因此模型必须满足延迟、功耗、成本和连接性的严苛要求,同时还要适应特定现场的实际环境。
对开发者而言,这意味着需要一套可重复的方法论:用来生成训练数据、微调模型,并在边缘和云端部署智能体视频应用。NVIDIA Metropolis智能体技能和蓝图正是为此而生,为开发者提供了可复用的工作流,覆盖从构建、运行到优化视觉AI智能体的整个生命周期。
在仿真模拟和合成数据方面,通用场景描述(OpenUSD)提供了一个通用框架,用于描述、组合和复用3D世界。基于OpenUSD构建的NVIDIA Omniverse库,则帮助团队构建仿真模拟、合成数据生成和数字孪生工作流,能够对现实世界环境进行建模,并扩展场景覆盖范围——涵盖照明、天气、交通模式、摄像头角度、遮挡和罕见事件等复杂条件。
组织转向自主视觉智能体时,通常会遇到三个绕不开的挑战:
NVIDIA智能体技能和蓝图,与基于OpenUSD的仿真和合成数据生成工具NVIDIA Omniverse、以及模型开发和视频AI部署平台NVIDIA Metropolis结合使用,能为开发者提供可复用的起点,覆盖工作流的关键部分:
开发者无需从头重建每个步骤,而是可以直接使用这些可复用的工作流,更快速地生成数据、改进模型并部署视觉AI智能体。
在制造业中,一个工厂越成功地预防缺陷,就越难收集到足够的缺陷样本来训练下一个检测模型。这是一个典型的“好问题”。
Roboflow正将NVIDIA缺陷图像生成技能和NVIDIA Cosmos世界基础模型集成至其视觉AI平台,当真实训练数据稀缺时,为康宁等客户生成合成缺陷图像。结果不仅实现了优秀的检测性能,还显著减少了人工图像审查的需求。
在与康宁光纤制造工程团队进行的一项基准测试中,一个仅使用8张真实缺陷图像(通过NVIDIA缺陷图像生成技能生成的合成数据增强)训练的模型,在具有挑战性的缺陷类别上达到了95%的平均精度和出色的召回率。这一性能超过了仅使用真实数据训练的基准模型,将一个原本需要历时多个季度的检测项目压缩到了短短几天内。
观看视频,了解合成数据生成工作流如何帮助开发者创建训练和改进物理AI模型所需的数据:
大规模城市运营展示了为什么视觉AI智能体需要的是相互连接的工作流,而不仅仅是推理。
Linker Vision正在使用适用于VSS的NVIDIA Metropolis Blueprint构建智慧城市AI系统,加速在城市基础设施中部署视频推理智能体。在这一工作流中,VSS技能可以将搜索、摘要、警报、报告和流管理等常见视频AI任务打包成可复用且可由智能体执行的工作流。
基于OpenUSD的NVIDIA Omniverse数字孪生帮助建模城市环境,并测试视觉AI系统如何应对不同的交通模式、天气条件、紧急事件和基础设施变化。Linker Vision使用NVIDIA Cosmos进行视频数据增强,并使用NVIDIA TAO进行Cosmos模型微调。
在高雄,Linker Vision使用VSS蓝图将开发工作量减少了85%,并将事件响应时间缩短了高达80%。其较新的AI-GRID扩展基于这种方法,结合用于安全智能体AI的NVIDIA NemoClaw蓝图,支持城市和交通环境中的自主视频推理。
在工业环境中,挑战不仅仅在于检测视频帧中间出现的内容。团队需要智能体能够理解工作是否被正确执行,对比执行与标准操作程序,并在缺陷转移到下游之前生成洞察。
在Foxconn,DeepHow的实时标准操作程序(SOP)验证智能体使用NVIDIA Metropolis VSS蓝图作为智能体视频工作流层,用于跨运营环境的搜索、摘要和分析。NVIDIA Cosmos提供推理能力,帮助智能体在上下文中解释复杂的人类活动和工作序列,例如组装步骤是否按预期顺序正确执行。
该解决方案已在NVIDIA Grace Blackwell Ultra服务器生产线上使用,可将一次交验合格率提高3%,在关键SOP步骤的微动作理解中实现99%的任务级准确率,并通过帮助团队尽早发现问题来减少冗余工作。
(来源:Gartner,《预测2026:物理AI将I&O推向边缘》,2026年3月3日。Gartner是Gartner, Inc.和/或其关联公司的商标。)
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
腾讯ima怎么把微信内容一键导入知识库?
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
2026热门直线加速赛车手游推荐:高人气、爽快加速体验的精品榜单
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
Windy卫星云图怎么看?云层变化识别技巧
kimi提示词专家使用方法新手指南
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
原神霜月三处月灵龛具体位置汇总
《幻兽帕鲁》不触发通缉捕捉传说商人方法
短剧《史上最强洪荒修为》剧情介绍
9条破亿视频,新号涨粉百万,过去半年谁在制造AI爆款?
为什么推特KOL都在BRC20赚钱 我一冲就亏?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
炼金工房新作或能吃成“良子” 想让女主越吃越丰满
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc