来源:互联网 更新时间:2026-07-04 15:01
当AI公司还在读论文,Bio公司已经让AI做完了实验。
没错,又一热门AI赛道,被国产玩家率先跑通了——

时至今日,这个赛道几乎挤满了最不缺算力的一批硅谷玩家:
OpenAI发GPT-Rosalind,专攻药物发现和基因组学;谷歌推Co-Scientist和ERA,把多Agent系统塞进科学推理流程;Anthropic上线面向科研流程的Claude Science工作台。
虽然大家想的都是让大模型读完论文后,写个「完美」的实验方案,再真正走进实验室,但奈何现实很骨感:
就拿最接近终点的OpenAI和Ginkgo Bioworks的合作来说,GPT-5在那个项目里负责的是实验设计和参数探索,真正在实验台上执行的Catalyst protocols,全部由Ginkgo的人类工程师编写。
换句话说,强如OpenAI,模型也没有真正接触到「做实验」这一层。

△图源:OpenAI官网
不过现在,全球第一个补上这关键一步的来了。
从自然语言实验意图到湿实验物理执行,完整闭环,真实验证。
这一次,让AI「真正走进实验室」的不是哪家AI巨头,是一家跨界做AI的中国Bio公司。
这事估计连老黄都没想到:年初他在CES上说,「Physical AI的ChatGPT时刻」到了,说的是机器人和自动驾驶。但现在,
为什么硅谷这帮最不缺算力的玩家,集体卡在了实验室门口?
要回答这个问题,其实只需要弄清楚一件事:

让我们从AI for Bio这个赛道的真实进展说起。
过去几年,AI在生命科学领域的应用多聚焦于「理解」和「分析」。文献阅读、知识问答、序列比对、蛋白质结构预测,模型确实博学,但它本质上是个坐在屏幕后面的助理。
Agent时代来了之后,事情开始变了。AI不再只满足于回答问题,它开始「设计和行动」。应此潮流,以OpenAI、Anthropic为代表的前沿AI玩家,开始把目光投向更下游、更主动的方向:假设生成、实验设计、参数空间探索、药物发现、蛋白工程、自动化实验。
听起来是不是已经很接近「让AI进实验室干活」了?但现实情况是——还差得很远。
当下AI for Bio最真实的现状就一句话:

△图片由AI生成
这中间几乎隔着一整条转换链。ProtoPilot的论文拆得很清楚:一个实验意图要变成湿实验台上的真实操作,需要穿过五层——科学意图、Protocol(方案设计)、SOP(标准操作流程)、设备代码,再到物理执行和反馈修正。而每一层都要解决不同的模糊性,比如Protocol要表达生物逻辑、样本谱系和质控结构;SOP要把逻辑落到可操作的体积、浓度、耗材和温控条件上;设备代码要绑定deck布局、孔位映射、液体处理动作和厂商SDK指令……就这一套下来,只要有任一环节出错,实验就可能失败。
所以,当AI for Bio的竞争从「模型能不能回答生命科学问题」转向「模型能不能走完从屏幕到实验台的全链路」时,行业真正缺的也就浮出水面了。
需要提醒的是,这两件事都不是坐在屏幕前就能凭空设计出来的,它们必须来自真实实验室:真实任务、真实设备、真实约束、真实失败和真实专家判断。
所以现在你明白,为啥两家国产团队选择联手了:坐拥全栈生命科学设备、自动化实验平台、AI4Science经验和丰富真实实验场景的
ProtoPilot和BioLab Bench,具体如何填补行业空白?仔细扒了扒论文,答案渐渐清晰。
先说多智能体系统ProtoPilot。
目前AI for Bio赛道上,能打通Design2Protocol、Protocol2Code、设备执行与湿实验反馈验证的系统仍然极少,大多还停留在分段优化阶段,
怎么个「全链路贯通」?举个例子:当你用自然语言对ProtoPilot说「构建8个GLuc突变体」,它就能把这句话拆解成科学合理的Protocol,识别可用设备,转化为可执行的工作流代码,下发到物理设备执行,并根据湿实验反馈持续修正和进化。

注意,这不是聊天机器人,也不是单一设备的脚本生成器。ProtoPilot背后是多个Agent在协同发力:Orchestrator Agent统筹全局工作流状态,Protocol Expert Agent生成实验方案和SOP,Coding Agent将方案转化为设备可执行代码。三个Agent各司其职,逐层推进。通过这种行业主流的「多Agent协同工作」方案,它成功解决了三个过去卡死行业的「老大难」。
就这几招下去,ProtoPilot能交出下面这份硬核成绩单,真不意外。
别的不说,行业公认「试金石」ProtocolQA总得挑战一下吧。ProtocolQA由AI4S领域的顶级机构FutureHouse推出,是专门考察AI对实验流程理解与故障排查能力的第三方独立benchmark。OpenAI家目前最顶的GPT-5.6 Sol的系统卡中也收录了该benchmark结果。
结果呢?在开放式问答上,GPT-5.6 Sol得分43.5%,距离人类专家54%还有明显差距;

在Protocol任务上,ProtoPilot综合评分94.7(满分100),在所有8个评估维度上几乎全线领跑。参数合理性98.9、方法学一致性97.7、内容完整性98.4,全部碾压通用大模型和专用Bio Agent。

盲评中,三位独立湿实验科学家在不知道系统身份的情况下,70.6%的情况将ProtoPilot排在第一,90.2%的情况将ProtoPilot排在前三。从下图也能一眼看出,ProtoPilot生成的方案普遍更受科学家喜爱。


但光有脑子还不够,还得手脚利索。


说完了选手,再说考场。
现有的第三方benchmark,比如刚才提到的ProtocolQA,考的还是实验理解和知识问答。但AI for Bio真正要回答的问题,从来不是「你懂不懂实验」,而是「你能不能把实验跑出来」。
这就是BioLab Bench要填的坑,它衡量的核心只有一件事:

和传统的生物benchmark的区别在哪?以前的考试是做阅读理解,看你懂不懂实验原理,而BioLab Bench考的是真上手——从实验意图到方案、SOP、设备代码,一路到真实执行,全链路打通。而且它还能跨平台检验。同一个任务,换到不同自动化设备上,看Agent能不能适应。说到底,ProtocolQA这类测评考的是「知不知」,BioLab Bench考的是「做不做得到」。
系统有了,考场也有了,剩下的问题只有一个:
忙着「搭桥修路」这么久,总得让人看到实际成果。
ProtoPilot用四组递进难度的湿实验给出了回答。(湿实验指真实实验台操作,和纯计算模拟相对应)




显然,这就不是纸面分数了。这是从需求理解、流程生成、自动化执行、结果验证到异常修正的完整闭环,在真实实验台上真刀真枪跑出来的。
系统跑通了,数据打完了,湿实验也验过了。问题只剩下一个:为什么交出这份答卷的,是一家中国Bio公司?
正是在这样的背景下,涌生智能这家公司的出现也就不那么让人意外了:

△图片由AI生成
当然了,一家成立仅几个月的公司能快速拿出新成果,底气无疑离不开其母公司
所以,一切都很清楚了:
这是一条和硅谷完全不同的路线。头部AI公司选择scale compute,用更大的算力推高通用模型能力;而涌生智能则从真实实验世界出发,基于国产开源模型,结合自研Bio Agent Harness架构,通过真实实验数据回流与Agent协同驱动系统进化,将任务执行、设备约束、专家反馈与湿实验结果统一纳入训练闭环。路线不同,结果说话。

而这种差异,也很快体现在产品层面:
有意思的是,Anthropic的Claude Science平台瞄准的下一站,正是干湿闭环。

而涌生智能和上海人工智能实验室这次联合发布的,已经是干湿闭环了。一家跨界做AI的中国Bio公司,不仅抢在硅谷前面交卷,更用一条完全不同的路线证明:
回到开头。年初黄仁勋在CES上说,Physical AI的下一站是机器人和工厂,但物理世界还有一块他没圈到的版图:
涌生智能和上海人工智能实验室的这次联手,释放了一个明确信号:AI for Bio的竞争,正在从「谁的模型更强」转向「谁的闭环更完整」。
论文:https://arxiv.org/abs/2606.31763
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
WorkBuddy微信版怎么获得积分?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
5000元起的鼠标哪个最值得入手?
腾讯ima知识库怎么分类管理?
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
博世壁挂炉关闭暖气怎么操作
男生高性价比充电头?
车载冰箱重置到出厂设置几步?
Windy卫星云图怎么看?云层变化识别技巧
WorkBuddy积分怎么获得?
5000-6000元鼠标有什么推荐?
管线机怎么接云米净水器
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc