来源:互联网 更新时间:2026-08-11 16:47
AI领域正在经历一场范式转变——突破不再来自单一模型,而是来自多个大语言模型(LLMs)与其他复杂组件的编排组合。因此,如何为这类复合AI系统设计合理且自动的优化方法,成了当前最紧迫的挑战之一。
回顾历史,神经网络早期也面临过类似困境,直到反向传播和自动微分出现,才让优化成为核心驱动力,彻底改变了整个领域。受此启发,我们来看一项新工作:
TEXTGRAD遵循PyTorch的语法和抽象,灵活且易用。只要用户提供目标函数,无需调整框架组件或提示,就能开箱即用。我们在多个任务上验证了它的有效性:从问答、分子优化到放射治疗计划。例如,在不修改框架的前提下,TEXTGRAD将GPT-4o在Google-Proof问题回答中的零样本准确率从51%提升到55%,在LeetCode-Hard编码问题解决方案上获得20%的相对性能提升,改进了推理提示,设计了具有理想体内结合力的类药小分子,并做出了高特异性的放射肿瘤治疗计划。TEXTGRAD为加速下一代AI系统的开发奠定了基础。
原文:Automatic "Differentiation" via Text
地址:https://arxiv.org/abs/2406.07496
代码:https://github.com/zou-group/textgrad
出版:arXiv
机构: 斯坦福大学
本文的核心问题是:如何设计一个通用且自动的框架,来优化由多个大语言模型及其他复杂组件构成的复合AI系统。
举个具体的例子:一个由两部分组成的问答系统——第一部分是LLM,根据给定提示(Prompt)和问题(Question)生成答案(Prediction);第二部分是另一个LLM,根据评估指令(Evaluation Instruction)和第一部分的答案给出评分(Evaluation)。现在的挑战是:如何自动调整第一部分的提示,让整个系统的最终评分尽可能高?
这个问题之所以棘手,主要源于几个特性:
针对这些挑战,TEXTGRAD提出了一种基于“文本反馈自动微分”的思路。
它的核心是将复合AI系统表示为一个计算图,图中的变量可以是任意非结构化数据(代码、分子式、自然语言文本等),边上的函数可以是任意复杂的不可微算子(如LLM调用、数值模拟器等)。给定一个下游目标后,TEXTGRAD会通过LLM产生的文本反馈(称为“文本梯度”)来自动指导每个变量的优化方向。就像PyTorch等框架通过链式法则自动计算导数一样,TEXTGRAD也能利用文本梯度的“链式传播”实现端到端的优化。对于图中的每条边(每个子函数),框架会提示LLM分析其输入、输出以及已有的输出梯度,进而“反向传播”出输入变量的梯度。通过迭代优化,最终让整个系统在目标函数上取得进展。值得一提的是,这个框架可以无缝集成外部工具(如代码解释器、分子对接模拟器),并在多种场景下开箱即用。
TEXTGRAD通过反向传播自然语言反馈来优化AI系统。它把系统表示成一个计算图,节点是变量,边是计算。变量可以是输入、输出或中间结果,值可以是文本、图像等非结构化数据,函数可以是LLM调用、仿真器或其他工具。
举个栗子:一个由两个LLM调用组成的简单系统:
其中第一个LLM根据提示和问题生成预测,第二个LLM根据指令对预测进行评估。我们希望优化提示来改善整体评估分数。
TEXTGRAD的核心是为变量计算自然语言“梯度”,这个梯度就是告诉我们需要如何修改变量值才能改善目标。反馈由LLM生成,形式比如“这个预测可以通过……来改进”。
得到梯度后,TEXTGRAD使用Textual Gradient Descent(TGD)来更新变量。TGD基于LLM,以当前变量值和梯度反馈为输入,生成新的变量值。直观上,LLM充当了“优化器”,以智能的方式修改变量。
总的来说,TEXTGRAD通过LLM提供的自然语言反馈,实现了类似于PyTorch中自动微分和优化的能力,从而灵活优化各种复杂AI系统。

前面以两个LLM调用的例子说明,但实际上它可以应用于任意复杂的计算图。对于图中任意变量,它的梯度由其所有后继节点的梯度经过该函数的backward函数计算得到。接受当前变量的值、所有后继节点的值以及它们的梯度作为输入,生成反馈。要计算一个变量的反馈,需要看它在图中所有直接用途,也就是如何参与生成后继,以及还需要如何改进。
得到任意变量的梯度后,就可以用TGD更新。通过前向传播计算变量值,反向传播计算梯度,并用TGD更新,整个系统就能被优化。这很像PyTorch等框架训练神经网络的过程。
TEXTGRAD主要关注两类优化问题:实例优化和提示优化。
实例优化中,将问题的解(如代码、答案、分子结构)作为变量,直接优化这个解以改进目标。例如,给定一个编程问题,把代码解构建为变量,通过TEXTGRAD迭代优化代码,使其在测试用例上表现更好。
提示优化中,则希望找到一个LLM的输入提示,使其在某个任务上整体表现更好。例如,找到一个数学题的提示,让LLM在所有数学问题上都表现好,而不是某个特定问题。这里优化变量是提示,loss在多个样本上评估。通过优化,得到的提示可以很好地泛化。
尽管目标不同,但在TEXTGRAD中,处理方式是统一的。实例优化可看作只有一个样本的提示优化。
除了基础TGD更新,TEXTGRAD还支持多种优化技术。比如batch optimization,一次评估多个样本的loss,综合起来传播梯度(通过tg.sum操作实现,类似PyTorch的torch.sum)。
还有constrained optimization,通过自然语言描述约束条件,在变量更新时让LLM满足这些条件,比如要求“答案最后一行必须以‘Answer: $VALUE’格式给出”。这能更好地控制生成结果。
TEXTGRAD还支持momentum,更新变量时参考之前的变量值,平滑优化轨迹。这些技术大多借鉴了经典梯度下降法的思想,只不过用自然语言反馈替代了数值梯度。
通过以上设计,TEXTGRAD成为一个通用的优化框架,为构建下一代AI系统奠定了基础。
实验在多个场景下展示TEXTGRAD的灵活性和有效性,包括代码优化、科学问题解答、推理任务、药物分子设计和放射治疗计划优化。复杂任务被表示为计算图,利用LLM的自然语言反馈进行优化,无需针对特定任务手工调整框架。

目的:在LeetCode Hard数据集上优化代码,提高gpt-4o的性能。
涉及图表:表1
实验细节:以代码为优化变量,利用局部测试信息和自我评估迭代优化,每次迭代3次LLM调用。
结果:TEXTGRAD将gpt-4o的通过率从23%提高到36%,超过Reflexion方法的31%。
目的:在科学问题数据集上优化解答,提高gpt-4o的zero-shot表现。
涉及图表:表2
实验细节:以答案为优化变量,通过LLM评估迭代优化,每次迭代3次,最后多数投票得到最终答案。
结果:在GPQA上将gpt-4o准确率从51%提高到55%,在MMLU子集上也有2-4个点的提升。
目的:通过优化提示改进gpt-3.5在推理任务上的性能。
涉及图表:表3
实验细节:以系统提示为优化变量,用gpt-4o评估反馈,批量优化,共36个训练样本,最后在验证集挑选最优提示。
结果:在3个任务上均显著优于零样本CoT提示,与DSPy方法相当或更优。
目的:同时优化分子对靶点的结合能和类药性。
涉及图表:图2、补充图1-3
实验细节:以SMILES分子式为优化变量,用Autodock Vina和QED评分计算loss,迭代10次优化3种初始分子片段。
结果:生成分子在58个靶点上持续改进结合能和类药性,在29个靶点上与临床药物相当,同时具有结构新颖性和安全性。
目的:优化前列腺癌放射治疗中的剂量分布,兼顾肿瘤剂量和保护器官。
涉及图表:图3、补充表1-2
实验细节:以PTV和OAR的权重超参为优化变量,内层用数值优化器matRad得到计划,外层用LLM计算loss,迭代优化权重。
结果:TEXTGRAD对PTV的剂量更加符合临床目标,对直肠膀胱等器官的保护优于人工计划。
本文针对优化包含多个LLM和其他复杂组件的复合AI系统,提出了一种基于文本“反向传播”的自动优化框架TextGrad。它让LLM为计算图中的变量提供富有洞见的自然语言反馈,通过反向传播这些“文本梯度”来优化系统组件。TextGrad采用与PyTorch类似的语法和抽象,使用灵活方便。多个领域的应用表明,无需调整框架即可提升GPT-4等模型的零样本性能,为加速下一代AI系统的开发奠定了基础。
一些思考和延伸方向:
可借鉴的方法点:
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
腾讯ima怎么创建共享知识库?
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
区块链OTC交易所有哪几家比较正规?
2026热门直线加速赛车手游推荐:高人气、爽快加速体验的精品榜单
腾讯ima怎么把微信内容一键导入知识库?
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
原神霜月三处月灵龛具体位置汇总
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
合集38个项目筹集5.406亿美元 Figure融资2亿
Windy卫星云图怎么看?云层变化识别技巧
9条破亿视频,新号涨粉百万,过去半年谁在制造AI爆款?
如何修复Edge浏览器无法通过微软账号进行身份验证?
五菱星光L六座新能源SUV上市:三版可选,中配12.28
kimi提示词专家使用方法新手指南
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc