热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai教程 >见证历史,AI想的科研idea,真被人类写成论文发表了

见证历史,AI想的科研idea,真被人类写成论文发表了

来源:互联网 更新时间:2026-08-02 07:11

直接看论文内容,干货都在里面。

Claude提的idea,被人类写成论文了

翻开“AI科学家”之前撰写的论文,能找到Jeff Clune提到的那一篇。

《Grokking Through Compression: Unveiling Sudden Generalization via Minimal Description Length》——通过压缩实现Grokking,借助最小描述长度揭示突然泛化现象。

据描述,这篇论文的想法由Claude 3.5 Sonnet在第22次迭代时提出。核心探讨的是神经网络中最小描述长度(MDL)与“grokking”现象(模型长时间训练后突然泛化)的关系,从信息论视角切入,研究突然泛化的机制。

MDL可以看作一种衡量模型复杂度和可压缩性的方法:模型既要拟合数据,又不能过于复杂(以免过拟合)。

具体来说,研究引入了一种基于权重剪枝的新型MDL估计技术,并应用于模块化算术和排列任务等多种数据集。实验揭示了一个强烈相关性:MDL减少与泛化能力提升几乎同步发生,MDL的转变点通常在“grokking”事件之前或与之重合。

此外,研究观察到“grokking”与非“grokking”情境下MDL演变模式的差异:前者表现为快速的MDL减少后持续泛化。这些发现为理解“grokking”的信息论基础提供了线索,也表明训练期间监控MDL可以预测即将发生的泛化。

了解原论文后,再来看人类选手最新发表的内容。

概括而言,他们研究了神经网络在“grokking”现象中的复杂性动态——即网络从记忆训练数据到实现完美泛化的过渡过程,并提出了一种基于失真压缩理论的新方法来衡量神经网络的复杂性。

作者之一Branton DeMoss自述,他们受到了Sean Carroll和Scott Aaronson之前研究的启发。DeMoss团队将这一直觉形式化,并应用于神经网络,以跟踪网络学习的抽象复杂度。

展开来说,作者们先介绍了grokking现象:神经网络在长时间过度拟合训练数据后突然能够泛化的能力。图中x轴表示优化步数,y轴表示准确率;红线代表训练集准确率,绿线代表验证集准确率。可以看到,训练一个小型Transformer,几百步后模型已完美拟合训练数据,但直到大约10^5步才能实现泛化。

为解释这一现象,团队引入了一种基于失真压缩和Kolmogorov复杂性的新方法来衡量神经网络复杂性,并通过该框架追踪grokking过程中网络复杂性的动态变化。按作者的比喻,这就像“神经网络的JPEG”。

研究结果表明,网络从记忆到泛化的过渡中,复杂性先上升,随后在泛化发生时下降。进一步研究发现,如果神经网络没有任何形式的正则化(防止过拟合的技术),它将无法从记忆过渡到泛化,而是无限期保持记忆模式。

没有正则化的反应:

有正则化的反应:

此外,作者指出传统的复杂性评判标准(如参数数量和权重范数)并不能准确描述模型复杂性,因为它们忽略了训练过程中的变化。他们采用最小描述长度(MDL)原则和Kolmogorov复杂度来定义和近似复杂性,并通过实验验证了这种方法,强调了简单模型在数据压缩中的优势。最终,研究表明理解复杂性对预测模型泛化能力至关重要。

更多细节可查阅原论文。可以看出,一个由AI最初提出的想法,最终由人类完成了更细致的论证。有网友分析指出,AI写的那篇实验结果不及人类研究员。

之前撰写“AI科学家”总论文的共同一作Cong Lu也表示:

顺便一提,在Sakana AI公布“AI科学家独立生成10篇学术论文”的消息后,公司9月份还拿到了一笔2亿美元的A轮融资,英伟达也有参与。总之,AI以后不仅能自己写论文,还能和人类搭配干活了。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc