来源:互联网 更新时间:2026-08-04 14:28
Gradient AI 最近做了一件挺有意思的事:他们把 Llama-3 的 8B 和 7B 模型,通过渐进式训练,硬生生把上下文长度从 8k 一口气扩展到了 262k、524k,甚至突破了一百万。

今天,Gradient AI 正式宣布成功将 Llama-3 系列模型的上下文窗口扩展到超过 100 万 token——而且,70B 规模的模型在“大海捞针”(NIAH)测试中取得了满分。要知道,Llama 3 原生只支持 8000 个 token 的默认上下文,大约相当于 6000 字或 10 页文档。现在这个扩展意味着模型能够一次性处理《哈利·波特》前五本书的总量,相当惊人。
这种扩展带来的直接好处是:模型能够在一个任务里吸收更大量的信息,生成和理解文本的精确度和相关性自然水涨船高。
要实现这么大的跨越,Gradient 采用了一套渐进式训练方法。简单说,就是让模型从短序列开始学起,慢慢过渡到目标长度,而不是一上来就挑战百万 token 这种极限。这种“小步快跑”的策略,有助于模型逐步掌握处理长文本的技巧,训练过程也稳定得多。
核心步骤:从较短的文本序列起步,逐步拉长训练样本的长度。每一步都让模型适应新的挑战,稳扎稳打地提升长序列处理能力。
这种做法最大的好处是避免了初期的训练困难——如果上来就扔给模型百万 token,梯度可能直接爆炸。渐进式增长保证了训练的稳定和高效。
技术细节:为了高效管理超长序列带来的计算负担,Gradient 引入了 RingAttention 库来优化注意力机制,使其能扩展到极长的序列。同时,EasyContext Blockwise 技术负责把长文本分块处理,进一步提升速度并降低内存需求。
实际效果:训练和推理速度明显加快,在大规模 GPU 集群上部署和运行也更游刃有余。
目的:利用神经切线核(NTK)理论来指导模型参数的初始化与调整,使之适配不同长度的文本。
具体实施:通过缩放法则和 NTK-aware 的参数插值,动态调整 RoPE(旋转位置编码)中的 theta 参数,确保模型在不同上下文长度下都能发挥最佳性能。
数据集:使用了大规模图像-文本配对数据集和纯文本数据集的组合,通过交错训练平衡视觉与文本信息的处理能力。
数据增强:引入多种数据增强策略,让训练数据更丰富,提升模型对不同文本类型的适应性和鲁棒性。
部署环境:模型在 Crusoe Energy 提供的高性能 L40S 集群上训练,这些集群配备了先进的 GPU 和高速网络连接,支持大规模并行处理。
Ondo将于今日上线股票永续合约
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
区块链OTC交易所有哪几家比较正规?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
异环伊洛伊阵容怎么搭配
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
潜水员戴夫丛林DLC接吻的鱼任务攻略
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Windows环境下Claude Code从C盘迁移至D盘的完整操作教程
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
币安投票上币与下币机制解析:买票争议与规则边界
合集38个项目筹集5.406亿美元 Figure融资2亿
微软Copilot AI漏洞可致敏感数据泄露,企业用户需及时更新
《探索流放之路物品等级的奥秘》 揭秘物品等级的效果和怎么查看
逆战未来s3出什么新角色 逆战未来S3赛季新角色爆料
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc