来源:互联网 更新时间:2026-07-29 15:48
大语言模型的上下文窗口一直是个热门话题,大家都在想怎么让模型记住更多内容。最近微软提出了一种名为LongRoPE的方法,直接把预训练语言模型的上下文窗口扩展到了2048k个标记——也就是超过200万个token。更厉害的是,它在扩展后的同时,还保住了原始短上下文窗口的性能,而且只需要1000步的微调。这听起来比以往许多方案都务实得多。

那么,LongRoPE是怎么做到的?它主要靠三个关键创新撑起了这个“长上下文”大局:
整件事情的逻辑有点像搭积木:从识别非均匀性入手,再到逐步扩展,最后修补短处的短板——每一步都是在为更长、更稳定的上下文窗口铺路。
下面这张图可以帮你直观感受一下,不同插值方法下RoPE嵌入的表现差异:
上图是直接外推的效果,中图是线性位置插值后的重新缩放结果,下图是LongRoPE的做法——它充分利用了前面提到的两种非均匀性,在不同标记位置上对RoPE维度进行变化的插值和外推,效果明显更灵活。
在LLaMA2和Mistral这两个主流模型上,LongRoPE在各类长上下文任务中都展现了很强的竞争力。由于它保留的是原始架构,只是对位置嵌入做了微调,所以大多数已有的优化方法仍然可以直接沿用。实验数据显示,在256k上下文长度内,它在困惑度指标上就已经超过了以往各种位置插值方案。
说到这里,还有一个值得注意的细节:LongRoPE在做扩展时,并不需要额外的微调,训练时只用了128k和256k的上下文窗口,但确实有效地把上下文大小推到了2048k这个极端长度。这个“训练短、推理长”的特点,在实际部署中会显得非常实用。
从论文的实验部分来看,LongRoPE在长文档上的困惑度表现相当低,同时标准基准测试的准确性也没有掉链子。更关键的是,在像密钥检索这类考验长上下文能力的任务中,它的表现尤其出色——甚至能从数百万级别的标记池里准确找到目标密钥,这已经属于“不可思议”的范畴了。
在Hugging Face Open LLM基准测试中,长上下文LLMs与原始LLaMA2和Mistral的比较结果也进一步验证了这一点。
简单总结:LongRoPE给长上下文扩展提供了一个既优雅又实用的新解法,既有理论上的创新点,又有工程上的可落地性。当然,后续是否能在更大范围、更多任务上稳定复现效果,还需要更多实践的检验。不过至少从目前来看,这步棋走得挺稳。
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
Ondo将于今日上线股票永续合约
暗黑4S14野蛮人终局BD攻略
区块链OTC交易所有哪几家比较正规?
什么是山寨币?山寨币指数如何查看?全球前10大山寨币盘点
全球十大加密货币APP v3.11.5正版下载
Binance新增15种bStocks代币化证券为杠杆抵押资产
本周比特币行情预判:BTC后市的三种推演与两强对决
剑侠世界3雪峰论剑怎么打-剑侠世界3雪峰论剑打法介绍
Meme币DOGS今晚上线!开局就解锁91%代币是否带来风险?
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
超长高标准质保+总部直保售后体系:小牛真实售后体验大起底
比特币守住关键支撑,HYPE市值升至第九并反超DOGE
货拉拉如何查看历史订单 货拉拉往期行程轨迹查询【功能教学】
今日小鸡庄园答案2026.7.2
美债股纳斯达克首盘暴跌38%且加密代理交易解体,AVAX价格何去何从?
男生头像配网名可爱(精选100个)
赵云与阿斗神兵符使用教程 神兵符怎么使用
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc