来源:互联网 更新时间:2026-08-03 14:24
调参这件事,说是深度学习的“手艺活”一点也不为过。前面聊了一些基础,接下来我们把剩下的核心技巧逐一拆解。从损失函数到数据验证,每一步都有门道,值得细细品味。
调参,做笔记是基本功。而且切记:每次只动一个参数,否则出了效果你都不知道功臣是谁,出了问题也找不到元凶。
那么,有哪些参数值得重点调?
损失函数,是模型和数据以外第三重要的参数。选MSE、Cross entropy、Focal还是自定义?没有标准答案,得具体问题具体分析。分类任务和回归任务天然不一样,样本不平衡时Focal往往有奇效。
注:
不要过早early stopping,有时候收敛平台在后半段才出现。
对于数据量巨大的推荐系统模型,一个epoch足矣,再多就过拟合了。
注:NLP、抽象层次高或目标函数不平滑的任务,优先用Adam;其他任务可以试试SGD(一般需要的迭代次数多于Adam)。
过拟合和欠拟合是训练中绕不开的两个坎,直接影响模型的泛化能力——也就是在未见数据上的表现。
从实践经验来看:过拟合首先上dropout,然后加batch norm。过拟合越严重,dropout和BN就加得越多。有时候直接在embedding层加dropout,会有预料之外的效果。
Linear/CNN常用Kaiming uniform或normalize,Embedding常用截断normalize。相关论文很多,可以深入看看。
GN、BN和LN都是神经网络中常用的归一化方法。BN指Batch Normalization,LN指Layer Normalization。
GN与LN、IN有密切关系,这两者在循环网络(RNN/LSTM)和生成网络(GAN)中尤其成功。
基于backbone构建层次化的neck,通常比直接使用最后一层输出效果好。reduce function方面,attention通常优于简单pooling。多任务场景需要构建不同的QKV。
随机数种子一定要设定好,否则很多对比实验的结论可能并不准确。
交叉验证方式要结合具体任务和数据标签设计。时序数据务必避免未来信息泄漏。
开发新模型时,最开始不要加激活函数、不加batch norm、不加dropout——纯模型先跑通。然后再一步一步加组件,验证每个改动的作用。不要迷信经典结构(除非是预训练模型),比如觉得加了dropout一定有效、加了BN一定有提升就一股脑全加上。首先要判断模型处于欠拟合还是过拟合阶段,再对症下药。
对于图像和NLP任务,如果效果一直提不上去,可以尝试自己标注一些模型经常分错的bad case,加入训练集后往往会有意想不到的收获。
Ondo将于今日上线股票永续合约
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
区块链OTC交易所有哪几家比较正规?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
异环伊洛伊阵容怎么搭配
《探索流放之路物品等级的奥秘》 揭秘物品等级的效果和怎么查看
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
潜水员戴夫丛林DLC接吻的鱼任务攻略
电视剧《白领公寓》剧情介绍
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Windows环境下Claude Code从C盘迁移至D盘的完整操作教程
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
币安投票上币与下币机制解析:买票争议与规则边界
合集38个项目筹集5.406亿美元 Figure融资2亿
蚂蚁庄园今日答案最新2026.7.5
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc