我的模型训练的一开始(大约1/10的阶段)指标长的非常快,但是后面指标就一直在震荡,不再上涨或者是几次震荡后只有非常微小的增长,请问这是怎么回事?我的训练集只有800个样本,是否是因为模型层数太多导致这个问题?我的模型是由Transformer块堆叠而成。请不要使用AI回答
14条回答 默认 最新
- -Agony 2024-05-30 07:28关注
在震荡前下调学习率,比如用step减半:或者一开始设置的就比较大,以及batch size较小导致训练不稳定
本回答被题主选为最佳回答 , 对您是否有帮助呢?解决 无用评论 打赏 举报