名字不能取太长 2024-05-29 23:28 采纳率: 76.7%
浏览 10
已结题

关于模型训练的一个问题

我的模型训练的一开始(大约1/10的阶段)指标长的非常快,但是后面指标就一直在震荡,不再上涨或者是几次震荡后只有非常微小的增长,请问这是怎么回事?我的训练集只有800个样本,是否是因为模型层数太多导致这个问题?我的模型是由Transformer块堆叠而成。请不要使用AI回答

  • 写回答

14条回答 默认 最新

  • -Agony 2024-05-30 07:28
    关注

    在震荡前下调学习率,比如用step减半:或者一开始设置的就比较大,以及batch size较小导致训练不稳定

    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(13条)

报告相同问题?

问题事件

  • 系统已结题 6月7日
  • 已采纳回答 5月30日
  • 修改了问题 5月29日
  • 修改了问题 5月29日
  • 展开全部

悬赏问题

  • ¥15 metadata提取的PDF元数据,如何转换为一个Excel
  • ¥15 关于arduino编程toCharArray()函数的使用
  • ¥100 vc++混合CEF采用CLR方式编译报错
  • ¥15 coze 的插件输入飞书多维表格 app_token 后一直显示错误,如何解决?
  • ¥15 vite+vue3+plyr播放本地public文件夹下视频无法加载
  • ¥15 c#逐行读取txt文本,但是每一行里面数据之间空格数量不同
  • ¥50 如何openEuler 22.03上安装配置drbd
  • ¥20 ING91680C BLE5.3 芯片怎么实现串口收发数据
  • ¥15 无线连接树莓派,无法执行update,如何解决?(相关搜索:软件下载)
  • ¥15 Windows11, backspace, enter, space键失灵