PyTorch梯度裁剪避免训练loss nan的操作

作者:一个菜鸟的奋斗 时间:2022-02-16 10:56:23 

近来在训练检测网络的时候会出现loss为nan的情况,需要中断重新训练,会很麻烦。因而选择使用PyTorch提供的梯度裁剪库来对模型训练过程中的梯度范围进行限制,修改之后,不再出现loss为nan的情况。

PyTorch中采用torch.nn.utils.clip_grad_norm_来实现梯度裁剪,链接如下:

https://pytorch.org/docs/stable/_modules/torch/nn/utils/clip_grad.html

训练代码使用示例如下:


from torch.nn.utils import clip_grad_norm_
outputs = model(data)
loss= loss_fn(outputs, target)
optimizer.zero_grad()
loss.backward()
# clip the grad
clip_grad_norm_(model.parameters(), max_norm=20, norm_type=2)
optimizer.step()

其中,max_norm为梯度的最大范数,也是梯度裁剪时主要设置的参数。

备注:网上有同学提醒在(强化学习)使用了梯度裁剪之后训练时间会大大增加。目前在我的检测网络训练中暂时还没有碰到这个问题,以后遇到再来更新。

补充:pytorch训练过程中出现nan的排查思路

1、最常见的就是出现了除0或者log0这种

看看代码中在这种操作的时候有没有加一个很小的数,但是这个数数量级要和运算的数的数量级要差很多。一般是1e-8。

2、在optim.step()之前裁剪梯度


optim.zero_grad()
loss.backward()
nn.utils.clip_grad_norm(model.parameters, max_norm, norm_type=2)
optim.step()

max_norm一般是1,3,5。

3、前面两条还不能解决nan的话

就按照下面的流程来判断。


...
loss = model(input)
# 1. 先看loss是不是nan,如果loss是nan,那么说明可能是在forward的过程中出现了第一条列举的除0或者log0的操作
assert torch.isnan(loss).sum() == 0, print(loss)
optim.zero_grad()
loss.backward()
# 2. 如果loss不是nan,那么说明forward过程没问题,可能是梯度 * ,所以用梯度裁剪试试
nn.utils.clip_grad_norm(model.parameters, max_norm, norm_type=2)
# 3.1 在step之前,判断参数是不是nan, 如果不是判断step之后是不是nan
assert torch.isnan(model.mu).sum() == 0, print(model.mu)
optim.step()
# 3.2 在step之后判断,参数和其梯度是不是nan,如果3.1不是nan,而3.2是nan,
# 特别是梯度出现了Nan,考虑学习速率是否太大,调小学习速率或者换个优化器试试。
assert torch.isnan(model.mu).sum() == 0, print(model.mu)
assert torch.isnan(model.mu.grad).sum() == 0, print(model.mu.grad)

来源:https://blog.csdn.net/u013685264/article/details/106516417

标签:PyTorch,梯度,裁剪,loss,nan
0
投稿

猜你喜欢

  • php 文件缓存函数

    2023-11-06 15:28:47
  • Python递归函数特点及原理解析

    2023-12-02 19:40:40
  • python property的使用技巧分享

    2022-11-18 21:25:51
  • Django的用户模块与权限系统的示例代码

    2023-04-27 14:48:23
  • 设计与用户体验

    2009-05-06 13:36:00
  • Python 编程速成(推荐)

    2021-04-03 04:30:10
  • Python实现读取文件的方法总结

    2021-05-04 00:56:26
  • matplotlib bar()实现百分比堆积柱状图

    2022-06-22 02:05:22
  • asp正则表达式详细说明

    2008-10-23 16:23:00
  • 使用pyinstaller打包PyQt4程序遇到的问题及解决方法

    2023-11-04 11:21:26
  • 几个ASP字符串处理函数

    2008-04-23 12:55:00
  • XML 在使用中产生的二十个热点问题

    2008-05-29 11:07:00
  • 用Python实现定时备份Mongodb数据并上传到FTP服务器

    2021-09-09 03:40:02
  • 详解Python3 pandas.merge用法

    2023-07-04 20:26:48
  • HTML头部属性全接触

    2007-09-05 19:09:00
  • 解决python3 pika之连接断开的问题

    2021-09-28 18:40:09
  • 解决python 打包成exe太大的问题

    2021-09-22 11:33:59
  • 浅谈Scrapy网络爬虫框架的工作原理和数据采集

    2023-08-24 22:17:21
  • python实现ftp文件传输功能

    2023-04-21 13:20:16
  • 解决TensorFlow GPU版出现OOM错误的问题

    2021-09-10 10:27:44
  • asp之家 网络编程 m.aspxhome.com