解决PyTorch报错“cublas runtime error : library not initialized”

在运行深度学习训练代码时,遇到GPU显存不足导致的RuntimeError。通过排查发现是由于另一个处于debug状态的CUDA程序占用显存。停止该程序后,问题得到解决。

运行一段深度学习的training代码时遇到如下错误:

  File "train_mdnet.py", line 69, in train_mdnet
    neg_regions = neg_regions.cuda()
  File "/home/dodge/anaconda3/envs/py27_for_pytorch020/lib/python2.7/site-packages/torch/autograd/variable.py", line 279, in cuda
    return CudaTransfer.apply(self, device_id, async)
  File "/home/dodge/anaconda3/envs/py27_for_pytorch020/lib/python2.7/site-packages/torch/autograd/_functions/tensor.py", line 151, in forward
    return i.cuda(async=async)
  File "/home/dodge/anaconda3/envs/py27_for_pytorch020/lib/python2.7/site-packages/torch/_utils.py", line 66, in _cuda
    return new_type(self.size()).copy_(self, async)
RuntimeError: cuda runtime error (2) : out of memory at /opt/conda/conda-bld/pytorch_1511304568725/work/torch/lib/THC/generic/THCStorage.cu:66

经查阅PyTorch社区,发现该问题主要可能由两方面的原因引起:

  1. GPU显存不足
  2. GPU缓存没有清理干净

检查主机实际运行情况,发现还有一个CUDA程序处于debug状态,应该是显存不够了所致,停止该程序,问题解决。

评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值