Pytorch 多块GPU的使用详解

作者:R.X.Geng 时间:2021-01-21 09:19:09 

注:本文针对单个服务器上多块GPU的使用,不是多服务器多GPU的使用。

在一些实验中,由于Batch_size的限制或者希望提高训练速度等原因,我们需要使用多块GPU。本文针对Pytorch中多块GPU的使用进行说明。

1. 设置需要使用的GPU编号


import os

os.environ["CUDA_VISIBLE_DEVICES"] = "0,4"
ids = [0,1]

比如我们需要使用第0和第4块GPU,只用上述三行代码即可。

其中第二行指程序只能看到第1块和第4块GPU;

第三行的0即为第二行中编号为0的GPU;1即为编号为4的GPU。

2.更改网络,可以理解为将网络放入GPU


class CNN(nn.Module):
 def __init__(self):
   super(CNN,self).__init__()
   self.conv1 = nn.Sequential(
   ......
   )

......

self.out = nn.Linear(Liner_input,2)

......

def forward(self,x):
   x = self.conv1(x)
   ......
   output = self.out(x)
   return output,x

cnn = CNN()

# 更改,.cuda()表示将本存储到CPU的网络及其参数存储到GPU!
cnn.cuda()

3. 更改输出数据(如向量/矩阵/张量):


for epoch in range(EPOCH):
 epoch_loss = 0.
 for i, data in enumerate(train_loader2):
   image = data['image'] # data是字典,我们需要改的是其中的image

#############更改!!!##################
   image = Variable(image).float().cuda()
   ############################################

label = inputs['label']
   #############更改!!!##################
   label = Variable(label).type(torch.LongTensor).cuda()
   ############################################
   label = label.resize(BATCH_SIZE)
   output = cnn(image)[0]
   loss = loss_func(output, label)  # cross entropy loss
   optimizer.zero_grad()      # clear gradients for this training step
   loss.backward()         # backpropagation, compute gradients
   optimizer.step()
   ... ...

4. 更改其他CPU与GPU冲突的地方

有些函数必要在GPU上完成,例如将Tensor转换为Numpy,就要使用data.cpu().numpy(),其中data是GPU上的Tensor。

若直接使用data.numpy()则会报错。除此之外,plot等也需要在CPU中完成。如果不是很清楚哪里要改的话可以先不改,等到程序报错了,再哪里错了改哪里,效率会更高。例如:


 ... ...
   #################################################
   pred_y = torch.max(test_train_output, 1)[1].data.cpu().numpy()

accuracy = float((pred_y == label.cpu().numpy()).astype(int).sum()) / float(len(label.cpu().numpy()))

假如不加.cpu()便会报错,此时再改即可。

5. 更改前向传播函数,从而使用多块GPU

以VGG为例:


class VGG(nn.Module):

def __init__(self, features, num_classes=2, init_weights=True):
   super(VGG, self).__init__()
... ...

def forward(self, x):
   #x = self.features(x)
   #################Multi GPUS#############################
   x = nn.parallel.data_parallel(self.features,x,ids)
   x = x.view(x.size(0), -1)
   # x = self.classifier(x)
   x = nn.parallel.data_parallel(self.classifier,x,ids)
   return x
... ...

然后就可以看运行结果啦,nvidia-smi查看GPU使用情况:

Pytorch 多块GPU的使用详解

可以看到0和4都被使用啦

来源:https://blog.csdn.net/qazwsxrx/article/details/89672578

标签:Pytorch,GPU
0
投稿

猜你喜欢

  • keras Lambda自定义层实现数据的切片方式,Lambda传参数

    2021-03-18 09:16:20
  • Go语言基础函数基本用法及示例详解

    2024-05-09 14:57:15
  • Golang编译器介绍

    2024-05-02 16:26:01
  • vue服务端渲染添加缓存的方法

    2024-04-30 10:37:30
  • 深入理解Mysql事务隔离级别与锁机制问题

    2024-01-23 21:33:26
  • 解决python 3 urllib 没有 urlencode 属性的问题

    2022-03-31 12:42:44
  • 使用SQL Server判断文件是否存在后再删除(详解)

    2024-01-19 13:03:33
  • MySQL中UNION与UNION ALL的基本使用方法

    2024-01-25 21:34:03
  • python合并RepeatMasker预测结果中染色体的overlap区域

    2021-12-28 21:29:35
  • 基于python中staticmethod和classmethod的区别(详解)

    2023-09-30 22:03:32
  • go解析svn log生成的xml格式的文件

    2024-03-13 15:13:34
  • python实现烟花小程序

    2022-10-02 09:45:23
  • 使用NetBox 编译 asp 为exe应用程序

    2009-11-29 16:13:00
  • Python pip安装第三方库实现过程解析

    2022-01-04 02:17:31
  • xmlHTTP技术资料

    2008-01-05 13:39:00
  • 利用python GDAL库读写geotiff格式的遥感影像方法

    2023-08-31 13:15:06
  • 在Vue组件上动态添加和删除属性方法

    2024-04-09 10:59:10
  • vue实现菜单切换功能

    2024-05-03 15:12:08
  • 为什么要进行CSS缩写?

    2007-10-29 12:56:00
  • vue修改滚动条样式的方法

    2024-04-27 15:48:59
  • asp之家 网络编程 m.aspxhome.com