python教程网

当前位置：首页 » python教程 » 正文

pytorch sampler对数据进行采样的实现

看: 1812次时间：2020-12-21 分类 : python教程

PyTorch中还单独提供了一个sampler模块，用来对数据进行采样。常用的有随机采样器：RandomSampler，当dataloader的shuffle参数为True时，系统会自动调用这个采样器，实现打乱数据。默认的是采用SequentialSampler，它会按顺序一个一个进行采样。这里介绍另外一个很有用的采样方法： WeightedRandomSampler，它会根据每个样本的权重选取数据，在样本比例不均衡的问题中，可用它来进行重采样。

构建WeightedRandomSampler时需提供两个参数：每个样本的权重weights、共选取的样本总数num_samples，以及一个可选参数replacement。权重越大的样本被选中的概率越大，待选取的样本数目一般小于全部的样本数目。replacement用于指定是否可以重复选取某一个样本，默认为True，即允许在一个epoch中重复采样某一个数据。如果设为False，则当某一类的样本被全部选取完，但其样本数目仍未达到num_samples时，sampler将不会再从该类中选择数据，此时可能导致weights参数失效。

下面举例说明。

from dataSet import *
dataset = DogCat('data/dogcat/', transform=transform)

from torch.utils.data import DataLoader
# 狗的图片被取出的概率是猫的概率的两倍
# 两类图片被取出的概率与weights的绝对大小无关，只和比值有关
weights = [2 if label == 1 else 1 for data, label in dataset]

print(weights)

from torch.utils.data.sampler import WeightedRandomSampler
sampler = WeightedRandomSampler(weights,\
                num_samples=9,\
                replacement=True)
dataloader = DataLoader(dataset,
            batch_size=3,
            sampler=sampler)
for datas, labels in dataloader:
  print(labels.tolist())

输出：

[2, 2, 1, 1, 2, 1, 1, 2]
[1, 1, 0]
[1, 0, 0]
[0, 0, 1]

github 地址：

https://github.com/WebLearning17/CommonTool

以上这篇pytorch sampler对数据进行采样的实现就是小编分享给大家的全部内容了，希望能给大家一个参考，也希望大家多多支持python博客。

2021-12-20Python 实现图片色彩转换案例
2021-12-20python初学定义函数
2021-12-20图文详解Python如何导入自己编写的py文件
2021-12-20python二分法查找实例代码
2021-12-20Pyinstaller打包工具的使用以及避坑
2021-12-20Facebook开源一站式服务python时序利器Kats详解
2021-12-20pyCaret效率倍增开源低代码的python机器学习工具
2021-12-20python机器学习使数据更鲜活的可视化工具Pandas_Alive
2021-12-20python读写文件with open的介绍
2021-12-20Python生成任意波形并存为txt的实现

搜索

推荐资源

python教程网

当前位置：首页 » python教程 » 正文

pytorch sampler对数据进行采样的实现

看: 1812次 时间：2020-12-21 分类 : python教程

相关文章

搜索

推荐资源

看: 1812次时间：2020-12-21 分类 : python教程