前言
文章性质:实操笔记 📖
数据来源:Download – Cityscapes Dataset
主要内容:本文详细记录了如何转换 Foggy Cityscapes 数据集的标注文件。
冷知识+1:小伙伴们不经意的 点赞 👍🏻 与 收藏 ✨ 可以让作者更有创作动力!
一、数据集准备
1、从官网下载数据集
我们可以从 Cityscapes 官网下载数据集:Download – Cityscapes Dataset ,我们需要下载这三个压缩包:
① gtFine_trainvaltest.zip (241MB) :gtFine_trainvaltest.zip (241MB)
② leftImg8bit_trainvaltest.zip (11GB) :leftImg8bit_trainvaltest.zip (11GB)
③ leftImg8bit_trainvaltest_foggy.zip (30GB) : leftImg8bit_trainvaltest_foggy.zip (30GB)


2、解压后的文件目录
① 文件夹 gtFine_trainvaltest / gtFine 被划分为 train 、test 、val 三个文件夹,然后按照城市划分了子文件夹。
gtFine_trainvaltest
- gtFine
- train(含 aachen 、bochum 、bremen 、cologne 、darmstadt 、dusseldorf 、erfurt 、hamburg 等 18 个城市)
- test(含 berlin 、bielefeld 、bonn 、leverkusen 、mainz 、munich 等 6 个城市)
- val(含 frankfurt 、lindau 、munster 等 3 个城市)
- license.txt
- README
② 文件夹 leftImg8bit_trainvaltest / leftImg8bit 被划分为 train 、test 、val 三个文件夹,然后按照城市划分了子文件夹。
leftImg8bit_trainvaltest
- leftImg8bit
- train(含 aachen 、bochum 、bremen 、cologne 、darmstadt 、dusseldorf 、erfurt 、hamburg 等 18 个城市)
- test(含 berlin 、bielefeld 、bonn 、leverkusen 、mainz 、munich 等 6 个城市)
- val(含 frankfurt 、lindau 、munster 等 3 个城市)
- license.txt
- README
③ 文件夹 leftImg8bit_trainvaltest_foggy / eftImg8bit_foggy 被划分为 train 、test 、val 三个文件夹,然后按照城市划分了子文件夹。
leftImg8bit_trainvaltest_foggy
- leftImg8bit_foggy
- train(含 aachen 、bochum 、bremen 、cologne 、darmstadt 、dusseldorf 、erfurt 、hamburg 等 18 个城市)
- test(含 berlin 、bielefeld 、bonn 、leverkusen 、mainz 、munich 等 6 个城市)
- val(含 frankfurt 、lindau 、munster 等 3 个城市)
- foggy_trainval_refined_filenames.txt
- license.txt
- README_foggy.md
【说明】Foggy Cityscapes 数据集没有标签,可以直接使用 Cityscapes 数据集的标签。
对应关系:Cityscapes 数据集的 1 张原图对应了 Foggy Cityscapes 数据集的 3 张雾图,雾度 beta = [0.005,0.01,0.02] ,分别进行转换能够得到 3 个 Foggy Cityscapes 数据集。
3、解压后 gtFine 格式
由于在 gtFine 文件夹中,只对 train 和 val 中的图片进行了标注,而 test 中的图片是没有标注的,故 test 中的图片我们暂时不使用。
如下图所示,这里的 json 文件和 txt 文件就包含了我们需要的标注信息。

二、转换为 VOC 数据集格式
我们需要先构建 VOC 数据集格式的文件夹,用于存放数据集原本的文件和我们生成的对应文件。
VOCdevkit
- VOC2007
- Annotations
- ImageSets
- train.txt
- val.txt
- JPEGImages
1、生成 xml 标注文件
我们需要根据 gtFine 文件夹中的 json 标注文件得到 xml 标注文件,这是用于格式转换的 json_to_xml.py 文件:
import json
import os
import os.path
from PIL import Image
def position(pos):
# 该函数用来找出 xmin, ymin, xmax, ymax 即 bbox 包围框
x = []
y = []
nums = len(pos)
for i in range(nums):
x.append(pos[i][0])
y.append(pos[i][1])
x_max = max(x)
x_min = min(x)
y_max = max(y)
y_min = min(y)
b = (float(x_min), float(y_min), float(x_max), float(y_max))
return b
def convert_annotation(image_id):
load_f = open(rootdir + '/' + image_id + "_gtFine_polygons.json", 'r') # 导入 json 标签的路径
load_dict = json.load(load_f)
out_file = open(rootdir + '/' + '%s_leftImg8bit.txt' % (image_id), 'w') # 输出标签的路径
objects = load_dict['objects']
nums = len(objects)
cls_id = ''
for i in range(0, nums):
labels = objects[i]['label']
if (labels in ['person', 'rider', 'car', 'truck',
'bus', 'train', 'motorcycle', 'bicycle']):
print(labels)
pos = objects[i]['polygon']
bb = position(pos)
cls_id = labels
out_file.write(cls_id + " " + " ".join([str(a) for a in bb]) + '\n')
if cls_id == '':
print('no label json:', "%s_gtFine_polygons.json" % (image_id))
def images_id(orgin_picture_dir): # 获取训练集每个图像的名称(orgin_picture_dir 训练集图像的路径)
a = []
for parent, dirnames, filenames in os.walk(orgin_picture_dir):
for filename in filenames:
print(filename)
filename = filename.split('_leftImg8bit.png')[0]
a.append(filename)
return a
def xml_generator(orgin_picture_dir, rootdir): # 生成 xml 文件
img_basenames = os.listdir(orgin_picture_dir)
img_names = []
for item in img_basenames:
temp1, temp2 = os.path.splitext(item) # 分别提取图片名称和图片后缀名称(具有 _leftImg8bit)
img_names.append(temp1)
print(img_names)
for img in img_names: # img 是没有后缀的 pic 名称
im = Image.open((orgin_picture_dir + img + '.png'))
width, height = im.size
# open the crospronding txt file
gt = open(rootdir + '/' + img + '.txt').read().splitlines()
# write in xml file
xml_file = open((rootdir + '/' + img + '.xml'), 'w')
xml_file.write('<annotation>\n')
xml_file.write(' <folder>CITYSCAPE</folder>\n')
xml_file.write(' <filename>' + str(img) + '.png' + '</filename>\n')
xml_file.write(' <size>\n')
xml_file.write(' <width>' + str(width) + '</width>\n')
xml_file.write(' <height>' + str(height) + '</height>\n')
xml_file.write(' <depth>3</depth>\n')
xml_file.write(' </size>\n')
# write the region of image on xml file
for img_each_label in gt:
spt = img_each_label.split(' ')
xml_file.write(' <object>\n')
xml_file.write(' <name>' + str(spt[0]) + '</name>\n')
xml_file.write(' <pose>Unspecified</pose>\n')
xml_file.write(' <truncated>0</truncated>\n')
xml_file.write(' <difficult>0</difficult>\n')
xml_file.write(' <bndbox>\n')
xml_file.write(' <xmin>' + str(spt[1]) + '</xmin>\n')
xml_file.write(' <ymin>' + str(spt[2]) + '</ymin>\n')
xml_file.write(' <xmax>' + str(spt[3]) + '</xmax>\n')
xml_file.write(' <ymax>' + str(spt[4]) + '</ymax>\n')
xml_file.write(' </bndbox>\n')
xml_file.write(' </object>\n')
xml_file.write('</annotation>')
def xml_newdir(orgin_picture_dir, rootdir, new_rootdir):
img_basenames = os.listdir(orgin_picture_dir)
img_names = []
for item in img_basenames:
temp1, temp2 = os.path.splitext(item) # 分别提取图片名称和图片后缀名称(具有 _leftImg8bit)
img_names.append(temp1)
print(img_names)
for img in img_names: # img 是没有后缀的 pic 名称
im = Image.open((orgin_picture_dir + img + '.png'))
width, height = im.size
# open the crospronding txt file
gt = open(rootdir + '/' + img + '.txt').read().splitlines()
# write in xml file
xml_file = open((new_rootdir + '/' + img + '.xml'), 'w')
xml_file.write('<annotation>\n')
xml_file.write(' <folder>CITYSCAPE</folder>\n')
xml_file.write(' <filename>' + str(img) + '.png' + '</filename>\n')
xml_file.write(' <size>\n')
xml_file.write(' <width>' + str(width) + '</width>\n')
xml_file.write(' <height>' + str(height) + '</height>\n')
xml_file.write(' <depth>3</depth>\n')
xml_file.write(' </size>\n')
# write the region of image on xml file
for img_each_label in gt:
spt = img_each_label.split(' ')
xml_file.write(' <object>\n')
xml_file.write(' <name>' + str(spt[0]) + '</name>\n')
xml_file.write(' <pose>Unspecified</pose>\n')
xml_file.write(' <truncated>0</truncated>\n')
xml_file.write(' <difficult>0</difficult>\n')
xml_file.write(' <bndbox>\n')
xml_file.write(' <xmin>' + str(spt[1]) + '</xmin>\n')
xml_file.write(' <ymin>' + str(spt[2]) + '</ymin>\n')
xml_file.write(' <xmax>' + str(spt[3]) + '</xmax>\n')
xml_file.write(' <ymax>' + str(spt[4]) + '</ymax>\n')
xml_file.write(' </bndbox>\n')
xml_file.write(' </object>\n')
xml_file.write('</annotation>')
if __name__ == '__main__':
city_name = os.listdir('D:/dataset/Cityscapes/gtFine_trainvaltest/gtFine/val')
print(city_name)
for city in city_name:
rootdir = 'D:/dataset/Cityscapes/gtFine_trainvaltest/gtFine/val/' + city + '/'
orgin_picture_dir = 'D:/dataset/Cityscapes/leftImg8bit_trainvaltest/leftImg8bit/val/' + city + '/'
names = images_id(orgin_picture_dir)
for image_id in names:
print(image_id)
convert_annotation(image_id)
# xml_generator(orgin_picture_dir, rootdir)
new_rootdir = 'D:/dataset/Cityscapes/val/labels-xml/'
if os.path.exists(new_rootdir + city):
pass
else:
os.makedirs(new_rootdir + city)
xml_newdir(orgin_picture_dir, rootdir, new_rootdir + city)

【说明】如图所示,这就是转换后的 xml 标注文件,文件命名与原 json 文件相同。
2、提取 Foggy 数据集
前面提到 Foggy Cityscapes 数据集提供了三种雾度的图像,即 beta=[0.005, 0.01, 0.02] ,我们将 beta=0.01 提取出来作为雾天数据集。
import os
import shutil
# train 训练集
source_dirs = [r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\aachen",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\bochum",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\bremen",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\cologne",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\darmstadt",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\dusseldorf",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\erfurt",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\hamburg",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\hanover",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\jena",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\krefeld",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\monchengladbach",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\strasbourg",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\stuttgart",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\tubingen",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\ulm",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\weimar",
r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\train\zurich",]
target_dir = r"D:\dataset\Cityscapes\train\hazy"
# val 验证集
# source_dirs = [r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\val\frankfurt",
# r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\val\lindau",
# r"D:\dataset\Cityscapes\leftImg8bit_trainvaltest_foggy\leftImg8bit_foggy\val\munster",]
# target_dir = r"D:\dataset\Cityscapes\val\hazy"
for source_dir in source_dirs:
for filename in os.listdir(source_dir):
if "beta_0.01" in filename:
new_name = filename.split('_foggy')[0] + ".png"
source_file = os.path.join(source_dir, filename)
target_file = os.path.join(target_dir, new_name)
shutil.copyfile(source_file, target_file)
print(source_dir)

【说明】如图所示,这就是从 Foggy Cityscapes 数据集中提取的 beta=0.01 雾天图像,图片命名与前面的 xml 标注文件 相对应 。
3、生成 Imagesets 文件
由于在 VOC 格式文件夹中,所有的训练集图像和验证集图像都被统一放在 JPEGImages 文件夹中,因此需要在 Imagesets 文件夹中创建两个文件以区分训练集图像和验证集图像,例如 train.txt 文件中记录了训练集图像的名称,而 val.txt 文件中记录了验证集图像的名称。
import os
# 源文件夹和目标文件路径
xml_folder = r'D:\dataset\Cityscapes\train\labels-xml'
txt_output_folder = r'D:\dataset\Cityscapes\0401-Imagesets'
txt_output_file = os.path.join(txt_output_folder, 'train.txt')
# xml_folder = r'D:\dataset\Cityscapes\val\labels-xml'
# txt_output_folder = r'D:\dataset\Cityscapes\0401-Imagesets'
# txt_output_file = os.path.join(txt_output_folder, 'val.txt')
# 确保输出文件夹存在
if not os.path.exists(txt_output_folder):
os.makedirs(txt_output_folder)
# 获取所有 xml 文件的文件名
xml_files = [f for f in os.listdir(xml_folder) if f.endswith('.xml')]
# 将文件名写入 txt 文件
with open(txt_output_file, 'w') as f:
for xml_file in xml_files:
f.write(os.path.splitext(xml_file)[0] + '\n')
print("File names have been saved to:", txt_output_file)

【说明】如图所示,这就是生成的 train.txt 文件和 val.txt 文件,分别记录了训练集图像名称和验证集图像名称。
4、转换数据集图片格式
由于在 VOC 格式文件夹中,数据集的图片文件通常为 JPEG 格式,而 Foggy Cityscapes 数据集提供的是 PNG 图片,因此需要进行转换。
这是将图片文件从 PNG 格式转换为 JPEG 格式的代码:
from PIL import Image
import os
# 指定原始 png 文件夹和输出 jpg 文件夹路径
png_folder = r'D:\dataset\Cityscapes\val\hazy'
jpg_output_folder = r'D:\dataset\Cityscapes\0401-JPEGImages\val'
# 确保输出文件夹存在
if not os.path.exists(jpg_output_folder):
os.makedirs(jpg_output_folder)
# 循环处理 png 文件夹中的每个 png 文件
for filename in os.listdir(png_folder):
if filename.endswith('.png'):
img = Image.open(os.path.join(png_folder, filename))
output_filename = os.path.splitext(filename)[0] + '.jpg'
img.convert('RGB').save(os.path.join(jpg_output_folder, output_filename), 'JPEG')
我们同样提供了将图片文件从 JPEG 格式转换为 PNG 格式的代码:
from PIL import Image
import os
# 指定原始 jpg 文件夹和输出 png 文件夹路径
jpg_folder = 'D:/dataset/Cityscapes/train/hazy'
png_output_folder = 'D:/dataset/Cityscapes/train/hazy'
# 确保输出文件夹存在
if not os.path.exists(png_output_folder):
os.makedirs(png_output_folder)
# 循环处理 jpg 文件夹中的每个 jpg 文件
for filename in os.listdir(jpg_folder):
if filename.endswith('.jpg'):
img = Image.open(os.path.join(jpg_folder, filename))
output_filename = os.path.splitext(filename)[0] + '.png'
img.save(os.path.join(png_output_folder, output_filename), 'PNG')
三、转换为 YOLO 数据集格式
我们将前面转换所得的 VOC 格式的 xml 标注文件转换成 YOLO 格式的 txt 标注文件,转换代码如下:
import xml.etree.ElementTree as ET
import pickle
import os
from os import listdir, getcwd
from os.path import join
def convert(size, box):
x_center = (box[0] + box[1]) / 2.0
y_center = (box[2] + box[3]) / 2.0
x = x_center / size[0]
y = y_center / size[1]
w = (box[1] - box[0]) / size[0]
h = (box[3] - box[2]) / size[1]
# print(x, y, w, h)
return (x, y, w, h)
def convert_annotation(xml_files_path, save_txt_files_path, classes):
xml_files = os.listdir(xml_files_path)
# print(xml_files)
for xml_name in xml_files:
# print(xml_name)
xml_file = os.path.join(xml_files_path, xml_name)
out_txt_path = os.path.join(save_txt_files_path, xml_name.split('.')[0] + '.txt')
out_txt_f = open(out_txt_path, 'w')
tree = ET.parse(xml_file)
root = tree.getroot()
size = root.find('size')
w = int(size.find('width').text)
h = int(size.find('height').text)
for obj in root.iter('object'):
difficult = obj.find('difficult').text
cls = obj.find('name').text
if cls not in classes or int(difficult) == 1:
continue
cls_id = classes.index(cls)
xmlbox = obj.find('bndbox')
b = (float(xmlbox.find('xmin').text), float(xmlbox.find('xmax').text), float(xmlbox.find('ymin').text),
float(xmlbox.find('ymax').text))
# b=(xmin, xmax, ymin, ymax)
# print(w, h, b)
bb = convert((w, h), b)
out_txt_f.write(str(cls_id) + " " + " ".join([str(a) for a in bb]) + '\n')
if __name__ == "__main__":
# 1、需要转化的类别
classes = ['person', 'rider', 'car', 'truck', 'bus', 'train', 'motorcycle', 'bicycle']
# 2、现有 voc 格式的 xml 标签文件路径
xml_files = r'D:\dataset\Cityscapes\val\labels-xml'
# 3、转为 yolo 格式的 txt 标签文件存储路径
save_txt_files = r'D:\dataset\Cityscapes\val\labels-txt'
convert_annotation(xml_files, save_txt_files, classes)
四、转换成 COCO 数据集格式
因为需要将 Foggy Cityscapes 数据集应用于 mmdetection 框架,所以还需要将数据集转换成 COCO 格式。
mmdetection
- data
- coco
- annotations
- instances_train2017.json
- instances_val2017.json
- train2017( 存放训练集图片 )
- val2017( 存放验证集图片 )
【说明】instances_train2017.json 记录了训练集图片的名称和高宽信息,instances_val2017.json 记录了训练集图片的名称和高宽信息。
【彩蛋】这里专门提供了 instances_train2017.json 和 instances_val2017.json 文件的网盘链接:
链接:https://pan.baidu.com/s/1SIGNuF996Wq3ov_oY_eGQA?pwd=fcin
提取码:fcin
&spm=1001.2101.3001.5002&articleId=139711264&d=1&t=3&u=b9e05e8e42de470ba7d6e84800ba7a75)

被折叠的 条评论
为什么被折叠?



