可用的模型
- 仅记录中文可用的表现较优的模型
- LLaMA、LLaMA2、LLaMA3(规模在7,13,30,65左右,需要搭配ChineseLLaMA的LoRA权重使用)(多语言表现不错,中文也挺好)
- ChatGLM3-6b,4-9b(中文微调表现不错)
- Baichuan-2-7b(预训练数据规模达到了1.2T 词元。)
- InternLM-2-1.8b,7b,20b(支持工具使用,框架有点非主流)
- Qwen-2-(0.5–70b) (打榜怪兽,3T预训练)
- Mistral-7b、Instruct(分组查询注意力 + 滑动窗口注意力)(处理长文能力较强)
- Mixtral-8x7b(经典混合专家模型,MoE)
下图为LLaMA发展脉络

部分模型的训练规模和数据

常用数据集

外文
-
Common Crawl:规模庞大的、非结构化的、多语言、时间跨度长(2008-)包含原始网页数据、元数据和提取的文本数据等,总数据量达到 PB 级别。由于这个数据集规模过于庞大,现有的研究工作主要提取其特定时间段或者符合特殊要求的子集进行使用,该数据集内部充斥着大量的噪声和低质量数据,在使用前必须进行有效的数据清洗,以确保数据质量和准确性,常用的自动清洗工具有 CCNet 等。
-
C4(Colossal Clean Crawled Corpus):大型网页数据集,源自超过 365M 个互联网域,包含超过 156B 词元,数据量约 800GB。该数据集基于 2019 年 4 月的 Common Crawl 语料构建,已经被公开发布,使用该数据集的典型模型有 UL2 和 LLaMA。该数据集针对不同需求,发布了多个子版本:en(英文数据,806G),en.noclean(未清洗的原始数据,6T),realnewslike(仅包含 RealNews 涉及的领域的内容,36G),webtextlike(仅包含来自 OpenWebText 中URLs 的内容,17G)和 multilingual (多语言数据,38T)。
-
CC-Stories:专为常识推理和语言建模构建的故事风格数据集,数据来源是 Common Crawl 中与常识推理任务问题有高度重叠的文档,总共包含约 5.3B 个词元,数据量约 31GB。CC-Stories 的原始来源现在无法访问,只有复现版本 CC-Stories-R 可供使用。使用该数据集训练的代表性模型包括 MegatronTuring NLG 等。
-
CC-News:一个新闻文章数据集,数据量约 76GB,包含了从 2016 年 9 月到 2019 年 2 月期间抓取的 63M 篇英文新闻文章,并以网页存档(WARC)文件形式提供,在 Hugging Face 上可以进行下载。
-
REALNEWs:从 Common Crawl 中抓取的大型新闻语料库,覆盖了谷歌新闻索引的 5,000 个新闻领域,数据量约为 120GB,可从OpenDataLab 上进行下载。该数据集按照时间顺序进行了训练集和测试集的划分,其中2016 年 12 月至2019 年 3 月的新闻划分为训练数据,2019 年 4 月的新闻划分为测试数据。
-
RedPajama-Data:公开的综合网页数据集,包含了来自Common Crawl 的 100B 份文档,其使用了 CCNet 工具进行清洗,在经过过滤和去重得到约 30T 词元,在 Hugging Face 上提供了公开下载。该数据集是一个多语言数据集,包含 5 种语言:英语、法语、西班牙语、德语和意大利语。此外,还提供了 40 余种预先标注好的数据注释,使下游模型开发者能够根据自己的标准对数据集进行筛选或重新加权。该数据集仍在不断更新维护,所有的数据处理脚本均在GitHub 开源。
-
RefinedWeb:该数据集是一个在 Common Crawl 数据的基础上通过严格筛选和去重得到的网络数据集,使用的源数据是从 2008 年到 2023 年 6 月的所有Common Crawl 网页记录,共约 5T 词元。其中,开源部分有 600B 词元,数据量约500GB,解压后需要 2.8TB 的本地存储空间,可从 Hugging Face 上下载。该数据集是开源大语言模型 Falcon 的主要训练数据集。
-
WanJuan-CC(万卷 CC):该数据集是一个从 Common Crawl 数据中抽取并清洗的高质量英文数据集。首批开源的语料覆盖了过去十年内互联网上的公开内容,包含 100B 词元,构成约 400GB 的高质量数据。在数据清洗过程中,发布人员搭建了高性能分布式数据处理系统,通过启发式规则过滤、多层级数据去重、内容安全过滤、数据质量过滤等四个步骤,最终从约 130B 份原始数据文档中萃取出约 1.38% 的高质量内容。上海人工智能实验室发布的 InternLM2 就是以 WanJuan-CC 作为关键数据进行训练。
-
WebText:该数据集是由 OpenAI 构建的一个专注于文档质量的网络文本语料库,它通过抓取 Reddit 上获得至少 3 个赞的外链得到。该语料库旨在捕捉用户认为有趣、有教育价值或幽默的内容,使用的数据是 2017 年 12 月之前的数据,包括了来自 45M 个链接的文本内容,共计超过 8M 份文档,文本总量达到 40GB。OpenAI 在一系列模型的训练过程中,都是使用了该数据集,包括 GPT-2、GPT-3和 InstructGPT 等。遗憾的是,WebText 并未开源。
-
OpenWebText:该数据集是 WebText 的一个复现开源版本,与 WebText 的构建方法相似,其首先从 Reddit 上提取网页链接,经过去重、过滤等处理,最终保留了来自约 8M 份文档的 38GB 文本数据。该数据集可在 Hugging Face 上进行下载。
中文
- ChineseWebText:从 Common Crawl 庞大的网页数据中精心筛选的中文数据集。该数据集汇集了 2021 年至 2023 年间的网页快照,总计 1.42TB数据量。同时,ChineseWebText 的每篇文本都附有一个定量的质量评分,为研究人员提供了可用于筛选与使用的参考标准。此外,为满足不同研究场景的需求,ChineseWebText 还特别发布了一个 600GB 大小的中文数据子集,并配套推出了一款名为 EvalWeb 的数据清洗工具,方便研究人员根据需求清洗数据。
- WanJuan 1.0 Text:该数据集是上海人工智能实验室发布的万卷 1.0 多模态语料库的一部分(除文本数据集外,还有图文数据集和视频数据集)。该文本数据集由多种不同来源的数据组成,包括网页、书籍等,数据总量约 500M 个文档,数据大小超过 1 TB。在数据处理过程中,该语料将多种格式的数据进行了统一,并进行了细粒度的清洗、去重,提升了语料的纯净度。该数据集被用于 Intern Multimodal 和 Intern Puyu 的训练,完整数据集可在 Opendatalab 上进行下载。
- WuDaoCorpora Text:该数据集是北京智源研究院构建的“悟道”项目数据集的一部分(除文本数据集外,还有多模态图文数据集和中文对话数据集)。该文本数据集来源于 100TB 高质量原始网页数据,其中还包含教育、科技等超过 50 个行业数据标签,经过清洗、隐私数据信息去除后剩余 5TB,而开源部分有 200GB。
- SkyPile-150B:该数据集是一个大规模的综合中文数据集,数据来源于公开可获取的中文网页,其公开部分包含大约 233M 个网页,总共包含约 150B 个词元,620GB 的纯文本内容。为了确保数据质量,该数据集进行了严格的过滤、去重以及隐私数据的清除。此外,还使用了 fastText 等工具进一步筛除低质量数据。该数据集被用于训练 Skywork 模型。
书籍和论文
-
BookCorpus:该数据集是一个免费小说书籍集合,包含了 11,038 本未出版书籍(大约有 74M 句子和 1B 个单词),涵盖了 16 种不同的主题类型(如浪漫、历史、冒险等),本地存储大概需要 5GB 左右。该数据集常被用于训练小规模的模型,如 GPT 和 GPT-2。同时,BooksCorpus 也被 MT-NLG 和 LLaMA等模型所使用。该数据集原始数据集不再公开,但多伦多大学创建了一个镜像版本 BookCorpusOpen,可在 Hugging Face 上进行下载,该版本包含了共计 17,868 本书籍,本地存储大概需要 9GB 左右。至于在 GPT-3 中使用的 Books1 和Books2 数据集合,比 BookCorpus 规模更大,但目前也尚未对外公开。
-
arXiv Dataset:是一个收录了众多领域预印本论文的网站,总数据量约为 1.1TB,并在 Kaggle 上提供了公开下载。为了更好地方便研究工作的使用,arXiv 官方在其网站上发布了一个机器可读的 arXiv 论文数据集,广泛涵盖了物理、数学和计算机科学等领域的论文文献,共包含约1.7M 篇预印本文章,每篇预印本都包含文本、图表、作者、引文、分类以及其他元数据等信息,总数据量约为 1.1TB,并在 Kaggle 上提供了公开下载。
-
S2ORC:该数据集源于学术搜索引擎 Semantic Scholar 上的学术论文,这些论文经过了清洗、过滤并被处理成适合预训练的格式。
百科数据
- 维基百科
代码
- BigQuery:是一个谷歌发布的企业数据仓库,包含了众多领域的公共数据集,如社交、经济、医疗、代码等。其中的代码类数据覆盖各种编程语言。
- The Stack:该数据集由 Hugging Face 收集并发布,是一个涵盖了 30 种编程语言的代码数据集,其数据来源于 GHArchive 项目中 2015 年 1 月 1 日至 2022年 3 月 31 日期间的 GitHub 活跃仓库。The Stack 最初的版本经过数据筛选、过滤以及许可证检测等处理后,最终数据量约为 3TB。同时,该数据集还在不断更新中,v1.2 版本的编程语言已扩展到了 358 种,可以在 Hugging Face 上进行下载。
- StarCoder:该数据集是 BigCode 围绕 The Stack v1.2 进一步处理得到的代码数据集,是同名模型 StarCoder 的预训练数据。在数据处理上,其根据数据量、流行度排名等因素,从 The Stack v1.2 的 358 种编程语言中筛选出了 86 种语言,同时,为了确保数据质量,该项目还对数据进行了人工抽样审核,以确认数据为人类编写的正常代码,而不是文本或自动生成的代码。此外,数据处理过程还进行了对多种文件类型的过滤,以去除低质量数据。最终数据总量约为 783GB,可以通过 Hugging Face 进行下载。
混合数据集
微调数据集

任务
- P3:是一个面向英文数据的指令微调数据集,由超过 270 个自然语言处理任务数据集和 2,000 多种提示整合而成(每个任务可能不止一种提示),全面涵盖多选问答、提取式问答、闭卷问答、情感分类、文本摘要、主题分类、自然语言推断等自然语言处理任务。P3 是通过 Promptsource(一个收集任务提示的众包平台)收集的,其子集被用来训练 T0 模型 。
- FLAN:早期的 FLAN 是通过将 62 个广泛使用的 NLP 基准数据集进行格式化得到的英语指令数据集。现在俗称的 FLAN 实际上是指 FLAN-v2,主要由四个子集 Muffin、NIV2、T0-SF 和 CoT 构成。其中,Muffin 由之前 FLAN 的 62 个任务和新加入的 26 个任务组成(包括对话数据和代码合成数据);T0-SF 则是从T0 模型的数据中抽取出来,同时确保与 Muffin 不重叠;NIV2 指的是数据集Natural-Instructions v2;而 CoT 则是为了增强模型的推理能力而加入的九种不同推理任务的组合。与此同时,FLAN-v2 对每项任务都设置了最大上限,因为在同一混合数据集中,有些任务比其他任务大得多,这可能会在采样中占主导地位,从而影响模型的训练效果。据 FLAN 论文,使用了 Muffin:52%,T0-SF:15%,CoT:3%,NIV2:30% 这一混合比例,通常能够使得模型具有较好表现。
对话
- 主要的对话类型包括开放式生成、问答、头脑风暴和聊天。
- ShareGPT:该数据集因来源于一个开源的数据收集平台 ShareGPT 而得名。在该平台中,用户可以将自己的各种对话数据通过浏览器插件进行上传。这些对话包括来自 OpenAI ChatGPT 的用户提示和回复,语种主要为英语和其他西方语言。具体来说,查询来自于用户的真实提问或指令,回复则是 ChatGPT 对此生成的回答。
- OpenAssistant:该数据集是一个人工创建的多语言对话语料库,共有 91,829条用户提示,69,614 条助手回复。OpenAssistant 共包含 35 种语言的语料,每条语料基本都附有人工标注的质量评级(例如回复的有用性、无害性等)。值得注意的是,这里所有的数据都是由用户真实提供的,与上面所提到 ShareGPT 的数据构建方式并不相同。
- Dolly:该数据集是一个英语指令数据集,由 Databricks 公司发布。Dolly 包含了 15,000 个人类生成的数据实例,旨在让大语言模型与用户进行更符合人类价值的高效交互。该数据集由 Databricks 员工标注得到,主题涉及 InstructGPT 论文中提到的 7 个领域,包括头脑风暴、分类、封闭式质量保证、生成、信息提取、开放式质量保证和总结等。
合成数据集
- 合成数据集通常是使用大语言模型基于预定义的规则或方法进行构建的。
- Self-Instruct-52K. Self-Instruct-52K 是使用 self-instruct 方法生成的英语指令数据集,共包含 52K 条指令以及 82K 个实例输入和输出。最初,由人工收集创建了 175 个种子任务,每个任务包括 1 个指令和 1 个包含输入输出的实例。然后,每次随机抽取了 8 个指令作为示例,以此提示 GPT-3 生成了新的指令,之后在这些已有指令的基础上,继续利用 GPT-3 生成实例输入及其对应的输出,从而获得了更多数据。这些新得到的指令和输入输出经过滤(去除低质量或重复数据)后会加入数据集中,并继续类似的循环。通过迭代上述过程,最终获得了 52K 条指令和 82K 个实例数据,其中每一条指令可能会用于生成多个输入输出的实例。
- Alpaca-52K. Alpaca-52K 数据集同样是基于 self-instruct 方法进行构建的,它是在 Self-Instruct-52K 的 175 个种子任务上,利用 OpenAI 的 text-davinci-003模型获得了 52K 个不重复的指令,并根据指令和输入生成了输出,进而构成了完整的实例数据。与 Self-Instruct-52K 不同,这里每条指令仅对应于一个输入输出实例。此外,Alpaca-52K 在生成数据的过程中考虑到了输入的可选性,最终的数据中只有 40% 具有输入部分。也正是因此,Alpaca 也包含两种提示模板:包括输入以及不包括输入。
对齐数据集

- HH-RLHF:该数据集包含两大类标注数据,分别关注于大语言模型的有用性和无害性。整个数据集共包含约 169K 个开放式对话,每个对话涉及一个众包工作者向一个智能信息助手寻求帮助、建议或请求完成任务等情景。信息助手将会为每个用户查询提供两个回复,一个回复被选择而另一个被拒绝。对于有用性相关的数据中,被认为更有用的回复将被选择;而对于无害性相关的数据中,被认为更有害的回复则将被选择。
- SHP:该数据集主要关注模型生成回复内容的有用性。该数据集共 385K 个数据实例,对于 18 个不同主题领域中问题/指令的人类偏好进行标注,涵盖了从烹饪到法律建议等各种主题。每个数据实例都是基于一个寻求帮助的 Reddit 帖子构建的,包含该帖子中的问题和帖子下两个排名较高的评论。这两个评论其中一个被 Reddit 用户认为更有用,另一个被认为不太有帮助。与 HH-RLHF 不同,SHP 中的数据并非模型生成,而是人类的回复贴子。
- PKU-SafeRLHF:该数据集侧重于对回复内容的有用性和无害性进行标注。该数据集囊括了 330K 个专家注释的实例,每一个实例都包含一个问题及其对应的两个回答。其中,每个回答都配备了安全性标签,用以明确指出该回答是否安全。此外,标注者还会就这两个回答在有用性和无害性方面进行细致的比较和偏好注释。
- Stack Exchange Preferences:该数据集专注于对答案的有用性进行标注,涵盖了来自知名编程问答社区 Stack Overflow 的约 10M 个问题和答案,具有很高的实用价值。每个数据实例均包含一个具体的问题以及两个或更多的候选答案。每个候选答案都附有一个根据投票数计算得出的分数,并附带了一个表示是否被选中的标签。
- CValues:该数据集是一个面向中文的大模型对齐数据集,提出了安全性和责任性这两个评估标准。这个数据集包含了两种类型的提示:安全性提示和责任性提示。安全性提示共有 1,300 个,主要用于测试模型的安全性表现,这些提示的回复被人工标注为安全或不安全,但由于内容敏感,因此并未开源;责任性提示共有 800 个,这些提示由领域专家提供,并用于评估模型在特定领域内的责任性表现,专家也为这些提示的回复进行了打分。由于内容敏感,实际开放的数量有删减。除此之外,CValues 还提供对比形式的数据集,该数据集中一共有 145K 样例,每条样例包含提示、正例回复(被认为更安全更负责任的回复)和负例回复,这部分数据被完全开源。



4508

被折叠的 条评论
为什么被折叠?



