大模型相关数据集分类!
大模型相关数据集可划分为:预训练语料、指令微调数据集、偏好对齐数据集、评测基准数据集、领域专用数据集、多模态数据集、AI合成数据集、私有/企业数据集这八个类别。
具体分类如下:
1. 预训练语料(Pre-training Corpora)
用于大模型的基础训练阶段,让模型学习通用语言知识和世界知识。数据量通常极为庞大(TB级别),多为无标注文本。
- 通用预训练语料:涵盖网页、书籍、学术论文、百科等多领域文本,如 Common Crawl、C4、The Pile、RedPajama 等。
- 领域特定预训练语料:针对金融、医疗、法律等垂直领域的专业文本,用于增量预训练以增强模型的专业知识。
2. 指令微调数据集(Instruction Fine-tuning Datasets)
用于监督微调(SFT)阶段,使模型学会理解和遵循人类指令。数据格式通常为”指令输入-回答输出”对。
- 通用指令数据集:覆盖翻译、摘要、推理、代码生成等多种任务,如 Alpaca、FLAN、ShareGPT、BELLE 等。
- 领域指令数据集:面向医疗问诊、法律问答、代码生成等特定场景,如 DISC-Med-SFT、Code Alpaca 等。
3. 偏好对齐数据集(Preference/RLHF Datasets)
用于人类反馈强化学习(RLHF)或直接偏好优化(DPO)阶段,使模型输出与人类价值观对齐,减少有害或偏见内容。数据通常包含同一问题的多个回答,并标注了偏好排序或评分。
- 代表数据集:Anthropic HH-RLHF、UltraFeedback、PKU-SafeRLHF、OpenAssistant 等。
4. 评测基准数据集(Evaluation Benchmarks)
用于量化评估模型在不同任务上的能力表现,是模型迭代优化的重要参考。
- 知识与能力评测:MMLU、C-Eval、ARC 等。
- 推理能力评测:GSM8K、MATH、BBH 等。
- 代码能力评测:HumanEval、MBPP 等。
- 安全性评测:SafetyBench、TruthfulQA 等。
5. 领域专用数据集(Domain-specific Datasets)
面向特定行业或应用场景的专业数据集,通常需要经过领域专家标注,数据质量要求高。
- 医疗领域:疾病诊断、医学文献摘要、医患对话等。
- 金融领域:财报分析、风险评估、金融问答等。
- 法律领域:法条理解、判决预测、法律咨询等。
- 教育领域:课程辅导、作文批改、情感支持等。
6. 多模态数据集(Multimodal Datasets)
包含两种或以上模态的数据(文本+图像、文本+音频、文本+视频等),用于训练多模态大模型。
- 如视觉问答(VQA)、图像描述(Image Captioning)、图文匹配等任务的数据集。
7. AI合成数据集(AI-generated/Synthetic Datasets)
利用已有的大模型(如 GPT-4)自动生成或增强的高质量训练数据,是当前解决数据稀缺问题的重要手段。
- 典型方法包括 Self-Instruct、Evol-Instruct 等,通过模型自我生成指令-回答对来扩充训练数据。
- 代表数据集:Alpaca-GPT4-data、Wizard_evol_instruct 等。
8. 私有/企业数据集(Private/Enterprise Datasets)
企业或机构内部积累的业务数据,通常不对外公开,但在实际落地中价值极高。
- 包括企业内部知识库、客服对话记录、业务流程文档、用户反馈数据等。
- 这类数据往往具有高度专业性和时效性,是构建行业专用模型的核心资源。
以上八类覆盖了大模型从预训练、微调、对齐到评测的完整生命周期,同时也兼顾了数据来源(公开/私有/合成)和数据模态(文本/多模态)的多样性。
你是想用这个分类来整理现有数据集,还是准备自己构建数据集?告诉我具体场景,我可以帮你细化。
© 版权声明
文章版权归作者所有,未经允许请勿转载。