市场突然聚焦高质量数据集?高质量数据集应该如何建设?


市场突然聚焦高质量数据集?高质量数据集应该如何建设?

近期,有好几个企业朋友都在咨询我,如何建设高质量数据集。

看得出来,现阶段市场方向聚焦到高质量数据集建设上了。

接着,我又查阅到了一些数据,印证了这一点:截至2025年上半年,全国高质量数据集累计交易额已达40亿元,交易机构挂牌3364个高质量数据集。截至2025年底,全国已建成的高质量数据集超过了10万个,总体量超过了890PB,这相当于中国国家图书馆数字资源总量的310倍左右。

因此,这一期内容,我来做高质量数据的建设分享。

一、为何要建设高质量数据集?

建设高质量数据集的原因主要有三点:

一是,人工智能(AI)的发展迫切需要高质量数据。当前人工智能,特别是大模型的发展,已从“以模型为中心”转向“以数据为中心”。模型的性能高度依赖于训练数据的规模、质量和多样性。有研究表明,即使数据中含有极少量(如0.001%)的错误信息,也可能导致模型输出严重偏差。因此,高质量数据集是决定AI“智商”和可靠性的根本。此外,通用大模型虽具备强大泛化能力,但在工业制造、医疗健康、金融服务等垂直领域,其行业知识深度不足,垂直行业智能化亟需“高应用价值、高知识密度、高技术含量“的专属数据集。

二是数据要素政策推动。国家数据局已将高质量数据集建设置于核心位置。2024年12月,国家发展改革委、国家数据局等部门印发《关于促进数据产业高质量发展的指导意见》,首次明确提出“高质量数据集”概念,支持企业面向人工智能应用创新,开发高质量数据集,大力发展“数据即服务”“知识即服务”“模型即服务”等新业态。2025年发布了首批104个高质量数据集典型案例,覆盖十余个重点领域。2026年5月,更是启动强基扩容、标注攻坚、提质增效、应用赋能、管理服务、价值释放六大专项行动,系统推进建设工作。此外,国家数据局联合26个部委共同制定政策,部署了140项先行先试任务,并布局建设了成都、沈阳等7个国家级数据标注基地,引进和培育标注企业362家,从业人员达8.5万人,带动相关产值163亿元。

三是以词元为基础的新型交易模式出现。随着数据交易从原始数据包买卖向API调用、模型化服务升级,经过标准化治理、标注和封装的高质量数据集,成为市场上可量化、可定价、可流通的核心产品。国家正在探索以词元(Token)为基础的新型交易模式,构建数据集的价值体系。

不过这三点原因其实也可以归结为一个点,那就是:数据要素要高度绑定AI产业。这也是我近期从各种信息中得到的关键趋势。

二、什么是高质量数据集?

高质量数据集是指经过采集、加工等数据处理,可直接用于开发和训练人工智能模型,能有效提升模型表现的数据的集合。高质量数据集主要服务于人工智能的实际应用场景,通常包括以下四个核心组成要素特征、标签、元数据和样本。

特征是模型训练的输入变量,用于描述每个样本的具体属性;标签是需要模型预测的目标输出;元数据记录了数据生成与处理过程的相关信息,如采集时间、地点、来源等;样本则是构成数据集的基本单元,由特征向量及其对应的标签共同组成。例如,机器学习中的经典数据集鸢尾花(Iris)数据集,包含150条样本,均匀分属三类鸢尾花,每类 50 条样本,使用花萼长度、花萼宽度、花瓣长度和花瓣宽度作为分类特征。再如图像识别领域广泛使用的ImageNet 数据集,涵盖超过 1400 万张高分辨率图像,覆盖 2 万多个类别,每张图像均配有准确的类别标签,其中超过 100 万张图像还包含了物体边界框等精细标注信息。

高质量体现在规模“大”、安全“牢”、观点“正”、效果“好”、应用“广”等方面,可以采用静态和动态的质量评价方法来度量。

静态质量主要关注数据本身的关键属性,在准确性、完整性、一致性、时效性等基础指标上增加多样性、真实性、合规性等维度,重点评估数据的领域覆盖、来源可靠性以及在隐私保护和安全合规方面的表现。

动态质量则强调数据集在模型训练和应用中的实际效果,可通过引入代表性模型开展基准测试,结合基准评测数据集与量化指标,客观衡量模型性能的提升程度,从而明确数据集的“高质量”标准。

同时,还应建设统一的质量评估平台,规范评估流程与工具,增强不同数据集之间的可比性与通用性。由于不同行业数据集的模态分布、标注需求差异较大,需根据行业特点应用不同的数据处理技术和方法,其质量评价也需要在通用的指标上进行定制加强。

例如,医疗卫生领域,以文本(电子病历)和医疗影像居多,侧重于文本解析、图文结合处理和专业标注等处理方式,更关注数据内容的合规性、安全性和标注准确性;工业制造领域,以时序数据、图像、图纸文档、仿真数据居多,侧重于时序数据处理、高精度合成和专业标注等处理方式,更关注数据内容的真实性、多样性和标注准确性。

三、高质量数据集应该如何建设?

根据中国信息通信研究院、国家数据发展研究院等单位联合编制的《高质量数据集建设指引》来看,高质量数据集的建设是一个覆盖数据集全生命周期的系统性工程。当前业界主要采用两种典型的建设模式:“场景驱动”的建设模式和“数据驱动”的建设模式。

“场景驱动”的建设模式以明确的业务需求或场景为起点,通过“需求拆解-数据设计-数据采集-数据处理-数据质量检测-数据运营”的闭环确保数据集对场景的智能化水平提升,避免“数据冗余”或“数据缺失”。这种模式强调“先有需求或场景,再构建对应的数据支撑”,是目标导向型建设的典型代表。这种建设模式的优势是数据质量高、针对性强,能够有效支撑特定任务的模型训练和评估,易于形成闭环反馈机制,通过模型效果反向优化数据采集和处理流程。

“数据驱动”的建设模式以积累的大量、多源异构数据为基础,通过主动的数据探索、关联分析与价值挖掘,反向发现潜在的业务需求或优化方向。这种模式强调“先有数据资产,再通过数据驱动需求升级”,是过程导向型建设的典型代表。这种建设模式的优势是能快速形成大规模数据资产,为后续模型探索提供丰富素材,一般更适合通用大模型、预训练模型等需要海量多样化数据的任务。

高质量数据集建设应按照生命周期有序展开,包括数据需求、数据规划、数据采集、数据预处理、数据标注、模型验证等环节其中,各环节主要按以上顺序逐步开展,同时,各环节会对其他环节进行反馈,或者会在其他环节反馈下进行迭代优化。以下为建设流程:

当然,高质量数据集的建设的细化过程是比较繁琐的,这里就不一一展开了,后面有时间再继续研究和分享。

实际上,高质量数据集就是数据产品的一种类型。建设高质量数据集可以按照数据产品打造的流程来做参考。我前面写过数据产品的打造的思路大家可以点击阅读:企业手里有数据,该如何打造一款好的数据产品?

参考资料:《高质量数据集建设指引》