3 分钟结论:这份文件改变了什么
先说结论:AI 项目卡住的环节,已经从「选哪个模型」变成了「有没有一份拿得出手的数据」。2026 年 6 月,国家数据局印发《关于推进行业高质量数据集建设行动的实施方案》(国数科基〔2026〕25 号,6 月 3 日印发、6 月 8 日对外发布),把行业高质量数据集从企业的「自选动作」升级为国家行动,并给出了到 2028 年底的时间表。据央视报道,这是国家层面首次对数据赋能人工智能发展作出的系统性部署。
对企业来说,这份文件真正的含义只有三句:① 你手里那份别人复制不了的行业数据,是这一轮 AI 落地真正的入场券;② 但原始数据不算数,要按「AI-Ready」的四条标准治理和标注过;③ 重点不在买什么技术,而在把数据集放进一个真实业务场景里验证。
如果你只想记一句话:别再问「我们该用哪个模型」,先回答「我们有哪些数据是别人没有的、能不能拿给模型用」。
政策原文讲了什么:六大行动一张表
文件的核心是六个专项行动,逻辑上是一条链:先有数据(强基扩容)→ 把业务知识注入进去(标注攻坚)→ 达到能喂模型的质量(提质增效)→ 放进真实场景验证(应用赋能)→ 全过程可管可控(管理服务)→ 最后变成能调用、能计价的资产(价值释放)。政策原文把这个闭环叫「数据飞轮」:场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值。
| 专项行动 | 一句话说清 | 落到企业这一侧是什么 |
|---|---|---|
| ① 强基扩容 | 拓宽供给渠道、丰富供给类型,为人工智能提供「燃料」 | 聚焦 19 个重点领域 + 5 个创新领域建数据集;鼓励链主单位带动上下游协同共建 |
| ② 标注攻坚 | 数据标注从「以人为主」转向「人机协同、专家深度参与」 | 让懂业务的人参与标注,而不是把标注当廉价外包劳动 |
| ③ 提质增效 | 建设「人工智能就绪(AI-Ready)」的数据集,推行「一次测评、全国互认」 | 按四类质量标准整理自己的数据;将来不必为每个客户重做一遍评测 |
| ④ 应用赋能 | 以场景为牵引,打造「数据飞轮」应用闭环 | 每个数据集都要挂一个真实业务场景,建成之后要真的用起来 |
| ⑤ 管理服务 | 全生命周期管理,落实数据持有权、使用权、经营权「三权分置」 | 把数据来源、授权链条、使用边界写清楚——这是合规底座 |
| ⑥ 价值释放 | 产品化、资产化、市场化,探索以词元(Token)为基础的价值体系 | 数据集要能被调用、被计量,才有定价和交易的前提 |
文件点名的重点领域是 19 个:科学研究、工业制造、农业农村、智慧能源、交通运输、金融服务、医疗卫生、教育教学、电子商务、人力资源、文化旅游、应急管理、气象服务、绿色低碳、公共安全、城市治理、住房建设、自然资源、社会信用;创新领域 5 个:低空经济、具身智能、智能驾驶、智慧海洋、生物制造。对照一下你的行业在不在里面——在,就意味着未来两年这个方向会有配套措施、专项资金与示范项目认定。
政策的紧迫感也可以从一组数字看出来:国家数据局披露的数据显示,截至 2026 年第一季度,全国已建成高质量数据集超过 11.6 万个,总体量超过 960PB,日均词元(Token)调用量突破 140 万亿。在这样的体量下,通用模型能力正在趋同,真正拉开差距的是行业私域数据——官方解读里有一句很直接的话:公域数据红利消退,行业私域数据成为核心资源。
门槛写在「AI-Ready」四个字里
文件里对企业最实用的一句是:推动构建符合结构完整性、内容多样性、标注准确性、模型适配性等质量标准、满足人工智能就绪(AI-Ready)的高质量数据集。这四个词就是一张自查表。多数企业手里有数据却用不起来,缺的正是这四条。
| AI-Ready 标准 | 它到底在问什么 | 不达标时的典型症状 |
|---|---|---|
| 结构完整性 | 字段、格式、层级是否统一、可被机器解析 | 数据散在多个系统里,同一个客户三套编号,导出即失真 |
| 内容多样性 | 覆盖的场景和边界情况够不够 | 常见问题答得不错,一遇到特殊情况就开始胡说 |
| 标注准确性 | 有没有业务专家参与、标注口径是否一致 | 标注靠外包短期培训,同一句话两个人标出两个结果 |
| 模型适配性 | 能不能直接被模型消费、效果可验证 | 把一份 80 页 PDF 丢给模型就当「数据给了」,回答质量全靠运气 |
这四个词的价值在于,它们把「我们的数据好不好」这种说不清的问题,变成了四个可以逐条回答的问题。能逐条回答,才有改进的起点。
企业要做的三件事,先做哪一件
把六大行动折到企业视角,真正要动手的只有三件。顺序很重要:先确认手里有什么,再决定怎么整,最后才是验证。反过来做——先买模型、先搭平台,是最常见的浪费。
| 顺序 | 要做什么 | 交付物 | 参考周期 | 谁主导 |
|---|---|---|---|---|
| 第一步 | 私域数据盘点:哪些数据是我们有、别人没有的,权属与使用边界在哪 | 数据资源清单 + 权属与授权说明 | 2-4 周 | 业务部门 + 数据负责人 |
| 第二步 | 按 AI-Ready 四条标准治理与标注,把业务知识注入进去 | 口径统一的数据集 + 标注规范 + 质量报告 | 1-3 个月 | 数据团队 + 业务专家 |
| 第三步 | 选一个真实场景做应用验证,用业务指标验收而不是模型分数 | 可复用的应用场景 + 效果对比数据 | 4-8 周 | 业务方牵头 |
先说第一步为什么不能跳。政策对高价值数据资源的描述是四个特征:来源独特、外部难以复制、持续供给、长期绑定具体应用场景。这四个特征没有一个是技术属性,全是业务属性——它们只能从盘点里得出来,不可能从采购里得出来。很多企业被问「你们有什么数据」时,回答是「数据都在系统里」,这等于没有盘点。
再说第二步里最容易被忽略的一点:标注必须让业务专家进场。政策把标注升级为「人机协同、专家深度参与」,并明确数据标注已从低端重复劳动变成知识密集型工作。落到企业就是一句话:你那份数据的价值,藏在老师傅的判断里,不在字段里。请一位有十年经验的业务专家参与两周,通常比多买一台服务器更有用。
政策另外给了三个抓手
除了目标和要求,文件里还有三条可以立刻对接的具体机制。
| 抓手 | 政策表述 | 对企业意味着什么 |
|---|---|---|
| 数据不等价交换 | 鼓励数据换数据、换订单、换服务、换模型、换场景等交换方式,探索数据作价出资 | 拿不出预算买数据的企业,可以用自己的数据去换——这对中小企业尤其实际 |
| 一次测评、全国互认 | 创新「数据质量验证 + 模型应用反馈」测评机制,推行统一测评方案与工具 | 数据集质量评定会标准化,将来不必为每个客户、每个项目重做一遍评测 |
| 资产化与融资 | 开展数据资产盘点、登记、评估试点,创新数据质押融资、作价入股等模式 | 数据集从成本项变成可质押、可作价入股的资产——与「数据资产入表」是同一方向 |
第三条要和另一份文件连着读。2026 年 2 月,国家数据局、工业和信息化部、公安部、证监会四部门联合印发《关于培育数据流通服务机构 加快推进数据要素市场化价值化的意见》,首次把数据流通服务机构做了体系化分类——数据交易所(中心)、数据流通服务平台企业、数据商,并提出到 2029 年底的目标。两份文件叠起来看,政策给企业画出的路径是很清楚的:把数据整理成 AI-Ready 的数据集 → 在真实场景里验证 → 通过数据流通服务机构对外流通或作价,最终进入资产表。
这里有一条实用的提醒:「数据商」已经成为一个有明确界定的角色。今后再有人拿着「全链条数据要素服务」的方案来找你,可以先问一句「你属于哪一类」。交易所管市场秩序、平台企业管流通链路、数据商管货品本身——三类不是高低之分,是分工之别。能力结构完全不同的机构,报价和交付物本来就不该长得一样。
四个容易被读偏的地方
- 误判一:以为又是一份「要报材料」的文件。这是一份建设性部署,不是新的合规义务,重点在供给、流通与应用三个环节。它真正的信号是资源会往这个方向倾斜:地方配套措施、专项基金、示范项目认定。方案明确「鼓励地方设立专项基金,为产业发展提供持续稳定的资金支持」。
- 误判二:等标准齐了再动手。文件写的是「支持有条件地区开展试验区建设」「以先行先试工作为抓手,打造标杆示范场景」——先做的人定义标准,后做的人适配标准。等标准齐了再开始,等于把定义权让出去。
- 误判三:把数据集建设当成 IT 项目。官方解读点出的行业痛点是「统筹规划不足、标准不统一、治理能力滞后」,这三件事没有一件是买套系统能解决的:口径要业务部门定,标注要业务专家参与,场景要业务方牵头。
- 误判四:数据多就等于数据好。方案对行业高质量数据集的定义是「经过采集、加工等数据处理,可直接用于开发和训练人工智能模型、能有效提升模型性能」——判断标准是能不能提升模型效果,不是有多少 TB。不经治理地堆数据,只是把噪音换了个地方放。
本文要点
- 国家数据局 2026 年 6 月印发《关于推进行业高质量数据集建设行动的实施方案》(国数科基〔2026〕25 号),是国家层面首次系统部署「数据赋能人工智能」
- 六大专项行动:强基扩容 → 标注攻坚 → 提质增效 → 应用赋能 → 管理服务 → 价值释放,形成「数据飞轮」
- 真正的门槛在 AI-Ready 四条:结构完整性、内容多样性、标注准确性、模型适配性
- 企业要做的三件事,按顺序:私域数据盘点 → 治理与标注 → 场景应用验证
- 可直接对接的三个机制:数据换数据/换订单、一次测评全国互认、数据资产化与质押融资
微信内识别二维码分享此文