电脑桌面
添加运营动脉到电脑桌面
安装后可以在桌面快捷访问

数据工厂白皮书:推理数据首超训练量,高质量数据集供给成AI最大瓶颈

作者:北京交通大学、北京化工大学、华为等联合编制 2026-08-01 63

AI越强大,数据的"饥渴"就越根本。北京交通大学、北京化工大学联合华为等三十余家单位共同编制的《数据工厂白皮书》,138页,系统论述了一个正在浮出水面的新业态——将高质量数据集的生产从"作坊式"升级为"工厂化"。

一、拐点已至:推理数据量首次超越训练数据量

白皮书给出了一个标志性的时间节点:2025年国内AI推理数据量达到101.34EB,首次超越98.14EB的训练数据量——这意味着人工智能已正式跨过"学习阶段",步入"规模化应用阶段"。Token调用量爆发式增长、智能体流量超过人类对HTML网页的访问流量、计算驱动成为数据生产的主要方式——这三组变化共同指向一个结论:AI正在从"技术能力"竞赛转向"数据燃料"竞赛,谁能规模化地生产高质量数据集,谁就能在AI应用的深度和广度上拉开差距。

二、"供不出、存不好、产不快":数智产业链的三个薄弱环节

白皮书直指数智产业链的三大短板:数据"供不出"——存量公域数据持续供给乏力,海量私域数据、非结构化数据、行业高端数据无法有效供给;数据"存不好"——多元异构数据的存储、标注、治理体系尚未建立统一标准;高质量数据集"作坊式"生产效率低下——行业高质量数据集供给严重不足,导致市面上各类大模型能力趋同,难以突破专业场景应用。白皮书的判断直截了当:高质量数据集的规模和质量,不仅是AI模型"智商"的决定因素,更是AI在千行百业广泛应用的核心瓶颈。

三、数据工厂的解法:设施化、规模化、智能化"三位一体"

白皮书将"数据工厂"定义为高质量数据集规模化生产的关键设施,并拆解为"供给—生产—应用"三环节:供给环节要建立多元稳定的数据来源渠道;生产环节要实现设施化、规模化、智能化"三位一体"——从储备车间到生产车间再到中试车间,形成完整的数据流水线;应用环节直接对接AI模型训练与推理的持续性数据需求。白皮书还对比了国内外典型数据工厂的实践——美国的ScaleAI、星际之门,欧洲的数据中心与实验室数据工厂,中国的崖州湾超级数据工厂、贵州主枢纽、库帕思语料超级工厂、京津冀数据要素产业园等——并归纳出三种类型、五种特征、四种建设模式、四种运营模式和四种部署策略。

数据工厂白皮书-北京交通大学等_第1页

数据工厂白皮书-北京交通大学等_第2页

数据工厂白皮书-北京交通大学等_第3页

数据工厂白皮书-北京交通大学等_第5页

数据工厂白皮书-北京交通大学等_第6页

2026数据工厂白皮书-北京交通大学.pdf
2026数据工厂白皮书-北京交通大学.pdf
138 页 24 次下载 8.27 MB

声明:除非特别标注,否则均为本站原创文章,转载时请以链接形式注明文章出处。如若本站内容侵犯了原著者的合法权益,可联系本站删除。

确认删除?
签到
收藏
足迹
微信
  • 站长微信
回到顶部