构建高质量数据体系 助力AI跨越式发展
人工智能作为驱动新一轮科技与产业变革的核心引擎,正深刻重塑人类的生产与生活模式。“十五五”期间将是AI技术突破与普及的关键阶段。在AI演进中,数据的作用愈发关键,既是决定模型上限的关键,也是决定应用成效的核心。加速打造面向AI的高质量数据供给体系,是推动我国AI跨越式发展、深化“人工智能+”行动的必要手段,对促进产业智能化升级及新型工业化进程具有重大支撑意义。
当前,AI技术的爆发式增长对数据要素提出了更高要求。近年来,我国AI产业蓬勃发展,数据要素功不可没。据国家数据局统计,截至2026年3月,日均词元调用量突破140万亿,较2024年初激增千倍以上。《全国数据资源调查报告(2025年)》显示,2025年我国年度数据产量达52.26泽字节,占全球总量的27.44%,稳居首位。其中,用于AI训练和推理的数据量达199.48艾字节,同比增长42.86%,推理数据量首次反超训练数据量,标志着AI应用正加速从训练阶段迈向规模化落地。截至2026年3月,全国已建成高质量数据集超11.6万个,规模逾960拍字节,为AI突破性发展提供了坚实保障。随着AI迈向通用智能新阶段,对数据的需求将更加多元。
模型迭代需实现“数据+场景”的深度融合。随着基础模型能力跃升,多模态理解与复杂推理能力增强,智能体成为主流形态,推动生成式AI向生产力转化。前沿模型在复杂任务处理上已逼近甚至局部超越人类水平,应用重心正从“内容生成”转向“任务执行”。然而,单纯依赖互联网公开语料的路径难以为继,“数据墙”制约日益凸显,单纯靠规模扩张的边际效益递减,通用数据难以支撑代际突破。同时,应用落地需深度绑定垂直场景。核心矛盾已从“量”的不足转向“体系”支撑的缺失。这要求构建自动化、标准化的数据工程体系,提升数据自我造血能力,形成“场景沉淀数据、数据优化模型、模型赋能场景”的正向循环。
模型训练重心的转移要求更加关注动态交互行为。大模型初期依赖互联网“静态语料”(如CommonCrawl)构建知识底座,但随着训练重心向强化学习迁移,静态语料已无法满足智能体自主决策、闭环执行的高阶需求。数据需求结构需向动态行为数据与交互流数据倾斜,涵盖API工具调用、路径规划、试错修正及反馈流等现实世界数据。特别是高质量的动态交互样本与人类对齐反馈数据,正成为突破智能体自主性与运行可靠性瓶颈的关键。
通用智能演进需进一步拓展物理空间数据。具身智能与世界模型是通往通用AI的必由之路。世界模型负责物理规律建模与决策推演(“认知大脑”),具身智能则是智能体与环境的交互载体(“行动载体”),二者互为支撑。目前,具身智能与世界模型尚未出现类似ChatGPT的突破性进展,核心瓶颈在于物理世界高质量交互数据积累不足,未跨越能力涌现阈值。支撑大模型跃升的训练语料达万亿词元级,而全球用于具身智能的高质量真机交互数据多处于百万级轨迹,差距巨大。这要求数据范畴向物理世界的多模态交互感知、连续运动控制及环境因果规律延伸,形态上从单模态转向“感知—决策—执行—反馈”的全链路闭环时序数据,并兼具场景丰富度、物理真实性与因果逻辑性。
面对AI发展对数据要素的新需求,应以“人工智能+”行动为牵引,以“模数共振”为关键路径,统筹推进数据扩容提质、流通共享、治理赋能和机制创新,加快构建系统完备、安全可控且充分激活的高质量数据供给体系。
扩充数据资源供给,夯实要素底座。紧扣大模型跃升、智能体落地及具身智能攻关需求,聚焦科研、制造、医疗、交通及低空经济、生物制造等主战场,针对性布局多类型数据集。围绕智能体自主决策,积累任务规划、工具调用等轨迹数据;围绕具身智能,搭建机器人操作、多模态感知等真机数据集;围绕世界模型,探索数字环境交互与仿真生成数据体系,发挥龙头企业与公共资源作用。利用合成数据弥补物理场景短板,生成符合物理规律的三维交互数据,填补高危、小众场景缺口;建立全流程数据质量评估机制,打通仿真生成、标注、入库、验证、迭代的数据闭环。
升级数据加工能力,培育专业服务体系。数据工程体系是解决作坊式治理、实现自主供给的关键。需适配大模型及具身智能的高标准需求,推动数据标注从劳动密集型向知识、技术密集型转型,推广智能标注、自动质检等新技术。面向医疗、工业等专业领域,培育兼具行业认知与技术能力的数据机构,推动加工向知识提炼、价值挖掘升级。拓展三维点云、关节位姿、动作序列等标注维度,做好多源感知数据时空对齐,采用仿真预标注加人工校验模式提升精度。布局AI数据工程基础设施,攻关多模态清洗、向量检索、合成数据生成等技术,打造可复用工具链,探索“云—边—端”协同架构;加快研制相关国家标准,形成“需求—采集—治理—应用—迭代”的闭环。
构建可信流通体系,释放数据价值。围绕跨主体协同创新需求,建设流通设施,运用隐私计算、区块链、数据沙箱等技术,实现价值共享与安全流通,消除共享顾虑。完善产权登记、价值评估、收益分配制度,形成技术制度协同保障。推动行业数据从分散封闭向标准化、服务化转变,依托统一标准整合资源,破除跨主体、跨行业、跨区域壁垒,构建数据资源循环体系。打造公共数据服务平台,封装合规脱敏等共性能力,降低中小企业创新门槛,盘活存量数据,赋能全域创新。
完善价值激励机制,激发内生动力。遵循产业发展规律,探索适配AI发展的数据价值实现机制,完善托管、分配与权益保护制度,保障提供者权益。坚持“谁贡献、谁受益”,建立科学收益分配体系,增强主体供给积极性。引导企业加大投入,推动竞争从算力、参数比拼转向数据质量、价值释放,形成“优质数据支撑模型迭代、模型价值反哺数据供给”的良性循环。坚持创新与规范并重,建立分级分类监管体系,在守住安全底线前提下,为新模式预留空间,健全容错纠错机制,营造包容审慎环境。
强化产业协同联动,构建数据飞轮生态。聚焦全链条创新,发挥行业组织、龙头企业的桥梁作用,构建跨领域、产学研用深度融合的机制。鼓励企业、服务商、研发企业结成联合体,通过场景开放、数据共享实现良性互动。统筹政策与市场工具,引导社会资本参与,形成多元化投入格局。打造标杆数据集,赋能AI与实体经济融合。扶持高价值中文开源数据集,带动标准统一,降低创新成本。依托智库、院所与龙头共建平台,参与全球AI数据治理规则制定,掌握战略主动权。
AI时代的竞争不仅是模型与算力的角逐,更是高质量数据供给体系的较量。率先构建覆盖数据全生命周期的体系,方能掌握智能化发展主动权。对此,需坚持自主创新、应用牵引、生态协同、开放共享、安全可控的路径,以高质量数据供给支撑AI高质量发展,为新质生产力发展及制造强国、网络强国、数字中国建设贡献力量。
(作者余晓晖系中国信息通信研究院院长)
(