标签

AI数据告急:训练素材快用光了怎么办?

你每天用来聊天、写方案、生成图片的AI,知识到底从哪来?答案很简单:来自人类过去几十年留在互联网上的所有文字、图片和视频。大模型就像一头食量惊人的巨兽,把百科、书籍、论文、帖子、开源代码统统“吃”进肚子里,才练就了如今的能力。但一个越来越现实的问题正在摆在整个行业面前:这份“免费的数据午餐”,快吃完了。从2024年“数据枯竭论”首次引发争议,到2026年成为行业共识,短短两年时间,“数据会不会不够用”已经从学术猜想,变成了巨头们必须直面的产业瓶颈。中国信通院总工程师何宝宏直言:当前大模型已经撞上了“数据墙

2026-06-28 18:18:29  |  16 阅读

AI训练数据即将见底

当前主流人工智能技术大多依托机器学习与深度学习架构,其本质在于从海量数据中提取隐藏的模式与规律。缺少训练数据,模型将无法完成学习,人工智能的智能属性也就无从谈起,正因如此,数据常被视为人工智能的“能量来源”。步入大模型时代,采用自监督学习的预训练策略显著降低了对人工标注数据的依赖,使模型能够以更低成本、更高效率处理大规模数据集,推动了数据、模型参数与计算资源三者的协同发展。基于此,业界归纳出著名的规模定律:大语言模型的能力与模型参数量、训练数据规模、计算资源之间呈现平滑的幂律关系,简言之,就是模型规模越大

2026-04-23 18:35:34  |  9 阅读