用AI生成数据回训AI会怎样?Nature称模型坍塌,这支团队拿出破解之法
生成式AI正在编织"梦境"——梦见数百万种全新材料。然而,越来越多的质疑声此起彼伏:这些AI"创造"的材料,许多其实早已存在,甚至就潜藏于模型的训练数据之中。2025年Nature的一篇报道标题直击要害:"AI在梦中缔造数百万种新材料,它们真的可靠吗?"这一困境的根源在于材料数据的匮乏与偏差。以二维材料为例,已知的稳定化合物数量极为有限,且大多集中于二元和三元体系。生成模型在这样"营养失衡"的数据上训练,其结果只能是反复产出已知结构的变体,而非真正的突破。东南大学团队在National Science R
AI的困境:循环训练与未来隐忧
假期期间,我和女儿进行了一次深入的交流。起因是我们在回家的路上,女儿突然感慨:“我觉得自己是不是生错了时代。”这让我颇为惊讶,毕竟现在的生活条件优渥,衣食无忧。我立刻对比了爷爷那一代人的艰辛,他们经历过物质匮乏的年代,八十年代初,白天在工厂劳作,清晨和傍晚还要下地干活,那种辛苦难以想象。好在他们坚持下来,最终实现了从农村到城市的转变……我接着说,每个时代都有其独特的挑战。以我为例,虽然赶上了计算机技术蓬勃发展的黄金时期,但也面临着“35岁危机”。如果我当初没有选择创业,而是继续留在IBM,2022年可能就
AI的“内卷”困境:模型坍塌的危机与潜在的自我救赎
有人推演说,AI开始吃自己的粑粑了,这是个有趣的推演。你养过鱼吗?一缸观赏鱼不引入新血统,长期近亲繁殖,前几代看不出异样。到第四五代,体型逐渐缩小,体色暗淡无光,抗病能力直线下降。到最后,整缸鱼长得一模一样,畸形虚弱,素质大幅下滑。生物学上管这叫近交衰退。2026年,同样的悲剧正在AI身上上演。网上新增的内容一半以上都是AI生成的,占比达到百分之五十二,意味着人类优质原创内容最快两年就会被AI彻底挤占。2026到2028年的趋势叠加,到底意味着什么?AI生成内容大量堆积在互联网,被下一代AI抓取当做训练数