标签

大模型背后的数学支柱

人工智能的基础有哪些呢?在常见的讨论中,常给出的答案往往是"算力""数据"或"Transformer 架构"。这些回答并没有错,却停留在工程层面。若沿着技术栈继续下探,会发现真正支撑 GPT、Claude、Gemini 等新一代大语言模型(Large Language Model, LLM)的,是三门基础的数学学科——线性代数、微积分、概率与统计。事实上,学界目前尚缺乏一套能够完整解释 Transformer 全部行为的统一数学理论(Tai et al., 2025);但在"输入表示—信息加工—参数训练"

2026-07-10 08:38:21  |  18 阅读

OpenAI 原版缩放定律被推翻:实验设计存在致命逻辑错误

Scaling Laws 是过去五年里人工智能领域最核心的基石之一。它揭示了一个规律:模型规模越大、投入的数据越丰富,模型的表现就越出色。这种简单且确凿的信念,正是促使 GPT-3、PaLM 以及当下所有大型语言模型进行激烈军备竞赛的动力源泉。然而,前 OpenAI 研究员 Diogo Almeida 在 Complete Skeptic 专栏发布的一篇文章揭露了一个令人震惊的事实——归功于 Kaplan 等人的原始 Scaling Laws,实际上从一开始就是一个谬误。造成这一局面的罪魁祸首并非算力不足

2026-07-08 13:58:00  |  22 阅读

专家观点:夯实数据根基,加速“人工智能+”创新升级

文 |上海阶跃星辰智能科技股份有限公司创始人、CEO 姜大昕数据是人工智能发展的三大核心要素之一,也是支撑大模型训练与应用的重要基石。高质量数据集直接决定模型的“智能水平与价值取向”,更是制约“人工智能+”落地见效的根本性、关键性问题。习近平主席在向世界数据组织成立致贺信中强调,当今世界正加速迈入智能时代,数据的基础资源功能与创新驱动作用日益凸显。国务院《关于深入实施“人工智能+”行动的意见》也清楚指出要加强数据供给创新,以应用为引领,持续推进人工智能高质量数据集建设。国家发展改革委等部门联合发布《关于促

2026-06-19 09:29:10  |  16 阅读

AI的每一次调整,都是上车机会

黄仁勋多次在采访中表示,AI的发展基于缩放定律,以算力为基石,将经历四个演进阶段:第一阶段为当下的多模态大模型,主要表现为被动响应,依赖Blackwell架构GPU提供算力,这类推理模型是通往智能体的过渡形态;第二阶段预计在2‑5年后,将诞生能独立处理商业事务的AI智能体,通过Agent化、智能体互联以及对接人形机器人来实现具身智能,有望在五年内于大多数经济领域超越人类;1.第一步:多模态大模型走向智能体化。多模态模型不再只是被动回答,而是封装成独立的AI智能体,能够自主调用工具、联网搜索、编写代码、管理

2026-06-15 00:29:20  |  7 阅读

AI 瓶颈论:是终结还是赛道切换?

引言:近两年,"AI 将取代万物"的论调铺天盖地。然而近期硅谷却在热议一个反向话题——AI 的发展速度是否正在放缓?本文将为您厘清"缩放定律"、"数据墙"及"撞墙论"等核心概念,助您分辨哪些是真实困境,哪些仅是喧嚣之争。你是否察觉,过去一年中,AI 新模型发布时的惊艳感已大不如前?往昔并非如此。2023 年,新模型问世常令人瞠目结舌:既能编程、解题,又能绘图,迭代速度极快。那种体验,宛如目睹孩童从爬行到行走再到奔跑,令人应接不暇。然而进入 2025 至 2026 年,局面生变。尽管新模型仍在涌现,参数更庞

2026-06-14 02:28:52  |  8 阅读

深度解析:AI 浪潮下的经济与资本逻辑

首轮冲击波及:就业市场,办公空间闲置,一线人口流动,出境游热度,核心地段房价次轮震荡涉及:新生人口,高考志愿倾向,中小学辅导产业,网购订单,配送业务量三轮深远影响:贫富分化,婚恋体系,财富再分配,治理责任,人文关怀外卖服务等同于白领的能量补给白领能耗由半数体力活动加半数静止代谢构成静止代谢即白领的算力与存储。联想业绩优异旨在替代此环节,若其财报亮眼,则应持续看空大型餐饮纵观历史,唯有此刻服务器正开始取代碳基生命,往昔皆为协作关系依此逻辑不禁发问,若全员失业,谁为谷歌、亚马逊及 Meta 贡献营收?裁员致收

2026-06-06 01:01:06  |  19 阅读

AI数学的深浅

今天聊点硬核话题。一个疑问:AI究竟运用了多深奥的数学?从技术手段和架构来看,AI所涉数学的“平均年龄”已达150岁,绝大多数源自19世纪以前:矩阵运算、梯度下降、链式法则、傅里叶变换、内积、概率论,大多属于本科低年级课程。然而,AI涌现出的某些现象,即便是当前最前沿的数学理论也无法阐释。我总结了几个备受关注的现象:- 缩放定律:当模型规模扩大、数据量增加、算力提升时,模型的损失函数会遵循一条极其平滑的幂律曲线下降,在对数坐标下近乎直线。面对一个拥有数千亿参数、内部高度复杂的巨型网络,其宏观表现竟如此井然

2026-05-24 08:19:08  |  20 阅读

AI 历程:谁绘制了主宰发展的"神性曲线"?

如今,众人皆晓“模型越大智能越强”,当行业巨头拼命堆叠参数、倾尽算力训练大模型时,鲜少有人忆起,这一发展路径的源头,竟始于 OpenAI 早年一次意外且精妙的数学洞察。而这一发现的领军人,正是日后创立 Anthropic 的达里奥·阿莫代伊。达里奥·阿莫代伊的经历颇为传奇:他曾在百度研究团队实习,2016 年加入 OpenAI,自起步便深耕人工智能安全领域——致力于让 AI 系统更贴合人类偏好与价值观,规避对人类的伤害。正是在此方向的探索中,他率领团队研发出后来重塑行业格局的技术:人类反馈强化学习(RLH

2026-05-17 19:38:49  |  12 阅读

AI回复像拆盲盒?掌握生成原理就能稳住

你在用AI的时候,有没有冒出过这样的疑问:为什么有时它给出的回答又准又精彩?为什么有时却像是在“正确”地胡说?聊天窗口后面,究竟在不停运转着什么流程?这篇文章想带你一段路,用一个形象比喻把AI大模型讲清楚。等你下次再跟AI聊,就知道怎么把它用对,不必再像拆盲盒那样碰运气。01 一句话介绍假设你手里有一台机器,它最擅长的只有一件事:接龙。你说一句,它就接下一句。理解AI大模型,我们同样从这一步开始:把它当作一台超强的“词语接龙器”。02 一个比喻:词语接龙机器想让这台机器读得懂人话、能答题、还能帮你把事办成

2026-05-05 15:01:32  |  20 阅读

大模型为何爆发:跨过规模阈值的必然

今天的“大模型革命”,常被形容成一段“误打误撞的奇迹”。但曹古拉斯认为,真实情况更像是:人类点燃了火焰,可火势的扩展速度与范围,远远超出了最初的预想与掌控。AI看起来像个黑箱,我们却很难直接给出答案——到底是什么原因让AI走到今天的爆发。基于此,本文想围绕一个主题把脉:当面对人类亲手造出的黑箱时,AI的每一次高涨究竟是怎样被一步步推出来的。一、Transformer 的诞生:结构改变世界2017 年,一篇后来被频繁引用的论文—— Attention Is All You Need——提出了新的模型范式:T

2026-05-02 22:06:01  |  18 阅读