标签

AI为何能输出复杂推理过程?原理大揭秘

AI 原理系列当我们使用AI时,若开启深度思考模式,模型会展示一连串的思考轨迹涵盖拆解难题、逻辑推导,甚至自我纠错比如像 “等等,感觉不对,我重新思考一下”这些繁复的逻辑推导究竟是如何实现的?首先,AI大模型的训练主要分为三个阶段预训练阶段监督微调阶段强化学习阶段别担心,这三个概念听起来很深奥,但我会尽量通俗地解释,让你了解核心逻辑让我们开始正题首先,AI大模型在完成预训练后—— 就从 初始模型 升级为 基座模型此时通过海量数据的洗礼,人类世界的常识与物理法则已被内化于模型内部具体是如何内化的?本质上就是

2026-07-21 02:46:04  |  11 阅读

人工智能的训练三部曲

前文我们解释了 AI 的本质。本文探讨最引人关注的问题,这样的系统,人类是如何构建出来的?别紧张,不谈复杂算式,我们用“炼丹”来比喻——大模型这枚“灵丹”,需要经历三个阶段,缺一不可。 数据喂养(预训练) 大模型的起始,是“喂养”。将网络上可获取的图书、文本、网页、程序代码,数以千亿计的词汇,大量输入其中。这个环节称作“预训练”。 输入后做什么?让它进行一个填字游戏:把语句中的词语隐藏,让它猜测被遮盖的内容。猜错就调整参数,猜对则继续。经过亿万次循环,它便将人类语言的模式、知识、推理,都“浸泡”进那数千亿

2026-07-11 07:58:35  |  10 阅读

人工智能探索笔记|大模型究竟为何物?

轻点关注加入我们开篇近两年来,无论你是金融从业者、材料研究员,还是气象预报专家,甚至只是闲暇时浏览手机,都难免被“大模型”这个词汇频频冲击。科技巨头们狂热地将数千亿资金倾注于数据中心。采购芯片、铺设电网,仿佛要将全球服务器连为一体。有人戏言,如今大模型每升级一代,地球的碳排放就得剧烈波动三次。这不禁令人困惑。以往提及AI,不外乎人脸识别、刷脸支付,或手机相册自动归类。为何转瞬间,这些话题被搁置,满耳尽是“大模型”?大模型到底是何种庞然大物?我们常听到的Token,又在故弄什么玄虚?今日我们不涉艰深学术论文

2026-07-06 20:06:14  |  22 阅读

AI论文精选:可重复性、机器人优化与健康评估新进展

1. 利用GitHub问题提升可重复性审计:ReproRepo通过标准化流程实现规模化验证 原文标题: ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues 发布时间: 2026-06-16 论文链接:http://arxiv.org/abs/2606.18237v1 复现研究结果的论文与代码发布是科学进步的核心环节。现有工作已构建基准测试来评估大语言模型代理在可重复性审计中的作用,但存在数据标注和人工评估成本过高、

2026-06-18 07:32:00  |  14 阅读

清华团队研发AI驱动PDE智能计算框架并开创预训练有限元新方法

清华新闻网6月2日电 偏微分方程(PDEs)作为刻画复杂物理系统演变规律的核心数学工具,也是航空航天、先进制造、能源装备、生物医学工程等领域开展数值模拟与工程设计的重要基础。传统有限元、有限体积、有限差分等数值方法在过往数十年间取得了显著成就,但在处理复杂几何、强非线性、多尺度、多物理场及高维参数空间等问题时,仍面临计算开销大、重复求解耗时长、数据与物理融合困难等瓶颈。近年来,人工智能与科学计算深度交叉融合形成的AI for Science正在引领科学研究范式的深刻变革。其中,运用人工智能技术求解偏微分方

2026-06-11 09:56:06  |  20 阅读

AI研究前沿速递(6月11日)

LG - 机器学习 CV - 计算机视觉 CL - 计算与语言1、[CL] 跨越鸿沟:前沿大语言模型能否通过标准化办公能力考核? 2、[LG] 统一大语言模型预训练中的本地通信与本地更新 3、[LG] 能精简(至少量Token)者,皆不易过拟合:机器学习研究智能体中的压缩与泛化 4、[LG] 解决反馈对齐中的秩崩溃问题 5、[CL] 汇聚真实复杂环境下的AI智能体集体智慧驱动科学新发现摘要:前沿大语言模型能否通过标准化办公能力考核、统一大语言模型预训练中的本地通信与本地更新、机器学习研究智能体中的压缩与泛

2026-06-11 08:02:41  |  29 阅读

AI 进化史:从规则机器到大语言模型的蜕变之路

导语:昨日我们探讨了一个核心议题:究竟何为大语言模型?先来简要复盘:大语言模型好比一位博览群书的"超级语言天才",它通过吞噬海量文本来掌握语言逻辑,具备写作、摘要、翻译、编程及陪聊等多重技能。然而,许多人心中或许仍有疑问:其实早在上世纪 50 年代,科学界便已开启相关思索:1950 年,英国数学家艾伦·图灵提出了举世闻名的"图灵测试"。其核心逻辑是:让一名测试者同时与机器及真人进行对话。若测试者无法分辨哪方是机器、哪方是真人,则该机器可被视为拥有一定智能。这听起来是否与我们今日同 AI 助手交流的场景如出

2026-06-09 13:31:23  |  10 阅读

字节 Seed 澄清:顾全全并非 AI 制药与预训练主管

鞭牛士6 月 8 日讯,近日有消息指出,前字节跳动 Seed 团队成员顾全全已离职投身创业,外界将其职位界定为 Seed 团队中 AI 制药及大模型(LLM)预训练板块的负责人。针对此事,字节 Seed 内部人士回应称,顾全全在职期间确实参与了生物分子结构预测以及 LLM 预训练的部分项目,但他并非字节 Seed 在 AI 制药和预训练领域的总负责人,公司方面对其具体的创业计划并不知情。早些时候,顾全全已在海外社交媒体上正式宣布脱离字节跳动 Seed 团队,为其三年的任职画上句号。欢迎关注鞭牛士公众号:访

2026-06-08 14:31:04  |  21 阅读

AI术语快速指南

本文不聊深奥理论,主打“短平快”。将这20个术语划分为四大维度,每个词用一句话讲清楚。建议收藏,下次开会可悄悄对照使用。AI01 与“大脑”相关(模型基础篇)这些术语决定了你使用的AI究竟有多智能。•预训练:AI的“九年义务教育”。在正式出道前,它阅读了互联网上的所有书籍和文章,掌握了语言和常识,但尚未学会如何听从指令。•基座模型:刚毕业、尚未经历职场磨练的“大学生”。知识渊博,但不懂规矩,问什么答什么,甚至可能口出秽言。•Transformer:现代AI的“大脑架构”。可理解为AI的“神经元连接方式”,

2026-06-05 13:09:51  |  25 阅读

重磅|南京信息工程大学发布NUIST-WE能源气象AI大模型

南京信息工程大学能源气象AI大模型(NUIST-WE)正式上线当前,在我国“双碳”战略目标的指引下,构建清洁化、多元化、智能化的现代能源体系已成为行业发展核心方向,新能源替代进程正在不断加快。风能、太阳能、水能等可再生能源比重持续增加,正逐渐成为我国新型电力系统的供给主体。根据全球能源行业最新统计数据,截至2025年底,全球风电累计装机容量已突破1299吉瓦,其中中国风电装机占比达49.6%,位居全球首位;在2025年全球新增可再生能源装机中,风电占比更是达到23.9%,成为推动全球可再生能源增长的核心引

2026-05-30 19:54:30  |  9 阅读

AI认知 005:揭秘模型能力是如何被“训练”出来的

AI 认知导图005🗺️在上一篇中,我们探讨了“模型架构”。架构决定了信息在模型内部的流动,而参数则决定了这些流动中的具体权重与关联。然而,文章结尾留出了一个疑问:架构搭建完毕,参数也已填入,模型为何能展现出实际能力?刚开始时,即便架构复杂,初始参数也缺乏实际意义。模型并不会天生就知道“苹果”在什么语境下指代水果,何时指代公司,也不会自动掌握总结文章、回答问题或编写代码的技能。那么,这些能力源自何处?答案便是:训练。训练的核心任务在于:如何将一组初始参数,优化为能够胜任特定任务的参数组合。许多人对“训练”

2026-05-29 07:05:54  |  9 阅读

AI 进化史:从规则机器到全能大模型的跨越

导语:昨日我们探讨了一个核心议题:究竟何为大语言模型?在此快速复盘:大语言模型好比一位博览群书的“语言天才”,通过吞噬海量文本来精通语言逻辑,胜任写作、总结、翻译、编程及陪聊等任务。然而,许多人心中或许仍有疑问:其实早在上世纪 50 年代,科学界便已开启探索:1950 年,英国数学家艾伦·图灵提出了举世闻名的“图灵测试”。其核心逻辑是:让人类同时与机器和真人对话。若人类无法分辨孰真孰假,便可认定该机器具备某种智能。这是否让你联想到今日与 AI 助手的交互场景?只不过彼时的计算机体积庞大,算力也极为捉襟见肘

2026-05-26 15:01:59  |  10 阅读

AI大模型技术详解与职业发展指南

AI大模型领航就业班抓住数字经济红利时代第一波高薪机遇!AI大模型,通常指参数量巨大(通常达到数十亿甚至万亿级别)的人工智能模型。它们大多基于Transformer架构,通过在海量数据上进行预训练(Pre-training),学习通用的知识和模式,再通过微调(Fine-tuning)等方式适应特定任务。其核心能力包括但不限于高级自然语言处理(如对话、写作、翻译、摘要)、代码生成与理解、逻辑推理、数学问题求解,以及日益重要的多模态理解与生成能力(如图文、音视频交互)。保障就业年薪杭州数字人才实训基地保障就业

2026-05-23 09:04:51  |  11 阅读

深度学习大牛Karpathy转投Anthropic:从OpenAI元老到特斯拉AI负责人,为何他看好Claude

五月二十日,前特斯拉人工智能主管、OpenAI联合创始人Andrej Karpathy正式宣布加入Anthropic团队,将主导预训练研究工作。这标志着继Ilya Sutskever之后,又一位顶尖AI学者向Anthropic"迁移"。午后看到这条消息时,我并未感到意外。Karpathy的职业轨迹如同一条清晰的发展脉络——他始终在追寻最具影响力的位置。2015年,人工智能尚未成为今日的热门话题,他便参与了OpenAI的创建。2017年,自动驾驶正处于技术突破的前夜,他加盟特斯拉担任AI负责人。2023年A

2026-05-21 03:46:15  |  34 阅读

AI 精英争夺升温:前特斯拉大牛卡帕西转投 Anthropic

曾任特斯拉 (404.11, -5.88, -1.43%) AI 主管及 OpenAI 联合创始人的安德烈·卡帕西,现已正式入职人工智能新锐企业 Anthropic,将主导预训练研究团队的构建工作。这一动向深刻反映出顶级 AI 人才争夺战已趋于白热化。当前,科技巨头们正全力以赴招揽稀有的 AI 专家,旨在夯实自身的技术护城河。责任编辑:张俊 SF065新浪财经声明:本文内容系转载自合作媒体,新浪财经发布此文旨在传递更多信息,内容仅供参考,不构成任何投资建议。郑重声明:1.依据《证券法》相关规定,严禁编造或

2026-05-20 21:09:30  |  17 阅读