面壁智能破局:600亿参数模型仅用8G内存,国产算力领跑端侧AI
通常情况下,运行一个8B参数的大模型大约需要16GB显存,参数规模越大,对显存资源的消耗就越严峻,这也推高了硬件成本。不过,现在出现了一种新技术,能让显存需求骤降6倍,同时尽量维持原有的性能水平。这两年全球都在争夺这一前沿技术,而我国凭借国产算力优势,已率先取得突破。该技术能把模型压缩到3B以内,性能保留率高达97%;配合MoE架构,未来只需8G内存的手机就能运行600亿参数的大模型。这一惊人的技术突破背后有何奥秘?传统大模型通常依赖高精度的数值来存储权重,每个权重的可选数值非常丰富,虽然精度高,但非常消
国内首个1.58比特端侧大模型开源发布
IT之家5月25日信息,面壁智能携手清华等机构,今日公布并开源其最新低比特大模型成果BitCPM-CANN。 据透露,该模型为我国首个完全基于华为昇腾平台端到端训练并开源的三值(1.51-bit)大模型。从量化计算、训练方法到整体框架,BitCPM-CANN均在昇腾平台原生构建,提供0.5B、1B、3B、8B四种规模,与同规模MiniCPM4全精度系列逐一对比测试,表现卓越。 相较传统BF16精度,BitCPM-CANN在推理时释放约6倍显存优势,同时保持90%-97.2%模型能力保留率。 官方指出,对移
端侧AI新突破:国产技术实现手机运行大模型的高效压缩
一个 8B 参数的大模型,通常需要约 16GB 显存。参数越多,越吃显存,这就是为什么,内存价格一天比一天高。 现在,有一种方法,可以省下 6 倍显存,却几乎不损耗模型性能。 过去两年,围绕这个看似极端的思路,一条全球性的技术竞赛正在成型。而就在这条赛道上,一个完全基于国产算力的方案,刚刚给出了自己的第一个回答。 模型被压到了不到 3B,同时,能力却可以保留 97%,甚至更进一步,如果结合 MoE 架构,未来可以直接在一部 8GB 内存的手机,运行 600 亿参数的大模型。 听上去匪夷所思,怎么做到的?
面壁智能开源首个基于昇腾训练的1.58位端侧大模型
【TechWeb】5月25日,面壁智能联合清华大学、OpenBMB开源社区共同发布了其在低比特大模型训练领域的最新成果——BitCPM-CANN。这是国内首款完全基于华为昇腾算力平台实现的1.53位端侧大模型,该模型在技术上实现了重要突破。在相同设备配置下,该技术展示首次完成,随后已将其完整模型系列向公众开放。据公开信息显示,相比传统BF16精度,该模型在推理过程中节省了约6倍的显存资源,同时模型能力保持在90%至97.2%之间。在相同终端设备上运行时,可承载的模型能力大幅提升,过去需要1/6的内存即可获
国产AI芯片三巨头竞逐算力基础竞争
在美国芯片出口限制加剧的环境下,中国的AI芯片行业迎来了战略机遇期。据国际数据公司(IDC)2026年4月发布的《2025年度中国云端AI加速器市场报告》指出,2025年国内AI加速卡出货量达400万张,其中国产厂商出货165万张,市场份额升至41%,而英伟达出货220万张,占比55%。在这一快速发展的国产市场中,华为昇腾、阿里平头哥和百度昆仑芯组成核心“三强”阵营。自2026年上半年以来,这三家企业相继发布新一代芯片产品和超节点方案,中国AI算力基础的竞争正加速推进。华为昇腾:以一年一代、算力翻倍的节奏
台积电 A13/A12 蓝图揭晓,AI 芯片封装战打响
台积电在 2026 技术论坛上投下震撼弹:A13 与 A12 两大先进制程路线图首度曝光,N2U 量产时程更提前至 2026 年第四季。这标志着 AI 芯片的竞逐核心,已由比拼"制程微缩"转向较量"封装实力"。📅 发布日期:2026 年 5 月 25 日⏱️ 预估阅读:约 4 分钟🏷️ 内容标签:#硅基觉醒 #台积电 #AI 芯片台积电借由 2026 台湾技术论坛,正式披露 A13(1.3 纳米)及 A12(1.2 纳米)两项新制程规划。同期,N2U(2 纳米增强版)的量产节点提前到 2026 年末季,较
清华携手华为昇腾:AI大模型训练内存占用锐减六成
快科技5月24日报道,当前AI算力的核心痛点已从显卡转移至存储介质,特别是国内在高端HBM内存方面存在短板,因此各类优化方案层出不穷。近期清华大学的一项研究成果显示,其在华为昇腾平台上成功将内存占用压低了六倍。 面壁智能、清华以及 OpenBMB 团队共同推出了 BitCPM-CANN,这标志着首个基于华为昇腾 NPU 打造的端到端 1.58 比特(三元)大模型训练平台问世。 该系统采用了独特的三元量化算法,将模型参数压缩至 -1、0、1 三个数值状态,不仅使显存占用减少了 6 倍,同时也有效降低了能耗。
国产 AI 芯片迎来政策强音:大模型适配加速算力自主
导语|5 月 22 日,国家发改委在例行发布会上明确表态:指导国产大模型加大力度适配国产算力芯片。同一场发布会还释放了具身智能基建、AI 立法研究、集成电路税收优惠等一揽子信号。这是一次国家层面的 AI 路线定调。5 月 22 日上午,国家发改委政策研究室副主任、新闻发言人李超在例行发布会上,针对人工智能领域作了一段值得逐句拆解的表态。原话是:"人工智能领域核心技术和应用需求都呈现快速增长态势,我们始终坚持系统布局、分业施策、开放共享、安全可控,推动人工智能与经济社会各行业各领域广泛深度融合,指导国产大模
俄储蓄银行拟采华为芯片:国产算力破局西方封锁
快科技 5 月 21 日讯,消息显示,俄罗斯联邦储蓄银行掌门人格尔曼·格雷夫透露,该行正计划引进中国产处理器,以支撑其 GigaChat 人工智能模型的运作。鉴于西方制裁致使俄方难以获得尖端欧美硬件,华为昇腾 950 系列已成为俄方重点考察的替代方案。当下华为昇腾 950PR 芯片面临巨大的产能考验,字节跳动、阿里巴巴及腾讯等国内互联网巨头已抢先锁定大量货源。单是字节跳动一家,今年采购金额便高达约 380 亿元人民币。华为设定了 2026 年产出 75 万颗芯片的目标,但受限于中芯国际 7 纳米 DUV
华为郭振兴:AI赋能制造业价值凸显,2026年开启深耕新阶段
2026年5月15日,由华为同江汽集团共同承办的AI+制造行业峰会2026在合肥顺利召开。此次峰会以“跃升行业智能化”为核心议题,汇集了汽车、机械电子、医药等制造领域的专业人士,各方重量级代表就AI+制造、AI推动制造业提质增效等话题展开深入交流。峰会现场,安徽省工业和信息化厅党组成员、副厅长蒋晨捷、华为监事会副主席陶景文、江汽集团股份公司总经理李明发表开场致辞,充分认可AI在制造业取得的成效,并指出AI在制造业的应用前景广阔,是推动中国从“制造大国”迈向“制造强国”的重要驱动力量。以《释放AI新质生产力
国产AI芯片崛起:英伟达份额骤降至8%,自研架构重塑市场格局
【TechWeb】中国AI芯片市场正经历一场深刻的变革。根据Bernstein Research等多家机构的最新数据,英伟达在中国AI芯片市场的占有率已从三年前的95%高位急剧下滑至8%。与此同时,国产AI加速卡的市场份额却强势攀升,成功突破60%大关,标志着国产GPU正式告别“跟随者”角色,开始主导市场走向。 自主创新:国产芯片突围的关键 国产AI芯片的强势崛起,并非简单模仿国外技术路线,而是凭借原创架构实现突破。据《2026中国AI计算芯片市场研究报告》显示,多家国产芯片企业通过自主研发,在性能和成本
AI 服务器电源产业深度解析:市场格局、技术趋势与供应链洞察
AI 服务器电源专家深度对话国产 AI 服务器超级节点目前的交付进度怎样?与 2025 年下半年相比有何不同?国产 AI 服务器超级节点计划于 2026 年启动小批量交付,整体步入稳健起步期,这与 2025 年下半年几乎无规模化产出的状况形成鲜明对比。目前,国内核心采购方主要为阿里和字节两家互联网巨头,两者的机柜硬件配置策略差异显著:阿里采用单机柜 128 卡搭配 3.3kW 电源架构,每台机柜配置 8 个电源模组,共计 96 颗 3.3 千瓦模块;字节曾规划多种方案,最终基于产品成熟度选定 72 卡机柜
国产GPU突破技术壁垒:市场份额超六成、追赶者变领跑者
快科技5月18日报道,Bernstein Research等多家研究机构数据显示,英伟达在中国AI芯片市场的份额从三年前的95%骤降至8%,而国产AI加速卡市场份额突破60%,国产化率首次跨越六成门槛。中国AI芯片市场正在经历历史性变革,国产GPU彻底摆脱"追随者"的固有印象。 国产GPU的成功并非简单复制英伟达的技术路径,而是开辟了自主架构的新方向。据《2026中国AI计算芯片市场研究报告》,华为昇腾采用自研达芬奇架构实现全栈自研,950PR芯片推理性能达到英伟达H20的3倍,有力回击了国产芯片性能逊于
无锡打造大型Token工厂 首批配备华为昇腾服务器
IT之家 5 月 17 日消息,据《科创板日报》今日消息,弘信电子将与无锡高新区合作建设大型"Token 工厂"。 消息称,此次在无锡高新区建成的"Token(IT之家注:词元)工厂",初期将配置 4 台华为昇腾 384 超节点服务器。每台超节点服务器具备 384 卡算力能力,将 4 个 384 张 GPU 组成超级计算集群。该项目未来将作为规模化、高性能"国产芯片模型"算力集群的新典范。
无锡携手华为打造华东最大昇腾算力集群
弘信电子集团官方公众号披露,5月15日,无锡高新区与燧弘华创就Token工厂项目及华为超节点集群达成合作共识并正式签约。即将建设的Token工厂首批将配置4台华为昇腾384超节点服务器,旨在构筑华东地区规模首屈一指的昇腾算力集群。 Token工厂落户无锡 华为昇腾超节点作为国产芯片集群的领军产品,代表着当前国产AI算力的顶尖水准,其单套算力高达215 PFLOPS,拥有卓越的算力密度与高速互联能力,能够高效支撑大模型训练与推理等关键应用场景。 此次在无锡布局的Token工厂,其核心目标是构建"能源—芯片—