标签

AI算力基础设施岗位热招:华为、腾讯、百度、字节

岗位1:AI基础设施工程师公司/机构:华为工作地点:深圳 / 上海 / 杭州岗位类型:全职(校招)招聘对象:本科及以上💡 工作内容:投身 Agent、语言、多模态、空间智能等大模型训练与推理的核心技术及系统架构研发;承担训推框架与加速特性的设计开发工作,涵盖预训练、RL 后训练、Agentic AI、推理引擎及服务化等方向;负责 AI 训练/推理系统的性能调优,围绕计算、内存、通信、IO 等维度实施软硬协同优化;关注 AI 计算集群、训练系统、推理系统优化等领域前沿动态并促成落地应用;投入下一代 AI 训

2026-08-29 16:18:45  |  9 阅读

直播预告丨AI推理性能深度优化:openFuyao InferNex如何大幅降低TTFT

当算力规模迈入万卡集群、单日Token处理量迈入万亿级别的今天,传统推理架构在KVCache的高效复用、长上下文显存调度、Prefill/Decode资源协同等关键环节遭遇全新的技术挑战。毫秒级的延迟波动与显存资源的无效占用在大规模推理业务场景下会被持续放大,不仅显著推高运营成本,也对终端用户体验带来不利影响。InferNex作为openFuyao面向多样化算力与灵衢高性能总线协议打造的云原生分布式推理加速套件,依托智能路由、PD分离式弹性伸缩决策框架、分布式KVCache管理、推理全链路可观测四大核心子

2026-08-11 15:19:22  |  53 阅读
WAIC聚焦:摩尔线程揭秘AI工厂新突破,国产芯训模性价比跃升

WAIC聚焦:摩尔线程揭秘AI工厂新突破,国产芯训模性价比跃升

专题:2026世界人工智能大会(WAIC) 新浪科技讯 7月19日下午报道,在2026世界人工智能大会(WAIC)上,摩尔线程(612.980, -35.92, -5.54%)重点呈现了三大“AI工厂”——模型训练工厂、词元生产工厂、智能体生产工厂所取得的阶段性建设成效。 眼下,前沿基础模型平均每两月更新一次,词元消耗激增,导致算力需求呈指数级攀升。摩尔线程创始人、董事长兼CEO张建中在现场表示,依托摩尔线程夸娥(KUAE)智算集群构建的三大“AI工厂”,能够支持从训练到推理、从数字空间到物理空间的多样化

2026-07-19 17:23:46  |  24 阅读

智慧调度Token制造中心:AI计算架构的变革性深度分析报告(综合完善版)

到2026年,中国每日Token使用量超过140万亿次,对比2024年初增幅逾1400倍(央视财经,2026年3月),这标志着AI计算架构从"资源租用阶段"过渡到"Token制造阶段"。英伟达首席执行官黄仁勋在GTC 2026大会上首次推出"Token制造经济学",把计算设施的输出标准由FLOPS转变为Token产出量(Token Throughput),并预计到2027年AI运算需求将至少触及1万亿美元(NVIDIA GTC 2026)。▸然而,Token制造中心解答了"怎样高效产出Token"的难题,

2026-07-12 21:49:37  |  24 阅读

AI科研日报 | 自主生物医学Agent最新动态

扫描时间:2026-07-11 09:50 (Asia/Shanghai) 数据源:arXiv、PubMed、产业新闻 覆盖方向:AI/ML、计算机视觉、NLP、生物医学+AI 交叉核心亮点:关键结论:核心创新:关键结果:核心优势:愿景与意义:7月9日多方消息透露,OpenAI计划发布GPT-5.6,推理速度达到750 Tokens/s,可能采用覆盖100张晶圆的全新架构。大模型推理效率竞争迈入新阶段。腾讯混元团队推出Hy3模型,基于MoE架构,总参数量295B、激活参数量21B。幻觉率从12.5%下降至

2026-07-11 14:12:16  |  14 阅读

AI基建千亿蓝海,为何潜伏于网络深处?

作者丨包永刚过去六年,国产GPU企业乘风AI浪潮,估值屡创新高,DPU却长期处于聚光灯之外。这与产业实情并不相符。2020年英伟达并购Mellanox之后,便确立了"GPU+CPU+DPU"的三芯布局。近年来英伟达持续加码网络布局,黄仁勋在2026年CES展示"六芯矩阵"时,其中四款产品均与网络息息相关。一个日益明朗的走向正在显现:AI基础设施的制约因素,正由算力本体向网络与调度层面迁移。特别是Agent时代来临后,AI系统由训练阶段转向高频推理与永续运转,GPU利用率愈发受制于网络效能。DPU也由昔日数

2026-07-03 14:15:27  |  26 阅读

AI推理赛道杀出黑马,挑战英伟达霸主地位

就在刚刚,又一家AI芯片企业正式“出山”。“我们即将走出隐身状态。”美西时间6月30日,AI芯片新秀 Etched 在X平台宣布,公司已完成首颗A0流片,并建成了首批整机机柜(Frontier Inference Clusters)。不仅如此,产品已累计签订超过10亿美元客户合同,融资总额达到8亿美元,首批产品将于今年夏季交付。Etched还透露,早期客户测试表明,其系统在推理任务上的吞吐量、延迟和能效已处于行业领先水平。AI芯片行业几乎每天都有新公司诞生,Etched之所以引发关注,是因为它选择了一条与

2026-07-01 10:37:52  |  32 阅读

OpenAI联手博通推出自研AI推理芯片Jalapeño

在大模型算力需求持续攀升的背景下,OpenAI正式迈出自研AI芯片关键一步,与博通联合打造的首款芯片“Jalapeño”已浮出水面,聚焦成本与能效压力最突出的推理场景。据多家科技媒体与产业链信息,OpenAI与芯片巨头博通(Broadcom)深度合作,共同设计并量产一款专用于人工智能推理任务的定制芯片,内部代号为“Jalapeño”。该项目已推进数个季度,被视为OpenAI从纯软件与云服务商向“软硬一体化”转型的重要里程碑。区别于当前主流的GPU方案,Jalapeño从设计之初即针对大规模模型的在线推理、

2026-06-26 06:28:00  |  30 阅读

AI前沿洞察 | OpenAI造芯·智能体·程序员出路

HN本期推荐 | 五则硬核技术剖析今天 Hacker News 与 TechCrunch 曝光了多条引人注目的深度科技资讯。我们从 30 篇外文报道里挑出了 5 篇技术干货,涉及 AI 硬件、开发基建、语言迭代、AI 智能体发展及程序员求职动向,全篇译制并附带专业评析。OpenAI 推出首款自研大模型推理芯片 "Jalapeno"核心词:AI算力推理加速芯片设计OpenAI 今天官宣了旗下首枚自研处理器,内部代号 Jalapeno,交由 Broadcom 协助生产。该处理器是专为 AI 推

2026-06-25 23:43:11  |  34 阅读
昇腾0Day全面优化GLM-5.2推理性能

昇腾0Day全面优化GLM-5.2推理性能

IT之家 6 月 18 日消息,“昇腾 AI 开发者”公众号 6 月 17 日宣布,昇腾 0 Day 支持 GLM-5.2,为编程与长程任务提供全面推理优化。 据官方介绍,目前昇腾 A3 系列产品已经支持 GLM5.2 的单双机以及大 EP 推理部署。针对 GLM5.2 模型的结构特点,昇腾围绕以下几个关键技术开展了高效推理优化: IT之家注意到,智谱 6 月 17 日宣布上线并开源 GLM-5.2。在全球百万用户参与盲测的前端开发评估系统 Code Arena 上,GLM-5.2 取得全球可用模型第一的

2026-06-19 03:36:40  |  30 阅读

AI顶尖人物最新洞察 | 2026年5月20日行业风向标

AI界从来不缺热点与深度思考。今日多位顶尖专家分享了对人工智能发展的最新见解:从MoE架构的效率提升,到世界模型的发展路径,再到算力投入的指数级增长,这些前沿观点值得我们仔细研读。X 🔥 热度指数👉 MoE架构的核心在于高效激活机制Karpathy在研读完GPT-5的推理实现后,对MoE路由优化印象深刻。在MoE架构中,每个token仅需激活少数专家模块,GPT-5中每个token仅激活2/128的专家,但性能依然卓越。他想传达的核心观点是:模型不一定要更大,关键是架构设计更高效。这给我们一个重要启示:未

2026-06-11 08:30:52  |  24 阅读

英伟达 GTC 台北站:告别纯聊天,Agent 行动纪元来临

AI 已不止于答疑,它正着手替你执行具体任务。在 GTC 2026 台北盛会中,黄仁勋耗费两小时阐述了一个核心观点:AI 正从“内容生成”迈向“任务执行”的新阶段。这一变革对算力需求的冲击,远超大众此前的预判。01 推理超越训练:算力消耗的主阵地发生转移黄仁勋在演讲中强调,Agentic AI 的工作负载以推理为核心,且在特定场景下,其算力消耗已逾越传统训练模式。这表明企业部署 AI 的成本架构正经历重塑英伟达于会上推出了新一代 Blackwell Ultra 架构,专为高频推理场景量身优化。这不仅是产品

2026-06-07 08:29:46  |  41 阅读

AI 行业前沿观察

Agent 走向基建化世界模型理论获证实。智能体与多智能体协作Orchard 统一架构:微软开源项目,整合代码、图形界面及助手三类 Agent 的训练流程,确立标准动作空间。Agent 衰退与评测:研究表明 Agent 长期运作会导致性能下滑,并提出了针对环境破坏的鲁棒性评估方案。科研自组织化:AutoScientists 达成“假设 - 实验 - 验证”的全自动闭环,依靠失败驱动自我修正。推理机制与思维链隐性思维链:证实 Transformer 能内化推理过程,无需输出中间 token,大幅削减推理开销

2026-06-03 00:23:23  |  18 阅读

AI顶尖人物洞察 | 2026/5/20 - 业界领袖最新思考

AI领域从来不缺乏热点和深度思考。今日多位顶尖专家分享了对AI未来演进的最新看法:从MoE架构的效率提升,到世界模型的发展路径,再到算力投入的指数级增长,这些业界领袖的洞见值得我们仔细研读。X 🔥 热度指数👉 MoE架构的核心在于精准激活仔细研究完GPT-5的推理代码后,Karpathy最受触动的是MoE路由的改进。在MoE架构中,每个token仅需激活少数专家,GPT-5里每个token仅激活2/128的专家,却依然表现出色。他想传达的核心并非模型规模,而是架构的效率提升。这给我们一个重要启示:未来AI

2026-05-30 18:33:01  |  44 阅读

AI助力罕见病诊断与技术革新并进

波士顿儿童医院携手OpenAI研发出“副驾遗传学家”系统,融合基因数据、表型信息及全球医学文献,已成功协助确认40余例此前无法确诊的罕见病例,并发现新的基因靶点和潜在治疗路径。OpenAI承诺投入5000万美元支持该项目。核心功能:Co-pilot Geneticist系统整合基因组数据 + 表型描述 + 实时医学文献,支持医生跨越传统信息处理瓶颈突破成果:已实现40+例“此前被认为不可能的诊断”,并识别出新基因靶点及潜在治疗途径投入规模:OpenAI承诺专项投入$5000万美元;这是OpenAI迄今最大

2026-05-30 07:54:46  |  32 阅读