NVIDIA Dynamo实战解析:Agentic AI推理迈入生产新阶段
伴随Agentic AI与多模态任务的高速发展,AI推理底层架构正由单点调优向多节点分布式协同演进。本次线上分享由NVIDIA资深架构师与业界技术大牛联袂呈现,聚焦NVIDIA Dynamo 1.1版本,带来两场硬核技术解读:长效运行Agent:借助KV Cache感知路由及多级卸载技术提升前缀命中率,并探讨RoleBasedGroup在K8s环境下如何保障有状态Agent服务的高可用与容错机制多模态推理体系:解析E/P/D三段式解耦架构与Embedding缓存调优,如何驱动视频生成及多模态应用的规模化部
解析AI Infra:定义与核心架构技能
AI Infra即AI Infrastructure的简称,中文名为人工智能基础设施,系支撑AI模型自研发、训练至推理应用的全栈技术基石。两大方向:运维与架构设计。若从事运维方向,需着重强化集群监控及故障定位能力;若深耕架构,则应多积淀大规模算力集群的规划经验。架构设计主要涵盖训练架构与推理架构。以下为推理架构设计的关键技能点:第一部分模型优化,需精通量化、剪枝及算子融合技术,明晰模型微调对推理效能的作用;第二部分推理引擎,需熟练运用TensorRT与vLLM,能调节核心参数以优化吞吐量;第三部分调度与缓
AI突破长文本极限,多数人却未察觉其深意
我是楚哥,某软件上市企业副总,深耕软件行业近二十载,自2018年起便与国内顶尖AI专家联手推进相关项目。今年六月这波模型发布热潮,在朋友圈刷屏,众人只注意到“又出新模型了”。坦白讲,这波兴奋实属多余。真正值得关注的数据仅有一个:上下文窗口。GPT-5.6已突破150万Token,Kimi K2.6更是激进,直接达到200万Token。这意味着什么?能将《三体》三部曲全文一次性输入,AI可从头读到尾,人物关系、伏笔线索,全盘铭记。以往与AI对话至第三轮,它便遗忘首句内容;如今?它能一口气读完你全年的工作日志
中国AI芯片产业:供需格局与云服务商合作契机
摘要:2026年国产AI芯片设计行业短期内遭遇尖端制程产能制约,二线厂商依靠库存维持出货,本土代工厂大规模投产预期在2026年下半年。从长期视角看,国内云服务商(CSP)采购突破构成核心增长引擎,预计2026-2030年国产AI芯片需求量年复合增长率约40%。研报涉及燧原科技、沐曦等目标企业,看好拥有稳固产能、成功进入顶尖云厂商供应链、匹配推理计算架构的厂商,认为这类企业具备高速成长与利润实现的潜力,同时警示美国技术封锁、生产良率、CSP资本支出低于预期等风险因素。该报告全文共25页,因篇幅所限,此处仅呈