标签

AI集群的隐形支柱——数据中心交换机解密

在GPU的狂热背后,一场隐秘的网络较量正悄然展开。单块GPU的算力早已绰绰有余,万卡集群的最大掣肘,从来不只是芯片,还有互联网络。今天我们来探讨一个常被轻视的AI硬件——数据中心交换机。01为何交换机是AI的隐形瓶颈从2023年起,全球陷入了一场空前的算力争夺战。众人的目光几乎全聚焦于GPU:🔶NVIDIA的H100、H200、B200供不应求;🔶各大云服务商疯狂抢购GPU;🔶全球企业竞相搭建AI数据中心。同时,美国对GPU芯片向东方大国严加管控、Deepseek逆势推出不依赖顶级GPU的大模型、而Goo

2026-07-15 21:29:46  |  8 阅读

华存案例 | 智谷方案破解AI大模型存储瓶颈,释放千卡集群算力

面对千亿参数大模型的训练挑战,存储系统需具备何种速度方能匹配GPU算力?某人工智能研究院在集群规模不断扩大的过程中,遭遇传统存储受限于以太网带宽、网络丢包及冷热数据统一存储成本高昂等难题,极易引发GPU算力闲置及训练任务中断。华存智谷助力该研究院成功落地训推大模型存储实践,采用高效分层数据存储方案。该方案基于TGStor 9800高性能并行文件系统与RoCE无损RDMA网络构建存算分离底座,利用HSM分层技术连通高性能存储与大容量对象存储,全面支撑大模型预训练、数据集处理及推理业务。目前,该方案已完成全流

2026-06-30 15:19:24  |  19 阅读

AI 以太网组网实战:RDMA协议、流量管控、交换芯片与软件生态全解析

目 录AI 网络互连硬件第一篇:1.6T/3.2T 背后的价值迁移,交换、铜互连、光互连和物理层谁最受益英伟达、博通与 Marvell 的 AI 网络控制权:2026 英伟达闭环与博通开放网络之战铜互连没有结束:Astera Labs、Credo 与 Marvell 高速连接芯片,2026 AI 机柜短距连接控制权全解全文内容概括:本文的核心观点是,AI 以太网不是简化版的 InfiniBand,而是一套必须借助 RoCEv2、PFC、ECN、DCQCN、VOQ、deep buffer、packet sp

2026-05-17 21:06:04  |  29 阅读