华存案例 | 智谷方案破解AI大模型存储瓶颈,释放千卡集群算力
面对千亿参数大模型的训练挑战,存储系统需具备何种速度方能匹配GPU算力?某人工智能研究院在集群规模不断扩大的过程中,遭遇传统存储受限于以太网带宽、网络丢包及冷热数据统一存储成本高昂等难题,极易引发GPU算力闲置及训练任务中断。华存智谷助力该研究院成功落地训推大模型存储实践,采用高效分层数据存储方案。该方案基于TGStor 9800高性能并行文件系统与RoCE无损RDMA网络构建存算分离底座,利用HSM分层技术连通高性能存储与大容量对象存储,全面支撑大模型预训练、数据集处理及推理业务。目前,该方案已完成全流
Run:ai v2.25 部署前必查清单|硬件系统网络存储证书核对指南
本文基于 NVIDIA Run:ai v2.25 官方文档整理翻译,产品架构、部署分类、软硬件兼容规范均来源于英伟达官方公开手册,仅供企业 AI 算力技术交流使用,生产环境部署建议参考官方原版文档进行验证。上篇《NVIDIA Runai v2.25 私有化部署|拆解平台底层架构与部署方案》已阐明平台两大核心组件与部署方案。但很多团队直接进行安装时,往往会在资源不足、版本不匹配、网络域名缺失等基础环节卡住,造成返工浪费。本文为简明部署前自查清单,不涉及具体操作步骤,仅梳理控制平面、业务集群两套软硬件基础规范
AI时代内存产业格局与技术演进趋势
📌摩根士丹利指出内存在AI发展中扮演关键限制角色;高盛持相似看法,认为随着KV缓存规模扩大、多模态计算需求增长、电力与人力成本上升、物理调度周期延长,算力需求将从GPU逐步分散至HBM、普通内存、闪存、机械硬盘、SRAM、控制器、存储系统及封装设备等多个领域第一层:DRAM与闪存领域 🧠主要内存厂商直接对接AI算力产能瓶颈,HBM为AI加速器提供高带宽支持,标准DRAM保障服务器运作,闪存则负责快速检索、推理数据存储及实时AI数据处理等业务 美光 🇺🇸美国本土全品类内存厂商,产品线涵盖HBM、标准DRAM
本地AI训练卡顿?存储系统或是关键所在
随着AI技术日益普及,越来越多的用户倾向于在本地搭建AI环境。本地化部署无需依赖网络和云端服务器,既能保障数据隐私安全,又能实现对数据的完全掌控。然而,在配置本地AI环境时,大多数人往往将注意力集中在GPU、CPU等算力设备上,却容易忽视存储这一关键基础环节。实际上,存储是本地AI稳定高效运行的“根基”。根基不稳固,再强大的模型也难以发挥最佳性能。在本地AI运行过程中,硬盘空间主要由三大板块占据:模型权重与配置文件模型权重是AI模型的核心参数,尤其是大模型,从几十GB到上百GB都很常见。配置文件、词汇表等
影石固态闪传器:全景相机存储新方案
运动相机拍摄的视频能否直接存入固态硬盘?影石确实实现了这一构想。Insta360移动固态闪传伴侣,体积小巧如硬币,可为自家设备随拍随存,日常亦可作为手机固态硬盘使用,售价999元,您认为如何? “掌”握科技前沿(微信搜索techsina或扫描左侧二维码关注) 新浪科技 新浪科技为您提供最新的科技动态 苹果汇 苹果汇为您带来最新的苹果产品资讯 新浪众测 新奇产品第一时间免费体验 新浪探索 提供最新的科学家新闻,震撼的图片集锦 新浪科技意见反馈平台 新浪简介|广告服务|About Sina 联系我们|招聘信息
AI存储的升级新路径
生成式AI的迭代速度快到让人目不暇接:从早期文生图、文生视频逐步迈向智能体AI,如今在可控范围内已能呈现更具“自主实体”特征的能力,并开始向更高阶的物理AI演进。与此同时,这种快速扩张也让存储在AI数据中心与AI工厂里的地位愈发关键。为此,铠侠在近期推出多项创新方案与产品形态,涵盖高容量SSD、带宽光互联SSD以及1亿IOPS SSD等,相关技术体系均源自BiCS FLASH™闪存技术。SSD的重要性愈发凸显目前AI基础设施的构建,主要围绕GPU展开,并围绕GPU为其提供配套存储支持。其中HBM虽然能够把