AI瓶颈不在算力,而在懂模型的存储
自ChatGPT亮相以来,英伟达股价飙升十余倍,跻身全球股市最受追捧的明星。其核心逻辑在于:AI能力越强,对GPU的需求就越旺盛。然而时至今日,AI的舞台已不再由GPU独霸。
随着Coding Agent等智能体应用的崛起,AI还需承担任务规划、工具调用、文件读取、知识检索、记忆回溯等职能,并在长上下文环境中持续运作。
这使得计算机内部更多组件被调动起来:GPU承担大模型运算,CPU负责任务调度与工具执行,内存存储高频访问数据,SSD(固态硬盘)则需承载模型参数、上下文缓存、知识库乃至智能体记忆。
当AI大模型参数量从千亿跃升至万亿,当显存与内存价格"堪比黄金"(目前内存价格较去年第四季度已上涨3至4倍),当智能体所需的上下文数据不断膨胀,继续沿用"暴力堆砌"GPU与内存的策略,不仅成本高企,更无法根本解决AI Agent规模化部署的性价比难题。
寅谱尝试以"以存换算"的理念破局:并非让SSD取代GPU的计算职能,而是借助成本更低的SSD承接冷温(访问频率偏低和中等)的AI大模型数据、复用已完成计算的中间产物,从而缓解显存与内存的压力、缩短GPU等待时间、减少重复的Prefill(预填充)操作。
他们正与SSD控制器企业联芸科技(688449.SH)携手,将传统意义上仅用于文件存储的硬盘,重塑为可参与模型数据调度的AI SSD。
其核心并非简单地为硬盘贴上"AI"标签,而是从模型运行与系统软件的视角出发,重新规划数据的存放位置、迁移时机,以及哪些计算任务值得被固化到芯片之中。
除新近推出的AI SSD外,寅谱还在布局近存计算协处理器与推理专用ASIC芯片。
为何一家初创企业需要横跨多个品类的半导体芯片布局?
创始人田洋指出,寅谱是一家半导体与集成电路企业,公司立足AI推理的真实负载与数据流向,以软件诉求牵引硬件架构设计,通过软硬件协同,将模型与系统层面的需求落地至芯片、控制器、固件及存储介质的设计之中。
首席科学家欧阳苇航(左)、CEO田洋(中)、CTO熊巍
立足系统层面
让硬盘介入AI运算
寅谱创立于2024年。CEO田洋具备清华大学计算神经科学与统计物理博士背景,CTO熊巍同为清华博士,长期深耕高性能计算与AI for Science领域,对I/O(输入/输出)优化、负载均衡及芯片软件生态有着深刻认知。两人均为95后。
二人都曾就职于华为2012实验室,这段共同经历使他们进一步从系统维度审视计算机架构。主板上分布着电压、频率、温度、功耗等众多参数,芯片间也彼此关联。倘若能够实时感知并协同调控这些状态,便有望在相同硬件条件下释放更优的性能与能效。
寅谱早期发布的KLEENE主板智控技术,正是这一理念的结晶。
传统主板一般依据出厂预设的静态规则管控电压、频率、功耗与散热,而KLEENE借助实时感知系统运行状态,对各部件实施动态调节,使硬件性能得以更稳定、更充分地释放。此后,寅谱推出了搭载AMD Ryzen AI Max+ 395的桌面计算机Hilbert,将其作为新技术与软硬件协同能力的"试验田":主板调控、存储分层与推理软件等技术可率先在自有平台上协同运行并持续打磨,再转化为参考设计与标准化组件。
经过在自有平台上对AI推理的反复验证,团队洞察到的关键路径日益明朗:无论模型参数由显存下沉至内存,还是KV Cache从内存写入SSD,数据均须经由PCIe总线。
因此,寅谱沿此总线探寻瓶颈所在——田洋表示:"AI的瓶颈已不止于算力,存储正成为新的关键制约。AI硬件需应对的,已不只是能否计算,而是如何让不同层级的存储在恰当时机接力,使计算尽可能减少等待。"
寅谱推出AI SSD的契机之一,便是为了尝试破解这一难题。
寅谱的AI SSD,非实物图(图片来源:互联网)
普通SSD所面对的仅是一连串读写请求。它无从知晓某一数据块属于模型权重、MoE专家还是KV Cache,也不清楚模型下一毫秒将要计算哪一层。熊巍指出:"SSD并不理解这些数据的差异,而是统一视作文件处理。"
寅谱于今年6月发布的AI SSD,首先仍是一款兼容现有计算机的SSD,但新增了面向大模型的数据管理能力:通过专用的加速分区、固件与调度算法,参与模型权重、KV Cache及MoE专家的分层、预取与搬运。
这一设计进一步提升了大语言模型的计算效率,也使本地可部署AI模型的参数规模得以进一步扩展。
这并不等同于SSD取代显存。更合理的层级关系是:最热、即将参与计算的数据驻留显存;近期可能调用的数据存放内存;容量更大、暂不活跃但仍有复用潜力的数据下沉至AI SSD。上层软件负责判定"谁该去哪",主控与固件负责高效执行。
据寅谱透露,公司正与联芸科技等SSD控制器及产业链伙伴协作,围绕大模型推理、Runtime、操作系统与SSD主控、固件、NAND Flash及模组量产适配等环节展开协同探索。
熊巍强调:"真正需要攻克的难题,是如何将主机端真实的AI负载需求逐层传递至中间件、固件、控制器乃至NAND介质管理,使SSD围绕AI负载实现协同优化。"
对普通用户来说,AI SSD最直接的价值在于借助成本相对低廉的SSD容量,缓释AI大模型运行对昂贵内存扩容的依赖。在特定模型、量化方式与软件栈的配合下,普通消费级计算机通过内存与AI SSD的协同,有望承载原本需更高硬件配置方能运行的大模型及Coding Agent任务。
沿PCIe总线
反向定义专用计算芯片
如今,人与AI的交互正从Chatbot的问答模式迈向Agent模式。
过去围绕训练构建的计算集群,已无法完全契合大模型推理的计算特性。熊巍指出:"Agent时代的硬件角逐,正从比拼单点性能,转向计算与存储协同的系统能力。"
AI SSD并非寅谱当前主攻的"高地",沿PCIe总线延伸,公司还在研发另一类芯片——计算协处理器与计算ASIC。
鉴于现有产品与商业体系难以根除的I/O瓶颈,公司正凭借新型协处理器与专用芯片直击这一痛点。
田洋表示:"我们遵循的是软件牵引硬件设计的思路。先厘清模型与Runtime的真正诉求,再决定硬件应有的形态,将稳定、可重复、值得加速的能力逐步固化至硬件乃至电路层。"
寅谱正在布局近存计算协处理器及更为专用的推理ASIC。与追求全任务兼容的通用芯片不同,这类芯片将让渡部分通用性,把大模型推理中计算密度高、结构相对固定的环节直接硬化,目标是以有限的成本与功耗支撑更大规模的模型。
AI SSD与专用推理芯片因而并非两条彼此独立的产品线。前者解决数据存放位置与及时抵达问题;后者解决如何以更契合推理的方式完成计算。两者共同服务于同一目标:让一台设备以更低成本持续高效地产出真正可用的Token。
在DDR与HBM成本仍居高位、模型持续演进的阶段,寅谱首先借助调度与协同,使现有CPU、GPU、内存与SSD释放更大效能。正如田洋所言,这些虽为既有部件,但通过不同的组合与设计,可实现截然不同的效果。与此同时,寅谱也在推进专用芯片,将软硬件协同能力进一步落实至芯片设计之中。
寅谱的产品路线图同样折射出公司的定位。田洋表示:"我们是一家集成电路与芯片设计公司。我们从大模型推理中的真实负载、数据流与应用场景出发,先判断模型、Runtime与操作系统的真正诉求,再将这些需求逐层落地至硬件的设计与适配中。最终目标是让软硬件真正协同,将有限的算力与存储资源利用得更充分。"
谈及未来,AI计算将呈现"云边端"协同格局——计算任务分布于云端、边缘节点和个人设备之间,由系统依据成本、时延、隐私及数据位置灵活调度。熊巍指出:"无论计算发生于何处,核心都绕不开两个命题:一是降低计算成本,二是让敏感数据尽可能由用户自主掌控。"