算力告急 亚马逊AWS勒令工程师压缩CPU资源损耗
据一位内部参会者披露,亚马逊(274.48, 2.22, 0.82%)云服务部门(AWS)高管层在5月同工程团队进行沟通时,抛出一项严格任务:为确保旗下核心弹性计算业务EC2今后可向全部用户输出充裕算力,工程人员需竭尽所能节省资源。
该消息人士指出,需压缩的算力既涵盖标准中央处理器(CPU)相关服务器能力,也涉及长期处于供不应求状态的AI专用芯片资源。过去几十年间,互联网行业整体运转均建立在CPU芯片之上;而近期AWS内部多位工程师反映,申领CPU服务器算力用于研发项目的排期明显延长。
有工程人员透露,此前数小时便可获配的服务器算力,眼下需等待数日之久,极易造成项目难以按时交付。这位工程人员在AWS供职多年,从未经历过如此漫长的资源排队周期。
另有知悉该内部部署的人士表示,AWS已为各项目组设定今年下半年前达成算力压缩目标的时间节点。工程人员正在下线软件开发完毕后空转的EC2虚拟服务器(即云实例),将这部分算力腾挪出来分配给外部客户使用。
今年蔓延整个科技行业的算力短缺潮,目前已波及传统通用算力范畴。众所周知,英伟达图形处理器(GPU)等AI芯片需求井喷,直接引发AI专用算力紧张;而在AI产业整体带动下,CPU服务器同样陷入供给紧绷。配套CPU运行的内存芯片产能吃紧、数据中心物理机柜容量受限,进一步放大了算力鸿沟。
金融AI服务商埃伦迪尔实验室联合创始人兼董事谢静(音译)剖析,越来越多员工借助AI智能体开发软件,企业CPU消耗量随之大幅攀升。她接触到的客户企业中,员工人均IT支出直接翻番——大量工作交由AI智能体执行,需要采购更多云端算力,而此类任务普遍依赖CPU支撑。
即便在AI模型研发环节中,CPU同样承担重要工作:例如AI企业训练模型前预处理数据阶段,需借助CPU读取文档、图片、视频等原始材料。
谢静指出:“当前绝大多数模型开发、生成与运行环节,对CPU的需求规模远超以往。”
英特尔(101.65, 1.84, 1.84%)首席执行官谭仲明在4月财报电话会议上透露,当时AI推理(模型线上运行)场景中CPU与GPU算力配比为1:4;至7月,英特尔首席财务官大卫・津斯纳表示二者配比已逼近1:1,AMD(483.36, -5.92, -1.21%)、安谋(Arm)高管也得出了类似结论。
AWS则否认自身运营策略出现调整,并在官方声明中指出:“即便需求持续走高,我们仍能满足绝大多数内外部客户的算力诉求。我们始终协同内部团队保障其算力供给,同时督促团队高效使用EC2资源,该管理方针从未改变。”
亚马逊表示,内部工程人员优化资源的准则与面向外部客户的建议完全一致:比如关停闲置云实例、切换适配自身业务负载的实例规格。若客户当前实例的算力未被充分利用,可更换配置更低的机型。
AWS给出明确优化准则:若某台EC2服务器连续四周CPU、内存平均使用率低于40%,建议客户降级更换更小规格实例。
AWS配套提供自动化扫描工具,可自动识别利用率偏低的服务器。亚马逊强调,即便当前内存芯片紧张,面向内部员工的资源管控标准并未调整。
近两年来,统筹内部研发算力与外部客户算力供给,成为各大科技巨头共同面临的挑战。去年谷歌(353.47, -3.15, -0.88%)成立高管专项委员会,统筹分配谷歌云、DeepMind人工智能实验室、C端业务三大板块的算力资源,但各方算力争夺矛盾依旧尖锐。据报道,今夏谷歌顶尖AI研究员诺姆・沙泽尔便因算力资源受限、研发遇阻离职。
企业若能精细化管控算力资源,就能更快将闲置算力转化为收入。微软(499.99, 0.13, 0.03%)首席财务官艾米・胡德在上月最新财报电话会议上表示,Azure云服务业绩增长,部分得益于团队对CPU、GPU算力集群的高效调度优化。
胡德指出:“本季度工程团队在算力盘活上成效突出;受供需失衡大环境影响,只要我们提升算力使用效率,新增的可用资源就能迅速变现创收。”
一名AWS行业咨询顾问透露,客户通过合约锁定的预留CPU算力暂未出现供给缺口,但近几个月大批量申领AWS竞价实例(厂商闲置富余算力,低价售卖、可提前两分钟回收资源)的难度显著上升。
责任编辑:刘明亮
新浪财经声明:此消息系转载自合作媒体,新浪财经登载此文出于传递更多信息之目的,文章内容仅供参考,不构成投资建议。
郑重声明:1.根据《证券法》规定,禁止编造、传播虚假信息或者误导性信息,扰乱证券市场;2.用户在本社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。用户应基于自己的独立判断,自行决定证券投资并承担相应风险。
