跳到正文
硅脉动SiliconMai

报道称AWS收紧内部CPU资源分配

AI智能体带来的计算需求开始从GPU扩散至通用服务器;AWS称仍能满足绝大多数内外部客户需求,外部合同资源尚未出现明显短缺。

硅脉动
亚马逊资料图
图片来源:Wikimedia Commons / Buiobuione,CC BY-SA 4.0

亚马逊云服务AWS正要求内部团队减少闲置计算资源,以便把更多CPU服务器容量留给外部客户。The Information援引知情人士称,AWS高管5月要求工程团队尽可能节省算力,并为部分团队设定了年内削减资源占用的期限。

报道称,一些工程师正在关闭过去用于软件开发、目前已经闲置的EC2虚拟服务器实例。一名AWS工程师表示,过去数小时即可获得的CPU资源现在可能需要等待数天,项目交付因此面临延误风险。AWS回应称,即使需求庞大,公司仍能满足绝大多数内部和外部客户的计算需求,并正与团队合作提高EC2资源利用效率。

外部客户目前没有出现同等程度的影响。一名协助企业使用AWS的顾问表示,尚未观察到客户通过合同承诺获得的CPU容量发生运营性短缺。不过,AWS以折扣方式出售、并可提前收回的竞价实例近几个月更难大批量取得,显示云平台可供调度的富余容量正在减少。

需求变化与AI智能体的使用方式有关。AI咨询机构Elendil Labs联合创始人Jing Xie表示,其客户人均IT支出出现翻倍,原因是AI智能体会持续调用云资源。模型训练前的数据读取和处理同样依赖CPU,因此GPU采购增加并不会减少通用服务器的需求。

芯片厂商披露的信息也指向CPU负载上升。英特尔首席执行官陈立武4月表示,AI推理中的CPU与GPU使用比例约为1比4;公司首席财务官David Zinsner在7月称,这一比例已经接近1比1。内存供应和数据中心物理空间不足,又进一步限制了服务器部署。

算力分配已经成为大型云厂商共同面对的问题。报道称,谷歌设立了高级管理委员会,在Google Cloud、DeepMind和消费者业务之间协调资源;微软则把Azure部分增长归因于CPU和GPU机群管理效率提高。对云服务客户而言,合同容量尚未受影响,但低价弹性资源减少可能先推高批量计算的成本。