LinkedIn宣布,在其刚刚开始的财年内(截至明年六月),不会扩大数据中心规模。公司表示,过去六个月通过提升现有GPU的使用效率,实现了硬件资源的翻倍利用,从而避免了在AI硬件上的大额支出。尽管AI硬件需求变化迅速,LinkedIn高管们表示已考虑到内存芯片价格的上涨。

LinkedIn工程技术总监Erran Berger表示:“我们的目标是尽可能保持计算资源的规模不变,同时上线更多计算密集型的产品。这在当前环境下是一个大胆的承诺。”基础设施技术总监Raghu Hiremagalur补充说,他们希望在支出上保持谨慎,这种限制将激励工程团队在开发新一代生成式AI功能时更加富有创造力。Berger相信,效率提升将随着时间积累,未来数据中心扩展时能获得更大收益。

Hiremagalur强调:“对于我们这样规模的公司来说,全年不增加存储和计算资源是一项不小的成就,这背后付出了大量努力。”

目前,OpenAI、Meta和Google等公司正通过各种合作,建设配备最新芯片的大型数据中心,但劳动力和零部件短缺使许多项目受阻,部分AI工具的客户使用也被限制。与此同时,业界开始质疑持续高额投资AI的可持续性。拥有超过13亿用户的LinkedIn,成为首个公开表达支出顾虑并抵制数据中心扩建热潮的大型企业。

Principal Venture Partners管理合伙人、惠普董事会成员宋怡允表示:“这对行业是个积极信号,表明AI正从试验阶段进入生产纪律阶段。最终胜出的企业不会仅仅是那些在基础设施上投入最多的。”

微软于2016年收购LinkedIn后,曾尝试将其迁移至Azure云服务,但由于LinkedIn用户量和需求激增,通用数据中心难以满足其需求。2022年,LinkedIn决定全面自建数据中心,分别位于俄勒冈、德克萨斯和弗吉尼亚,这使其能更好地掌控技术细节,适应新时代的挑战。

同期,LinkedIn开始开发基于AI的助手,帮助用户撰写消息、寻找工作和招聘候选人。Hiremagalur指出:“每个查询的成本逐年上升,数据存储量也在翻倍增长,这种趋势不可持续。”

为此,LinkedIn优化了AI模型训练和推理的整个数据中心使用流程,开发了计算和存储使用的监测工具,并建立了更高效的资源分配系统,使GPU利用率达到95%以上。

此外,LinkedIn采用模型蒸馏技术,将大型AI模型压缩成更小的模型,用于职位推荐等功能,既降低了运行成本,又保证了推荐质量。Berger表示:“用户能发现之前难以找到的职位,模型对用户需求理解得非常精准。”

LinkedIn还对新闻推送模型进行了优化,通过简化训练流程、复用历史推荐信息以及合理分配CPU和GPU负载,实现了成本效益的提升。公司甚至改写了部分Nvidia处理器的软件,使其能处理超出设计范围的任务,同时将部分任务转移至成本更低、能耗更少的CPU上。过去12个月,这些效率提升为LinkedIn节省了约2400万美元,相当于节省了1100个GPU全年运行的成本。

虽然节省金额对年收入达180亿美元的LinkedIn来说不算巨大,但Hiremagalur强调,技术精细化管理和释放资源带来的灵活性同样重要,这让工程师能更快启动新项目,集成更多AI功能,而无需扩大计算资源。

Berger表示,LinkedIn在控制成本的同时,提升了职位和候选人匹配的质量,为微软创造了财务回报。“我们希望通过部署更大模型和更深入推理,以更低成本提供更优质的服务。”

尽管支出保持平稳,LinkedIn的数据中心并未停滞,公司承诺采购新服务器以替换老旧设备。Hiremagalur指出,硬件价格近期飙升,有些服务器价格涨了三倍,这使提前采购成为节省成本的关键。

LinkedIn的效率提升反映了业界对生成式AI工具使用成本的深入分析趋势,被称为“代币经济学”。咨询公司Gartner的Chirag Dekate表示:“企业正从‘买更多’转向‘做更多’。过去的口号是买得越多越省钱,但买得越多只会增加成本。”

Dekate观察到,许多中小企业通过清理闲置软件、裁员、购买更经济的新型数据中心空间以及采用低成本AI模型,成功降低了开支。但他也担忧,如果财务限制过严,企业可能面临计算和存储需求无法满足的困境。“最终要么放弃部分AI目标,要么放弃冻结IT支出的要求。”

LinkedIn并未完全放弃未来的数据中心扩建,但改变了基础设施资源的分配方式。Hiremagalur表示,不再凭空猜测未来一年的计算资源需求,而是采取季度评估的方式,Berger称这是“拥抱混乱”,同时关注长期投资回报。未来支出是否能持续保持平稳仍有待观察。