截至目前,全球在人工智能领域的投入已超过1.6万亿美元,且增长势头依然强劲。然而,实际成果却并不理想。多项研究表明,诸如AI聊天机器人和自主代理等工具在完成现实世界任务时,表现并不令人满意。

科技行业普遍认为,随着AI能力的飞速提升,未来几年内将带来前所未有的经济增长。但这一观点是否成立?加州大学伯克利分校负责任去中心化智能中心的一项新研究给出了不同的答案。

该研究设计了一个名为“代理人终极考试”(Agents’ Last Exam,简称ALE)的严格评估体系,旨在测试多款最先进AI模型的“工作准备度”。ALE涵盖了超过1500项由专家提供的任务,涉及55个职业领域,包括软件工程、平面设计,以及海事工程、农业、音频制作和公共卫生等较为边缘的岗位。

研究团队利用ALE基准测试了多款先进的闭源AI模型,如Anthropic的Fable 5、OpenAI的GPT-5.5、Cursor的Composer 2.5和谷歌的Gemini 3.1 Pro,同时也考察了两款中国开发的开源模型。

结果显示,尽管这些AI模型技术先进,但在应对现代职场复杂需求时仍远远不够。所有模型均未能通过测试,OpenAI的GPT-5.5表现最佳,但总体通过率仅为24%。

研究人员指出:“当前的AI代理能够完成部分专业任务,但面对需要持续推理、深厚领域知识和长期可靠执行的复杂任务时,表现远不及人类。”随着任务难度增加,AI的表现迅速下降。在ALE最难层级,所有测试的前沿AI代理,包括Fable 5,成功率均为0%。

此外,研究还分析了成本因素。Fable 5的表现与GPT-5.5和Composer 2.5相近,但每完成一项任务的成本却高出4到12倍。

尽管测试结果不佳,研究人员警告说,AI技术仍可能对工作市场产生冲击。许多企业高管的调查显示,即便AI表现不佳,也足以让员工感受到压力。

伯克利计算机科学研究员、该研究合著者Dawn Song表示:“即使当前通过率较低,依赖常规且流程明确的职业可能首先受到影响,而需要决策密集型的岗位则更具韧性。”她补充道:“关键因素不是行业本身,而是工作的性质。”

更多AI相关内容,请关注OpenAI销售目标的最新动态。