我们在7月曾关注过“节奏控制”争论,当时《Pacing the Frontier》首次提出相关观点。如今,这场辩论迎来了第二轮,原文作者Dario Amodei发表了一篇罕见的个人博客,详细阐述了他对节奏控制的具体看法:
-
嵌入式评估者:每家前沿AI公司承诺为嵌入的第三方评估团队(如METR)提供持续、类似员工的访问权限。这些评估者负责核实安全实践和承诺的遵守情况,报告事件,并协助评估不仅是完成的AI模型,还有训练流程和管道。这是确保节奏承诺可验证的关键步骤,类似于银行业中监管“监督员”与员工共事的做法。Anthropic已单方面承诺执行此步骤,旨在加强安全与对齐工作。
-
民主协调:民主国家的前沿AI公司协调制定共同的安全标准及对AI进展速度的限制。部分协调措施法律上存在挑战,需要政府支持。
-
全球协调:美国及其他民主政府尝试与威权政府协调,尽可能推动合规验证,尽管面临诸多挑战。
巧合的是,成立于2025年12月的AI评估者论坛(AI Evaluator Forum)也发布了他们对第一类评估者职责的期望:

AEF成员预计将成为大型实验室自我监管时招募的主要第三方审计者。Dario承诺提供前所未有的访问权限,包括“办公室内的工作台、访问证和公司笔记本电脑”,以及“工作空间、工具和权限,基本上与内部风险评估团队相当”。
虽然这些措施符合国内自我监管的惯例,但更具挑战性的考验是Dario提出的如何与中国共同控制AI进展速度的方案。
近期AI领域的动态还包括:
-
AI安全治理与第三方评估标准的正式化:AI评估者论坛发布了AEF-1标准,涵盖访问权限、利益冲突、资金关系、回避机制和透明度,推动独立评估的规范化。
-
节奏控制与安全优先的分歧加剧:部分业内人士呼吁放缓能力提升以确保对齐和透明度,而另一派则强调通过控制和治理解决安全问题,反对减速。
-
代理框架和编程代理的兴起:代理框架工程逐渐成为独立学科,桌面编程代理应用扩展,工作流趋向更复杂的编排。
-
模型与产品发布及成本效益变化:DeepSeek-V4.1-Flash表现突出,成为开放模型中性价比领先者。Cohere推动文档解析经济性,Google和OpenAI等持续拓展多模态和消费级功能。
-
机器人基础模型和专用应用AI进展:RewardAI发布OM-1机器人基础模型,具备跨多种机器人类型的零样本泛化能力。芯片设计AI工具实现全栈覆盖,大幅缩短设计周期。
-
基础设施与开放生态系统发展:TPU与vLLM集成加深,开放模型生态与真实数据采集结合,去中心化和主权AI系统受到关注。
-
社交媒体热议焦点:围绕Anthropic安全生态的财务关系质疑、未来模型可能规避对齐评估的风险声明、以及消费级AI产品Muse的快速增长。
综上,AI安全治理正迈向更成熟的第三方评估体系,行业内对节奏控制的争论依然激烈,技术和治理手段不断演进,全球协调与透明度成为未来发展的关键方向。


