我们此前曾热切关注过GLM 5.2,并且Jie Tang教授曾预测年底会出现一个开放权重的Fable级模型。当前距离年底还有134天,已有两款2-3万亿参数的模型(Qwen 3.8 Max和Kimi K3),而Fable模型估计在3-7万亿参数之间,性能仅比它们略高。

Jie Tang教授最近在X平台上指出,单纯用参数数量来衡量模型规模已不够:“参数数量必须结合数据量、计算资源分配以及模型运行者和运行环境等三个维度一起考虑。”

我们之前讨论过Chinchilla及其后续的规模定律,但在实际推理应用中,Chinchilla的假设并不完全适用,因为任务对参数与数据的依赖存在差异。简言之,记忆型任务更依赖参数数量,而推理型任务则更依赖后训练数据和有效深度。

GLM 5.3的重大进步主要来自于在长时环境中的强化学习训练:

这些环境涵盖了更广泛的生产工作流程,任务设计基于工程和研究的实际操作。一些任务代表了经验丰富工程师数天的工作量。例如,在机器学习基础设施任务中,模型拥有与工程师相同的工作环境,能够访问计算集群、存储系统、内部文档、代码库和实验结果。模型需要诊断训练瓶颈、实施优化、运行实验,并在保证正确性的前提下实现端到端的加速。此类训练推动模型承担起从头到尾完成复杂工作的责任,而非依赖用户分解问题和监督每一步。"

对于关注递归自我提升的读者,他们的环境、评判和验证过程完全是合成的:

随着代理能力提升,后训练规模化的难点从模型转向环境。有效的任务环境必须可执行、可验证且贴近真实专业工作,且需要大量此类环境。为此,他们构建了端到端合成环境的流水线,并为部分任务合成强化学习奖励信号。研究代理从真实工作中收集任务模式,转化为具有多步依赖和隐藏状态的长时环境;评判代理尝试每个任务以验证其可解性。验证器在无参考解的情况下合成,利用求解轨迹发现并修正奖励捷径。通过多重检查的验证器能产生足够可靠的二元奖励信号用于训练。"

为终结对参数数量的执念,Jie Tang教授提出了五个规模调节旋钮,包括MoE稀疏性的新XA-YB符号。他指出,高级技能(如发现软件漏洞)不是简单的检索或记忆问题,而是需要保持长达20步以上的因果链推理能力。这种能力一旦达到一定知识阈值,参数总量已不再是决定因素。

GLM 5.3规模调节示意图

显然,AI的发展还有很长的路要走。

此外,近期AI领域动态丰富:

  • Ornith-1.5发布,涵盖9B到397B参数的MIT许可开放模型,支持多种量化格式,强调端到端自我提升能力。
  • 压缩技术持续进步,Qwen3.8-27B的动态量化版本提升了约10%的准确率,同时支持低内存运行。
  • 代理和法律评测榜单持续变动,GLM 5.3在多个开源模型中表现优异。
  • 新型代理框架如DeepSeek Harness和TrueForge强调插件化和成本效率,推动代理运行时的开放和可扩展。
  • 微软Agent Lightning通过强化学习提升模型性能,展示了实用的训练方案。
  • 检索系统和基础设施优化不断推进,提升生产环境的响应速度和效率。
  • Google Gemini 3.7 Flash在评测和产品集成方面表现突出,OpenAI聚焦低成本部署和隐私保护,Anthropic优化开发者体验。

这些进展共同指向一个趋势:AI规模的提升不再单纯依赖参数数量,而是多维度优化训练数据、计算资源和环境设计,推动模型向更复杂、更自主的方向发展。