今天的AI领域相对平静,是时候退一步,深入思考背后的趋势。如果你关注过2025年的论文清单,了解Z.ai GLM的发展,关注Poolside的战略转变,跟进AI科学主题,收听过Simile播客,你会发现一个清晰的思维模型:

AI发展趋势图

自2022年以来,构建机器智能的流程中,越来越多环节由模型替代人工完成。这种替代不是渐进的,而是每个环节都有“零号病人”——一篇论文或一个产品首次实现了合成版本的关键突破,未来已来,只是尚未全面产业化。

我们曾称之为“合成数据”、“合成评分标准”、“AI研究员”和“端到端强化学习环境”的,实际上是越来越雄心勃勃的人类模拟——性能可能差10%,但成本降低100倍,速度提升10000倍。

阶段1:奖励信号(2022年)

最先被合成的是评判者。InstructGPT提出了经典方法:收集人类偏好训练奖励模型,策略针对模型优化而非直接针对人类。Constitutional AI让AI根据原则自我批评,后续研究证明AI反馈能以更低成本匹配人类反馈。到LLM作为评判者成为默认评估方式时,整个审批体系——奖励、批评、评估——均由模型完成。

阶段2:训练数据(2023年)

微软Phi系列提出“教科书就是全部所需”,小模型用LLM合成的高质量数据训练,表现超出参数规模。苹果WRAP进一步推广,不仅生成数据,还用LLM重述整个网络,预训练效率提升约3倍。NVIDIA Nemotron-4 340B发布时,合成数据生成管线成为亮点。到2025年,推理链式语料成为标准预训练和中期训练材料,原本不可替代的人类输入大量由模型生成。

阶段3:教师模型(2023年)

ChatGPT API开放后不久,斯坦福Alpaca展示了用600美元微调GPT生成的指令即可复制前沿模型行为。Vicuna通过共享对话,Orca通过丰富教师解释,技术从模仿演进为训练学科。on-policy知识蒸馏解决训练与推理不匹配,DeepSeek-R1发布蒸馏模型家族,教师即模型成为小模型发布的默认假设。

阶段4:课程设计(2024年)

前面阶段合成了输入,第四阶段模型开始决定“下一步学什么”。早期已有Self-Instruct和STaR等模型自写指令和推理链,Meta的Self-Rewarding Language Models和SPIN让模型自生成任务、自评估并超越人类偏好数据极限。课程设计——传统上最依赖人工经验的环节——开始由模型自主完成。

阶段5:研究者(2026年)

辅助时代仍由人类选实验,发现时代则非如此。DeepMind的AlphaEvolve在2025年进化出新算法,Sakana的AI Scientist描绘了完整论文写作流程。Karpathy的autoresearch实现了极简闭环,自动修改训练配置,运行短实验,仅保留验证损失改善的改动,夜间循环,700次实验积累20次改进,将GPT-2训练时间从2.02小时缩短至1.80小时,真正实现了睡眠中发现代码优化。

阶段6:环境(2026年)

强化学习瓶颈从模型转向环境:需要成千上万个可执行、可验证、专业级的任务环境,人工构建速度远远不够。Z.ai构建了端到端合成环境管线,研究代理挖掘真实工作模式转化为长时程环境,评判代理确认任务可解,验证器无需参考解答独立合成并经过严格测试,确保奖励信号可靠。GLM-5.3发布时,整个环境、评判和验证堆栈均为合成。Ornith-1.5实现端到端自我提升,模型自拟任务,自生成强化学习轨迹,健身房、裁判和记分板均由模型承担。

阶段7:人类主体(2025年)

模型能担任评判、教师和环境,剩下的人类角色是“主体”——偏好、行为和需求的来源。Simile项目正替代这一层,从Joon Sung Park的Generative Agents到千人数字孪生模拟,数字人能以85%准确度复现受访者行为。难点是前沿模型趋向代理模型,难以真实模拟人类,Simile通过访谈、交易数据和注册随机对照试验后训练,恢复人类偏差和因果结构。Shopify的SimGym模拟购物轨迹,腾讯的十亿人格方法,焦点小组、用户研究和A/B测试正转变为推理工作负载。

阶段8:物理世界(2026年,进行中)

最后一环永远未完全合成,这正是重点。Poolside的反向执行信表明,世界问题分为智能驱动和实验驱动两类,后者无法仅靠智能解决,需真实实验反馈。AI的持久价值属于掌控实验闭环者,成为“世界最有价值的科学发现引擎”。生物领域则从另一方向推进,CZ Biohub将人类细胞图谱数字化为虚拟细胞,成本和速度均远优于体内实验,向虚拟免疫系统延伸,Chai、Xaira和Lila等项目完善AI科学堆栈。物理世界无法完全合成,只能逐细胞压缩为模型。

指数增长始于验证机制

每次合成替代都伴随质疑——模型崩溃、幻觉堆叠、垃圾进垃圾出——但每次替代都发生在验证机制成熟之时:Phi的教科书过滤、LLM评估的模型间一致性、RL验证的单元测试和证明检查、z.ai验证器的多重测试、Simile孪生的注册RCT、虚拟细胞的湿实验。合成前沿的进展不是生成质量提升,而是验证能力提升。

这也指明未来方向。网格左下角的物理实验和具身真相区域,是验证最慢、最昂贵的部分。模型学会了写作、评判、实践、实验,未来十年关键问题是它们需要触及多少现实,又能模拟多少。

10%性能损失,100倍成本节约,10000倍速度提升,且三者均快速改善。

再看一遍趋势图:

AI发展趋势图


AI推特热点回顾

  • Ox Alpha成为焦点神秘模型,多方报告其编码和代理性能异常强劲,疑似Zhipu/GLM系列,可能是GLM-5.3 Vision或闪电版,社区快速分发。
  • 技术观点聚焦“后训练+基础设施优于单纯规模”,Ox Alpha表现更像高效GLM衍生品,非1万亿参数巨兽。
  • DeepSeek发布最具体产品,V4-Flash-Vision-Exp支持多模态,性能接近Opus-4.8,新增混合文本+图像API和文件API。
  • 中国实验室在价格性能和多模态代理方面压缩前沿,引发美国实验室关注。
  • OpenAI调降GPT-5.6 Sol价格20%以上,并推出更细化的消费控制,回应竞争压力。
  • Codex用户激增,活跃用户达2000万,产品增长显著。
  • 代理基础设施产品化加速,GitHub将协作代理工作流集成至Slack和Teams。
  • 强化学习推理正确性取得系统性进展,vLLM IsoExec解决浮点非结合性导致的日志概率不一致问题。

AI Reddit热点回顾

  • Qwen3.8-27B本地代理表现突出,能自主完成复杂任务,但知识回退明显,偏向编码和工具调用。
  • DeepSeek V4 Flash Vision-Exp性能显著提升,多模态任务表现优异。
  • 硬件配置创新,16×RTX 5060 Ti推理集群展示极致性能

AI模拟技术正以惊人的速度和效率,逐步替代传统人工环节,推动AI进入一个全新的发展阶段。未来,验证机制的进步将决定模拟技术的边界,而物理世界的实验仍是不可替代的关键环节。