我们报道了Jev模型于周三的发布,该视频在短短两天内就获得了3600万次观看(相比之下,OpenAI的Navier Stokes结果获得了7400万次观看,Anthropic的Fable 5获得了5700万次观看)。

Jev并非开源,这引发了大量猜测、精彩演示和讨论,也带来了不少争议和批评,进一步推高了热度。

以下是目前已知的几个Jev克隆版本,最被看好的技术基础是ModernBert和Diffusion模型:

  • Laya:拥有4.21亿参数,基于ModernBERT-large编码器,增加了两个Transformer层用于评分用户提供的选项,采用PPO优化序列嵌入以输出逐步转换轨迹(概率范围0.0到1.0)。
    • 开发者对未获认可表示不满,声称使用了未证实的RLCD方法。
    • 置信度基于熵计算,缺乏校准。
  • DiffusionGemmaJev:基于扩散模型,基准测试表现接近原版。
  • Bespoke Nimble:Qwen3.5-9B的LoRA微调版本,采用对比数据策划,基准测试略低于原版。
  • SemIf (前身为OpenJev)HuggingFace链接):基于4B和35B参数的因果Qwen3.5骨干,末尾带有三分类NLI分类器。
  • Jevlike:轻量级40K字节嵌入的选项注意力模型,每个候选项作为查询读取共享上下文并获得评分。
  • Kev-0.5B:基于Qwen2.5-0.5B的小型LoRA适配器和读取头。

值得注意的是,数据方面被确认是100%合成的,这一点尚未引起足够关注。


AI Twitter综述

决策模型、路由与“Jev”浪潮

  • 判别模型作为新系统原语崛起:Jev作为非生成式决策模型,被视为快速的“系统1”补充,显著降低了评分成本。
  • 开放复现和生态克隆迅速出现:多个团队发布了基于不同技术的Jev克隆,性能和速度各有侧重。
  • 首批有吸引力的集成多在浏览器和电脑使用流程中,体现为工作流控制层而非聊天机器人。

代理工具、编码框架与代码标准

  • AGENTS.md作为跨工具规范获得认可,减少了格式转换文件。
  • 编码代理的框架设计成为性能和成本的重要变量。
  • 软件系统中的模型选择呈现分化趋势,规划与执行分别采用不同模型以优化效率。

基准测试、递归自我改进与数学能力

  • 递归自我改进的定义更为精准,强调改进过程本身的可修改性。
  • 数学基准测试持续被前沿模型刷新,但解释仍需谨慎。
  • 计算机使用基准尚未饱和,实时动作和视频适应成为新方向。

基础设施、训练系统与模型架构

  • 长上下文和大规模训练基础设施仍是优化重点。
  • 架构分类讨论活跃,线性RNN与SSM的区分更清晰。
  • 边缘/本地神经程序执行取得进展,支持离线本地运行。

机器人、视觉、音频与生成媒体

  • 开放机器人数据集发布丰富,涵盖大量模拟和真实任务。
  • Astra模型在视觉任务中表现突出,集成于多种产品。
  • 语音和唇动同步技术取得显著进步,相关模型在速度和质量上领先。

AI安全、评估治理与安全性

  • Anthropic与埃森哲合作推动前沿AI独立评估,投资规模达十亿美元级别。
  • “流氓代理”事件引发对隔离和防护措施的讨论,强调多层防御的重要性。
  • 政策层面安全法规和操作责任压力增大,独立监督和安全激励成为焦点。

AI Reddit综述

关注/r/LocalLlama和/r/localLLM社区的最新动态。