Cursor是一款用于构建专业软件的AI编码代理。它支持所有主流前沿模型,同时也拥有自家的模型,这使得Cursor成为评判各模型实际表现的一个极为中立的观察者。

Nate Schmidt是负责维护这份评分表的工程师。他在Cursor专注于评估和模型行为的研究:分析模型成功的原因、失败的原因,以及是什么让开发者在任务中途悄然放弃某个模型。当同事和客户想了解新版本表现时,都会找他咨询。

随着时间推移,Schmidt团队发现公开的基准测试分数与开发者的实际反馈不再一致,于是他们开发了自己的评测体系:CursorBench。

CursorBench旨在捕捉工程师实际使用模型时那种复杂且不明确的提示方式。比如一个评测任务仅仅是粘贴一个堆栈跟踪并附上“fix”一词,模型需要自行推断意图,找到根本原因,并验证修改效果。另一个任务则故意告诉模型错误的模块出了问题,测试它是否会质疑用户的假设,还是盲目跟随走入死胡同。

当Claude Fable 5参与评测时,模型在最大努力模式下取得了72.9%的成绩,创下新高,展现了当代理编码工具与合适模型结合时的强大能力。

CursorBench成绩

然而,当Schmidt在自己的工程工作流和个人测试中使用该模型时,他发现自己不再需要反复提醒模型目标。过去需要不断“看护”——提醒上下文、详细说明解决方案、审核结果——现在都变得多余了。他可以直接交给模型一个问题,无论是他一直拖延的复杂重构,还是需要推理的细微边缘情况,Claude Fable 5都能解决。

“我感觉不需要再引导Claude Fable 5去理解我所处的世界和我想解决的问题,”Schmidt说,“模型开箱即用就能理解。”

全局推理能力

Schmidt团队在用CursorBench测试新模型时,正确答案只是基础。他们更关注的是模型是否真正理解了被问的问题。

“很多评测都是:这是一个定义明确的问题,这些是约束条件,去修复它。但真实用户给出的提示并非如此,”Schmidt说,“模型必须推断用户有问题,理解他们想表达什么,找出根因,修复它,验证修复效果,并反馈结果。”

Claude Fable 5在这些模糊任务上的高分让Cursor团队开始怀疑。

“要么模型非常聪明,要么模型在作弊,”他说。于是团队深入分析了模型在最难任务中的推理过程,这些任务提示看似简单,但破解它们需要理解整个系统。

“我们不断看到模型挖掘出其他模型之前未曾做到的成功案例,”他说。它完成任务所需的操作也更少,令牌使用效率更高。

随后,Schmidt用Claude Fable 5做了他最喜欢的个人测试之一:登月任务。

几周前,他用一句简单的提示——“建造一枚火箭并登月”——将Claude Opus接入一个可编程的太空飞行模拟器,让它在第二个屏幕上运行12到16小时。模型会发射,燃料在轨道耗尽,添加更多燃料后火箭因过重无法突破大气层,任务失败。

他用同样的空白提示重新运行实验,这次用的是Claude Fable 5。几分钟后,火箭升空,进入低轨道停泊,然后返回地面。失败依旧。但Schmidt查看了对话记录。

“Fable决定首次不直接登月,而是先完成一个进入轨道并收集遥测数据的初始任务,然后用这些数据指导下一次飞行。”几次尝试后,第二个屏幕上的引擎声停止了,月球上出现了着陆器。整个过程用了几个小时,而Opus则是十二小时以上无结果。

“Opus做的是局部推理——考虑刚发生的事情和眼前即将发生的事,”Schmidt说,“而Fable是在做全局推理,思考整个任务。”

登月测试

何时选择全局最优解

Schmidt总结了一个简单规则,决定何时使用Claude Fable 5而非更便宜、智能较弱的模型。

“如果你对从A点到B点的路径有清晰认识,可能不需要Fable。但如果你在A点,完全不知道B点在哪里,Fable是极佳选择,”他说,“当我想用正确方式构建东西时,Fable是我首先想到的模型。”

Claude Fable 5还让团队重新启动了之前搁置的项目——那些大家都认为重写会更好,但没人愿意花几周时间去做的项目,因为模型能承担起足够的框架工作。“它降低了启动这些任务的能量门槛,”Schmidt说,“让我们能追求全局最优,而非局部最优。”

这也改变了团队的协作方式。Cursor团队结构精简,强调个人强烈的责任感,几乎没有例会。现在,Schmidt会让代理先阅读队友最近的提交并标记冲突,这样两人都不用停下来沟通确认。

为了平衡成本和性能,团队将Claude Fable 5与更快、更轻量的模型搭配使用,日常工作用轻量模型,遇到能力瓶颈时才调用Fable。Schmidt表示,这种组合是他们迄今为止最有效的配置。

“当我遇到极其棘手的问题——最难的1%问题——我最想优化的是解决时间,”他说,“我认为Fable是解决我们最难问题的最佳模型。”

团队协作

未来展望

尽管已经在CursorBench和登月测试中充分考验了模型,Schmidt仍在寻找Claude Fable 5的极限。接下来,他计划测试模型能否无人值守管理后端系统,进行数天甚至数周的运行。Cursor团队内部则用模型主动寻找性能瓶颈和用户痛点,而不是等待报告,并构建更复杂、更贴近现实的评测环境,以衡量未来的模型表现。

“有一类问题过去没人考虑,因为看起来难以接近,”他说,“有了Fable,我很期待去挑战它们。”

想要开始使用Claude Fable,请访问 Claude Fable