JetBrains是全球开发者使用的工具制造商,旗下产品包括IntelliJ IDEA、PyCharm以及Kotlin编程语言,服务超过1250万活跃用户和财富全球100强中的88家公司。JetBrains首席技术官Vladislav Tankov与Anthropic分享了他们团队如何评估新模型、决定何时使用Claude Fable 5,以及在使用前沿模型时如何考虑数据保留和安全保障。
2026年,前沿AI对JetBrains有何影响?
我在JetBrains工作已有10年,我们是最早一批使用大型语言模型(LLM)服务的客户之一。过去一年里,公司内部和客户中曾有AI怀疑论者,但现在大家普遍接受AI将成为技术行业的基础性变革。公司里几乎所有怀疑者的态度都发生了改变。
如何评估新模型并决定使用时机?
作为一家专注于编程的公司,我们建立了完善的评估流程:使用大量私有代码库(包括我们的单体仓库)进行测试。我们重点关注模型在实际工作中的表现,而非仅仅依赖公开基准测试,因为有些模型虽然在公开测试中表现优异,但在真实任务中表现不佳。私有仓库让我们更容易验证这一点。我们还维护多个排行榜,评估最佳质量、每任务成本和最快模型。虽然Claude Fable 5每个token成本较高,但在复杂且长时间运行的任务中,其每任务成本反而更低。
Claude Fable 5在评估中表现如何?
Claude Fable 5在准确性和效率上均优于之前的模型。它在我们的测试套件中Python通过率达到44.3%,相比Opus 4.8的28.2%提升了16个百分点。面对面比较中,Claude Fable 5解决了18个Opus 4.8未能完成的Python任务,仅输掉2个。其代码的可信度更高,运行通过测试的概率远超Opus系列。代码能运行但结果错误是最昂贵的失败类型,因此这一点尤为重要。
效率方面同样令人印象深刻。Claude Fable 5比Opus 4.8少用了约22%的步骤就找到了解决方案,减少了试错次数。它还更善于聚焦关键部分。例如在Java任务中,Opus 4.8反复尝试调用外部资源,而这些资源在我们的环境中几乎无用;而Claude Fable 5则直接处理眼前代码,展现了更好的工程习惯。
何时选择Claude Fable 5而非其他模型?
Opus被视为“劳模”,能稳定完成任务。而Claude Fable 5适合需要深入推理、几乎像合作伙伴一样协助的场景,尤其当你自己也不确定如何完成任务时。例如,我们一位技术负责人决定实现一个复杂的富文本编辑器组件,Claude Fable 5几乎一次性完成了任务。
另一个典型应用是长时间运行的自主编码实验。我们给运行Claude Fable 5的代理提供规格说明(文本和图片形式),让它实现复杂的IDE类应用。有趣的是,代理还能基于现有应用生成规格说明。将这两部分结合起来,我们几乎可以实现应用从一种运行时、框架或语言到另一种的黑盒式重写。
如何看待当前前沿模型的安全性和数据保留?
我们并不打算自己开发最安全的模型,而是信任Anthropic在模型安全方面的红队测试和其他措施。我们采取系统化的部署策略,确保安全——构建模型及其运行环境的基础设施和安全网,而非直接调整模型本身。
安全也是我们使用Claude Fable 5的重点领域之一。我们通过白盒测试检测自家产品的漏洞,安全团队也在准备应对外部人员使用Claude Fable 5或类似模型对我们所有产品进行漏洞探测。鉴于我们服务于受监管行业的大型企业,提前做好准备至关重要。Claude Fable 5是支持我们安全工作的工具,而非阻碍。
这是一种微妙的平衡:如果你这边的分类器不够严格,外部人员可能会发现更多漏洞,包括未知漏洞。
我们希望实现零数据保留,但目前看来,只有保留部分数据才能理解用户提问内容和分类器可能的误判。只要审查仅针对最严重的案例,我认为这是合理的权衡,换取前沿智能带来的工作效率提升。
JetBrains未来的AI规划是什么?
我们预计大型语言模型提供商的底层模型能力将持续提升。关键在于打造一个软件开发的“驾驶舱”——一个代理与人协作、管理开发流程的空间。
对JetBrains来说,这是一次重大转型。我们看到机会打造支持该驾驶舱的下一代代理软件开发生命周期产品。开发者将借助代理交付更多更优质代码,非技术岗位将在软件创造中扮演更大角色,组织也能获得所需的治理和投资回报透明度。


