我们的建议:聪明地开始
我们经常被问到的一个问题是:“针对这个工作负载,我应该选择哪个模型?”随着我们发布了更多的模型类别和版本,答案变得更加细致。
本文将详细介绍各个模型类别,选择模型时需要考虑的关键问题,以及其他最佳实践。
但暂且不谈细节,我们的默认建议是从最智能的通用可用模型开始,根据所需的性能和成本调整使用强度。
更智能的模型在每项任务的成本上往往更低,尤其是在较低使用强度时,即使它们的每个token价格更高。这是因为更强大的模型通常需要更少的交互轮次和思考时间就能完成大多数任务。反之,从较小的模型开始可能会让您难以区分模型本身的失败和配置错误。
当然,当您的用例对延迟或成本更敏感时,可以尝试较低级别的模型,直到找到最合适的方案。
有些组织也可能选择先从最具成本效益的模型开始,逐步升级到满足质量标准的模型。我们在模型选择文档中提供了这两种指导性方法。
Claude模型家族
Mythos / Fable
Mythos是Anthropic最强大的模型类别,具备跨领域的前沿能力。该类别在编码、长时间运行的代理任务以及解决AI之前难以可靠处理的问题方面表现尤为出色。
Mythos类别包含两个包装的同一底层模型。Claude Mythos面向处理双重用途网络安全和生物学工作的受信任组织,而Claude Fable则附加了额外的安全措施,确保模型适合公众使用。两者都要求有限的数据保留以保证安全使用。
Opus
Opus是我们针对推理密集型企业任务的强大模型类别。Opus模型在关键行业基准测试中表现优异,如知识工作领域的GDPval-AA和代理编码领域的Terminal-Bench 2.1。
表面上看,Opus和Fable在编码、长时间代理和知识工作方面都表现出色,选择可能不太明显。但在实际应用中,较大的模型如Fable往往拥有更多智慧、创造力和写作能力,尽管它们的基准分数与Opus相近。
一般经验法则是,如果您的评估或内部测试显示Opus在某些任务上表现不足,那么选择Fable。如果Opus已经满足质量要求,其速度和价格优势可能使其成为更佳选择。
Sonnet
Sonnet是我们面向日常任务的多功能模型类别。Sonnet在性能、成本和速度之间取得平衡,适用于最广泛的通用场景,包括多代理编排中的高频子代理。
Haiku
Haiku是我们成本最低且速度最快的模型类别,专为对延迟和成本敏感的高频工作负载设计。
如何选择最适合您工作负载的Claude模型
我们的模型类别并不专注于某一特定领域。我们不建议某个模型类别专门用于金融,另一个用于科学。每个Claude模型都经过训练,擅长编码、代理任务和知识工作。

不同模型类别的主要区别在于它们能可靠处理问题的难度,以及这种能力在价格和速度上的成本。选择模型时,请考虑:
- 任务难度如何? 如果任务通常耗时较长、步骤多或以前未解决,建议选择更强大的模型类别。
- 延迟需求如何? 如果模型用于高频率的面向客户的工作负载,Sonnet通常是最佳选择。
- 访问限制有哪些? Mythos仅向参与“Project Glasswing”的组织开放。并非所有组织都会向所有角色开放所有模型类别。
- 单位经济效益如何? 生产量较大时,较低级别的模型可能更合适,尤其是评估显示任务完成质量令人满意时。模型的定价基于每个token,且不同模型和使用强度下的每项任务成本不同。
使用强度也影响质量、速度和成本的平衡。高等级模型在高使用强度下提供最佳性能,而高等级模型在低使用强度时有时比小模型更高效。


想了解更多,请阅读《选择Claude模型及使用强度》。
结合模型优势的顾问策略
顾问策略允许更快速、成本更低的执行模型调用更智能的模型来检查计划和评估工作,从而提升整体性能。
这种仅在必要时对执行模型进行指导的方法显著提升了表现。例如,在SWE-bench Pro测试中,Sonnet 5配合Fable 5顾问的得分接近Fable 5的90%,但成本仅为使用Fable 5完成整个任务的63%。
评估和基准测试如何助力模型选择
判断模型能力是否满足需求的两种常用方法是使用标准基准测试和自定义评估。
基准测试是一组预设任务或场景,通常针对特定领域,且有已知答案。它们有助于在不同模型类别和供应商之间进行能力比较。但对于如Opus和Fable这样几乎能解决所有测试题的强大模型,基准测试可能出现饱和现象。
此时,我们建议组织在真实工作负载上使用模型,或通过自定义评估进行测试,以决定最合适的模型。通常,自定义评估是从生产环境中精选的一组问题,包括当前工具难以解决的复杂任务,并由团队定义成功标准。

这正是前沿模型的能力和创造力开始显著区分彼此的地方。我们也详细介绍了定制代理评估的最佳实践。
做出明智选择
AI模型选择没有一刀切的方案,这也是我们提供多种模型类别的原因。最终,选择模型的最佳方式是了解每个模型类别的基础知识,并深入理解您的用例。这意味着需要构建、维护并部署有效的评估体系。


