作为乐天集团负责企业AI业务的总经理,梶祐介的职责是“发现变革性创新的种子,并将其推广到整个公司”。

其中一个重要的创新种子就是Claude。

自2025年3月起,乐天开始利用Claude加速软件开发(通过Claude Code)、在各业务职能中部署智能代理,并为数百万客户提供AI功能。梶祐介表示,乐天选择与Anthropic合作,正是看中了其企业专注度、领导力和产品品味。

在近十次模型发布中,他见证了自己能交给代理完成的工作量不断增长:最初用Claude Code发布生产软件,随后为公司各团队打造定制的Claude托管代理。他将测试新模型比作踏上“新任务”。

“优秀领导者会为团队设定挑战目标,我们也为新的Claude设定了挑战任务,”他补充道,“也许Claude也在推动我们不断突破。”

当他测试Claude Fable 5时,立刻感受到不同。该模型能独立运行的时间远超前代,首次实现了在他睡觉时自我检查工作并完成复杂任务。

这种额外的自主性让乐天能够交付更大规模、长时间运行的任务,彻底改变工作方式。

构建以AI为核心的劳动力

乐天正在围绕AI进行转型,称之为“AI化”——即将AI融入为客户、合作伙伴和员工提供的所有服务。当Claude托管代理上线后,乐天在一周内就在产品、销售、市场和财务等部门部署了代理,并接入Slack、Microsoft Teams及公司自有任务系统。

对梶祐介和他的团队来说,构建代理的限制从“谁会写代码”变成了“谁理解业务问题”。

“现代企业设计的目标是降低沟通成本,”他说,“我相信像Claude Code这样的代理能帮助我们降低创新成本,实现从想法到生产的快速转变。只要给有能力的人配备能保持上下文和品味的代理,就能释放隐藏的人才潜力,提升百倍的规模效应。”

但全天候运行代理也带来了新限制:人类判断。虽然乐天的代理在各领域解决问题的速度提升了约10倍,但任务量持续增加。增加代理数量并不能增加判断力,因此代理运行越快,组织的进展越依赖人类来完成最终决策。

支持长时间无人值守运行的代理

对大多数开发者来说,构建长时间运行且无需过多监督的代理是最大挑战。连接合适的工具和上下文是一方面,但梶祐介的经验是,代理能独立运行的时间总有限制,必须有人介入验证其工作。

在Claude Fable 5之前,让代理独立执行数小时任务总是冒险。“如果第一步选对了路径,一切顺利,”梶说,“但如果第一步选错,代理就得花大量时间修正,甚至可能无法完成任务。”对于需要运行五小时甚至一整天的任务,早期的错误假设可能导致整个过程失败,唯一的补救是人工检查。

失败的根本原因是缺乏自我验证。任何模型都可能第一步走错,早期模型的问题是它们不会在执行过程中检查自己的工作,错误会逐步积累,最终导致结果不理想。

据梶祐介介绍,Claude Fable 5改变了这一局面,因为它在执行过程中频繁自我检查,远超以往任何模型。

“我们测试了Fable,非常喜欢它的自我反思和自我验证能力,”他说,“相比之前的模型,它能在凌晨2点或3点之前发现错误,让我能安心睡觉。”

Claude Fable 5的独特优势

梶祐介团队总结了Claude Fable 5区别于前代模型的三大行为,标志着智能前沿的飞跃:

  • 反复检验自身假设。 当任务状态中途发生变化时,Fable 5能及时发现并纠正错误假设,而不是坚持错误路径直到数小时后才发现。
  • 每一步回归第一性原理。 它无需提示即可重新验证与最初目标的一致性,避免了梶祐介以前必须亲自纠正的偏差。
  • 符合团队品味。 即使指导有限,其对模糊决策的判断也与团队高度一致。梶为此创造了“品味对齐”一词,“Fable的品味对齐比我们用过的任何其他模型都要顺畅。”

更重要的是,更长的自主运行时间改变了梶能委派的工作单位。

“以前我们必须将工作拆分成明确的小块让代理执行,”他说,“现在我可以交付整个任务,同时运行多个任务。”

Claude Fable 5在执行过程中不断反思,及时纠正早期错误假设,自动回归第一性原理,无需人为干预即可重新导航到正确结果。由于模型能中途自我修正,首次实现了任务签核的可能,梶委派的工作单位也从任务转变为决策。代理还能跨任务记忆:“我们的代理会记住过去的错误,避免重复。”

因此,任务总量持续增长,但真正需要人工介入的任务保持在可控范围。无需中途干预是最大的生产力提升,让团队专注于只有人类能做出的决策,推动AI原生组织持续加速,而非因人工纠偏而停滞。

成本与效率的平衡

前沿能力伴随高昂成本,梶祐介坦言成本决定了部署规模。

“作为大型企业,我们希望在智能和成本之间取得平衡,”他说。团队会同时衡量任务完成率和单任务成本,将需要额外能力改变结果的工作交给Fable 5,其他任务则由较小模型处理。

对梶来说,Fable 5的优势在于:它用更少的token和更少的错误完成更多工作,且需要更少的人工干预。

未来展望

梶祐介目前测试的前沿不是单个代理的速度,而是让代理协调人类工作。Claude Code加快了他和同事的工作节奏,但组织中最难的是人际间的协调,匹配不同人的上下文和品味。他正在探索能“协调或组织,更像经理”的代理,承载团队成员间常被忽略的细微差别。

“我们不把AI代理看作未来的同事或竞争者,它们是我们周围的系统。”他也秉持Anthropic的建议,构建未来三到六个月的模型,而非眼前的版本。

“我认为社会还未完全找到Claude Fable 5的模型与任务匹配点,”他说,“但它已经成为跨越界限、进入我们世界的模型。”

开始体验Claude Fable 5