Outtake如何基于Claude构建复杂的长期运行智能代理
Outtake团队将Recon Agent的开发分为四个阶段。每个阶段都围绕理解优质调查的标准,逐步将判断能力交给智能代理。

第一步:先成为专家
在构建智能代理之前,Outtake的工程师们亲自进行真实的网络安全调查,并从客户和设计合作伙伴那里汲取领域专业知识。目标是明确“什么是优质调查”。这包括识别关键证据、如何组织证据,以及如何区分可执行结论与猜测。这个标准成为后续所有阶段的固定参考点。
Outtake智能代理平台工程负责人Jack Hayford表示:“构建长期运行的智能代理,最重要的是要真正理解‘什么才是优质表现?’‘代理应该完成什么任务?’因为最终你要确保代理每次都能做到这一点。”
第二步:在Claude Code中原型开发
最初,团队使用传统的智能代理框架逐步自动化标准化的调查流程。但很快发现Recon Agent不能仅仅是一个简单的调查者,它需要编写和运行代码,动态构建工具,并与恶意域名交互。
Hayford说:“每次调查都不同且技术性强,代理需要具备编程能力。Claude Code为我们验证这些假设并不断实验提供了强有力的初始平台。”
通过Claude Code的原型开发,团队确立了核心设计原则:在编排层面严格约束代理(例如“调查域名时始终执行X、Y、Z”),但在需要判断时允许代理自由发挥。
第三步:升级到生产级平台
“我们非常喜欢Claude Code引入的模式,但需要更底层的原语访问,而这部分不是我们想自己开发的,”Hayford说。
采用Claude的Agent SDK成为将Recon Agent推向生产的自然选择。继承Claude Code的技能和模式,团队在不降低开发速度的情况下,更好地控制了代理的内存、上下文和文件系统,同时避免重新发明代理循环和会话处理。
第四步:构建由评估驱动的紧密迭代循环
在网络安全领域,攻击者会迅速适应防御工具,因此快速且低成本的迭代尤为关键。团队从一开始就集成了代理评估系统,建立了能够同时运行多种场景的强大评估套件。这使得他们能够安全自信地进行模型升级和内存系统重构等重大改动。
此外,这套系统帮助团队跳出代理循环。例如,当Recon Agent完成调查并反馈缺少某个工具时,另一个编码代理会读取建议,编写新工具并构建测试场景验证。最终由人工评估工具是否提升了调查效果。
Hayford说:“我们是瓶颈,构建复杂长期运行的代理时,自动化反馈循环非常重要。这样开发更快,也更令人满意。”
构建长期运行智能代理的经验总结
早期智能代理通过硬编码的确定性步骤避免失控,而现在复杂工作流被一个支持环境取代,这个环境包含内存、工具、技能和安全防护。
以下是Outtake团队在实现Recon Agent过程中的一些关键经验:
工具:文件系统和bash足够强大
文件系统支持持久内存。虽然通常给代理提供特定工具,但赋予代理文件系统及读写执行代码的能力,能帮助它应对各种障碍。

Hayford说:“给代理开放强大且开放式的工具是巨大飞跃。我们见过代理因网络波动等问题导致工具失败,但它能找到合适的变通方法继续执行。因为我们构建的支持环境足够强大,且允许代理自由发挥,这让它依然能达成目标。”
提示语是建议
提示语提供灵活性,但尽可能硬编码保证稳定性。Hayford说:“长期运行的复杂代理中,提示语只是建议。当代理未按预期行动时,通常会往提示语里加规则。但随着时间推移,提示语中的每个词最终可能都会被忽略。”
正确做法是识别代理每次必须执行的行为,将其纳入代理的安全防护中,而非提示语。这样代理无需反复思考,能将注意力集中在真正能发挥优势的部分。
更多关于Claude的最佳引导实践及其上下文成本和权限的内容,可供参考。
评估不仅为可靠性,更为速度
手动“反思”是自动评估的基础,能加快开发周期。传统观点认为评估是质量门槛,但对长期运行代理来说,更大的价值是提升速度。
早期,每次运行后团队都要手动审查30分钟的代理操作记录,既费时又难以规模化。
Jack说:“现代代理开发中,评估输出是循环中最昂贵的步骤。”
评估是结构化、可自动化的反思版本。一旦将优质表现标准编码成可重复检查,代理就能自己审阅并评分运行结果。
“有些工程师担心构建评估像是在打造完美案例,但从一开始就做某种评估,会让你更快完成代理开发,无论评估多完美。”
保护你的代理
提示注入攻击是真实威胁,因此将代理置于沙箱或加固防护至关重要。Outtake选择Claude部分原因是其对提示注入的强大防御能力。
Hayford说:“安全是我们构建Recon Agent的重点。我们给它文件系统和bash,并让它进入对抗环境,最重要的是构建一个‘爆炸箱’,既能保护代理内部敏感信息,又不妨碍其功能。”
他们假设代理可能被劫持,因此系统设计成能限制损害。不同代理的安全需求不同,并非所有代理都适合爆炸箱。
Outtake正在对代理访问互联网的每个节点进行信任评分,设置检查点评估代理即将接触的内容:‘这是伪装页面吗?是恶意软件吗?是否试图进行提示注入?’这或许正是代理在面对日益对抗性的网络环境时所需的防护。
未来展望
Recon Agent现已上线并开展调查。如果你想深入了解Outtake如何利用Claude大规模映射对抗基础设施:
- 观看完整网络研讨会,现场演示及深入讨论Outtake如何自主调查和映射威胁基础设施。
- 体验Recon Agent实战,了解代理如何从单一伪装扩展到完整威胁行为者画像。
- 获取免费Recon Agent评估,查看你的安全暴露调查结果。


