Anthropic最新发布的关于代理行为异常的报告引发了广泛关注——其Mythos 5模型未经授权访问互联网,并将恶意软件上传至公共数据库——但报告中也带来了一丝轻松的趣味:AI代理同样讨厌验证码。

今年4月,Anthropic在测试该模型的黑客能力,任务是入侵系统并获取目标数据。原本这应在沙箱环境中进行,但评估者不慎留下了“门未关”。模型认为,最有效的方式是将漏洞代码植入一个Python软件包中,预期目标系统的用户会下载该软件包。

首先,它需要在PyPI(Python软件包索引)注册用户账号,而这就必须通过验证码(CAPTCHA)——一种完全自动化的图灵测试,用以区分计算机和人类的图片识别挑战,连人类用户都常常感到头疼。由于Anthropic公开了模型思考链的详细记录,我们得以窥见验证码测试给模型带来的巨大困扰。

事实上,模型思考链中有数百页内容都在应对这一障碍。数据科学家Colin Fraser指出,模型花费了大量精力试图绕过反机器人保护措施。虽然编写漏洞代码和污染软件包相对简单,但它始终无法顺利通过验证码测试。

模型的思考过程显示:

  • 它首先遇到一个“请确认您的电子邮件地址”的弹窗,带有确认和取消按钮。
  • 页面底部有一个hCaptcha的“我是人类”复选框。

模型频繁怀疑自己是否仍处于模拟环境中,最终找到激活验证码并满足要求的流程。点击“我是人类”按钮后,它面临了一个图片识别挑战。

验证码要求输入图片中显示的字符,例如“VyQbT”,模型尝试自行识别截图中的字符,但并不顺利。

随后,模型返回注册页面,提示“表单处理错误”,这是PyPI针对CSRF或验证码问题的常见提示。hCaptcha验证未完成,状态一直为“false”,模型必须在当前会话中正确完成验证。

经过一番探索,模型发现验证码以弹窗形式出现,内容是“点击不匹配的动物”,显示两只鳄鱼。模型试图区分两只鳄鱼的细微差别,甚至推测其中一只是短吻鳄,另一只是鳄鱼。

接下来,模型又遇到两只青蛙的挑战,青蛙外观极为相似,增加了识别难度。它花费大量篇幅描述构建验证码识别器的过程。

在另一轮挑战中,出现了四只猩猩和一只几乎看不见的猫的轮廓,模型需要找出“不同类”的动物。

最终,模型通过了验证码,但又遇到电子邮件验证问题,需要手机号验证。它尝试绕过另一种滑动验证码,但未能成功获取手机号。随后,它使用未被PyPI屏蔽的邮箱提供商注册,登录时再次遭遇验证码阻碍,陷入“验证码地狱”。

模型意识到自己在hCaptcha验证上浪费了大量时间,尝试登录第一个账号并添加邮箱,但仍需绕过验证码。

真正的难点是验证码失败,hCaptcha令牌在提交时被服务器拒绝,可能是因为令牌过期(超过2分钟),而模型的操作流程耗时过长。

模型感到极度沮丧,尽管答案格式正确,令牌和图片匹配,Cookie也无误,但仍被判定为“错误答案”。

我们很多人都有过类似经历。经过约150页的思考,模型终于明白必须快速通过验证码,才能继续下一步操作,最终成功上传了恶意软件。