近年来,前沿实验室为了防止推理轨迹被蒸馏,采用了加密签名隐藏模型的思考过程。然而,最新研究表明,这些加密的推理轨迹不仅可以被解码,还能被移植到不同模型或会话中,从而显著提升开放模型的性能。
研究团队通过分析约7000条公开轨迹,发现了62个独特API密钥、33个邮箱地址、33个密码等敏感信息,这些数据仅存在于加密的推理块中,未在可见会话中出现,暴露了严重的隐私泄露风险。
解码方法大致包括:
- 获取合法的加密推理块。
- 将该推理块重放到同一服务提供商的较弱模型或不同会话中。
- 通过助手或模型的对话轮次,提示或预填充以转录推理内容。
- 多次采样,剔除拒绝响应,必要时合并多条嘈杂的转录结果。
针对不同模型,研究提供了具体的解码模板,如Claude模型使用Haiku 4.5重放签名思考块,GPT模型则多次注入加密内容并采样输出,Gemini模型附加思考签名并重复采样。
该漏洞已被负责任地披露,多处安全问题已修复,但类似攻击仍可能存在。研究强调公开分享推理轨迹存在隐私风险,隐藏的推理链条难以有效监控,实验室需加强沙箱隔离和遥测安全。
此外,文章还回顾了近期AI领域的多项进展:
- NVIDIA发布了Nemotron 3.5 Lightning,一款拥有约30亿激活参数的MoE模型,专为持续运行的代理任务设计,支持百万级上下文长度,性能优异。
- 本地AI工具如Unsloth Desktop支持跨平台运行和训练多种模型,提升本地AI生态的完整性和效率。
- Meta发布了Muse Glimmer 30B,一款多模态密集模型,支持长上下文和多语言,适合本地代理工作流,表现出色。
- OpenAI推出了Linux版ChatGPT桌面应用,支持项目和插件同步,增强跨平台协作体验。
- xAI推出Grok Bot,强调持久登录和跨工具协作,体现了AI团队协作的新趋势。
最后,文章还涉及了AI推理的可验证性、跨硬件确定性推理、编译器适配等系统研究进展,展示了AI基础设施的不断完善。





