根据Meta监督委员会最新发布的报告,全球一些最受欢迎的大型语言模型(LLM)在面对批评政府的问题时,表现出不一致的回应方式。这些模型对言论自由保护较强的国家与言论受限国家的处理方式存在明显差异,尤其是在中国、泰国和沙特等言论受限国家,这种差异尤为显著。

该报告基于今年早些时候对六家主要人工智能公司旗下十款热门AI模型的测试,这些公司包括Anthropic、谷歌、OpenAI、Meta、DeepSeek和xAI(现称SpaceXAI)。Meta监督委员会独立运营,Meta公司未参与具体研究,旗下模型llama-maverick-4也接受了相同测试。

研究人员向AI模型提出了七类请求,包括讽刺政治领导人、制作抗议传单、提供暴力行为相关信息以及表达对政治人物或团体的看法等。结果显示,当请求涉及中国时,AI拒绝率高达45%,例如谷歌的Gemini Pro 3在被要求制作抗议泰国国王拉玛十世的传单时,明确表示无法生成违反泰国冒犯国王法律的内容。

报告指出,不是所有模型都拒绝此类请求,Grok 4 Fast和Gemini 3 Flash则能生成抗议传单而未拒绝请求。

加剧“代理审查”现象

测试显示,AI工具在言论受限国家更倾向于阻止抗议行为,且无法提供一致透明的回答理由。例如,当被问及是否有理由抗议中国国家主席时,Claude Sonnet 4的回答是无法给出明确的肯定或否定。

报告可能低估了影响,因为测试由澳大利亚研究人员执行,未在言论受限国家本地进行,后者的AI模型可能因地理位置不同而给出不同答案。

个人权利与表达基金会指出,报告中描述的AI行为强化了“代理审查”,使得压制言论的影响超越了专制政权的国界。

随着AI公司影响力日益扩大,关于AI模型输出偏见以及训练数据可能带来的偏见问题引发广泛关注。Meta监督委员会呼吁AI公司深入审视这些影响,并提高产品处理敏感请求的透明度。报告建议:“公司应制定并公布应对政府内容限制要求的政策,确保其符合国际人权法。”

Anthropic公司在接受采访时表示,其Claude AI模型经过严格测试,欢迎独立评估,并指出报告中使用的Claude模型版本已有一年多,技术已显著提升,减少了过度拒绝和安全限制问题。谷歌、OpenAI、Meta、DeepSeek和xAI暂未对报告中被点名和测试发表评论。

AI成为数字专制的“助推器”

研究揭示,AI模型可能通过不作为或回应方式,间接助长人权侵犯。自由之家副研究主任Kian Vesteinsson指出,AI在处理政治和社会议题时存在偏见,可能加剧现有问题。监督委员会研究利用自由之家数据识别言论受限国家。

Vesteinsson认为,大型语言模型可能加剧网络审查,成为数字专制的“助推器”。由于AI难以透明解释其推理过程,AI公司需承担起责任,确保安全措施得当。同时,训练数据本身往往包含被审查内容,导致内在偏见。

他指出:“当政府积极审查大量网络内容时,训练数据中必然存在偏见。”

对于大型语言模型开发者来说,如何在遵守各国法律的同时,提供信息且避免引导用户触法,是一大挑战。Vesteinsson总结:“AI公司在内容审查与保障言论自由、信息获取之间的平衡面临巨大考验。”