Pangram承诺能够检测任何文本中AI参与的程度,并以百分比形式给出最佳猜测(当然,这也是通过AI实现的)。今年一月,Reddit和YouTube上流传着作者Mia Ballard可能使用AI创作其自出版小说《害羞女孩》(Shy Girl)的猜测,该书后来被传统出版社Hachette收录。尽管Ballard否认了这一点,Pangram的CEO在X平台上表示该书有78%的内容由AI生成,随后Hachette取消了该书的发行。
类似的指控接踵而至。《纽约时报》因刊登一篇AI生成的《现代爱情》专栏而被点名,Pangram的检测分数为100%。随后,一篇获得英联邦短篇小说奖的作品(100%)、小说《Daggermouth》(60%)以及一部售价240万美元的惊悚小说《Call Me, I’ll Hide the Body》(97%)也被检测出高比例AI参与。七月底,Substack宣布将Pangram集成到其平台,方便读者快速判断文本是否可能由AI生成。
然而,并非所有作家都认可这种做法。作家及出版专家Jane Friedman表示:“对AI检测软件存在强烈的反感和愤怒,感觉它们甚至比AI公司本身更具破坏性。”尽管Pangram在出版和高等教育领域外尚未广为人知,但随着区分大型语言模型生成内容与人类写作的需求日益增长,它的影响力正在扩大。现在的问题是:这家公司到底有多值得信赖?
Pangram联合创始人Spero在接受采访时谈及其成长经历时显得有些不自在。他在洛杉矶郊区La Crescenta长大,热爱编程并加入了学校的机器人团队。斯坦福大学本科期间,他遇到了未来的合伙人Bradley Emi(多次采访请求未获回应)。毕业后,Spero曾在谷歌工作,参与FLoC项目(谷歌于2022年因隐私问题终止该项目),随后加入自动驾驶汽车公司Nuro,而Emi则先后在特斯拉和AI生物技术公司Absci工作。2022年ChatGPT发布后,两人看到了AI内容泛滥的商业机会,2023年创立了Checkfor.ai,一年后更名为Pangram。在众多竞争者中,Pangram凭借早期独立测试表现突出,成为领先者。
Spero介绍,Pangram采用“合成镜像”技术,通过让大型语言模型生成与人类写作相似的文本,训练模型识别AI写作风格。同时利用“硬负样本挖掘”,从数据集中寻找误判样本进行再训练。他强调所有数据集均获得合法授权,这在当前AI领域较为罕见。Pangram的产品对数据需求远低于ChatGPT或Claude。Spero坦言,AI公司在创意领域已失去大量信任。Pangram服务涵盖教育、法律和招聘等多个行业,但创意写作是其最大训练文本来源。
“害羞女孩”事件让Pangram声名鹊起。Spero曾在社交媒体上多次指出疑似AI写作,1月时他被Reddit用户@提及并收到Ballard手稿PDF,“我直接放入Pangram,发布了结果,随后《纽约时报》联系我评论。”他认为公众对Pangram在该事件中的作用有所夸大。实际上,是Pangram的一名客户经理与出版分析师沟通后,消息才传至《纽约时报》。
此外,批评者指出Spero获得的手稿来自盗版网站。对此,Spero回应:“是的,我没仔细查看全文,直接放入Pangram检测。”
此后,Pangram并未回避争议。英联邦短篇小说奖获奖作品检测出高AI比例后,公司分析了自2012年以来所有获奖作品,指出另外三部可能涉及AI。尽管如此,Spero淡化了Pangram在取消书籍合约中的作用,称检测分数只是众多因素中的一小部分。
谈及与Substack的合作,Spero表示:“不应害怕披露AI使用情况,作品应凭质量和吸引力说话。”他强调,如果作品价值依赖于欺骗读者认为非AI创作,那将是问题所在。Substack方面表示,他们并不反对AI,而是希望用户知晓所消费内容的性质。一些作者对此持谨慎态度,担心一键检测可能毁掉整个职业生涯。
我联系了五大出版社了解其AI检测使用情况。Simon & Schuster和HarperCollins拒绝评论,Hachette和Macmillan未回复。Penguin Random House发言人确认编辑可能使用获批的AI检测工具作为识别潜在AI内容的辅助手段,但强调这只是编辑流程中的一部分,不具决定性。一些经纪人也在使用检测工具,许多书籍交易在幕后被悄然取消。
研究员Chakrabarty首次通过Spero的帖子了解到Pangram,注册后获得API积分,双方成为“密友”,他经常在社交媒体发布检测结果并为Pangram辩护。Chakrabarty曾与出版社讨论AI检测问题,认为Pangram不应成为唯一判断标准,但结合个人判断使用是合理的。

Chakrabarty与纽约顶级文学代理机构Aevitas联合CEO Todd Shuster关系密切,后者采纳了Pangram作为分析手稿和书稿提案的工具。Shuster表示,检测结果显示部分作品AI成分高达50%至95%,因此不得不与作者进行艰难对话。部分作者坦诚AI使用,部分则防御甚至撒谎。Shuster要求作者用自己的声音和想法重写作品。
批评者指出Pangram存在两大问题:误判带来的伤害和机器学习潜在偏见。爱丁堡纳皮尔大学AI素养教授Sam Illingworth认为检测工具不可靠,且对非母语英语作者和神经多样性作者存在偏见。一项研究显示,检测工具更易将非母语作者作品误判为AI生成,神经多样性作者也反映其写作风格被过度标记。上述三部争议小说均由有色人种作者创作。美国文学代理协会主席Regina Brooks强调,行业内存在不平等,谁被检测、谁被公开指控,都是人类决策,难免带有偏见。
对于被误判的作者,Spero曾提出现金奖励,若能证明作品为本人原创。“我几乎确定有人在撒谎,或者如果不是,那对我们非常有价值。”但至今无人接受挑战。
Chakrabarty坦言:“当然可以骗过Pangram。”部分作者通过调整文本或模仿AI写作风格制造假阳性。圣母大学一份工作论文指出,Pangram 3.2版本对学术摘要中轻度AI编辑的检测准确率仅为64%至80%,但经过“人性化”处理后,检测率降至不到4%。
Pangram承认其工具在检测短文本(尤其少于100字)时表现较差。免费服务每日限额约2000字,平均输入为350字。相同文本单独检测或在上下文中检测结果可能不同,这对短摘录尤为明显。
总体而言,Pangram声称其新模型误判率仅为0.0041%,较之前的0.01%有所改进。Spero表示,Pangram采取保守策略,边缘文本倾向判定为人类写作,这降低了误判率,但也让部分AI生成内容逃避检测。根据Pangram数据,经过大量AI改写的人类文章仍有41.37%被判定为人类写作。
前Pangram合约员工、记者Rod Breslau称Spero“全天在线,回复推文、Reddit帖子和LinkedIn内容”。Breslau曾为Pangram提供社交媒体策略咨询,并公开点名疑似AI用户。他希望采取更严厉的措施,因为他认为人们对AI内容的容忍度过高。
Pangram后来与Breslau分道扬镳,部分原因是公司策略调整,预计AI使用将被更广泛接受。Spero表示,他不再追查所有AI使用者,但会针对“欺骗性”行为保持警惕。未来,Pangram将能检测轻度AI编辑,这是其发展路线图,目标是为各领域提供原创性鉴定服务。
目前,Pangram团队规模不大,成员包括前教育工作者和出版专业人士。公司发言人提到,一名研究员拥有英语文学学位。虽然有传言称被指控作者准备提起诽谤诉讼,但Spero表示尚无此类案件。他计划继续发布技术报告,强调透明度和社区互动,以建立信任。
采访结束时,Spero表现出些许心不在焉,采访过程中多次走动,换位置,甚至轻声打嗝,显得有些心不在焉。或许是忙碌疲惫,或许是媒体关注让他感到厌烦。无论如何,Pangram试图将复杂多变的写作过程简化为一个数字,而人类的表达远比这复杂得多。


