随着大型语言模型(LLM)能力的提升,幻觉现象依然难以避免。即使是最先进的模型也会出现错误,尽管业界已有一些方法来检测这些错误,但最佳解决方案仍在探索中。
刚刚获得Andreessen Horowitz 900万美元种子轮融资的Probably,正致力于构建一种更严谨的错误检测机制。
创始人Peter Elias表示,公司目标是杜绝幻觉和简单事实错误传递给用户,实现类似确定性系统中常见的99.99%准确率,而这在AI领域尤为困难。要达到这种准确度,必须重新思考许多AI工程的基本假设。
Probably的首款产品是一款数据科学工具,能够从复杂数据集中快速生成答案。每个结果都附带引用和审计轨迹,这已成为AI工具的普遍做法。
为了防止错误进入这些摘要,Elias形容其系统为“数据科学机甲服”。LLM的初步答案会通过一个确定性验证系统进行核对,任何与数据集不符的结果都会被退回。关键是,LLM经过了针对该验证器的训练,整个系统优化以实现快速且准确的回答。

“我们在构建过程中发现,约束机制越完善,模型本身可以越弱,”Elias说。“只要上下文足够精炼,模型就不必费力去做正确的事情,基本上就是减少歧义的过程。”
这使得Probably的数据科学工具能够运行在显著较小的AI模型上。Elias透露,目前版本使用的模型“比最前沿模型弱四个等级”,因此可以在本地硬件(如台式机)上运行,极大降低了与AI使用相关的令牌成本。
在令牌成本不断上涨、许多客户重新评估AI预算的当下,这一思路尤为受欢迎。Elias还表示,这套引擎不仅适用于数据科学,还能扩展到会计、医疗等“任何对精度敏感的应用场景”。
“我觉得很有趣的是,大型AI实验室甚至没有尝试过这样做,”Elias说,“他们没有动力去做,因为他们从你纠正模型的次数越多中获利。”


