ChatGPT让Diogo Almeida感到失望。

Almeida曾是OpenAI的研究员,参与了ChatGPT的开发,并发明了基于人类反馈的强化学习(RLHF)——这一模型训练技术被认为是推动当前AI时代的关键。然而,尽管ChatGPT功能强大,他依然感到不满足。

“我们手中掌握了闪电,但它却没能派上用场,”Almeida告诉TechCrunch。“我一直在努力解决这个问题。最终我得出结论:问题在于我们优化的是人类语言……过去四年我们在人类语言方面表现出色,但这对自动化并无太大帮助,因为计算机使用的是另一种语言。”

两年前,Almeida离开OpenAI,创办了TypeSafe AI,一家致力于解决这一问题的初创公司。本周,该公司发布了一款基于Transformer的新模型Jev,这并非传统的大型语言模型(LLM)。它不输出文本,而是生成概率,或称为“校准决策”。

摒弃语言输出带来了多重优势:模型极其廉价且运行快速,且由于用户预先定义输出内容,模型不会产生幻觉。输出的token是免费的,输入token的计费单位是十亿级别,而非百万级别。

Jev模型示意图

开发者对该产品表现出极大兴趣,甚至一度因需求过高导致API无法服务用户。Jev在软件自动化领域表现尤为出色,开发者认为它是将智能集成到代码中的更经济且更稳健的方案。

例如,Vercel的软件工程师Pranit Sharma表示,他们曾使用OpenAI的ChatGPT Luna 5.6运行分类器以审查命令安全性。将Luna替换为Jev后,处理速度提升了5到18倍,且准确率更高。

另一位开发者、Bryo AI首席技术官Nikhil Mudholkar测试了Jev与Gemini在商业邮件分类上的表现。虽然Gemini准确率略高,但成本是Jev的10到20倍。Mudholkar更看重Jev的置信度分数——“它是唯一能返回真实概率的模型,非常适合自动化工作流!”

除了在某些场景替代LLM,Jev还能辅助LLM,作为智能监控工具。用代理监控代理成本高昂,而用Jev则更为合理。Almeida预计用户将用Jev追踪LLM代理行为,防止越权操作。

“归根结底,它将幻觉问题部分交给用户处理,”开源模型框架Pi的CTO Armin Ronacher解释道。“用户需要判断,如果概率只有50%,可能是抛硬币,忽略它;但如果是95%,则可以放心使用。”

Ronacher还指出,Jev可用于模型路由。预测某项任务是否需要特定模型非常有用,但用LLM做这件事成本太高。Jev的低成本和高速使实时分类成为可能。

这正是Almeida的愿景。Jev以19世纪经济学家威廉·斯坦利·杰文斯命名,他的悖论指出商品价格下降会导致使用量增加。这里,智能成本降低应促使其广泛应用。

“我们认为智能软件将无处不在,以一种自发且分布式的方式出现……更像早期互联网,而非现在人们试图打造的超级应用,”Almeida说。

对于模型架构,Almeida保持低调,外界猜测其基于开源权重的LLM。公司称Jev为“系统一模型”,侧重直觉而非推理,专注于正确的任务。Jev完全通过合成数据训练,采用Almeida称之为“基于校准决策的强化学习”的技术。

“我们早早决定全部使用自制数据,这是我人生中最明智的决定之一——甚至超过了产品发布和RLHF,”他告诉TechCrunch。“我们公司一半是实验室,专注于统计学上成熟的合成数据子领域,这成了我生活的乐趣。”

目前Jev是此类模型中的佼佼者,但Ronacher预计随着其价值显现,竞争者将陆续出现。

“从很多方面看,我们本该更早看到这一点,但由于LLM成本低且有补贴,大家还没迫切需要创新,”他说。

TypeSafe未来将开发更多版本,涵盖新模态。谈及是否为前沿实验室,Almeida表示:“前沿实验室的主要产品是恐惧或炒作,我希望我们的主要产品是智能……我们不是那种押注无限财富、信仰或打造数据中心中的上帝的实验室。”