如果你还没有关注AI实验室PrismML,现在应该开始关注了——这并非因为它筹集了大量资金(目前仅完成了2225万美元的种子轮融资),而是因为其背后的技术团队以及正在开发的潜在行业变革性技术。

PrismML的核心理念是:高性能、具备推理能力的大型语言模型(LLM)其实不必庞大。

他们正在打造体积极小的推理模型,使其能够运行在个人电脑和智能手机上。(据传PrismML甚至正在与苹果洽谈合作,但CEO Babak Hassibi拒绝对此向TechCrunch发表评论。)

本周四,PrismML发布了其最新模型Bonsai 2 27B,这是其系列模型中的一员。该模型将阿里巴巴广泛使用的开源模型Qwen3.8 27B压缩至仅5.9GB,足够装入个人电脑,甚至可能适配高端智能手机。相比原始模型,内存需求减少了9到10倍。

PrismML由加州理工学院(Caltech)的一群研究人员创立,CEO Hassibi是加州理工学院教授,专长于压缩技术。该公司顾问团队还包括Databricks联合创始人、伯克利Sky Computing Lab负责人Ion Stoica。伯克利的Sky Computing Lab孕育了众多技术和初创企业,如Letta和SGLang。

PrismML的投资方包括Khosla Ventures、Cerberus Capital和加州理工学院。

虽然PrismML并非唯一一家致力于LLM压缩技术的公司,西班牙Donostia国际物理中心著名教授创立的Multiverse Computing也是竞争者之一,且后者已获得大量融资。

但Hassibi表示,PrismML的压缩技术独特之处在于其模型几乎没有性能损失。Bonsai 2在综合基准测试中达到了Qwen模型98%的得分,高于今年3月发布的首个Bonsai模型的95%。首个模型已被下载超过1100万次,而PrismML更小的模型累计下载量达260万次。

这表明PrismML的压缩技术在不断进步。是否能达到100%的性能完全一致还有待观察,Hassibi认为压缩技术总会对性能有一定影响。

不过,完美的基准一致性更多是学术问题。未压缩的LLM本身准确率并非完美,基准测试也不能完全反映实际应用场景,因此2%的性能差异不太可能显著影响模型的实际表现。此外,模型运行的环境软件对准确性也有重要影响。

PrismML通过缩减模型中的“权重”实现压缩——权重是模型训练过程中学习和存储的信息。通常每个权重需要16位存储,而PrismML采用“三级”权重方法,将权重简化为+1、-1或0三种状态。这样大幅减少了存储空间需求。(更多技术细节可见项目的Hugging Face页面。)

该公司下一步计划将压缩技术应用于更大规模的模型。Hassibi表示:“我们希望在未来几个月内发布参数规模达数百亿的模型,预计在更大模型上保持智能的难度会更小。”

他补充道:“随着模型规模增大,压缩时丢失智能的风险更低。总体趋势是,越大的模型越容易实现100%的性能保留。”

Stoica也对这项技术充满期待,因为它让先进模型能够直接在用户设备上运行。“你将随时拥有智能助手,而且是免费的,因为它运行在你已经购买的设备上。同时,它也更具隐私性,因为数据无需上传到云端。”