
随着AI模型的不断进步,自主型AI代理逐渐成为现实。然而,要使用AI代理,通常需要强大的大规模模型支持,这使得在硬件资源有限的个人电脑或智能手机上本地运行变得不切实际。日本Liquid AI公司于美国时间8月4日发布的「LFM2.5-2.6B」模型,有望彻底改变这一局面。目前,该模型已可通过Hugging Face等平台免费下载安装。
LFM2.5-2.6B是一款专为完全在设备端运行的AI代理设计的模型。通过在最普及的代理型框架中进行训练,提升了兼容性,并在工具使用、指令遵守及多步骤代理任务中,表现出与四倍规模模型相当的性能。
该模型拥有26.9亿参数,30层结构,训练时使用了约34万亿个token,词汇量达到128,000,支持最长131,072 token的上下文长度,且包含对日语的支持。

模型不仅提供原生格式的检查点,还支持llama.cpp及兼容工具的量化格式GGUF,跨平台的ONNX运行时,以及针对Apple Silicon的MLX格式。此外,提供了用于微调的预训练基础模型「LFM2.5-2.6B-Base」和针对代理工作负载的后训练模型两种版本。
尽管体积小巧,LFM2.5-2.6B依然具备与四倍规模模型相媲美的性能,推理速度快且效率高。在CPU推理测试中,Apple M5 Max达到220 token/s,AMD Ryzen AI Max+ 395达到113 token/s,智能手机上也实现了30 token/s的速度,支持实用的代理运行。

使用GPU时,该模型在同规模产品中速度最快。借助NVIDIA H100 GPU,在高并发条件下可达到约15,000 token/s的解码速度,每天可输出约13亿token。

需要注意的是,虽然LFM2.5-2.6B模型体积小且智能,但其对比对象Gemma 4和Qwen3.5支持多模态功能,因此在性能比较时应考虑这一差异。

