
许多用户可能遇到过这样的困扰:“模型本可以放入主内存,但显卡的显存不足,导致运行缓慢甚至无法使用。”针对这一问题,日本推出了免费的AI模型执行环境“FreeToken”,目前可从官方网站免费下载,采用Apache 2.0开源许可。
FreeToken专注于MoE(专家混合模型,Mixture-of-Experts)模型的高效运行。MoE模型只激活部分参数进行计算,因此实际占用的显存远低于模型总参数量。FreeToken利用这一特点,仅将激活的参数加载到GPU显存中,借助显存比主内存更高的带宽,实现加速处理。
虽然主流的AI执行环境如llama.cpp也支持将无法完全加载到显存的模型部分放入主内存,但这种做法是静态分层管理,未加载部分需依赖操作系统分页或CPU处理,容易成为性能瓶颈。
相比之下,FreeToken在每次推理时动态调用所需激活的专家参数到GPU,并通过引入LRU(最近最少使用)缓存机制替换长时间未使用的权重,大幅提升效率。此外,它还能根据上下文长度动态调整KV缓存与专家缓存之间的显存分配,并在预加载阶段同步传输权重与计算,最大限度减少等待时间。
根据加州大学伯克利分校Shuo Yang的论文,FreeToken在不同硬件环境下表现优异:在配备8GB显存的NVIDIA GeForce RTX 4060 Laptop上,Qwen3.6-35B-A3B模型实现了39 tokens/s的速度;在32GB显存的GeForce RTX 5090上,DeepSeek-V4-Flash 284B模型达到22至25 tokens/s;而在RTX PRO 6000工作站上,GLM-5.2 753B模型也能以15 tokens/s运行。
FreeToken还提供了原生GUI界面,用户无需转换GGUF格式,也不必从源码编译,只需一键即可轻松安装使用。
[相关GeForce产品推荐]



