Qwen3.8 27B模型

为了缩小AI模型的体积,量子化技术的研发正稳步推进。美国Unsloth公司于8月19日发布了全新的量子化技术“Dynamic v3.0”,并推出了应用该技术的模型“Qwen3.8-27B”的Dynamic v3.0量子化版本。本次发布是对先前早期预览版的更新。支持Dynamic v3.0的GGUF格式现已兼容包括llama.cpp和Unsloth Desktop在内的大多数推理引擎。

Dynamic v3.0的最大优势在于提升了模型的精度。Qwen3.8-27B是8月15日推出的AI模型,Unsloth量子化版本在短短5天内下载量达到了510万次。相比上一代v2.0,Dynamic v3.0通过大幅改进量子化方法,使得采用该技术的Qwen3.8-27B在精度上比其他供应商的同类模型提升了超过10%,位列前1%。

实现这一突破的关键之一是提升了用于后训练量子化(Post-Training Quantization)的校准数据集“imatrix”的质量。该数据集针对代理编码、聊天和多语言性能进行了优化。此外,通过改进层选择和结合多种量子化技术,模型在保持较小体积的同时最大限度地减少了精度损失。

此次发布的模型中,值得关注的是采用2bit量子化的“UD-Q2_K_XL”,容量约为9.83GB。在以往容易出错的HTML程序生成方面,该模型能够生成即使存在小型JS错误也能正常运行的HTML程序。对于容量低于8.37GB的小型模型,通过省略MTP模块节省了约500MB的磁盘空间。

更小型的UD-1bit量子化模型也已开发完成,其中无MTP的“UD-IQ1_S”容量仅为6.2GB。该模型在保持约72%的前1%精度的同时,体积较原始模型缩减了89%。

不过,Unsloth也警告称,1bit量子化模型不适合代理用途。在32个token的预测测试中,模型从UD-Q2_K_XL切换到UD-IQ2_S时,精度从约25%骤降至8%至10%以下。低于UD-Q2_K_XL的量子化模型容易产生大量循环,需设置presence_penalty≥1.5。此外,1bit模型若不将思考层级至少设为“低”,可能会出现空输出,且工具调用也可能失败。但该模型仍能保留一般知识,适合用于极短的事实核查问题。