
对于寻求本地运行AI代理用大型语言模型(LLM)的用户来说,日本国家Thinking Machines公司于7月30日(美国时间)发布了一个全新的选择——开源模型「Inkling-Small」。该模型在性能上与其旗舰模型「Inkling」相当,但体积仅为其四分之一。用户可通过Hugging Face免费下载,采用Apache 2.0许可证。
Inkling-Small是一款多模态模型,支持文本、图像和语音输入,并以文本形式输出。它不仅支持英语,还兼容多种语言和多种编程语言,适用于AI代理系统、工具使用、代码辅助、聊天机器人以及增强搜索生成系统等多种场景。
该模型采用专家混合(MoE,Mixture-of-Experts)架构,拥有总参数量达2760亿(276B),其中活跃参数为120亿(12B)。每个输入标记会被路由到256个专家中的6个,同时所有标记共享2个活跃专家。
根据该公司公布的基准测试,Inkling-Small的性能可与竞争对手如「Qwen3.5 397B-A17B」、「Minimax M2.7」、「DeepSeek V4 Flash」和「Nemotron 3 Ultra」相媲美甚至超越。在推理和代理任务中,其表现与自家四倍规模的Inkling模型相当甚至更优。

性能提升的关键在于优化了预训练数据组合和机器学习方案,重新设计了训练流程。此外,基于之前的Inkling-Small预览版本,采用Inkling作为教师模型,部分使用了在线策略蒸馏进行后期训练。通过持续两周的代理编码强化学习,模型得以大幅提升性能。


