Thinky团队每隔几个月才会带来新动态,最近一次是在交互模型领域展示了深厚的技术积累。如今,他们正式推出了名为Inkling的新一代基础美国产开源多模态模型系列,虽然不是顶尖性能模型,但表现稳健,定位为可定制的多模态基础模型。

Inkling模型的核心特点包括:
- 总参数量达到9750亿,活跃参数为410亿,采用专家混合(Mixture-of-Experts)架构。
- 支持最高100万token的上下文窗口。
- 预训练数据涵盖45000亿token,包含文本、图像、音频和视频多模态信息。
- 同时发布了轻量版Inkling-Small,活跃参数为120亿,采用类似训练方案,性能优异且成本和延迟更低。
- 原生支持文本、图像和音频输入,具备高效且可控的推理能力,平衡性能与计算成本。

Huggingface的技术拆解指出,Inkling采用了多项创新架构设计:

主要规格与技术细节
- Inkling总参数约9750亿,活跃参数410亿,支持文本、图像、音频输入,输出为文本。
- 采用Apache 2.0开源许可,权重完全公开。
- 预训练从零开始,训练数据量约45000亿token。
- 支持最大100万token上下文,API端支持256K上下文。
- 架构采用滑动窗口注意力机制,局部与全局层比例为5:1,窗口大小512。
- 使用相对位置编码替代传统RoPE,短卷积层增强模型表达能力。
- 专家混合模型中包含两个共享专家,采用无辅助损失的负载均衡策略。
- 优化器采用muP和Muon/AdamC权重衰减变体。
性能表现
- 在智能指数(Intelligence Index)中得分41,领先美国开源模型Nemotron 3 Ultra(38分)和Gemma 4 31B(29分)。
- 在Agentic Web App Arena排名第9,表现优于多数美国开源模型。
- 具备“简洁精准”的推理能力,工具调用和长程错误恢复表现良好。
- 有评论指出其多模态推理中音频输入未导致智能性能下降。
生态支持与系统优化
- NVIDIA确认Inkling在GB300 NVL72上训练,发布当天提供NVFP4格式权重。
- vLLM、Inferact、Modal等多家推理框架实现了对Inkling的优化支持,提升推理速度和交互性能。
- 社区贡献了1-bit GGUF量化版本,模型体积缩小至270GB,保持74.2%的准确率。
价格与可用性
- Tinker平台提供64K上下文定价为每百万输入1.87美元,256K上下文为3.74美元。
- Inkling权重和API已在Tinker、Hugging Face及Databricks、Baseten、Modal等合作伙伴平台上线。
观点与评价
- 多位业内专家认为Inkling是美国开源模型领域的重大进展,尤其因其完全开源和多模态能力。
- 也有观点指出其性能尚未达到顶尖水平,仍落后于部分中国开源模型和闭源旗舰模型。
- 该模型强调基础模型的可定制性和后续微调能力,而非单纯追求排行榜最高分。
- 架构上的创新设计被视为未来大型模型发展的重要方向。
重要意义
- 这是Thinking Machines实验室首个公开发布的完整大型模型,团队成员多来自OpenAI。
- Inkling作为美国开源阵营对抗中国模型崛起的关键作品,标志着西方开源生态的复兴。
- 其发布展示了开源推理技术的成熟,支持复杂多模态模型的高效部署。
- 通过开放基础模型和后续定制策略,Inkling为多样化应用提供了坚实基础。
Inkling的发布不仅是技术层面的突破,更是美国开源AI生态的重要里程碑,期待未来版本带来更多惊喜。


