Thinking Machines 发布 Inkling-Small:276B MoE 模型仅需 12B 激活参数,支持百万级上下文
Thinking Machines 于近日发布了其最新的开源模型 Inkling-Small。这是一款极具竞争力的多模态混合专家(Mixture-of-Experts, MoE)模型,旨在解决当前开源领域“要么算力昂贵,要么能力不足”的痛点。尽管名为"Small",但其 2760 亿参数的庞大架构与独特的 MoE 设计,使其在保持高效的同时,具备了处理复杂代码、长文档及多模态任务的能力。
核心突破:极致效率与超长上下文
Inkling-Small 最引人注目的特性在于其惊人的参数效率。
- 架构设计:采用 Decoder-only MoE 架构,总参数高达 2760 亿,但每次请求仅需激活约 120 亿 参数。相比之下,其旗舰模型虽总参数达 9750 亿,但激活参数高达 410 亿。这种设计大幅降低了推理成本。
- 超长上下文:支持高达 1,000,000 tokens 的上下文窗口。这对于处理大型代码库、长篇技术文档或长时间会议记录至关重要,无需像传统方案那样将输入切碎,从而避免信息丢失。
- 多模态输入:原生支持 文本、图像和音频 作为输入,输出则涵盖自然语言、代码及 JSON 格式。
性能表现:以三分之一成本匹配顶级模型
在关键基准测试中,Inkling-Small 展现了超越预期的实力,证明了"Small"并非意味着"Weak"。
- SWE-bench Verified:得分 77.6%,优于 NVIDIA Nemotron 3 (71.9%),在解决真实软件开发问题方面表现优异。
- Terminal Bench 2.1:在终端任务上匹配 Nemotron 3 Ultra 的表现,但 token 成本仅为后者的 三分之一。
- StrongREJECT:得分 98.6%,显示出极强的指令遵循能力和安全拒绝机制。
部署与生态:开源权重与灵活选择
Thinking Machines 提供了多种部署路径,满足不同团队的需求:
-
完全开源 (Self-Hosting):
- 模型权重已开源至 Hugging Face,采用 Apache 2.0 许可。
- 提供 4-bit NVFP4 量化版本,可在 NVIDIA GPU 上高效运行。
- 支持全量 100 万 token 上下文,适合对隐私和数据控制有严格要求的企业。
-
托管服务 (Tinker API):
- 提供快速接入的托管 API,无需复杂的本地基础设施搭建。
- 支持企业级微调、Web 搜索及响应长度控制。
- 上下文窗口限制为 256,000 tokens,适合快速原型验证。
对开发者的价值
Inkling-Small 的发布为美国团队及全球开发者提供了一个清晰的替代方案。它打破了封闭 API 的垄断,允许团队在保持低成本的同时,实现私有化部署和深度定制。无论是构建智能客服 Agent、进行代码审查,还是分析海量文档,Inkling-Small 都能提供强大的多模态处理能力,且无需承担高昂的推理费用。
"Inkling-Small 为团队提供了一个清晰的选项,使其能够在无需锁定于封闭 API 的情况下,以较低成本进行私有部署和长上下文多模态工作。" —— Thinking Machines 团队
随着 APIMart 等集成平台的出现,Inkling-Small 正逐渐融入多模态生产工作流,成为构建下一代 AI 应用的关键基石。