Thinking Machines 发布 Inkling-Small:276B MoE 模型仅需 12B 激活参数,支持百万级上下文

ADK APIMart官方 / ADK编译 2024-11-01 5 分钟 123 次浏览
速览导读 / Summary

Thinking Machines 正式推出 Inkling-Small,一款基于 2760 亿参数混合专家(MoE)架构的多模态开源模型。其核心突破在于仅需 120 亿激活参数即可运行,同时支持高达 100 万 token 的超长上下文窗口。该模型在 SWE-bench Verified 上取得 77.6% 的优异成绩,并在终端基准测试中以三分之一 token 成本匹配 Nemotron 3 Ultra 表现,为开发者提供了低成本、高灵活性的私有化部署方案。

总参数规模 276 Billion MoE 架构总参数
激活参数 12 Billion 每次请求激活参数
上下文窗口 1,000,000 tokens 自托管最大上下文
SWE-bench Verified 77.6% 代码问题解决能力
License Apache 2.0 开源协议

Key Insights / 核心看点

  • 1 采用 2760 亿参数 MoE 架构,仅需 120 亿激活参数即可运行,大幅降低推理成本。
  • 2 支持高达 100 万 token 的超长上下文窗口,完美适配大型代码库与长文档分析。
  • 3 原生支持文本、图像、音频多模态输入,输出涵盖代码、JSON 及自然语言。
  • 4 在 SWE-bench Verified 上得分 77.6%,以三分之一 token 成本匹配 Nemotron 3 Ultra 表现。
  • 5 提供 Apache 2.0 开源权重及 Hugging Face 下载,支持 NVIDIA GPU 4-bit 量化部署。

Thinking Machines 发布 Inkling-Small:276B MoE 模型仅需 12B 激活参数,支持百万级上下文

Thinking Machines 于近日发布了其最新的开源模型 Inkling-Small。这是一款极具竞争力的多模态混合专家(Mixture-of-Experts, MoE)模型,旨在解决当前开源领域“要么算力昂贵,要么能力不足”的痛点。尽管名为"Small",但其 2760 亿参数的庞大架构与独特的 MoE 设计,使其在保持高效的同时,具备了处理复杂代码、长文档及多模态任务的能力。

核心突破:极致效率与超长上下文

Inkling-Small 最引人注目的特性在于其惊人的参数效率。

  • 架构设计:采用 Decoder-only MoE 架构,总参数高达 2760 亿,但每次请求仅需激活约 120 亿 参数。相比之下,其旗舰模型虽总参数达 9750 亿,但激活参数高达 410 亿。这种设计大幅降低了推理成本。
  • 超长上下文:支持高达 1,000,000 tokens 的上下文窗口。这对于处理大型代码库、长篇技术文档或长时间会议记录至关重要,无需像传统方案那样将输入切碎,从而避免信息丢失。
  • 多模态输入:原生支持 文本、图像和音频 作为输入,输出则涵盖自然语言、代码及 JSON 格式。

性能表现:以三分之一成本匹配顶级模型

在关键基准测试中,Inkling-Small 展现了超越预期的实力,证明了"Small"并非意味着"Weak"。

  • SWE-bench Verified:得分 77.6%,优于 NVIDIA Nemotron 3 (71.9%),在解决真实软件开发问题方面表现优异。
  • Terminal Bench 2.1:在终端任务上匹配 Nemotron 3 Ultra 的表现,但 token 成本仅为后者的 三分之一
  • StrongREJECT:得分 98.6%,显示出极强的指令遵循能力和安全拒绝机制。

部署与生态:开源权重与灵活选择

Thinking Machines 提供了多种部署路径,满足不同团队的需求:

  1. 完全开源 (Self-Hosting)

    • 模型权重已开源至 Hugging Face,采用 Apache 2.0 许可。
    • 提供 4-bit NVFP4 量化版本,可在 NVIDIA GPU 上高效运行。
    • 支持全量 100 万 token 上下文,适合对隐私和数据控制有严格要求的企业。
  2. 托管服务 (Tinker API)

    • 提供快速接入的托管 API,无需复杂的本地基础设施搭建。
    • 支持企业级微调、Web 搜索及响应长度控制。
    • 上下文窗口限制为 256,000 tokens,适合快速原型验证。

对开发者的价值

Inkling-Small 的发布为美国团队及全球开发者提供了一个清晰的替代方案。它打破了封闭 API 的垄断,允许团队在保持低成本的同时,实现私有化部署和深度定制。无论是构建智能客服 Agent、进行代码审查,还是分析海量文档,Inkling-Small 都能提供强大的多模态处理能力,且无需承担高昂的推理费用。

"Inkling-Small 为团队提供了一个清晰的选项,使其能够在无需锁定于封闭 API 的情况下,以较低成本进行私有部署和长上下文多模态工作。" —— Thinking Machines 团队

随着 APIMart 等集成平台的出现,Inkling-Small 正逐渐融入多模态生产工作流,成为构建下一代 AI 应用的关键基石。

Inkling-Small gives U.S. teams a clear option for lower-cost deployment, private setup, and long-context multimodal work without being locked into a closed API.

Thinking Machines 官方团队

同主题深度资讯

查看更多 →
AI 工具 2026-09-07

WatermarkRemover 发布全新 AI 去水印工具:一键清除多水印,保留原图画质

WatermarkRemover 正式推出基于先进 AI 技术的免费图像去水印解决方案。该工具通过自动检测与智能修复技术,支持批量移除多色水印,同时保留图像原始质量。无需专业修图技能,用户即可在数秒内完成去水印操作,并支持批量处理,极大提升了内容创作者与商业用户的效率。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 发布:AI 驱动的高效去水印工具,重塑图像版权与分享体验

WatermarkRemover 推出全新 AI 驱动的去水印解决方案,旨在解决传统裁剪法无法保留原图质量及水印影响专业度的痛点。该工具无需安装,支持一键上传与自动检测,承诺在去除水印的同时完美保留图像分辨率与细节。文章强调,去除水印不仅是技术操作,更是保护摄影师声誉、提升社交媒体互动率及避免版权纠纷的关键策略。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 2025 版上线:AI 驱动一键去除 TikTok 水印,助力创作者跨平台分发

WatermarkRemover 于 2025 年推出全新 TikTok 水印去除功能,利用先进的 AI 图像修复与视频处理技术,帮助用户轻松移除嵌入的视频水印。该工具支持直接粘贴 URL 即可一键处理,解决了创作者在 Instagram Reels 等平台上分发内容时的合规与美观难题。核心亮点包括智能背景重构、无损画质保留及极速处理速度,显著提升了内容再创作效率。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 上线:AI 驱动一键清除截图水印,重塑图像纯净度

WatermarkRemover 正式推出全新 AI 驱动的水印移除功能,专为处理截图与照片设计。通过先进的图像分析与内容重构算法,用户无需专业修图技能即可一键清除复杂水印。该工具主打免费、高效与高保真输出,显著降低了图像去水印的技术门槛,为内容创作者与开发者提供了便捷的图像净化方案。

WatermarkRemover官方 / ADK编译 3 分钟
code · 免费
★ 5.0 · 120评测
A

APIMart

一站式 AI API 平台,多主流模型统一访问

APIMart是一站式 AI API 平台,提供对 500 多个主流 AI 模型的统一访问,涵盖聊天、视频生成、图像生成等多类 AI 能力。与 OpenAI 的 API 格式完全兼容,用户只需修改一行代码即可从 OpenAI 迁移到 APIMart,享受更低的成本和更高的性能。APIMart核心优势在于高性价比,相比竞品可节省 30% 至 70% 的成本,同时提供 99.9% 的高可用性。智能路由技术确保低延迟响应,支持超高并发,适合大规模应用场景。APIMart提供详细的用量分析和成本跟踪,帮助用户优化费用。

查看 APIMart 使用教程与功能