在线咨询
专属客服在线解答,提供专业解决方案
工单支持
专业技术支持团队,随时响应服务需求

只激活120亿参数,Inkling-Small为何能反超自家9750亿参数模型?

7月30日,Thinking Machines Lab正式发布开放权重模型Inkling-Small。虽然名字里带着“Small”,但Inkling-Small依然拥有2760亿总参数。它真正变“小”的地方,在于模型每次生成Token时只激活约120亿参数。

相比7月15日发布的Inkling,Inkling-Small的总参数从9750亿缩减至2760亿,约为前者的28%;单次激活参数则由410亿下降至120亿。在多项推理、编程和智能体评测中,Inkling-Small不仅接近更大的Inkling,部分成绩甚至实现了反超。


一. 2760亿总参数,每次只激活120亿

Inkling-Small采用稀疏混合专家架构,也就是MoE(Mixture of Experts)。与每次推理都调用全部参数的稠密模型不同,MoE模型会根据当前Token的内容,从多个专家模块中选择一部分参与计算。这样既能保留较大的模型容量,也能控制单次推理所需的计算量。

Inkling-Small一共包含256个专家模块。每个Token会被动态分配给其中6个专家,同时还有2个共享专家始终参与计算。

模型虽然拥有2760亿总参数,但生成每个Token时并不会调用所有参数,而是只激活约120亿参数。这也是Inkling-Small能够在维持较大模型容量的同时,降低推理成本的关键。

Inkling-Small的核心架构参数

项目 Inkling-Small
模型架构 稀疏混合专家模型(MoE)
模型结构 42层、仅解码器Transformer
总参数量 2760亿
激活参数量 120亿
专家数量 256个专家
专家路由 每个Token调用6个路由专家和2个共享专家
上下文窗口 最高100万Token
输入模态 文本、图片、音频
输出模态 文本

模型还采用局部注意力与全局注意力混合的设计,并支持可调节的推理强度。开发者可以根据具体任务,在响应速度、生成成本和任务效果之间进行取舍。

需要注意的是,Inkling-Small并不是为了被塞进普通消费级电脑。它的“Small”主要是相对于总参数接近万亿的Inkling而言,其产品目标是降低大型开放权重模型的服务器部署和推理成本,而不是成为一款个人电脑本地模型。


二. 模型变小,编程和推理能力却有所提升

从参数规模来看,Inkling-Small明显小于Inkling。但在多项编程、终端操作和复杂推理评测中,它反而取得了更高的成绩。

Thinking Machines Lab表示,Inkling-Small开始训练的时间晚于Inkling。团队因此有机会重新调整预训练数据配比和机器学习训练方案,并将此前积累的训练经验应用到新模型中。

在后训练阶段,团队还使用Inkling作为教师模型,对较早版本的Inkling-Small进行了在线策略蒸馏。随后,团队又在该检查点的基础上继续进行了两周的智能体编程强化学习。

这些改进让Inkling-Small在部分需要持续规划、调用工具和执行代码的任务中超过了体量更大的Inkling。

Inkling-Small测评

多项编程和推理成绩超过Inkling

评测项目 Inkling-Small Inkling
SWE-bench Verified 80.2% 77.6%
Terminal-Bench 2.1 64.7% 63.8%
HLE纯文本版本 31.6% 29.7%
GPQA Diamond 89.5% 87.2%
ARC-AGI-1 84.0% 79.5%
ARC-AGI-2 40.1% 36.5%
IFBench 82.2% 79.8%

其中,SWE-bench Verified主要考察模型解决真实软件工程问题的能力;Terminal-Bench 2.1则更关注模型在终端环境中规划步骤、执行命令和完成复杂任务的能力。

这些结果说明,模型参数规模已经不是决定智能体效果的唯一因素。预训练数据质量、数据配比、强化学习方式、推理预算以及模型运行时使用的智能体框架,同样会直接影响最终表现。

对于代码修改、终端操作和工具调用任务来说,一个经过针对性训练的较小模型,完全有可能超过参数更多但训练方式不同的大模型。


三. Inkling-Small并没有全面超过Inkling

Inkling-Small在推理和智能体任务上的进步,并不意味着它可以全面替代Inkling。

在更依赖知识储备和事实准确性的评测中,较大的Inkling仍然保持明显优势。

例如,在SimpleQA Verified事实性评测中,Inkling-Small的成绩只有20.6%,而Inkling达到43.9%,两者相差超过23个百分点。

在Global-MMLU-Lite测试中,Inkling-Small取得86.7%,同样低于Inkling的88.7%。Thinking Machines Lab也明确表示,Inkling仍然在知识覆盖范围和事实性方面占优。

为什么小模型的推理更强,事实性却更弱?

推理能力和知识覆盖并不是完全相同的能力。

智能体编程、终端操作和复杂推理任务,更依赖模型是否能够理解目标、拆解步骤、调用工具、检查执行结果并持续调整策略。这些能力可以通过后训练、强化学习和智能体轨迹数据得到明显提升。

事实准确性则在很大程度上依赖预训练阶段吸收的知识规模、数据覆盖范围以及模型存储知识的容量。总参数更多的Inkling在这方面仍然具有优势。

因此,Inkling-Small更适合被理解为一款侧重推理、编程和工具使用效率的通用模型,而不是Inkling在所有能力上的缩小版替代品。


四. 保留原生音频和视觉推理能力

Inkling-Small并不是一款只处理文本的语言模型。它延续了Inkling的原生多模态架构,可以同时接收文本、图片和音频,并将不同模态的信息放在统一模型中进行联合推理。

不少多模态系统会在语言模型外部连接视觉编码器、语音识别模型或其他独立模块,再将处理结果交给语言模型。Inkling-Small采用的则是无独立外接编码器的原生多模态路线。

图片和音频如何进入模型?

在图像处理方面,输入图片会被划分为40×40像素的图像块,再通过四层分层多层感知机进行转换。

在音频处理方面,音频会被表示为dMel频谱,并经过轻量级嵌入层转换。处理后的图片、音频和文本Token会进入共享的隐藏空间,由同一个解码器联合处理。

这种设计使模型能够直接结合文字、声音和视觉信息完成推理,而不只是先将声音转录成文字,再单独处理转录结果。

视觉和语音理解成绩接近大模型

在VoiceBench语音理解测试中,Inkling-Small取得90.1%;在MMAU音频理解评测中达到77.0%。

在MMMU Pro视觉理解测试中,Inkling-Small取得74.0%,略高于Inkling的73.5%。在CharXiv图表理解任务中,模型原始成绩为77.4%;结合Python工具后,成绩提升至81.3%。

Inkling-Small还可以在智能体框架中调用Python,对图片进行裁剪、放大和程序化分析。这项能力尤其适合处理图表、扫描文档以及文字或细节较小的图片。

不过,Inkling-Small当前仍然是“文本、图片和音频输入,文本输出”的模型,并不能直接生成语音。

开发者若要使用它构建实时语音交互产品,仍需要在模型外部接入语音合成、实时音频传输、回声消除、降噪、语音活动检测、打断处理和对话状态管理等模块。


五. “Small”依然不是消费级模型

Inkling-Small已经按照Apache 2.0许可证开放完整模型权重,开发者可以通过Hugging Face下载,也可以在Tinker平台上对模型进行微调。

官方模型卡列出了BF16、MXFP8和NVFP4等数值格式支持。目前公开部署方案主要包括BF16版本和经过量化的NVFP4版本。

不过,它对硬件的要求依然非常高。

BF16版本至少需要600GB聚合显存

官方建议,BF16检查点至少需要600GB聚合GPU显存。可参考的硬件配置包括:

  • 4张NVIDIA B300 GPU;
  • 8张NVIDIA H200 GPU。

NVFP4版本仍需要约180GB显存

经过NVFP4量化后,模型所需的最低聚合显存可以下降至约180GB,对应的参考配置包括:

  • 1张NVIDIA B300,以W4A4模式运行;
  • 2张NVIDIA H200,以W4A16模式运行。

其中,W4A4模式还要求GPU支持SM100或更高版本的架构。

在推理框架方面,Inkling-Small已经支持SGLang、vLLM、TokenSpeed、Unsloth和Hugging Face等工具。Hugging Face模型页还提供了Docker和OpenAI兼容接口的部署示例。

因此,这里的“Small”并不意味着模型可以直接部署在普通笔记本电脑或个人工作站上。它更适合拥有GPU服务器、云端算力或模型托管基础设施的企业、研究团队和模型服务商。


六. 每百万输出Token价格降至1.20美元

Inkling-Small最直接的优势之一,是降低了模型推理的单位成本。

按照Thinking Machines Lab在Tinker Serverless Inference测试服务中公布的价格,Inkling-Small的输入价格为每百万Token 0.30美元,输出价格为每百万Token 1.20美元。

作为对比,Inkling的输入价格为每百万Token 1美元,输出价格为每百万Token 4.05美元。

模型 输入价格 输出价格
Inkling-Small 0.30美元/百万Token 1.20美元/百万Token
Inkling 1.00美元/百万Token 4.05美元/百万Token

Inkling-Small的输出单价约为Inkling的29.6%,与两者激活参数规模的差距基本一致。

不过,上述价格对应的是Tinker目前处于测试阶段的Serverless Inference服务。官方暂时不建议将该服务直接用于高强度生产环境,实际商业部署成本还会受到推理框架、GPU利用率、批处理规模、上下文长度和输出Token数量等因素影响。


七. 大模型竞争开始转向“单位成本能力”

Inkling-Small释放出的信号,并不是模型越小越好,也不是总参数规模已经失去意义。

它真正展示的是,大模型之间的竞争正在出现新的评价方式。

过去,人们往往首先关注模型拥有多少参数。随着模型逐渐进入代码开发、数据处理、自动评测和智能体工作流,企业更加关心的开始变成:

  • 在相同计算预算下,模型能够完成多少任务;
  • 在相同Token成本下,能够获得多少有效推理能力;
  • 模型是否能够稳定调用工具并完成长链路任务;
  • 是否可以在控制成本的情况下处理文本、图像和音频;
  • 模型的知识覆盖、推理能力和运行成本是否符合具体业务需求。

对于生成合成数据、自动化评测、代码修改、终端操作和工具调用等应用来说,模型未必需要拥有最广泛的知识储备,但必须能够在可控成本下持续、稳定地执行任务。

Inkling-Small正是沿着这个方向进行取舍:它牺牲了一部分知识覆盖和事实性能力,换取了更低的激活参数规模、更强的编程与智能体表现,以及明显更低的单位输出成本。


八. Inkling-Small适合哪些应用?

从官方给出的能力和部署方式来看,Inkling-Small更适合以下几类应用。

智能体和工具调用系统

Inkling-Small在Terminal-Bench、MCP Atlas和Toolathlon等评测中表现较强,适合需要模型调用终端、API、MCP工具或外部程序的智能体系统。

AI编程和软件工程

模型在SWE-bench Verified中取得80.2%,适合代码修改、问题定位、仓库级代码理解和自动化开发工作流。

图表和文档分析

原生视觉能力结合Python工具,使其可以处理图表、长文档、扫描资料和包含细小信息的图片。

音频理解和语音智能应用

模型能够直接理解音频内容,可用于录音分析、语音问答、会议内容理解和音频智能体。但若用于实时语音对话,开发者仍需搭配TTS、RTC和打断检测等模块。

大规模合成数据和自动评测

由于输出价格明显低于Inkling,Inkling-Small也适合需要大量生成推理数据、测试用例、代码样本或自动评测结果的任务。


九. 总结

Inkling-Small依然是一款规模庞大的模型:2760亿总参数、120亿激活参数,最低部署显存约180GB,很难被称为普通意义上的“小模型”。

但与接近万亿参数、每个Token激活410亿参数的Inkling相比,它确实提供了一种更高效的选择。

经过预训练数据调整、在线策略蒸馏和智能体编程强化学习后,Inkling-Small在SWE-bench Verified、Terminal-Bench 2.1和HLE纯文本版本等评测中超过了Inkling,同时保留了100万Token上下文、原生图像与音频理解、可调节推理强度和工具调用能力。

它的局限同样明显。Inkling-Small在知识覆盖和事实准确性方面仍然落后于更大的Inkling,也无法直接生成语音,更不适合普通个人设备本地部署。

因此,Inkling-Small最值得关注的地方,并不是“用小模型击败大模型”,而是它重新定义了大型模型的效率:模型不再只依靠增加激活参数换取能力,而是通过数据、蒸馏、强化学习和稀疏架构,提高每一次计算所能完成的任务。

在声网,连接无限可能

想进一步了解「对话式 AI 与 实时互动」?欢迎注册,开启探索之旅。

本博客为技术交流与平台行业信息分享平台,内容仅供交流参考,文章内容不代表本公司立场和观点,亦不构成任何出版或销售行为。