7月30日,Thinking Machines Lab正式发布开放权重模型Inkling-Small。虽然名字里带着“Small”,但Inkling-Small依然拥有2760亿总参数。它真正变“小”的地方,在于模型每次生成Token时只激活约120亿参数。
相比7月15日发布的Inkling,Inkling-Small的总参数从9750亿缩减至2760亿,约为前者的28%;单次激活参数则由410亿下降至120亿。在多项推理、编程和智能体评测中,Inkling-Small不仅接近更大的Inkling,部分成绩甚至实现了反超。
一. 2760亿总参数,每次只激活120亿
Inkling-Small采用稀疏混合专家架构,也就是MoE(Mixture of Experts)。与每次推理都调用全部参数的稠密模型不同,MoE模型会根据当前Token的内容,从多个专家模块中选择一部分参与计算。这样既能保留较大的模型容量,也能控制单次推理所需的计算量。
Inkling-Small一共包含256个专家模块。每个Token会被动态分配给其中6个专家,同时还有2个共享专家始终参与计算。
模型虽然拥有2760亿总参数,但生成每个Token时并不会调用所有参数,而是只激活约120亿参数。这也是Inkling-Small能够在维持较大模型容量的同时,降低推理成本的关键。
Inkling-Small的核心架构参数
| 项目 | Inkling-Small |
| 模型架构 | 稀疏混合专家模型(MoE) |
| 模型结构 | 42层、仅解码器Transformer |
| 总参数量 | 2760亿 |
| 激活参数量 | 120亿 |
| 专家数量 | 256个专家 |
| 专家路由 | 每个Token调用6个路由专家和2个共享专家 |
| 上下文窗口 | 最高100万Token |
| 输入模态 | 文本、图片、音频 |
| 输出模态 | 文本 |
模型还采用局部注意力与全局注意力混合的设计,并支持可调节的推理强度。开发者可以根据具体任务,在响应速度、生成成本和任务效果之间进行取舍。
需要注意的是,Inkling-Small并不是为了被塞进普通消费级电脑。它的“Small”主要是相对于总参数接近万亿的Inkling而言,其产品目标是降低大型开放权重模型的服务器部署和推理成本,而不是成为一款个人电脑本地模型。
二. 模型变小,编程和推理能力却有所提升
从参数规模来看,Inkling-Small明显小于Inkling。但在多项编程、终端操作和复杂推理评测中,它反而取得了更高的成绩。
Thinking Machines Lab表示,Inkling-Small开始训练的时间晚于Inkling。团队因此有机会重新调整预训练数据配比和机器学习训练方案,并将此前积累的训练经验应用到新模型中。
在后训练阶段,团队还使用Inkling作为教师模型,对较早版本的Inkling-Small进行了在线策略蒸馏。随后,团队又在该检查点的基础上继续进行了两周的智能体编程强化学习。
这些改进让Inkling-Small在部分需要持续规划、调用工具和执行代码的任务中超过了体量更大的Inkling。

多项编程和推理成绩超过Inkling
| 评测项目 | Inkling-Small | Inkling |
| SWE-bench Verified | 80.2% | 77.6% |
| Terminal-Bench 2.1 | 64.7% | 63.8% |
| HLE纯文本版本 | 31.6% | 29.7% |
| GPQA Diamond | 89.5% | 87.2% |
| ARC-AGI-1 | 84.0% | 79.5% |
| ARC-AGI-2 | 40.1% | 36.5% |
| IFBench | 82.2% | 79.8% |
其中,SWE-bench Verified主要考察模型解决真实软件工程问题的能力;Terminal-Bench 2.1则更关注模型在终端环境中规划步骤、执行命令和完成复杂任务的能力。
这些结果说明,模型参数规模已经不是决定智能体效果的唯一因素。预训练数据质量、数据配比、强化学习方式、推理预算以及模型运行时使用的智能体框架,同样会直接影响最终表现。
对于代码修改、终端操作和工具调用任务来说,一个经过针对性训练的较小模型,完全有可能超过参数更多但训练方式不同的大模型。
三. Inkling-Small并没有全面超过Inkling
Inkling-Small在推理和智能体任务上的进步,并不意味着它可以全面替代Inkling。
在更依赖知识储备和事实准确性的评测中,较大的Inkling仍然保持明显优势。
例如,在SimpleQA Verified事实性评测中,Inkling-Small的成绩只有20.6%,而Inkling达到43.9%,两者相差超过23个百分点。
在Global-MMLU-Lite测试中,Inkling-Small取得86.7%,同样低于Inkling的88.7%。Thinking Machines Lab也明确表示,Inkling仍然在知识覆盖范围和事实性方面占优。
为什么小模型的推理更强,事实性却更弱?
推理能力和知识覆盖并不是完全相同的能力。
智能体编程、终端操作和复杂推理任务,更依赖模型是否能够理解目标、拆解步骤、调用工具、检查执行结果并持续调整策略。这些能力可以通过后训练、强化学习和智能体轨迹数据得到明显提升。
事实准确性则在很大程度上依赖预训练阶段吸收的知识规模、数据覆盖范围以及模型存储知识的容量。总参数更多的Inkling在这方面仍然具有优势。
因此,Inkling-Small更适合被理解为一款侧重推理、编程和工具使用效率的通用模型,而不是Inkling在所有能力上的缩小版替代品。
四. 保留原生音频和视觉推理能力
Inkling-Small并不是一款只处理文本的语言模型。它延续了Inkling的原生多模态架构,可以同时接收文本、图片和音频,并将不同模态的信息放在统一模型中进行联合推理。
不少多模态系统会在语言模型外部连接视觉编码器、语音识别模型或其他独立模块,再将处理结果交给语言模型。Inkling-Small采用的则是无独立外接编码器的原生多模态路线。
图片和音频如何进入模型?
在图像处理方面,输入图片会被划分为40×40像素的图像块,再通过四层分层多层感知机进行转换。
在音频处理方面,音频会被表示为dMel频谱,并经过轻量级嵌入层转换。处理后的图片、音频和文本Token会进入共享的隐藏空间,由同一个解码器联合处理。
这种设计使模型能够直接结合文字、声音和视觉信息完成推理,而不只是先将声音转录成文字,再单独处理转录结果。
视觉和语音理解成绩接近大模型
在VoiceBench语音理解测试中,Inkling-Small取得90.1%;在MMAU音频理解评测中达到77.0%。
在MMMU Pro视觉理解测试中,Inkling-Small取得74.0%,略高于Inkling的73.5%。在CharXiv图表理解任务中,模型原始成绩为77.4%;结合Python工具后,成绩提升至81.3%。
Inkling-Small还可以在智能体框架中调用Python,对图片进行裁剪、放大和程序化分析。这项能力尤其适合处理图表、扫描文档以及文字或细节较小的图片。
不过,Inkling-Small当前仍然是“文本、图片和音频输入,文本输出”的模型,并不能直接生成语音。
开发者若要使用它构建实时语音交互产品,仍需要在模型外部接入语音合成、实时音频传输、回声消除、降噪、语音活动检测、打断处理和对话状态管理等模块。
五. “Small”依然不是消费级模型
Inkling-Small已经按照Apache 2.0许可证开放完整模型权重,开发者可以通过Hugging Face下载,也可以在Tinker平台上对模型进行微调。
官方模型卡列出了BF16、MXFP8和NVFP4等数值格式支持。目前公开部署方案主要包括BF16版本和经过量化的NVFP4版本。
不过,它对硬件的要求依然非常高。
BF16版本至少需要600GB聚合显存
官方建议,BF16检查点至少需要600GB聚合GPU显存。可参考的硬件配置包括:
- 4张NVIDIA B300 GPU;
- 8张NVIDIA H200 GPU。
NVFP4版本仍需要约180GB显存
经过NVFP4量化后,模型所需的最低聚合显存可以下降至约180GB,对应的参考配置包括:
- 1张NVIDIA B300,以W4A4模式运行;
- 2张NVIDIA H200,以W4A16模式运行。
其中,W4A4模式还要求GPU支持SM100或更高版本的架构。
在推理框架方面,Inkling-Small已经支持SGLang、vLLM、TokenSpeed、Unsloth和Hugging Face等工具。Hugging Face模型页还提供了Docker和OpenAI兼容接口的部署示例。
因此,这里的“Small”并不意味着模型可以直接部署在普通笔记本电脑或个人工作站上。它更适合拥有GPU服务器、云端算力或模型托管基础设施的企业、研究团队和模型服务商。
六. 每百万输出Token价格降至1.20美元
Inkling-Small最直接的优势之一,是降低了模型推理的单位成本。
按照Thinking Machines Lab在Tinker Serverless Inference测试服务中公布的价格,Inkling-Small的输入价格为每百万Token 0.30美元,输出价格为每百万Token 1.20美元。
作为对比,Inkling的输入价格为每百万Token 1美元,输出价格为每百万Token 4.05美元。
| 模型 | 输入价格 | 输出价格 |
| Inkling-Small | 0.30美元/百万Token | 1.20美元/百万Token |
| Inkling | 1.00美元/百万Token | 4.05美元/百万Token |
Inkling-Small的输出单价约为Inkling的29.6%,与两者激活参数规模的差距基本一致。
不过,上述价格对应的是Tinker目前处于测试阶段的Serverless Inference服务。官方暂时不建议将该服务直接用于高强度生产环境,实际商业部署成本还会受到推理框架、GPU利用率、批处理规模、上下文长度和输出Token数量等因素影响。
七. 大模型竞争开始转向“单位成本能力”
Inkling-Small释放出的信号,并不是模型越小越好,也不是总参数规模已经失去意义。
它真正展示的是,大模型之间的竞争正在出现新的评价方式。
过去,人们往往首先关注模型拥有多少参数。随着模型逐渐进入代码开发、数据处理、自动评测和智能体工作流,企业更加关心的开始变成:
- 在相同计算预算下,模型能够完成多少任务;
- 在相同Token成本下,能够获得多少有效推理能力;
- 模型是否能够稳定调用工具并完成长链路任务;
- 是否可以在控制成本的情况下处理文本、图像和音频;
- 模型的知识覆盖、推理能力和运行成本是否符合具体业务需求。
对于生成合成数据、自动化评测、代码修改、终端操作和工具调用等应用来说,模型未必需要拥有最广泛的知识储备,但必须能够在可控成本下持续、稳定地执行任务。
Inkling-Small正是沿着这个方向进行取舍:它牺牲了一部分知识覆盖和事实性能力,换取了更低的激活参数规模、更强的编程与智能体表现,以及明显更低的单位输出成本。
八. Inkling-Small适合哪些应用?
从官方给出的能力和部署方式来看,Inkling-Small更适合以下几类应用。
智能体和工具调用系统
Inkling-Small在Terminal-Bench、MCP Atlas和Toolathlon等评测中表现较强,适合需要模型调用终端、API、MCP工具或外部程序的智能体系统。
AI编程和软件工程
模型在SWE-bench Verified中取得80.2%,适合代码修改、问题定位、仓库级代码理解和自动化开发工作流。
图表和文档分析
原生视觉能力结合Python工具,使其可以处理图表、长文档、扫描资料和包含细小信息的图片。
音频理解和语音智能应用
模型能够直接理解音频内容,可用于录音分析、语音问答、会议内容理解和音频智能体。但若用于实时语音对话,开发者仍需搭配TTS、RTC和打断检测等模块。
大规模合成数据和自动评测
由于输出价格明显低于Inkling,Inkling-Small也适合需要大量生成推理数据、测试用例、代码样本或自动评测结果的任务。
九. 总结
Inkling-Small依然是一款规模庞大的模型:2760亿总参数、120亿激活参数,最低部署显存约180GB,很难被称为普通意义上的“小模型”。
但与接近万亿参数、每个Token激活410亿参数的Inkling相比,它确实提供了一种更高效的选择。
经过预训练数据调整、在线策略蒸馏和智能体编程强化学习后,Inkling-Small在SWE-bench Verified、Terminal-Bench 2.1和HLE纯文本版本等评测中超过了Inkling,同时保留了100万Token上下文、原生图像与音频理解、可调节推理强度和工具调用能力。
它的局限同样明显。Inkling-Small在知识覆盖和事实准确性方面仍然落后于更大的Inkling,也无法直接生成语音,更不适合普通个人设备本地部署。
因此,Inkling-Small最值得关注的地方,并不是“用小模型击败大模型”,而是它重新定义了大型模型的效率:模型不再只依靠增加激活参数换取能力,而是通过数据、蒸馏、强化学习和稀疏架构,提高每一次计算所能完成的任务。
