llms.txt 完整文档索引请参见 llms.txt
快讯
xiaohui
收录

Inkling-Small:四分之一大小的开源模型,推理反超大哥

Thinking Machines 发布 Inkling-Small——276B 总参数、12B 激活,规模只有 Inkling 四分之一,HLE 31.6% 反超 Inkling 的 29.7%,输出价格 .20/百万 tokens 仅为 Inkling 的 30%。

正文

Thinking Machines 今天发布了 Inkling-Small——276B 总参数、12B 激活的开源权重模型,规模只有 Inkling 的四分之一,但在推理和 Agent 编码基准上反超了它的大哥。HLE(人类最后考试,文本版)得分 31.6%,高于 Inkling 的 29.7%;SWEBench-Verified 超过 80%。

这不是简单的「小模型追平大模型」。Thinking Machines 在官方博客中披露了训练细节:Inkling-Small 的预训练数据混合和机器学习配方都做了调整,先用 Inkling 作为教师做 on-policy distillation 后训练出预览版 checkpoint,再继续缩放 agentic coding RL 两周。结果是:Inkling-Small 在推理和 Agent 编码基准上超越 Inkling,而 Inkling 只在知识覆盖和事实性上保持优势。

成本是核心差异。Inkling-Small 输出定价 $1.20/百万 tokens,Inkling 是 $4.05/百万 tokens——接近 3.4 倍价差。配合可变的思考强度(从 minimal 到 xhigh 可调),用户可以在成本和性能之间做精细权衡:官方性能-成本曲线显示,Inkling-Small 的思考强度扫描轨迹在同类开源模型(DeepSeek V4 Flash、Qwen3.5-397B-A17B、Kimi K2.6、GLM 5.2、gpt-oss-120b)中处于帕累托前沿。

规格上,Inkling-Small 是 MoE 架构,在 NVIDIA GB300 NVL72 上训练,保留原生音频/图像推理和 1M token 上下文窗口。权重全量开源,支持在 Tinker 上微调,Tinker Playground 提供文本/图像/音频对话。

这类「缩小版开源模型」正在成为开源阵营的标准打法:先发大模型确立能力上限,再用更小的激活参数和蒸馏技术做成本杀手。对中小团队的意义在于——一个 12B 激活的模型就能跑 Agent 工具调用和编码任务,输出价格 $1.20/百万 tokens 的量级意味着把 AI Agent 接入真实业务流水线的单位成本已经降到可以算 ROI 的水平。

另一个值得注意的信号:Inkling-Small 的基准对比列表中,开源模型(DeepSeek V4 Flash、GLM 5.2、Kimi K2.6)和闭源模型(Gemini 3.5 Flash-Lite、GPT 5.6 Luna)出现在同一张性能-成本曲线上。这与 TLDR 同期报道的 ClinReg 基准结论一致——开源权重模型在专业任务上已追平闭源旗舰,成本仅三分之一。模型选型的逻辑正在从「用最贵的旗舰」变成「按任务挑模型」。

来源

复制成功后将正文粘贴到公众号后台即可发布