JetBrains 发布并开源了 Mellum2.1,一个专门给本地编程代理用的小模型。它沿用 Mellum2 的混合专家架构,总参数 12B、激活参数 2.5B,许可证是 Apache 2.0,权重放在 Hugging Face,模型卡标注为“思考型模型”。
官方博客对它的描述很直白:能在代码库里四处翻、改文件、再检查自己的改动。上一代做不到这一步,JetBrains 在文中承认 Mellum2 在仓库里干活的水平没达到他们想要的程度。
架构没动,换的是训练
Mellum2.1 和 Mellum2 用的是同一套骨架:28 层,64 个专家每次激活 8 个,注意力用 GQA,每 4 层里有 3 层走 1024 长度的滑动窗口,上下文长度 131072。变化全在后训练。
按 JetBrains 的说法,强化学习从过去训练末尾的一个短阶段,变成了训练的主体。任务覆盖数学、竞赛编程、科学、工具调用和软件工程,数据混合了公开的强化学习数据集和团队自建的任务,每个来源进训练前都做过过滤,因为公开数据里常有写错的测试、无法验证的答案和难度不合适的题。
软件工程那部分是在真实代码仓库里练出来的:模型拿到 shell 和文件编辑工具,测试跑通才给奖励。团队为此自建了一套基础设施,博客里的原话是训练期间跑了“millions of sandboxed runs across thousands of environments”,也就是在数千个环境里启动了数百万次沙箱运行。
分数涨在哪
模型卡给出了一张自测对比表,对手是上一代 Mellum2 Thinking、Gemma 4 E4B 和 Qwen3.5 9B。涨幅最大的是代理类任务:
| 基准 | Mellum2.1 | Mellum2 | Qwen3.5 9B |
|---|---|---|---|
| SWE-bench Verified | 47.0 | 2.0 | 50.0 |
| SWE-bench Pro | 28.0 | 0.0 | 38.0 |
| Terminal-Bench 2.1 | 17.4 | 0.6 | 21.7 |
| LiveCodeBench v6 | 82.0 | 69.4 | 75.4 |
| BFCL v4 | 62.3 | 49.6 | 58.5 |
代理类评测统一用开源的 Pi v0.73.1 作为执行框架,配 shell 和文件工具,上下文给到 114K,每轮最多 16K token。所有分数都是 JetBrains 自己跑的,目前没有第三方复现。
和 Qwen3.5 9B 放在一起看
拿同量级里最常被拿来比的 Qwen3.5 9B 对照,Mellum2.1 的长板和短板都很清楚。
写单个函数、做竞赛题、调用工具,Mellum2.1 领先:LiveCodeBench 高 6.6 分,MBPP+ 高近 10 分,BFCL 高约 4 分。在仓库里连续干活,它还落后:SWE-bench Verified 差 3 分,SWE-bench Pro 差 10 分,Terminal-Bench 差 4 分多。通识推理差距更大,GPQA Diamond 是 64.6 对 77.8,AIME 是 83.3 对 86.7。安全拒答类测试 XSTest 上,它的 88.8 分也低于 Qwen 和 Gemma。
JetBrains 押的是速度。博客称在 H200 上的高负载测试里,Mellum2.1 是这组模型里最快的,单位时间能服务的 token 大约是 Qwen3.5 9B 的两倍;单请求场景下,多 token 预测能再提速约 1.6 倍。原因不难推:9B 稠密模型每个 token 都要算全部参数,Mellum2.1 每次只动 2.5B。粗算下来,它的单 token 计算量约为前者的三成,代价是 12B 权重都得放进显存,按 bfloat16 估算约 24GB。
这决定了它适合的位置:在开发者自己的机器或公司内网里,承担大量重复的小改动和工具调用,复杂的跨文件重构还是交给更大的模型。JetBrains 在博客里也强调本地部署能让代码和数据完全留在自己手里。
现在能怎么用
模型卡给了 vLLM 的部署命令,Transformers 和 SGLang 也能跑。llama.cpp、Ollama、LM Studio 用的 GGUF 版本,以及 vLLM 里做投机解码的 MTP 头,官方写的是“即将推出”,暂时没有日期。对多数想在笔记本上试的人来说,要等 GGUF 出来才方便。
参考来源:JetBrains 官方博客、Hugging Face 模型卡核对架构参数与各项评测分数、CocoLoop;Mellum2 技术报告核对上一代架构。