AI INSIGHT

Mellum2.1开源,小模型学会改代码库

AI新闻 Cocoloop 2026-10-09 20:25
AI 摘要

编辑精选总参数 12B,每个 token 激活 2.5B,上下文 131072。SWE-bench Verified 从上一代的 2.0 分涨到 47.0 分。同量级的 Qwen3.5 9B 在这项上是 50.0 分,GPQA Diamond 上 Mellum2.1 落后它 13 分以上。 JetBrains 发布并开源了 Mellum2.1,一个专门给本地编程代理用的小模型。它沿用 Mellu

JetBrains 发布并开源了 Mellum2.1,一个专门给本地编程代理用的小模型。它沿用 Mellum2 的混合专家架构,总参数 12B、激活参数 2.5B,许可证是 Apache 2.0,权重放在 Hugging Face,模型卡标注为“思考型模型”。

官方博客对它的描述很直白:能在代码库里四处翻、改文件、再检查自己的改动。上一代做不到这一步,JetBrains 在文中承认 Mellum2 在仓库里干活的水平没达到他们想要的程度。

架构没动,换的是训练

Mellum2.1 和 Mellum2 用的是同一套骨架:28 层,64 个专家每次激活 8 个,注意力用 GQA,每 4 层里有 3 层走 1024 长度的滑动窗口,上下文长度 131072。变化全在后训练。

按 JetBrains 的说法,强化学习从过去训练末尾的一个短阶段,变成了训练的主体。任务覆盖数学、竞赛编程、科学、工具调用和软件工程,数据混合了公开的强化学习数据集和团队自建的任务,每个来源进训练前都做过过滤,因为公开数据里常有写错的测试、无法验证的答案和难度不合适的题。

软件工程那部分是在真实代码仓库里练出来的:模型拿到 shell 和文件编辑工具,测试跑通才给奖励。团队为此自建了一套基础设施,博客里的原话是训练期间跑了“millions of sandboxed runs across thousands of environments”,也就是在数千个环境里启动了数百万次沙箱运行。

分数涨在哪

模型卡给出了一张自测对比表,对手是上一代 Mellum2 Thinking、Gemma 4 E4B 和 Qwen3.5 9B。涨幅最大的是代理类任务:

基准Mellum2.1Mellum2Qwen3.5 9B
SWE-bench Verified47.02.050.0
SWE-bench Pro28.00.038.0
Terminal-Bench 2.117.40.621.7
LiveCodeBench v682.069.475.4
BFCL v462.349.658.5

代理类评测统一用开源的 Pi v0.73.1 作为执行框架,配 shell 和文件工具,上下文给到 114K,每轮最多 16K token。所有分数都是 JetBrains 自己跑的,目前没有第三方复现。

和 Qwen3.5 9B 放在一起看

拿同量级里最常被拿来比的 Qwen3.5 9B 对照,Mellum2.1 的长板和短板都很清楚。

写单个函数、做竞赛题、调用工具,Mellum2.1 领先:LiveCodeBench 高 6.6 分,MBPP+ 高近 10 分,BFCL 高约 4 分。在仓库里连续干活,它还落后:SWE-bench Verified 差 3 分,SWE-bench Pro 差 10 分,Terminal-Bench 差 4 分多。通识推理差距更大,GPQA Diamond 是 64.6 对 77.8,AIME 是 83.3 对 86.7。安全拒答类测试 XSTest 上,它的 88.8 分也低于 Qwen 和 Gemma。

JetBrains 押的是速度。博客称在 H200 上的高负载测试里,Mellum2.1 是这组模型里最快的,单位时间能服务的 token 大约是 Qwen3.5 9B 的两倍;单请求场景下,多 token 预测能再提速约 1.6 倍。原因不难推:9B 稠密模型每个 token 都要算全部参数,Mellum2.1 每次只动 2.5B。粗算下来,它的单 token 计算量约为前者的三成,代价是 12B 权重都得放进显存,按 bfloat16 估算约 24GB。

这决定了它适合的位置:在开发者自己的机器或公司内网里,承担大量重复的小改动和工具调用,复杂的跨文件重构还是交给更大的模型。JetBrains 在博客里也强调本地部署能让代码和数据完全留在自己手里。

现在能怎么用

模型卡给了 vLLM 的部署命令,Transformers 和 SGLang 也能跑。llama.cpp、Ollama、LM Studio 用的 GGUF 版本,以及 vLLM 里做投机解码的 MTP 头,官方写的是“即将推出”,暂时没有日期。对多数想在笔记本上试的人来说,要等 GGUF 出来才方便。

参考来源:JetBrains 官方博客、Hugging Face 模型卡核对架构参数与各项评测分数、CocoLoop;Mellum2 技术报告核对上一代架构。

来源:Cocoloop
阅读原文