首页 > 教程资讯 > 教程详情

JetBrains 发布 Mellum2.1:架构未改,强化学习撑起编码智能体

AI 与前沿 老K说软件 2026-10-09
文章分享

JetBrains 于 2026 年 10 月 8 日在官方 AI 博客发布 Mellum2.1。这是其 6 月开源的 120 亿参数混合专家模型的新版本,Apache 2.0 许可不变。发布方称,它面向可在自有硬件上运行的编码智能体和快速子智能体;架构自第二版起未变,激活参数仍为 25 亿,变化集中在预训练之后。

强化学习成为训练主体

JetBrains 写道,这一版的工作几乎都放在后训练,主要是强化学习。强化学习从训练末尾的短阶段,变成训练的主体。团队就训练方法和数据做了多轮实验,并保留经得住检验的部分。

数据上,新增的强化学习任务覆盖数学、竞赛编程、科学、工具调用和软件工程,把开源强化学习数据集与自建任务混在一起。发布方说明,开源数据里常见测试损坏、答案无法验证,或任务对模型过易、过难,因此每个来源在进入训练前都做了过滤。

为训练智能体能力,JetBrains 称自建了可同时运行数千个强化学习环境的基础设施,整个训练过程启动了数百万个沙箱。博客对比两代模型时说:Mellum2 速度快,但还不能在代码仓库里做到他们想要的程度;经过一个夏天在真实环境中的强化学习之后,Mellum2.1 可以探索代码库、编辑文件,并检查自己的改动。

发布方自测:能力与速度

JetBrains 在相同评测设置下,把 Mellum2.1 与 Mellum2,以及同级别开源模型 Qwen3.5-9B、Gemma 4 E4B 做了对比。发布方称,进步最大的是智能体编码;编程、竞赛编程、数学、工具调用和常识也有提升,难任务和日常任务上都站得住。博客正文没有给出各项具体分数,对比结果以配图呈现。

速度方面,发布方称后训练没有改架构,因此 Mellum2.1 与 Mellum2 一样快,多 token 预测(MTP)再把它加快。高负载下,Mellum2.1 是对比组中最快的,服务的 token 数量接近 Qwen3.5-9B 的两倍;单个请求下,MTP 使其大约快 1.6 倍。一张速度图的说明写明,测量的是单张 H200 上的每秒输出 token。以上均为发布方自测。

用途与获取

JetBrains 列出三类用法。一是放进智能体系统里当执行者,处理计划中的不同环节,例如定位失败测试的根因、起草并检查修复。二是当作通用助手,回答日常问题,并逐步处理较难的数学和推理题。三是本地或在自有基础设施上部署,使代码和数据留在使用者可控范围内。

模型已上架 Hugging Face。适用于 llama.cpp、Ollama 和 LM Studio 的 GGUF 版本,以及供 vLLM 推测解码使用的 MTP 头,均标注为即将推出。发布方邀请正在做编码智能体、子智能体或自托管 AI 工具的人试用,并表示反馈将影响下一版。

来源