10 月 9 日,一位自称在 H2O.ai 工作的 Reddit 用户在 r/LocalLLaMA 发帖,称 H2O.ai 发布了 H2O-Lightning-4B。这是一款 Apache-2.0 许可的开放权重 4B 决策模型,基座为 Qwen3.5-4B 微调。发帖人称,它在 JevBench 公开榜单上的综合得分为 72.5,高于 Jev 1.13 的 71.5,是榜上排名第一的开放模型。以上数据均出自发帖人自述,我们没有独立核实。评论区还有用户给出了自己的校准测试,并有发帖人的回应。
据发帖人介绍,H2O-Lightning-4B 面向 Jev 带火的「决策 API」式推理。调用方发送一个状态和若干带类型的问题(单选、是非、打分),模型只做一次前向传播,直接返回校准过的概率,不生成文本。发帖人称,这样做速度快、成本低。
部署方面,发帖人称使用原版 vLLM 加一个仓库里提供的小型开源 shim,在 H100 上每次决策约 30 毫秒。数据留在本地,没有按调用计费。权重、模型卡和部署说明发布在 Hugging Face 的 h2oai/h2o-lightning-4b。
发帖人还称,12B 和 31B 版本即将推出,同样开放权重、每次决策一次前向传播。他称这两个版本在内部测试中「明显比 Jev 更聪明」,这是发布方自测,未经第三方验证。他还提到了三个演示:1000 份保险理赔单的收件箱分拣、多浏览器网页智能体、用决策时钟玩 DOOM。
用户 retumbler 把它当作「先判一遍、拿不准再交给更大模型」的第一道分类器,并报告了两个问题。以下均为其自述,数据来自其自有的 300 条人工标注二选一数据:
发帖人回复称,是非题默认把所选一侧的概率抬到不低于 0.801(noul_floor),原因是榜单评分鼓励在是非题上给出明确判断。用 SHIM_NOUL_FLOOR=0 启动 shim 可以关闭这一设置,保留原始概率。他说模型卡已补充「路由阈值」一节。
他给出了一组留出集结果,称来自两个第三方决策数据集的 3,474 道题,与训练数据零重叠,阈值在分析前确定,且关闭了 floor:
对于二选一题中段概率偏高的问题,他称原因是出厂温度是在 H2O 自己的数据上调的单一数值。用户可以通过 SHIM_TEMPERATURE 自行拟合温度,H2O 也将很快发布按题型分别设温度的更新。
另一位用户 SecretBismarck 称,用它评估了一个 12.2 万行的数据集,并与 decider 4b 和 Claude Opus 5.5 对比:约 97% 与 Opus 一致,decider 约为 92% 至 93%。他说这个对比只用了约 20 个样例乘 18 个问题,不是完整数据集。