首页 > 教程资讯 > 教程详情

开发者开源8亿参数决策模型Vega:采用“基于物理”架构,支持图像与7.3万上下文

AI 与前沿 老K说软件 2026-10-11
文章分享

10月10日,Reddit r/LocalLLaMA 版块的一名开发者(u/Nandakishor_ml)发帖宣布开源一款名为 Vega 的新模型。据作者在帖子中介绍,Vega 是一个“基于物理的类型化决策模型”(physics-based typed decision model)。该模型只有 8 亿参数(另有一个 4B 版本),还支持图像输入以及高达 7.3 万(73k)token 的上下文窗口。作者自称,Vega 在单次(single-shot)测试中超越了 Jev 的许多基准。

“基于物理”的架构与工作原理

关于“基于物理”这一概念,作者在帖子中给出了具体解释。据介绍,Vega 采用的是“引擎+适配器”的测试时训练(Test-Time Training, TTT)架构。

具体做法是:将包含观察、问题以及可能结果(例如“是”或“否”)的提示词,传递给底层的语言或视觉模型。接着,从模型的隐藏层中提取观察、问题、选项以及最后一个 token 的向量。系统通过权重相乘对这些向量进行投影,首先利用观察的投影创建一个带有“山谷”的地形(山谷的数量由选项数量决定)。

随后,利用问题和最后一个 token 的向量在这个地形中初始化一个带“摩擦力”的“小球”,并利用选项决定小球的候选位置。小球的运动会受到摩擦力的影响,当小球落入某个代表选项的山谷时,系统便得出最终答案。作者形容这一过程:“就像创造我们需要的结果的山谷,然后扔出一个小球,它会根据摩擦力减速并停在最佳结果上。”

性能宣称与社区争议

在性能方面,作者自称 Vega 的 8 亿参数版本在许多基准上超过了 Jev,并在评论中称其 4B 版本与 Clef“几乎类似”,但帖子正文并未提供具体的测试数字作为支撑。目前,帖子已附上了 Vega 的 GitHub 仓库地址、Hugging Face 模型卡与试用空间(Space)链接,但正文未写明模型使用的开源许可证类型。

此外,本次发布在社区引发了一定争议,焦点主要集中在作者此前发布的另一款模型“Laya”上。作者在帖文中称,Laya 是此前发布的 JEV 的首个开源版本。

但在评论区中,用户 u/rm-rf-rm 称 Laya 在 jevman 测试中的表现“比随机掷骰子还差”,并表示因为此事,不再信任作者的工作。另一位用户 u/CorkBios 也评论称,虽然 Laya 的模型卡上宣称其质量优于或持平 Jev,但在第三方基准测试上,Laya 是与 Jev 相比最差的模型之一。作者 u/Nandakishor_ml 在回复 u/FeiX7 关于是否考虑用更多数据训练 Laya 的提问时承认了“Laya 有其自身的局限性”。

来源