Liquid AI 在官方博客宣布开源 d1 决策模型家族的两款开放权重模型:d1-3B 和 d1-omni-600M,两者已上架 Hugging Face。与逐个生成 token 的生成式模型不同,d1 系列一次前向传播就给出答案,官方强调其在边缘设备上的低延迟。文中成绩来自 Liquid AI 自测,部分边缘设备延迟数据为与 NVIDIA 合作测量。
据 Liquid AI 介绍,d1 决策模型不像该公司的生成式 Liquid Foundation Models(LFM)那样输出 token,而是在一次前向传播中直接产生答案。
两款模型基于不同的底座:
官方称,d1-omni-600M 是第一个实验性检查点,仍在开发中。
据博客,d1-3B 在 Decision Index v0.2.1 公开集上得 48.57 分,领先所有 10B 以下的模型,与体量大 12 倍的决策模型 Decider 35B-A3B 相当;d1-omni-600M 在同一指数上得 15.95 分。
在涵盖阅读理解、毒性检测、意图分类、医学问答和跨语言理解的七项公开文本基准上,Liquid AI 给出的平均分为:
博客还说,d1 的视觉能力在演示中展示;专门的音频决策基准目前仍是一个开放问题,官方期待社区后续补上。
决策模型不生成输出 token,所以 Liquid AI 以从输入到输出的端到端延迟来衡量。官方只公布了 d1-3B 的推理数据,并表示 d1-omni-600M 是早期研究版本、仍在积极开发中。
按官方数据,d1-3B 回答单个问题的延迟为:
官方称,两款模型运行于从数据中心 DGX 到边缘 Jetson 的 NVIDIA 全栈,并在发布首日支持 llama.cpp。
Liquid AI 在 Hugging Face Space 提供了十个演示,让 d1-3B 对摄像头实时画面逐帧推理,每帧只做一次前向传播,内容涵盖手势控制游戏到实时内容审核。官方还与 NVIDIA 合作,展示了 d1-3B 在 Isaac Sim 中导航的演示,模型部署在 Jetson 上。
两款模型均已在 Hugging Face 提供下载,官方文档说明了本地运行的方法。