首页 > 教程资讯 > 教程详情

Liquid AI 开源 d1 决策模型:d1-3B 单题最快 8 毫秒,d1-omni-600M 支持图像和音频

AI 与前沿 极客小林 2026-10-09
文章分享

Liquid AI 在官方博客宣布开源 d1 决策模型家族的两款开放权重模型:d1-3B 和 d1-omni-600M,两者已上架 Hugging Face。与逐个生成 token 的生成式模型不同,d1 系列一次前向传播就给出答案,官方强调其在边缘设备上的低延迟。文中成绩来自 Liquid AI 自测,部分边缘设备延迟数据为与 NVIDIA 合作测量。

决策模型不生成 token

据 Liquid AI 介绍,d1 决策模型不像该公司的生成式 Liquid Foundation Models(LFM)那样输出 token,而是在一次前向传播中直接产生答案。

两款模型基于不同的底座:

  • d1-3B:基于公司最新的视觉语言模型 LFM2.5-VL-3B 训练,该底座为纯解码器结构,接受文本和图像输入。
  • d1-omni-600M:基于双向编码器 LFM2.5-Encoder-350M,加装视觉和音频编码器,接受“文本+图像”或“文本+音频”输入。

官方称,d1-omni-600M 是第一个实验性检查点,仍在开发中。

基准成绩(发布方自测)

据博客,d1-3B 在 Decision Index v0.2.1 公开集上得 48.57 分,领先所有 10B 以下的模型,与体量大 12 倍的决策模型 Decider 35B-A3B 相当;d1-omni-600M 在同一指数上得 15.95 分。

在涵盖阅读理解、毒性检测、意图分类、医学问答和跨语言理解的七项公开文本基准上,Liquid AI 给出的平均分为:

  • d1-3B 为 82.9,高于 Decider 4B 的 81.1;
  • d1-omni-600M 为 78.4,高于 Decider 2B 的 77.1。

博客还说,d1 的视觉能力在演示中展示;专门的音频决策基准目前仍是一个开放问题,官方期待社区后续补上。

延迟:边缘设备上几十毫秒

决策模型不生成输出 token,所以 Liquid AI 以从输入到输出的端到端延迟来衡量。官方只公布了 d1-3B 的推理数据,并表示 d1-omni-600M 是早期研究版本、仍在积极开发中。

按官方数据,d1-3B 回答单个问题的延迟为:

  • NVIDIA RTX 4090:8 毫秒;
  • Jetson AGX Thor:16 毫秒;
  • Jetson AGX Orin:26 毫秒;
  • Jetson Orin Nano:50 毫秒。

官方称,两款模型运行于从数据中心 DGX 到边缘 Jetson 的 NVIDIA 全栈,并在发布首日支持 llama.cpp。

演示与获取

Liquid AI 在 Hugging Face Space 提供了十个演示,让 d1-3B 对摄像头实时画面逐帧推理,每帧只做一次前向传播,内容涵盖手势控制游戏到实时内容审核。官方还与 NVIDIA 合作,展示了 d1-3B 在 Isaac Sim 中导航的演示,模型部署在 Jetson 上。

两款模型均已在 Hugging Face 提供下载,官方文档说明了本地运行的方法。

来源