Liquid AI 开源 d1 系列决策模型:8 毫秒单次推理,支持图像与语音输入
Liquid AI 于 10 月 7 日发布 d1 系列两款开放权重决策模型,d1-3B 以 31.2 亿参数支持文本与图像判断,d1-omni-600M 以 5.87 亿参数支持文本、图像及语音输入。模型已在 Hugging Face 公开,d1-3B 在 RTX 4090 上单问耗时仅 8 毫秒。
继 Jev 模型 9 月引发关注后,决策模型赛道再添新玩家。Liquid AI 于 10 月 7 日发布博文,正式推出 d1 系列两款开放权重决策模型——d1-3B 与 d1-omni-600M,目前均已在 Hugging Face 平台公开,用户可自行下载、微调并部署。
两款模型在参数规模与模态支持上各有侧重。d1-3B 拥有 31.2 亿参数,基于视觉语言模型 LFM2.5-VL-3B 训练,可处理文本与图像输入。据 Liquid AI 介绍,该模型在 Decision Index v0.2.1 公开测试集上获得 48.57 分,并称其表现领先所有 10B 以下模型。另一款 d1-omni-600M 则以 5.87 亿参数基于双向编码器 LFM2.5-Encoder-350M 训练,支持文本与图像、或文本与语音的组合输入,是 Liquid AI 首个实验性多模态决策模型检查点。
推理速度是 d1 系列的核心卖点之一。官方数据显示,d1-3B 在 NVIDIA RTX 4090 上回答单个问题仅需 8 毫秒,处理 384 像素图像耗时 102 毫秒;在 Jetson AGX Thor 上单问耗时 16 毫秒。这一性能表现意味着该系列模型在边缘设备与实时决策场景中具备落地潜力。
随着 OpenAI 等公司相继布局决策模型,Liquid AI 的加入使该领域的竞争进一步升温。d1 系列以开放权重形式发布,或将为开发者提供更多轻量化、低延迟的决策模型选择。