快讯 23:53Claude 九月更新:Chat 与 Cowork 合并,5.5 系列模型登场23:07华为鸿蒙7.0.0.109补丁推送,多设备通信共享功能落地Mate 80系列22:50鸿蒙API分布更新:7.0.0版本占比逼近19%,5.0.0系列彻底退出 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期五 · 10-09 14:29 约 1 分钟读完

Liquid AI 开源 d1 系列决策模型:8 毫秒单次推理,支持图像与语音输入

摘要

Liquid AI 于 10 月 7 日发布 d1 系列两款开放权重决策模型,d1-3B 以 31.2 亿参数支持文本与图像判断,d1-omni-600M 以 5.87 亿参数支持文本、图像及语音输入。模型已在 Hugging Face 公开,d1-3B 在 RTX 4090 上单问耗时仅 8 毫秒。

继 Jev 模型 9 月引发关注后,决策模型赛道再添新玩家。Liquid AI 于 10 月 7 日发布博文,正式推出 d1 系列两款开放权重决策模型——d1-3B 与 d1-omni-600M,目前均已在 Hugging Face 平台公开,用户可自行下载、微调并部署。

两款模型在参数规模与模态支持上各有侧重。d1-3B 拥有 31.2 亿参数,基于视觉语言模型 LFM2.5-VL-3B 训练,可处理文本与图像输入。据 Liquid AI 介绍,该模型在 Decision Index v0.2.1 公开测试集上获得 48.57 分,并称其表现领先所有 10B 以下模型。另一款 d1-omni-600M 则以 5.87 亿参数基于双向编码器 LFM2.5-Encoder-350M 训练,支持文本与图像、或文本与语音的组合输入,是 Liquid AI 首个实验性多模态决策模型检查点。

推理速度是 d1 系列的核心卖点之一。官方数据显示,d1-3B 在 NVIDIA RTX 4090 上回答单个问题仅需 8 毫秒,处理 384 像素图像耗时 102 毫秒;在 Jetson AGX Thor 上单问耗时 16 毫秒。这一性能表现意味着该系列模型在边缘设备与实时决策场景中具备落地潜力。

随着 OpenAI 等公司相继布局决策模型,Liquid AI 的加入使该领域的竞争进一步升温。d1 系列以开放权重形式发布,或将为开发者提供更多轻量化、低延迟的决策模型选择。

Liquid AI决策模型开源多模态
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
60
企业落地案例
11
完整版提示词