Perplexity 开源双尺寸多模态嵌入模型 pplx-embed-v2-late
摘要
Perplexity 开源 pplx-embed-v2-late,包含 9B 与 0.6B 两个 late-interaction 多向量嵌入模型,共享同一嵌入空间,权重已上线 Hugging Face。9B 用于索引多模态数据,0.6B 支持设备端查询,无需 OCR 即可检索 PDF 页面,MADQA 得分 92.4%,BrowseComp+ 得分 64%。
Perplexity 在 Hugging Face 上开源了名为 pplx-embed-v2-late 的多模态嵌入模型系列,包含 9B 和 0.6B 两个参数规模版本。两者均采用 late-interaction 多向量架构,并共享同一嵌入空间,这意味着不同尺寸模型生成的向量可以在同一语义空间内直接比较与匹配。
从部署分工看,9B 版本面向多模态数据的索引场景,0.6B 版本则定位于设备端查询。官方信息显示,该系列模型无需 OCR 即可直接检索 PDF 页面内容,这一能力对文档密集型应用具有实际意义。
评测数据方面,pplx-embed-v2-late 在 MADQA 上取得 92.4% 的得分,在 BrowseComp+ 上为 64%。这两个基准分别覆盖多模态问答与浏览理解任务,可反映模型在跨模态检索与理解上的表现。
将 9B 索引模型与 0.6B 设备端查询模型组合,并共享嵌入空间,为多模态检索提供了一种可分离部署的思路:重负载留在服务端或索引侧,轻量查询落到终端。权重已在 Hugging Face 公开,开发者可直接获取并评估其在实际场景中的适用性。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗