Sentence Transformers v6.0 引入多向量编码器,支持 ColBERT 风格训练
Sentence Transformers v6.0 发布,新增 MultiVectorEncoder 模型类型,支持 ColBERT 风格后交互检索,并配套完整训练与微调流程,为多向量嵌入模型的开发与部署提供标准化工具。
Sentence Transformers 库迎来 v6.0 版本更新,此次升级的核心是新增第四种模型类型——MultiVectorEncoder。该类型允许开发者构建和训练多向量嵌入模型,尤其针对 ColBERT 风格的后交互检索场景进行了优化,进一步扩展了库在密集检索领域的应用边界。
在传统单向量模型基础上,MultiVectorEncoder 将每个文档或查询编码为多个向量,从而在推理阶段实现更细粒度的 token 级交互。这种设计显著提升了检索精度,尤其适用于需要捕捉复杂语义匹配的任务,如长文档问答和事实验证。v6.0 同时提供了完整的训练流程,包括数据准备、损失函数选择及微调脚本,降低了多向量模型的上手门槛。
此前,Sentence Transformers 主要支持单向量、双编码器及交叉编码器三类模型,而多向量模型通常需要依赖独立实现或第三方库。此次官方原生支持,意味着开发者可以在统一的 API 和训练框架下,直接进行多向量模型的实验与部署,减少了工程适配成本。
新版还优化了与 Hugging Face Transformers 的集成,支持从预训练检查点加载权重,并兼容现有数据加载器。对于已有 ColBERT 或类似架构实践的研究者,可直接迁移至 Sentence Transformers 生态,利用其成熟的评估与推理工具。
此次更新反映了多向量检索从研究走向工程化的趋势。随着 v6.0 的发布,多向量模型的可复现性和可维护性将得到提升,有望加速在 RAG 系统、语义搜索等场景中的实际应用。