快讯 23:20DeepSeek V4.1 Flash 在 ARC-AGI 评测中得分大幅提升,但成本增加约 250%22:49《明日方舟:终末地》宣布适配英伟达 RTX Spark 笔记本,丹青渡版本前瞻公布22:30AMD股价盘中创历史新高,苏姿丰称AI芯片供不应求将扩产 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期三 · 10-07 08:00 约 1 分钟读完

DeepMind 推出 EmbeddingGemma 2:740M 参数打通文本图像视频音频

摘要

Google DeepMind 于 10 月 6 日发布开放权重多模态嵌入模型 EmbeddingGemma 2,参数量 740M,可将文本、图像、视频帧和音频映射至统一向量空间,为跨模态检索与对齐提供新工具。

Google DeepMind 在 10 月 6 日对外公开了其最新多模态嵌入模型 EmbeddingGemma 2,该模型以开放权重形式发布,允许研究者和开发者直接获取并使用。

根据官方信息,EmbeddingGemma 2 的参数量为 740M,核心能力在于将文本、图像、视频帧和音频四种模态的数据映射到同一个向量空间。这意味着不同形态的信息可以在统一表示下进行比对与检索。

与仅处理单一模态的嵌入模型相比,EmbeddingGemma 2 的设计目标指向跨模态应用场景,例如以文搜图、以图搜视频或音频内容匹配等任务。开放权重的策略则可能降低相关研究与产品开发的门槛。

目前 DeepMind 尚未披露该模型的训练数据构成、基准测试成绩或具体许可条款,后续社区反馈与实际表现值得持续关注。

EmbeddingGemma 2Google DeepMind多模态嵌入开放权重
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
60
企业落地案例
10
完整版提示词