跳到正文
IT之家·· 1 小时前

谷歌推出 EmbeddingGemma 2:支持多模态、7.4 亿参数量化手机端运行只需 191MB 内存

谷歌推出 EmbeddingGemma 2:支持多模态、7.4 亿参数量化手机端运行只需 191MB 内存

摘要

IT之家 10 月 7 日消息,去年谷歌推出了 EmbeddingGemma,为开发者提供轻量高质量的文本嵌入方案,下载量已超 2000 万次,广泛应用于端侧搜索工具和隐私优先检索增强生成( RAG )管线。 如今谷歌正式推出 EmbeddingGemma 2 ,将能力从文本扩展到代码、图像、视频、音频,可将这些内容统一映射到同一个嵌入空间。 IT之家援引博文介绍,该模型基于 Gemma 4 架构开发,采用商业友好的 Apache 2.0 许可发布,总参数为 7.4 亿,非常适合端侧推理。 EmbeddingGemma 2 基于 Gemini 嵌入模型同源技术打造,具备多项核心优势: 同尺寸顶尖性能:在子 1B 参数多模态嵌入模型中,于 MTEB Code、MAEB 等基准测试中取得领先分数,性能比肩甚至超越不少更大尺寸模型。 模块化设计:纯文本任务仅需 2.7 亿参数,可按需添加 1.7 亿参数的视觉编码器和 3 亿参数的音频编码器,实现完整多模态支持。 存储高效:借助 Matryoshka 表示学习( MRL ),开发者可动态将输出向量从 768 维截断至 512、256 或 128 维,本地向量数据库存储和内存占用最高可缩减 6 倍。 端侧性能优化:在资源受限条件下仍可高效运行,量化后在谷歌 Pixel 11 Pro 上, 纯文本权重仅需约 191 MB 运行内存,完整多模态模型约需 567 MB。 支持扩展上下文:配备 8K Token 上下文窗口,比初代 EmbeddingGemma 大 4 倍,可在本地硬件直接处理最长 5.5 分钟音频、29 张图像、58 个视频帧,或上述内容的交错组合。 在性能方面,EmbeddingGemma 2 保留了前代出色的多语言文本性能,同时代码性能大幅提升 9.92 分(MTEB Code 测试中从 68.76 提升至 78.68),非常适合本地代码库索引、语义代码搜索和编程代理检索。 在图像、视频、文档和音频任务中,该模型为子 1B 参数模型树立了单位参数质量新标杆,甚至性能超过不少尺寸两倍于它的专业模型。 EmbeddingGemma 2 将强大能力直接带到端侧硬件,本地生成嵌入可保障数据隐私、降低管线延迟,支持开发者搭建完全离线运行的跨模态搜索和检索系统。 搭配 Gemma 4 等生成模型,还可实现理解复杂多模态数据的端侧 RAG 管线;由于二者架构同源,共享文本分词器和音频编码器,可在统一管线中同时运行,合计内存占用更低。 开发者可在 Hugging Face 和 Kaggle 下载模型权重,很快也会登陆 Gemini Enterprise Agent Platform Model Garden。 可通过 Google AI Edge MediaPipe 开发跨平台应用,或使用 LiteRT 进行自定义模型集成,也支持 transformers.js 、WebGPU 等浏览器开发方案,同时兼容 transformers、Ollama、LMStudio 等众多常用开发工具。

当前提供采集摘要与原文入口。完整内容请阅读原文。

来源:IT之家 · ithome.com