EmbeddingGemma 2 додає картинки, аудіо й відео в open-модель на 740M

EmbeddingGemma 2 від Google DeepMind: embedding-модель з ліцензією Apache 2.0 на 740M параметрів, яка працює з текстом, фото, аудіо й відео прямо на пристрої.

max_tensor2026-10-06· deepmind

Google DeepMind випустила EmbeddingGemma 2 шостого жовтня 2026 року. Це відкрита embedding-модель під ліцензією Apache 2.0, на 740 мільйонів параметрів. Вона зводить текст, картинки, аудіо й відео в один спільний простір векторів. Тож запит текстом знайде і фото, і голосову нотатку, і кліп. І це працює на телефоні.

Embedding-модель перетворює контент на вектори, тому пошук іде за змістом, а не за точними словами. Перша EmbeddingGemma працювала тільки з текстом, і, за словами Google, її скачали понад 20 мільйонів разів. Нова версія збудована на архітектурі Gemma 4, тобто на сімействі з відкритими вагами.

Цифри про RAM варто перевірити першими. З квантизацією Google каже, що для текстових ваг на Google Pixel 11 Pro потрібно близько 191 МБ активної RAM, а для повної мультимодальної моделі близько 567 МБ. Для роботи тільки з текстом вистачає 270M параметрів. Енкодери для зору (170M) і аудіо (300M) додаються за бажанням.

Місце на диску теж зменшується. Завдяки Matryoshka Representation Learning (MRL), методу навчання, який дозволяє обрізати вихідні вектори, 768-вимірний вихід можна звузити до 512, 256 або 128. Google обіцяє до 6x економії сховища для локальних векторних баз. Контекст становить 8K токенів, тобто близько 5,5 хвилин аудіо, 29 картинок або 58 кадрів відео в одному вході.

Другий головний пункт - код. На бенчмарку MTEB Code оцінка піднялася з 68,76 до 78,68, це приріст на 9,92 пункту. Якщо вам потрібен локальний пошук по кодовій базі або retrieval для кодового агента, слідкуйте саме за цією цифрою.

Як спробувати:

  1. Завантажте ваги з Hugging Face або Kaggle. Google пише, що лістинг на Gemini Enterprise Agent Platform з’явиться пізніше.
  2. Гляньте model card, там повні метрики оцінки.
  3. Для Android та інших застосунків використовуйте MediaPipe для embedding і retrieval.

Мінуси: усі головні цифри від самої Google, а цифри про RAM виміряні на одному пристрої. Поза Google якість у крос-модальних завданнях ніхто ще не перевірив, тож це поки не доведено.

Але відкрита мультимодальна embedding-модель під Apache 2.0 такого розміру - саме те, за чим я б стежив. Текстову версію багато хто використовував, тож якщо люди почнуть будувати офлайн-пошук на цій, це скаже більше, ніж будь-яка таблиця з бенчмарками.

Джерела: deepmind.google