EmbeddingGemma 2 спустя сутки: что осталось от обещаний Google

6 октября Google DeepMind выпустила EmbeddingGemma 2 — компактную open-weight модель для embeddings, которая умеет работать не только с текстом и кодом, но и с изображениями, видео и аудио. Спустя сутки релиз уже появился в локальном стеке разработчиков, а первые сравнения показывают более неоднозначную картину, чем следует из формулировки Google о «лучшем в классе».
Главная идея модели — собрать разные типы данных в единое 768-мерное пространство. Поэтому текстовый запрос можно сопоставлять с изображениями, аудио или видеокадрами без отдельной цепочки из speech-to-text, image captioning и нескольких embedding-моделей. Google рассчитывает таким образом упростить локальный семантический поиск, RAG, классификацию и маршрутизацию.
Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.