Aktualności, narzędzia i prawo AIPolska · codziennie
Narzędzia

EmbeddingGemma 2: otwarty model embeddingów dla tekstu, obrazu i dźwięku

Google udostępnił EmbeddingGemma 2 - lekki, otwarty model embeddingów, który w jednej przestrzeni wektorowej łączy tekst, obrazy, dźwięk, wideo i kod. Działa także na telefonie.

Programistka w okularach siedzi w bibliotece uniwersyteckiej i porównuje na laptopie oraz smartfonie siatkę miniatur zdjęć, wykres fali dźwiękowej i klatki wideo, w tle widać wieże kościoła za oknem
Ilustracja redakcyjna dailyAI

Google udostępnił 6 października 2026 roku EmbeddingGemma 2, otwarty model embeddingów, czyli model zamieniający treści na wektory liczbowe używane w wyszukiwaniu semantycznym i systemach RAG. Nowa wersja obsługuje w jednej przestrzeni tekst, obrazy, dźwięk, wideo i kod. Ma 740 mln parametrów, okno kontekstu 8192 tokenów i licencję Apache 2.0, więc można ją bez opłat wdrożyć komercyjnie na własnym serwerze lub urządzeniu mobilnym.

Czym jest EmbeddingGemma 2

Model embeddingów nie generuje odpowiedzi. Zamienia fragment treści na wektor, czyli listę liczb opisującą jego znaczenie. Treści o podobnym sensie dostają podobne wektory, dzięki czemu system może znaleźć dokument pasujący do pytania, nawet gdy nie zawiera tych samych słów. Na tym mechanizmie opiera się większość wyszukiwarek firmowych i systemów RAG (retrieval-augmented generation), w których duży model językowy odpowiada na podstawie odnalezionych dokumentów.

EmbeddingGemma 2 bazuje na architekturze Gemma 4. Według Google to najlepiej oceniany multimodalny model embeddingów poniżej miliarda parametrów w zestawach testów MTEB i MAEB. To deklaracja producenta oparta na jego własnych pomiarach.

Parametry i zmiany względem pierwszej wersji

Największa zmiana to multimodalność. Pierwsza EmbeddingGemma z 2025 roku obsługiwała tylko tekst. Nowa wersja umieszcza tekst, zdjęcia, nagrania i wideo we wspólnej przestrzeni, więc zapytanie tekstowe może odnaleźć fragment filmu albo nagranie rozmowy.

Zestawienie porównuje dane z kart obu modeli na Hugging Face. W teście MTEB dla języka angielskiego karta nowego modelu podaje 68,46 pkt, a karta poprzednika 69,67 pkt, więc w czystym wyszukiwaniu tekstowym po angielsku nie widać poprawy.

  • parametry: 740 mln (tekst 270 mln, obraz 170 mln, dźwięk 300 mln) wobec ok. 300 mln w EmbeddingGemma 1,
  • kontekst: 8192 tokenów wobec 2048,
  • modalności: tekst, kod, obraz, dźwięk, wideo wobec samego tekstu,
  • MTEB wielojęzyczny: 61,36 wobec 61,15 pkt,
  • MTEB kod: 78,68 wobec 68,76 pkt,
  • MIEB (obrazy): 64,64 pkt, MAEB (dźwięk): 49,39 pkt,
  • licencja: Apache 2.0 wobec Gemma Terms of Use.

Do czego przyda się model embeddingów działający na telefonie

Google podaje, że wersja tekstowa po kwantyzacji zajmuje ok. 191 MB pamięci RAM, a pełna wersja multimodalna ok. 567 MB na telefonie Pixel 11 Pro. To pozwala przeszukiwać zdjęcia, notatki głosowe czy dokumenty bezpośrednio na urządzeniu, bez wysyłania ich do chmury.

Dla polskich firm ma to znaczenie przy danych wrażliwych. Kancelaria, przychodnia czy dział HR może zbudować wyszukiwarkę po własnych dokumentach i nagraniach na serwerze w Polsce, bez przekazywania treści zewnętrznemu dostawcy API. Ułatwia to spełnienie wymogów RODO, choć nie zwalnia z oceny ryzyka.

Drugie zastosowanie to tańsze bazy wektorowe. Technika Matryoshka Representation Learning pozwala obciąć wektor z 768 do 128 wymiarów kosztem części dokładności. Przy milionach dokumentów oznacza to wyraźnie mniejsze koszty pamięci i szybsze wyszukiwanie.

Ograniczenia i niewiadome

Google deklaruje obsługę ponad 100 języków, ale nie publikuje osobnych wyników dla polskiego. Jakość wyszukiwania po polsku trzeba sprawdzić na własnych danych, zanim model zastąpi obecne rozwiązanie. Wynik wielojęzyczny jest praktycznie taki sam jak w poprzedniej wersji.

Model wymaga obliczeń w formacie bfloat16 lub float32. Karta odradza float16, co ogranicza część starszych kart graficznych. Dostęp przez Vertex AI Model Garden jest dopiero zapowiedziany, więc na start model trzeba uruchomić samodzielnie. Zmiana modelu embeddingów oznacza też ponowne przeliczenie całej bazy wektorowej, bo wektory z różnych modeli nie są zgodne.

Jak zacząć z EmbeddingGemma 2

Model jest dostępny na Hugging Face i Kaggle, a zoptymalizowane wersje na urządzenia mobilne opublikowano w społeczności LiteRT. Dla zespołów, które już używają biblioteki sentence-transformers, wdrożenie testowe zajmie niewiele pracy.

  1. Pobierz model google/embeddinggemma-2 z Hugging Face i załaduj go przez sentence-transformers.
  2. Wczytaj tylko potrzebne kodery, na przykład sam tekst, aby ograniczyć zużycie pamięci.
  3. Dodawaj do zapytań prefiksy zadań opisane w karcie modelu, np. dla wyszukiwania lub klasyfikacji.
  4. Porównaj wyniki z obecnym modelem na kilkudziesięciu polskich zapytaniach z własnej bazy.
  5. Przetestuj skrócone wektory 256 lub 128 wymiarów i sprawdź, ile dokładności tracisz.

Miejsce na rynku otwartych modeli

Premiera wpisuje się w rosnącą liczbę otwartych modeli, które firmy mogą uruchomić u siebie. W ostatnich tygodniach opisywaliśmy m.in. europejski model Kolibri od Aleph Alpha oraz Reflection Beam. EmbeddingGemma 2 jest jednak modelem pomocniczym: nie odpowiada na pytania, tylko pomaga znaleźć właściwe treści, które następnie trafiają do modelu językowego.

W naszej ocenie najwięcej zyskają zespoły budujące wyszukiwanie w materiałach mieszanych, takich jak nagrania spotkań, zdjęcia z inspekcji czy dokumentacja z rysunkami. Dla czysto tekstowych wdrożeń po polsku zmiana wersji ma sens dopiero po własnym teście.

Źródła i data sprawdzenia

  1. EmbeddingGemma 2: an open, lightweight multimodal embedding modelGoogle, publikacja: 2026-10-06, sprawdzono: 2026-10-06
  2. google/embeddinggemma-2 - karta modeluHugging Face, publikacja: 2026-10-06, sprawdzono: 2026-10-06
  3. google/embeddinggemma-300m - karta modeluHugging Face, publikacja: 2025-09-04, sprawdzono: 2026-10-06
  4. EmbeddingGemma - dokumentacjaGoogle AI for Developers, publikacja: 2026-10-06, sprawdzono: 2026-10-06
Nota redakcyjna

Artykuł ma charakter informacyjny. Przy decyzjach prawnych, finansowych lub organizacyjnych warto zweryfikować wnioski w odniesieniu do konkretnej sytuacji.