Kurz gesagt: Google erweitert mit EmbeddingGemma 2 die lokale KI-Suche auf Text, Code, Bilder, Audio und Video. Das kompakte, modular aufgebaute Modell verarbeitet unterschiedliche Medienformate in einem gemeinsamen Vektorraum und eignet sich unter anderem für semantische Suche und lokale RAG-Anwendungen.
Videoaufnahmen mit gesprochenen Fragen durchsuchen oder Quellcode anhand seiner Bedeutung finden: Mit EmbeddingGemma 2 erweitert Google die Möglichkeiten lokaler KI-Anwendungen. Doch wie funktioniert eine Suche, die verschiedene Medienformate miteinander verknüpft?
Grundlage sind sogenannte Embeddings. Dabei werden Inhalte in Zahlenvektoren umgewandelt, sodass semantisch ähnliche Informationen im selben Vektorraum nahe beieinanderliegen. Suchanfragen müssen deshalb nicht dieselben Begriffe wie die gesuchten Inhalte enthalten. Diese Technik bildet auch eine Grundlage für Retrieval-Augmented Generation (RAG), bei der Sprachmodelle gezielt Informationen aus vorhandenen Datenbeständen erhalten.
Modularer Aufbau reduziert Speicheranforderungen
EmbeddingGemma 2 basiert auf Googles Gemma-4-Architektur und umfasst vollständig geladen 740 Millionen Parameter. Für Text und Code benötigt das Modell lediglich 270 Millionen Parameter. Die Verarbeitung von Bildern erfolgt über einen zusätzlichen Encoder mit 170 Millionen Parametern, für Audio kommen weitere 300 Millionen hinzu.
Alle Varianten erzeugen Embeddings im selben Vektorraum. Standardmäßig besitzen diese 768 Dimensionen, können jedoch auf 512, 256 oder 128 Dimensionen reduziert werden. Dadurch lässt sich der Speicherbedarf für die abgelegten Vektoren verringern.
Auch beim Arbeitsspeicher setzt Google auf kompakte Modellvarianten. Auf einem Pixel 11 Pro benötigen die quantisierten Gewichte laut Hersteller etwa 191 MByte aktiven RAM für das reine Textmodell und rund 567 MByte für die vollständige multimodale Variante. Der tatsächliche Speicherbedarf einer Anwendung liegt allerdings darüber.
Das Kontextfenster umfasst 8192 Token und ist damit viermal so groß wie beim Vorgänger. Nach Google-Angaben lassen sich beispielsweise bis zu 5,5 Minuten Audio, 29 Bilder oder 58 Videoframes innerhalb einer Eingabe verarbeiten. Unterschiedliche Medienformate können ebenfalls kombiniert werden.
Verbesserte Codesuche und Integration in lokale KI-Systeme
Bei der semantischen Codesuche meldet Google deutliche Fortschritte. Im Benchmark MTEB Code steigt die Bewertung gegenüber EmbeddingGemma 1 von 68,76 auf 78,68 Punkte. Diese herstellereigenen Ergebnisse zeigen eine verbesserte Modellleistung, erlauben jedoch keine unmittelbare Aussage über die Qualität innerhalb konkreter Entwicklungsprojekte. Entscheidend bleiben insbesondere die Aufbereitung des Quellcodes und die verwendeten Suchanfragen.
Google stellt die Modellgewichte unter der Apache-2.0-Lizenz über Hugging Face und Kaggle bereit. Entwickler können für die Integration unter anderem LiteRT, MediaPipe, Transformers und llama.cpp verwenden.
In Kombination mit generativen Modellen wie Gemma 4 eignet sich EmbeddingGemma 2 als Suchkomponente lokaler RAG-Systeme. Beide Modelle verwenden laut Google denselben Text-Tokenizer und dieselbe Audio-Encoder-Architektur, was den gemeinsamen Speicherbedarf reduzieren soll.
Damit entstehen zusätzliche Möglichkeiten für multimodale KI-Anwendungen auf Endgeräten. Für die praktische Umsetzung bleiben neben den technischen Modellfähigkeiten insbesondere der gesamte Ressourcenbedarf und die Suchqualität in eigenen Datenbeständen relevant.
Weitere Entwicklungen rund um lokale KI-Modelle, semantische Suche und RAG-Technologien behandelt der Newsletter Beratung-KI mit praxisorientierten Einordnungen.
Effizienz durch Innovation: Teile der textlichen und visuellen Ausgestaltung dieser Seite wurden durch generative KI-Systeme unterstützt.
