Google DeepMind představil Gemmu 4 12B, multimodální model navržený jako jednotný systém bez tradičního enkodéru. Model může zpracovávat jak textové, tak obrazové vstupy v rámci jedné jednotné architektury. Tento přístup se liší od klasických multimodálních řešení, která oddělují zpracování jednotlivých typů dat. Gemma 4 12B se řadí do portfolia modelů Gemma, která Google DeepMind vyvíjí pro efektivní inference. Model je určen vývojářům a výzkumným institucím, kteří pracují s multimodálními úkoly. Zjednodušená architektura bez enkodéru může přispět k nižší latenci a efektivnějšímu využití výpočetních prostředků.