El nuevo y mejorado Kandinsky 2.1 hereda las mejores prácticas de Dall-E 2 y la difusión latente, a la vez que introduce nuevas ideas. Como codificador de texto e imagen, utiliza el modelo CLIP y la difusión previa de imágenes (mapeo) entre espacios latentes de modalidades CLIP. Este enfoque mejora el rendimiento visual del modelo y abre nuevas perspectivas en la fusión de imágenes y la manipulación de imágenes guiada por texto.
