Michael Tschannen
261
posts
Research Scientist
@GoogleDeepMind. Representation learning for multimodal understanding and generation. Personal account.
Zurich, Switzerland
Joined June 2012
Have you ever wondered how to train an autoregressive generative transformer on text and raw pixels, without a pretrained visual tokenizer (e.g. VQ-VAE)? We have been pondering this during summer and developed a new model: JetFormer ππ€ arxiv.org/abs/2411.19722 A thread π 1/
We are presenting JetFormer at ICLR this morning, poster #190. Stop by if youβre interested in unified multimodal architectures!
Have you ever wondered how to train an autoregressive generative transformer on text and raw pixels, without a pretrained visual tokenizer (e.g. VQ-VAE)? We have been pondering this during summer and developed a new model: JetFormer ππ€ arxiv.org/abs/2411.19722 A thread π 1/

