AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
By Jiajun Liang · Paper · cs.CL
Language remains an outlier in generative modeling: while images, video, and audio are increasingly modeled in continuous latent spaces, text generation still relies predominantly on discrete tokens. Existing continuous language models either inherit embedding spaces not designed