academic diffusion language models (ECHO) Sampling-aware MDLM training that outperforms SOTA by 15% on reasoning benchmarks self-correcting MDLMs (mdlm_refine) Training-time self-correction for masked diffusion, vs. inference-time correction methods speculative decoding for diffusion LMs (dvd) A lightweight KV-cached MDLM drafter paired with a bidirectional verifier what's next: diffusion-native optimizers & long-context MDLMs Early-stage ideas on training and scaling MDLMs more efficiently fairness transformer Transformer architecture for discrete fair division problems memory layers for continual learning in LLMs efficient continual learning through optimized memory layers personal