Unlocking Lossless Speedups in LLMs via Discrete Diffusion Paper • 2609.04010 • Published 8 days ago • 135
Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference Paper • 2609.05275 • Published 7 days ago • 20
Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference Paper • 2609.05275 • Published 7 days ago • 20
Unlocking Lossless Speedups in LLMs via Discrete Diffusion Paper • 2609.04010 • Published 8 days ago • 135
Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference Paper • 2609.05275 • Published 7 days ago • 20 • 2
Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM Paper • 2601.18306 • Published Jan 26
Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation Paper • 2608.15062 • Published 16 days ago • 11