Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
Apple Machine Learning Research524 字 (约 3 分钟)
85
扩散模型在算术强度上优于自回归模型,但长上下文扩展性不足,块级解码和批量推理优化可提升性能。
入选理由:DLMs算术强度比ARMs高30%但长上下文扩展性差50%
FeaturedArticle#Diffusion Models#Autoregressive Models#LLM Performance#Natural Language Processing英文