[IR]《End-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference》Y Chen, J Duan, R Zhang, M Liang… [Meta AI & University of North Carolina at Chapel Hill] (2026)
在大语言模型部署领域,静态计算图与动态资源环境的错配是一个悬而未决的难题。过去的方法受困于模型结构固定或启发式策略脆弱,本质原因是无法同时感知输入难度与实时波动的计算预算。
本文的核心洞见是:把推理过程重新看作受约束的资源分配问题。由此,引入预算条件触发的轻量化门控网络,实现层级跳过、头部裁剪及推理标记缩减的端到端联合优化,使模型能根据资源多寡动态调节计算足迹。
这项工作真正留下的遗产是为大模型提供了应对云端波动的弹性推理范式。它为后来者打开的新门是跨维度的动态稀疏化策略,但尚未跨过的门槛是门控决策对在线延迟预估准确性的高度依赖。
arxiv.org/abs/2606.27743 #机器学习# #人工智能# #论文# #AI创造营#
发布于 北京
