科技强森
25-07-31 11:13 微博认证:数码博主

DeepSeek 与北大等联合发表的论文获 ACL 2025 最佳论文,其提出的原生稀疏注意力(NSA)机制,让长文本处理速度提升 11 倍且性能反超传统模型,上下文可扩至 100 万 tokens,或用于下一代模型。

NSA 通过压缩、选择性、滑动三条注意力分支动态分层捕捉信息,结合硬件优化实现高效,在解码、前向和反向传播阶段分别提速 11.6 倍、9 倍、6 倍,多项测试表现亮眼,数学推理等任务优势显著。

另有三篇最佳论文值得关注:北大研究揭示大模型对齐训练易反弹;斯坦福探讨大模型公平性新视角 “差异感知”;亥姆霍兹信息安全中心等解析大模型响应采样机制的伦理问题。

这些前沿研究中,你最期待哪项技术早日落地应用?来评论区聊聊~

发布于 陕西