青稞AI
26-08-05 13:35 微博认证:AI博主

🔥一张全景图!拆解大模型推理性能优化技术的目标

大模型推理优化的技术很多,但不建议从 FlashAttention、量化、PagedAttention 这些名字开始背。更有效的办法,是先看一条请求究竟慢在哪里。

在 H100 上跑 batch=1 的解码,GPU 算力利用率不到 1%。不是配置错了:这块卡每从显存搬 1 个字节,要做约 300 次浮点运算,才对得起它的算力;而解码每搬 1 个字节,只做约 1 次。推理优化的大部分技术,都是在处理这个 300 比 1 的失衡——只是它们藏在一张让人眼花的名词表后面。

FlashAttention、PagedAttention、Radix Cache、FP8、AWQ、MLA、continuous batching、CUDA Graph、投机解码……每个名字背后都是一篇论文、一套工程。我们一个个啃,啃完还是没有全局感,因为它们看起来彼此无关。

其实优化的目标只有两个:

• 单条请求更快 ——延迟;
• 同一批硬件单位时间吐出更多 token ——吞吐。
这两个目标还经常打架:把更多请求合在一批里算,总吞吐上去了,单条请求可能等得更久;投机解码能降低单条延迟,但系统满负载时,多出来的草稿计算反而抢资源。

阅读全文:http://t.cn/AXCufg75

#青稞社区##人工智能[超话]##大模型#

所以判断一项优化,不能只问“能加速多少”,要问:它解决哪个瓶颈,花掉什么资源,在什么负载下划算?

下面用一套尽量简单的框架,把这些技术放回它们真正解决的问题里。

发布于 河北