🔥一张全景图!拆解大模型推理性能优化技术的目标
大模型推理优化的技术很多,但不建议从 FlashAttention、量化、PagedAttention 这些名字开始背。更有效的办法,是先看一条请求究竟慢在哪里。
在 H100 上跑 batch=1 的解码,GPU 算力利用率不到 1%。不是配置错了:这块卡每从显存搬 1 个字节,要做约 300 次浮点运算,才对得起它的算力;而解码每搬 1 个字节,只做约 1 次。推理优化的大部分技术,都是在处理这个 300 比 1 的失衡——只是它们藏在一张让人眼花的名词表后面。
FlashAttention、PagedAttention、Radix Cache、FP8、AWQ、MLA、continuous batching、CUDA Graph、投机解码……每个名字背后都是一篇论文、一套工程。我们一个个啃,啃完还是没有全局感,因为它们看起来彼此无关。
其实优化的目标只有两个:
• 单条请求更快 ——延迟;
• 同一批硬件单位时间吐出更多 token ——吞吐。
这两个目标还经常打架:把更多请求合在一批里算,总吞吐上去了,单条请求可能等得更久;投机解码能降低单条延迟,但系统满负载时,多出来的草稿计算反而抢资源。
阅读全文:http://t.cn/AXCufg75
#青稞社区##人工智能[超话]##大模型#
所以判断一项优化,不能只问“能加速多少”,要问:它解决哪个瓶颈,花掉什么资源,在什么负载下划算?
下面用一套尽量简单的框架,把这些技术放回它们真正解决的问题里。
发布于 河北
