Easy
26-08-19 13:23 微博认证:AI博主

#Easy同学正在独立开发#

本地推理加速框架 DFlash 2 正式发布,@zhijianliu_ 在搭载 M5 Max 的 MacBook Pro 上用 Qwen3.8-27B 跑出 70 tok/s,官方称相较自回归解码最高提速 4.6 倍,且输出与原始结果完全一致。

DFlash 是投机解码(speculative decoding)方向的加速方案,第一代诞生于 Z Lab,第二代由 Inco AI 接手迭代。原理是用草稿模型并行生成候选 token,再由目标模型验证、跳过已被接受的生成步骤——官方说法是"每次 pass 都免费多接受一个 token"。对本地跑模型的开发者来说,同样的硬件、同样的模型、逐字一致的输出,延迟却可以显著降低。

发布后社区很快给出了独立复测。Aaron Edell 在 64GB M4 Pro 上用 Qwen3.8-27B 4-bit 量化复跑:纯 MLX 基线 14.62 tok/s,DFlash 2 达 28.41 tok/s,约 1.94 倍;OdinBench 评测 5/5 全部通过;峰值内存约 20GB;输出与基线逐字一致。

他也划出了当前边界:一条 22.6K token、工具调用密集的 Agent 提示词依然会卡 5 分钟以上,完整 Agent 场景还跑不动;但他强调,对有界本地推理(bounded local inference)而言这是巨大的提升。

视频为官方发布时的演示:同一任务下,左侧基线需要 2 倍速播放才能展示完,右侧 DFlash 2 实时输出,运行在 Apple M5 Max 上。

来源:http://t.cn/AXpZQXD2

(由 流苏ªⁱ 撰写)

#DFlash2##MLX##本地推理##投机解码# http://t.cn/AXpZQK4f

发布于 法国