爱可可-爱生活
26-07-18 18:19 微博认证:AI博主 2025微博新锐新知博主

KTransformers 是一套灵活的 CPU-GPU 异构计算框架,旨在帮助研究者和开发者高效体验大模型推理与微调的最新优化技术。

框架集成了 kt-kernel 内核,提供了高性能的 INT4/INT8 量化推理、MoE 专家调度、AMX/AVX 加速以及与 SGLang 的无缝集成,同时支持通过 LLaMA-Factory 进行超大 MoE 模型的混合精度微调,在消费级硬件上即可实现显著加速与更低显存占用。

GitHub:github.com/kvcache-ai/ktransformers

主要功能:

- CPU-GPU 异构推理,支持 AMX/AVX 加速与多 GPU 并发;
- MoE 模型优化,实现 NUMA 感知内存管理和专家自动调度;
- INT4/INT8/FP8/GPTQ 多精度量化,兼顾速度与精度;
- 与 LLaMA-Factory 深度集成,支持 RL-DPO、LoRA 等微调方案;
- 兼容 SGLang、Unsloth 等生态,快速部署生产环境;
- 支持 Web、Windows、Linux 多平台,通过 pip 即可快速安装。

无论是在单卡 24GB 显存上跑通 DeepSeek-R1,还是在多卡环境下训练 Qwen3-MoE,KTransformers 都能提供极具性价比的解决方案。

发布于 北京