训练大型语言模型(LLM)从来不是小工程,尤其是想要高效、量化训练。llm.q 是一个用纯 CUDA/C++ 实现的量化 LLM 训练框架,专为单节点多 GPU 中型训练设计,性能优异且高度可配置。
它支持多种低精度格式(如 bf16、fp8),并集成了 NCCL、cuDNN 加速通信与注意力计算,能灵活开启激活重计算、权重分片和多 GPU 并行。训练过程全开源透明,方便自定义与调试。
用最新的 CUDA 12+ 环境即可快速构建,支持多种训练技巧和调度参数,适合科研和工业级别的模型微调与训练。只需一台配备 RTX 4090 或更强 GPU 的机器,几天内即可完成千万级 tokens 训练,花费低于 50 美元。
项目地址 👉 github.com/IST-DASLab/llmq
主要特点:
- 纯 CUDA/C++ 实现,性能卓越,适合量化训练
- 支持多 GPU 多进程或多线程训练,灵活高效
- 多种低精度数据类型和激活重计算策略,显著节省显存
- 集成 NCCL、cuDNN 实现快速通信和注意力机制
- 完整训练流程,从数据预处理到模型评估
- 支持断点续训、多周期评估、日志可视化
- 兼容 Hugging Face 模型格式,方便迁移和微调
如果你想用最少资源训练高质量量化 LLM,这个项目绝对值得一试!
发布于 北京
