unsloth 又发力了, 3GB 显存训练Qwen3-4b
unsloth 最新的更新提升巨大, 简单来说, 他们把原本Q和K各自需要的2个Triton内核合并为1个,并支持可变长度RoPE, 这样可以很大程度上节省显存和提升计算速度(原本Q和K需要两个Triton Kernel计算,现在合并为了一个), 在长上下文训练上实现了2.3x的训练速度加速.
另外还支持了int64索引, 因为原来的int32索引在500K这种超大上下文训练中会导致CUDA越界错误, 于是换了更大的精度来避免越界, 这样就支持更大上下文了.
#ai创造营##ai生活指南#
发布于 美国
