karminski-牙医
25-12-11 08:08 微博认证:AI博主

unsloth 又发力了, 3GB 显存训练Qwen3-4b

unsloth 最新的更新提升巨大, 简单来说, 他们把原本Q和K各自需要的2个Triton内核合并为1个,并支持可变长度RoPE, 这样可以很大程度上节省显存和提升计算速度(原本Q和K需要两个Triton Kernel计算,现在合并为了一个), 在长上下文训练上实现了2.3x的训练速度加速.

另外还支持了int64索引, 因为原来的int32索引在500K这种超大上下文训练中会导致CUDA越界错误, 于是换了更大的精度来避免越界, 这样就支持更大上下文了.

#ai创造营##ai生活指南#

发布于 美国