仅用8MB内存,推理自制168M参数的语言模型。
吐字速度大概是几分钟一个token。
图中设备是M5Stack的CoreS3(ESP32-S3)。
方法是将权重、KV缓存和分词器全部卸载到SD卡上。
实质上是实现了某种swap机制。
Qwen3-0.6B-Q80也可以推理,速度极慢。
思路很朴素,代码都是本地部署的DSV4F写的。
发布于 江苏
仅用8MB内存,推理自制168M参数的语言模型。
吐字速度大概是几分钟一个token。
图中设备是M5Stack的CoreS3(ESP32-S3)。
方法是将权重、KV缓存和分词器全部卸载到SD卡上。
实质上是实现了某种swap机制。
Qwen3-0.6B-Q80也可以推理,速度极慢。
思路很朴素,代码都是本地部署的DSV4F写的。