发布了 Llama 3.2 的 1B 和 3B 模型的量化版本。量化后的模型大小平均减少 56%,RAM 使用量平均减少 41%,模型速度提高 2 至 4 倍,降低了功耗,可部署到更多移动设备上。Meta 采用量化感知训练和后训练量化两种方法,为 Llama 3.2 的 1B 和 3B 模型各推出两款量化版本。Meta 声称这些量化模型比非量化的 Llama BF16 模型速度更快、占用更少 RAM、功耗更低且精度几乎相同。量化后的模型仅支持 8000 个 Token 的上下文,但其基准测试结果与 Llama BF16 版本相差不远。Meta 已在一加 12、三星 S24+/S22 及苹果 iOS 设备等移动平台测试这些模型,结果良好,未来还计划通过神经处理单元提升量化模型性能。
官网地址:
https://www.llama.com/
模型下载地址:
https://www.llama.com/llama-downloads/
