模型压缩 量化 剪枝 蒸馏 部署优化AI模型压缩进阶踩坑记录要把一个 7B 语言模型塞进 8GB 内存的边缘设备——这不是"优化一下体验",是硬件硬顶在那儿。 醉月思📁 技术实践📅 2023-06-11
模型压缩 量化 剪枝 知识蒸馏 深度学习把量化换到剪枝时踩过的坑项目里那个 7B 参数的模型训练好了,部署到推理服务器上时,CPU 占用直接拉满,延迟干到了 3 秒多。 醉月思📁 技术实践📅 2022-01-10