指尖魔法屋
  • 文章
  • 分类
  • 标签
  • 时间轴
  • 关于
  • 联系
  • 🔍

分布式训练

分布式训练 集群 大模型训练
AI分布式训练踩坑记录
显存占用一路狂奔到 23.5GB,然后崩了。
醉月思 醉月思
📁 技术实践
📅 2023-07-14
深度学习 ZeRO优化器 分布式训练 DeepSpeed 内存优化
AI ZeRO优化器实践笔记
ZeRO(Zero Redundancy Optimizer)是DeepSpeed里的一组优化策略,核心思想就…
醉月思 醉月思
📁 技术实践
📅 2023-06-28
深度学习 分布式训练 流水线并行 Megatron-LM 大模型
AI流水线并行折腾手记
GPT-3的论文里就提了这种思路,Megatron-LM也把它用得挺狠。
醉月思 醉月思
📁 技术实践
📅 2023-05-17
深度学习 分布式训练 PyTorch GPU集群 性能优化
关于大规模分布式训练的几点记录
上个月接手一个图像分类项目,训练数据大概 10TB,模型是 ResNet152 的魔改版。
醉月思 醉月思
📁 技术实践
📅 2023-05-05
分布式训练 模型并行 PyTorch 多卡训练 通信优化
把单卡换到多卡时踩过的坑
把单卡换到多卡时踩过的坑:先看卡点
醉月思 醉月思
📁 技术实践
📅 2022-06-05
联邦学习 隐私保护 分布式训练 TensorFlow Federated 机器学习
关于联邦学习的几点记录
如果只能用一句话说联邦学习:先把失败复现出来。
醉月思 醉月思
📁 技术实践
📅 2022-02-15
Copyright © 2017-2026 指尖魔法屋. All rights reserved POWERED BY thinkBlog · v6.1.0 关于 · 联系 · 隐私政策 · Cookie 政策 本站已顽强运行:加载中...
粤ICP备17055617号