Transformer Attention机制 深度学习AI注意力即一切实践笔记当时我在做一个机器翻译的项目,用的还是基于 LSTM 的 seq2seq 模型,那个下午训练曲线又震荡得厉害,我盯着屏幕看了二十分钟,想的是:这… 醉月思📁 学习笔记📅 2024-08-17
位置编码 RoPE ALiBi Transformer 深度学习从位置走到信息:AI位置编码笔记之前用绝对位置编码,生成到1000+token时效果明显变差。 醉月思📁 学习笔记📅 2024-08-12
Transformer Attention机制 深度学习 模型训练 性能优化关于Transformer 架构的几点记录后来硬着头皮从头实现了一遍 Transformer,过程中踩了不少坑,也算是对这个架构有了些实际体会。 醉月思📁 学习笔记📅 2024-06-10
神经架构搜索 NAS 架构搜索 自动化 深度学习关于AI 神经网络架构搜索的几点记录项目背景其实挺简单:给一个医疗影像分类任务做模型优化,数据量约 10 万张,算力限制在单张 A100 GPU,目标是在推理时间不超过 50ms … 醉月思📁 技术实践📅 2023-08-11
深度学习 ZeRO优化器 分布式训练 DeepSpeed 内存优化AI ZeRO优化器实践笔记ZeRO(Zero Redundancy Optimizer)是DeepSpeed里的一组优化策略,核心思想就… 醉月思📁 技术实践📅 2023-06-28
Vision Transformer 深度学习 PyTorch 注意力机制 计算机视觉把CNN换到ViT时踩过的坑把CNN换到ViT时踩过的坑上手并不难,难的是稳定跑起来。 醉月思📁 学习笔记📅 2023-06-27