Transformer Attention机制 深度学习AI注意力即一切实践笔记当时我在做一个机器翻译的项目,用的还是基于 LSTM 的 seq2seq 模型,那个下午训练曲线又震荡得厉害,我盯着屏幕看了二十分钟,想的是:这… 醉月思📁 学习笔记📅 2024-08-17
Transformer Attention机制 深度学习 模型训练 性能优化关于Transformer 架构的几点记录后来硬着头皮从头实现了一遍 Transformer,过程中踩了不少坑,也算是对这个架构有了些实际体会。 醉月思📁 学习笔记📅 2024-06-10
Transformer Attention机制 Self-Attention Cross-Attention把Self-Attention换到Cross时踩过的坑在调试过程中,我发现模型收敛速度比预期的慢,注意力权重分布也很奇怪——几乎所有head的注意力都集中在序列开头… 醉月思📁 技术实践📅 2023-05-23