Transformer
从零推导 Self-Attention:为什么是 QKV,为什么要除以 √d
把注意力拆成三步:打分、归一化、加权求和。顺带解决两个被反复问到却很少讲透的问题——查询键值的分工,以及缩放因子的来历。
把注意力拆成三步:打分、归一化、加权求和。顺带解决两个被反复问到却很少讲透的问题——查询键值的分工,以及缩放因子的来历。
论文里的 MoE 只有一个 top-k 和一个辅助损失,落到集群上却是一堆 all-to-all 和丢 token 的取舍。记录一次 8×A100 上的调参过程。
没有周报,没有转载摘要。写完一篇发一篇,平均一个月一到两封。随时可以退订。