Tensor Notes
Notes on machine learning
文章
存档
关于
订阅
全部文章
8 篇 · 2026
2026-07-11
从零推导 Self-Attention:为什么是 QKV,为什么要除以 √d
把注意力拆成三步:打分、归一化、加权求和。顺带解决两个被反复问到却很少讲透的问题——查询键值的分工,以及缩放因子的来历。
Transformer
2026-06-28
MoE 稀疏路由的工程真相:负载均衡、容量因子与通信瓶颈
论文里的 MoE 只有一个 top-k 和一个辅助损失,落到集群上却是一堆 all-to-all 和丢 token 的取舍。记录一次 8×A100 上的调参过程。
Scaling
2026-06-15
RAG 不是搜索加拼接:分块、重排与上下文压缩的实践
做了半年检索增强,最大的教训是:召回率的天花板在分块策略上,而不是在向量模型上。附内部评测集的对比数据。
Retrieval
2026-05-30
INT4/INT8 量化推理:从 GPTQ 到 AWQ 的取舍
同样是 4 bit,为什么有的模型掉点严重、有的几乎无损?答案藏在激活值的离群通道里。
Inference
2026-05-12
扩散模型的噪声调度:DDPM、DDIM 与 Flow Matching
线性调度在高分辨率下会浪费一半的采样步。梳理三代方法的动机,以及为什么最近大家都在往流匹配上迁。
Generative
2026-04-26
RLHF 到 DPO:偏好对齐的三年演化
奖励模型是不是必需品?把 PPO 的目标函数展开之后,会发现偏好数据里已经藏着一个隐式奖励。
Alignment
2026-04-09
Agent 的工具调用:状态、重试与失败边界
让模型调用工具很容易,让它在工具失败时不胡编才难。一套已经在生产环境跑了四个月的错误处理约定。
Systems
2026-03-22
KV Cache 的显存账本:PagedAttention 与连续批处理
推理服务的并发上限几乎完全由 KV Cache 决定。先把这笔账算清楚,再谈优化。
Serving
更早的内容正在整理,会陆续补回这个列表。