Lazy loaded imageKV-Cache技术小结(MHA,GQA,MQA,MLA)

KV-cache技术是目前LLM,VLLM等自回归模型常用的避免冗余计算的手段。但引入该技术需要额外的存储成本。原生的kv-cache所需的存储成本与生成的token长度成正比,是目前长文本生成的主要瓶颈之一。目前针对如何降低KV-cache的存储成本激起大量研究者广泛关注。GQA,MQA,MLA是目前常用的方法。本文将从经典的casual attention出发,阐述kv-cache的必要性,及目前常见优化kv-cache的手段。
KV-Cache技术小结(MHA,GQA,MQA,MLA)

Lazy loaded imageStep by Step: Understanding Flash-Attention

Transformers核心组件self-attention的空间复杂度为$\mathcal{O}(T^2)$ ,$T$为序列长度。从显存层面限制了模型长上下文upper bound。对于标准的self-attention计算而言,需要频繁进行HBM(high bandwidth memory, HBM)和SRAM的内存读写,存在IO瓶颈。 FlashAttention的核心创新点是通过online-softmax和tiling技巧来将self-attention的空间复杂度降至$\mathcal{O}(T)$,减少HBM与SRAM的IO通信。
Step by Step: Understanding Flash-Attention
大模型MoE架构技术小结
Step by Step: Understanding ROPE
RNN并行化——《Were RNNs All We Needed?》论文解读
LinearAttention系列解读(一):Transformers Are RNNs
LinearAttention系列解读(二):DeltaNet技术剖析

Lazy loaded imageLinearAttention系列解读(三):线性注意力中的Gating机制

本文从输入依赖性和门控粒度两个维度,梳理了linear attention中的forgetting gate。Data-independent decay提供固定的时间衰减;data-dependent gate则根据当前输入动态管理记忆,并进一步发展出 scalar、one-sided vector、two-sided separable matrix和full matrix等不同参数化。 这些设计本质上都是表达能力与计算效率之间trade-off:更细粒度的gate能提供更灵活的状态控制,但也会带来更多参数、更复杂的数值问题和更高的硬件实现成本。
LinearAttention系列解读(三):线性注意力中的Gating机制