KV-Cache技术小结(MHA,GQA,MQA,MLA)学习分享KV-cache技术是目前LLM,VLLM等自回归模型常用的避免冗余计算的手段。但引入该技术需要额外的存储成本。原生的kv-cache所需的存储成本与生成的token长度成正比,是目前长文本生成的主要瓶颈之一。目前针对如何降低KV-cache的存储成本激起大量研究者广泛关注。GQA,MQA,MLA是目前常用的方法。本文将从经典的casual attention出发,阐述kv-cache的必要性,及目前常见优化kv-cache的手段。2025-2-20 大模型
Step by Step: Understanding Flash-Attention学习分享Transformers核心组件self-attention的空间复杂度为$\mathcal{O}(T^2)$ ,$T$为序列长度。从显存层面限制了模型长上下文upper bound。对于标准的self-attention计算而言,需要频繁进行HBM(high bandwidth memory, HBM)和SRAM的内存读写,存在IO瓶颈。 FlashAttention的核心创新点是通过online-softmax和tiling技巧来将self-attention的空间复杂度降至$\mathcal{O}(T)$,减少HBM与SRAM的IO通信。2025-9-28 大模型
大模型MoE架构技术小结学习分享本文从 FFN 的 KV-Memory 视角出发,逐步推导出 MoE(Mixture of Experts)结构的动机与演化过程,并介绍了MOE架构训练过程Routing Collapse现象及解决方案。2025-11-12 大模型
Step by Step: Understanding ROPE学习分享ROPE是目前不论LLM还是VLLM常用的位置编码。本文将step by step梳理个人对ROPE的理解2025-12-23 大模型 多模态
RNN并行化——《Were RNNs All We Needed?》论文解读学习分享最近在看并行RNN相关的paper,发现很多都利用了Parallel Scanning算法。本文将从Parallel Scanning算法开始,介绍Bengio团队不久前发表的《Were RNNs All We Needed?》2024-11-21 大模型
LinearAttention系列解读(一):Transformers Are RNNs学习分享本文详细介绍了经典的linear attention提出的motivation和算法原理。并对其局限性做了讨论2026-7-23 大模型 linear_transformer
LinearAttention系列解读(二):DeltaNet技术剖析学习分享本文相对系统讨论了linear attention中的deltanet变体。本文着重介绍了该方法的核心motivation和insight:将固定state看成一个从key到value的fast-weight model,并根据prediction error对已有映射做增量修正。2026-8-11 大模型 linear_transformer
LinearAttention系列解读(三):线性注意力中的Gating机制学习分享本文从输入依赖性和门控粒度两个维度,梳理了linear attention中的forgetting gate。Data-independent decay提供固定的时间衰减;data-dependent gate则根据当前输入动态管理记忆,并进一步发展出 scalar、one-sided vector、two-sided separable matrix和full matrix等不同参数化。 这些设计本质上都是表达能力与计算效率之间trade-off:更细粒度的gate能提供更灵活的状态控制,但也会带来更多参数、更复杂的数值问题和更高的硬件实现成本。2026-8-20 linear_transformer 大模型