LinearAttention系列解读(一):Transformers Are RNNs学习分享本文详细介绍了经典的linear attention提出的motivation和算法原理。并对其局限性做了讨论2026-7-23 大模型 linear_transformer
LinearAttention系列解读(二):DeltaNet技术剖析学习分享本文相对系统讨论了linear attention中的deltanet变体。本文着重介绍了该方法的核心motivation和insight:将固定state看成一个从key到value的fast-weight model,并根据prediction error对已有映射做增量修正。2026-8-11 大模型 linear_transformer
LinearAttention系列解读(三):线性注意力中的Gating机制学习分享本文从输入依赖性和门控粒度两个维度,梳理了linear attention中的forgetting gate。Data-independent decay提供固定的时间衰减;data-dependent gate则根据当前输入动态管理记忆,并进一步发展出 scalar、one-sided vector、two-sided separable matrix和full matrix等不同参数化。 这些设计本质上都是表达能力与计算效率之间trade-off:更细粒度的gate能提供更灵活的状态控制,但也会带来更多参数、更复杂的数值问题和更高的硬件实现成本。2026-8-20 linear_transformer 大模型
LinearAttention系列解读(四):当 Delta Rule 遇上 Gating (GDN/KDA/GDN-2)学习分享本文从linear attention的delta-rule和gating机制出发,引出目前linear attention的最新进展GDN,KDA,GDN-2。并进一步探讨其在当下LLM架构中的应用2026-9-3 linear_transformer 大模型