Lazy loaded imageKV-Cache技术小结(MHA,GQA,MQA,MLA)

KV-cache技术是目前LLM,VLLM等自回归模型常用的避免冗余计算的手段。但引入该技术需要额外的存储成本。原生的kv-cache所需的存储成本与生成的token长度成正比,是目前长文本生成的主要瓶颈之一。目前针对如何降低KV-cache的存储成本激起大量研究者广泛关注。GQA,MQA,MLA是目前常用的方法。本文将从经典的casual attention出发,阐述kv-cache的必要性,及目前常见优化kv-cache的手段。
KV-Cache技术小结(MHA,GQA,MQA,MLA)

Lazy loaded imageStep by Step: Understanding Flash-Attention

Transformers核心组件self-attention的空间复杂度为$\mathcal{O}(T^2)$ ,$T$为序列长度。从显存层面限制了模型长上下文upper bound。对于标准的self-attention计算而言,需要频繁进行HBM(high bandwidth memory, HBM)和SRAM的内存读写,存在IO瓶颈。 FlashAttention的核心创新点是通过online-softmax和tiling技巧来将self-attention的空间复杂度降至$\mathcal{O}(T)$,减少HBM与SRAM的IO通信。
Step by Step: Understanding Flash-Attention
大模型MoE架构技术小结
Step by Step: Understanding ROPE
LinearAttention系列解读(一):Transformers Are RNNs

Lazy loaded imageKimi K3 技术解析

Kimi K3 的主要设计可以归纳为下面几项: 模型架构层面: • backbone 按 3:1 混合 KDA 与 MLA,兼顾长序列成本和周期性全局交互; • Attention Residuals 缩短 features 沿网络深度的访问路径; • Stable LatentMoE 使用 896 个 routed experts,配合 SiTU-GLU、RMSNorm 和 Quantile Balancing 稳定训练; • MoonViT-V2 从头参与 next-token training,图片、视频和文本使用同一 backbone; 训练&infra • context 按 8K、64K、256K、1M 四个阶段扩展; • post-training 在三个 domain、三个 reasoning-effort 档位上训练 9 个 teachers,再通过 MOPD 合并; • KCP、MoonEP、external KV cache、AgentENV 和 hybrid prefix cache 共同支撑训练与 serving。
Kimi K3 技术解析