RL学习小结 (001): 基本概念、贝尔曼方程
RL学习小结 (002): 策略梯度理论

Lazy loaded imageRL学习小结 (003): 性能差异引理(The Difference in Policy Performance)

新策略 相对于旧策略 的性能提升量,等于"用新策略去采样,然后用旧策略的优势函数去评估"所得到的期望累计折扣优势。 这意味着我们估计新策略性能,只需用旧策略的优势函数,就能评价新策略。 策略改进不需要直接知道新策略有多好,只需要知道旧策略认为哪些动作更好,然后让新策略更常选这些动作。
RL学习小结 (003): 性能差异引理(The Difference in Policy Performance)
RL学习小结 (004): Actor-Critic Method
RL学习小结 (005): TRPO理论剖析
RL学习小结 (006):PPO原理剖析
LinearAttention系列解读(一):Transformers Are RNNs

Lazy loaded imageKimi K3 技术解析

Kimi K3 的主要设计可以归纳为下面几项: 模型架构层面: • backbone 按 3:1 混合 KDA 与 MLA,兼顾长序列成本和周期性全局交互; • Attention Residuals 缩短 features 沿网络深度的访问路径; • Stable LatentMoE 使用 896 个 routed experts,配合 SiTU-GLU、RMSNorm 和 Quantile Balancing 稳定训练; • MoonViT-V2 从头参与 next-token training,图片、视频和文本使用同一 backbone; 训练&infra • context 按 8K、64K、256K、1M 四个阶段扩展; • post-training 在三个 domain、三个 reasoning-effort 档位上训练 9 个 teachers,再通过 MOPD 合并; • KCP、MoonEP、external KV cache、AgentENV 和 hybrid prefix cache 共同支撑训练与 serving。
Kimi K3 技术解析