领读 Kimi K3 技术报告:注意力美学、多教师蒸馏与开源 MoE 架构
Kimi K3 是有效扩展到 2.8T 总参数并全量开源的 MoE 模型,清华博士候选人孙宇涛领读其技术报告,串联讲解十余篇相关论文。报告覆盖线性注意力、Gated MLA、Attention Residuals、Stable LatentMoE 与 Muon 等架构创新,以及预训练、多教师 On-Policy 蒸馏和 KDA Kernel 等基础设施。
Kimi K3 是有效扩展到 2.8T 总参数并全量开源的 MoE 模型,清华博士候选人孙宇涛领读其技术报告,串联讲解十余篇相关论文。报告覆盖线性注意力、Gated MLA、Attention Residuals、Stable LatentMoE 与 Muon 等架构创新,以及预训练、多教师 On-Policy 蒸馏和 KDA Kernel 等基础设施。
清华大学交叉信息研究院助理教授、前 OpenAI 研究员吴翼在播客对谈中系统讲解了强化学习(RL)原理、RL 与 LLM 的结合路径及行业非共识。他提出 Intelligence = LLM(理解)× RL(决策),并指出 RL 三大分支为泛化(DeepSeek)、代码(Anthropic)、Agent(OpenAI)。