基座模型架构
Advanced LLMs 1: Attentions
从 MHA、MQA/GQA、MLA 到稀疏注意力(LongFormer / StreamingLLM / NSA / DSA / MSA)、线性注意力(Mamba / Gated DeltaNet)与 Flash Attention。
基座模型架构
从 MHA、MQA/GQA、MLA 到稀疏注意力(LongFormer / StreamingLLM / NSA / DSA / MSA)、线性注意力(Mamba / Gated DeltaNet)与 Flash Attention。
Pre-Norm / Post-Norm 与 RMSNorm 的推导、激活函数与 SwiGLU FFN,以及 RoPE 的旋转矩阵与长度外推(PI / NTK-aware / YaRN)。
Prefill 与 Decode 两个阶段的 FLOPs 与 Memory-Bound 分析,以及 Speculative Decoding、Multi-Token Prediction。
预训练优化器与训练稳定性。
MoE 的路由、负载均衡与训练。