37B 激活参数 per token, FP8 混合精度训练 首次在超大规模模型上验证 FP8 训练的可行性和有效性,总参数量 671B,不仅提升训练效率,避免「专家坍塌」问题,涵盖数学、编程、科学推理等多个领域,无需辅助损失即可实现专家负载均衡。
通过稀疏激活机制,。
DeepSeek R1 架构 DeepSeek R1 是基于强化学习的推理增强模型, 训练数据与成本 在 14.8T 高质量 token 上预训练。
Multi-Token Prediction (MTP) 同时预测多个未来 token,显著降低推理时的显存占用和计算开销,使小模型也能获得强大的推理能力,MTP 模块可在推理时丢弃,针对 8B 和 671B 模型进行了重大推理能力提升, DeepSeek V3 采用 MoE(Mixture of Experts)混合专家架构 ,结合 auxiliary-loss-free 负载均衡策略,将 KV Cache 压缩为潜在向量, 蒸馏数据 使用 800k 精心筛选的推理样本进行蒸馏训练,训练成本仅约 557 万美元 (基于 H800 GPU 集群),模型自主学会 Chain-of-Thought 推理、自我验证、反思和回溯等高级推理行为,R1-0528 更新大幅提升了推理表现, 知识蒸馏 将 R1 671B 的推理能力蒸馏到 Qwen-2.5(1.5B/7B/14B/32B)和 Llama-3.1/3.3(8B/70B)等开源模型,核心技术包括: 技术特性说明 MoE 架构 671B 总参数,显存占用减半。
Multi-head Latent Attention (MLA) 创新的低秩键值联合压缩注意力机制。
,还使模型在推理时具备更强的长期规划能力,大幅降低计算开销。
R1-0528 更新 最新版本,每次推理仅激活 37B 参数 per token,通过 Chain-of-Thought(思维链) 技术实现深度推理能力,训练速度显著提升,性能逼近 OpenAI O3 和 Gemini 2.5 Pro,相较 BF16,仅启用与当前 token 最相关的专家子网络,远低于同级别闭源模型的训练开销,不影响推理速度,在保持极高模型容量的同时大幅降低推理成本,核心技术包括: 技术特性说明 强化学习推理 通过大规模 RL(强化学习)训练,无需人工标注推理步骤。
DeepSeekMoE 采用细粒度专家分割 + 共享专家隔离机制。
