大模型相关概述
·
大模型相关概述
基础
Tokenizer
BPE
BBPE
Embedding
Word2Vec
相关论文
DeepSeek V3
-
MoE负载均衡损失
-
MLA(Multi-Latent Attention)

-
MTP(Multiple Token Prediction)

-
FP8混合精度训练


-
GRPO强化训练

-
蒸馏
Qwen 2.5
- 数据优化:预训练数据从 7 万亿个 token 增加到 18 万亿个 token。
- 两阶段强化学习:DPO+GRPO结合。
Qwen 3
- 动态思考模式切换。
- 更大范围的语言支持能力。多语言能力从29种上升到119种。
- 多阶段post-training。
1)General Stage;
2)Reasoning Stage;
3)Long Context Stage;
4)General RL

- Agent能力支持
- MoE架构优化
Qwen3-Next
GLM4.5
更多推荐



所有评论(0)