大模型相关概述

基础

Tokenizer
BPE
BBPE
Embedding
Word2Vec

相关论文

DeepSeek V3
  • MoE负载均衡损失

  • MLA(Multi-Latent Attention)
    在这里插入图片描述

  • MTP(Multiple Token Prediction)
    在这里插入图片描述

  • FP8混合精度训练
    在这里插入图片描述
    在这里插入图片描述

  • GRPO强化训练
    在这里插入图片描述

  • 蒸馏

Qwen 2.5
  • 数据优化:预训练数据从 7 万亿个 token 增加到 18 万亿个 token。
  • 两阶段强化学习:DPO+GRPO结合。
Qwen 3
  • 动态思考模式切换
  • 更大范围的语言支持能力。多语言能力从29种上升到119种。
  • 多阶段post-training
    1)General Stage;
    2)Reasoning Stage;
    3)Long Context Stage;
    4)General RL
    在这里插入图片描述
  • Agent能力支持
  • MoE架构优化
Qwen3-Next

参考:https://zhuanlan.zhihu.com/p/1949124079979299416

GLM4.5
Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐