大模型应用正在飞速发展:从聊天机器人(Chatbot)、智能客服,到 AI 写作、代码助手,它们已经融入到我们日常的工作与生活中。

但当我们真正把大模型“搬到生产环境”时,往往会撞上两个难题:

显存不够用:模型本身能跑,但一旦上下文变长,显存占用就迅速膨胀,甚至直接报错 Out Of Memory;

并发不高效:多个用户同时请求时,GPU 资源并未被充分利用,请求排队导致延迟体验差。

大模型推理的挑战

大模型的推理表面上是输入 Prompt,输出 Respone。但背后隐藏着多重挑战。

1. Prefill & Decode 的差异性

推理可以拆分为两个阶段:

  • Prefill 阶段:一次性处理用户输入的完整 prompt,算力开销集中且巨大。
  • Decode 阶段:逐 token 生成输出,每次计算量小,但需要频繁访问和新增 KV Cache,显存开销持续增长。

这意味着:Prefill 阶段的问题是算力,Decode 阶段的瓶颈是显存,两者对系统的要求完全不同,很难用统一的调度与资源管理策略兼顾。

2. 动态请求场景下的调度难题

在线服务场景中,请求是随时到来的:

  • 有的请求只生成几十个 token,很快结束。
  • 有的请求可能要生成几千个 token,长期占用显存和算力。

如果调度不合理:

  • 短请求会被“拖慢”,延迟上升,用户体验差。
  • 长请求可能“霸占资源”,导致其他用户的任务无法及时调度。

3. KV Cache 的显存瓶颈

每个 token 的推理都需要存储对应的 KV Cache

  • 上下文越长,占用显存越大;
  • 多个请求并发时,显存消耗会急剧膨胀;
  • 如果显存不足,系统只能淘汰一些KV Cache,然后重算,但这会带来 性能下降

大模型推理复杂性来自 算力差异、请求动态性 和 显存瓶颈,系统必须在 算力、显存、调度 三者间做精细化优化。

推理框架的演进

大模型推理框架的发展经历了从 易用高效 的演进:

  1. Hugging Face Transformers:易用为主
    简单易用、生态成熟,但长上下文和高并发场景下,吞吐率和显存利用率有限。
  2. DeepSpeed-Inference / FasterTransformer:算子级优化
    通过内核优化和算子融合加速推理,但仍难解决:
  • KV Cache 的高效管理(长上下文显存膨胀);
  • 动态批处理(在线请求随时到达的调度问题)。

正是针对这些挑战,vLLM 从系统层重新设计推理引擎,引入 动态批处理、PagedAttention 和 前缀共享,实现高吞吐、高并发、高显存利用率。

什么是 vLLM?

vLLM 是由 UC Berkeley 团队开源的一个 大模型推理框架(Serving Framework),它的目标是让大语言模型(LLM)在推理时更高效,特别是在 高并发、多请求、长上下文 等场景下。

vLLM 的三大关键技术:

  1. **PagedAttention:**像操作系统虚拟内存一样管理 KV cache,解决显存碎片问题。
  2. **Continuous Batching:**动态批处理机制,让新请求能随时加入,提升吞吐与并发。
  3. **Prefix Sharing:**相同前缀的请求共享 KV Cache,减少重复计算。

从而解决了显存碎片问题、KV Cache 不能复用的问题,在相同的延时水平下,vllm 是FastTransformer 的 2~4 倍。

PagedAttention 在大模型推理中,KV Cache 是加速生成的核心机制。它存储了历史上下文的注意力信息,使模型在 decode 阶段无需重新计算整个上下文的注意力,从而大幅提升推理效率。 然而,传统框架在管理 KV Cache 时存在几个明显痛点: 1. 内部显存碎片 短请求仍然必须占用最大生成长度(max new token)显存空间,导致大量内存被闲置,利用率低。 假设模型context length 为 2048,max new token 为 512。如下述例子,浪费 505 个 token 显存空间。 2. 外部显存碎片

不同请求的长度和生命周期不一致,显存中容易形成零散空洞。显存分配器 很难找到连续大块显存,可能引发 OutOfMemory。 假设 request 3 推理完成后,释放了物理显存空间,但是未来的请求,如 request 5 等需要的显存空间比 request 3释放的空间大,request 3 释放的空间就成为了外部碎片。 3. KV Cache 无法复用 每个请求的 KV Cache 都是独立分配且独占使用的。即使两个请求(例如 request 1 和 request 2)的 prompt 存在相同的前缀部分,这些已经计算好的 KV Cache 也无法共享或复用,只能重复计算并各自存储一份。 vLLM 提出的 PagedAttention 技术巧妙借鉴了操作系统的分页机制: * 拆分KV Cache:把每个请求的 KV Cache 分成固定大小(如16个token)的逻辑页。 * 灵活分配:不同请求可以按需申请页,不需要大块的连续物理显存。 * 页表管理:每个请求维护一个页表,记录它的 KV cache 存在哪些物理页里。注意力计算时通过页表将这些小页拼接起来使用。 优势: * 避免显存碎片:零散小页可以灵活复用,不会出现大块空洞无法使用的情况。 * 显存利用率高:短请求只占用实际需要的页数,不浪费资源。

Prefix Sharing

在大模型推理中,不同请求的 prompt 往往有相同的前缀。例如:

  • request 1:“写一首诗,主题是春天,风格模仿李白”
  • Request 2:“写一首诗,主题是春天,风格模仿杜甫”

传统方法会重复计算和存储前缀的 KV Cache,浪费显存。

vLLM 的 Prefix Sharing 技术正是为了解决这一问题。其核心思路是:

  1. 借助 PagedAttention 的分页机制,把 KV Cache 划分成固定大小的逻辑页。
  2. 用这些逻辑页构建一棵 前缀树(Prefix Tree)。相同前缀的请求共享同一组物理页,不再重复存储。
  3. 当请求在共享前缀之后生成了不同的 token,就会触发 Copy-on-Write(写时复制):共享的逻辑页保持不变,新的 token 会写入一份复制出的新页,从而在前缀树中分叉。

优势:

  • 节省显存:相同前缀只保留一份 KV Cache。
  • 减少计算:前缀部分只需计算一次。
  • 保证正确性:通过 Copy-on-Write,让分叉后的请求互不干扰。

Continuous Batching

在传统推理框架里,batch 通常是静态批处理(Static Batching)

  • 一个 batch 中的所有请求必须同时交给 GPU 执行。
  • 如果某些请求先完成,其余请求仍在生成,那么 batch 中空闲的位置就浪费了。
  • 新来的请求需要等到当前 batch 完成后才能被处理,延迟增加。

举个例子:

request 1 生成 10 个 token 就完成了,request 2 生成 1000 个 token 才完成。当 request 1 在第 10 步完成后,它在 batch 里对应的 slot 会空出来,但这部分计算资源不会自动被新请求利用。

结果就是:

  • 吞吐率下降:GPU 有空闲却不能马上服务新请求
  • 延迟增加:新请求必须等 batch 完成

vLLM 引入了 Continuous Batching,允许不同的请求同时在一个 batch 中运行

  • 已在 decode 阶段的老请求,和刚进入 prefill 阶段的新请求,可以放在同一个 batch 里计算。
  • 当一个请求完成时,它占用的 slot 会立即被回收,新请求可以立刻加入 batch,而不用等待整个 batch 完成。
  • batch 的大小是 动态变化 的,始终保持 GPU 尽可能满负荷运行。

优势:

  • 高吞吐:GPU 始终保持高利用率。
  • 低延迟:新请求无需等待,随时可以插入。
  • 更灵活的调度:不同长度的请求能混合执行,避免长请求拖慢整体速度。

KV Cache 淘汰策略

在 vLLM 中,KV Cache 是推理加速的关键,但显存有限,需要动态管理。系统采用分页管理和淘汰策略,核心逻辑如下:

  • 分页管理:KV Cache 按固定大小逻辑页分配,每页存储若干 token KV Cache。
  • 显存不足时交换:当 GPU 显存不足时,部分 KV Cache 页会被换出到 CPU 内存,释放 GPU 显存供新请求使用。
  • 内存不足时淘汰:如 CPU 内存也不足,使用淘汰策略如 LRU,丢弃相应的 KV Cache 页。
  • 需要时重新计算:被丢弃的 KV Cache 页在后续生成新 token 时,会重新计算,保证推理正确性。

总结

vLLM 通过系统级优化,引入了 PagedAttention、Prefix Sharing、Continuous BatchingKV Cache 淘汰策略,形成高性能推理方案:

  • PagedAttention:将 KV Cache 分页管理,按需分配逻辑页,解决内部与外部显存碎片问题。
  • Prefix Sharing:相同前缀请求共享 KV Cache,节省显存并减少重复计算,分叉时通过 Copy-on-Write 保证正确性。
  • Continuous Batching:动态批处理机制,让新请求随时加入正在执行的 batch,提高 GPU 利用率 并 降低请求延迟。
  • KV Cache 淘汰策略:显存不足时先换到 CPU 内存,内存不足时再淘汰,必要时重新计算。

通过这些技术,vLLM 能在高并发、长上下文场景下,实现 显存高效利用、高吞吐量 和 低延迟。vLLM 成为生产环境的高性能推理框架。

如何学习大模型 AI ?

我国在AI大模型领域面临人才短缺,数量与质量均落后于发达国家。2023年,人才缺口已超百万,凸显培养不足。随着Al技术飞速发展,预计到2025年,这一缺口将急剧扩大至400万,严重制约我国Al产业的创新步伐。加强人才培养,优化教育体系,国际合作并进,是破解困局、推动AI发展的关键。

但是具体到个人,只能说是:

“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。

这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。

我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

在这里插入图片描述

2025最新大模型学习路线

明确的学习路线至关重要。它能指引新人起点、规划学习顺序、明确核心知识点。大模型领域涉及的知识点非常广泛,没有明确的学习路线可能会导致新人感到迷茫,不知道应该专注于哪些内容。

对于从来没有接触过AI大模型的同学,我帮大家准备了从零基础到精通学习成长路线图以及学习规划。可以说是最科学最系统的学习路线。

在这里插入图片描述

针对以上大模型的学习路线我们也整理了对应的学习视频教程,和配套的学习资料。

大模型经典PDF书籍

新手必备的大模型学习PDF书单来了!全是硬核知识,帮你少走弯路!

在这里插入图片描述

配套大模型项目实战

所有视频教程所涉及的实战项目和项目源码等
在这里插入图片描述

博主介绍+AI项目案例集锦

MoPaaS专注于Al技术能力建设与应用场景开发,与智学优课联合孵化,培养适合未来发展需求的技术性人才和应用型领袖。

在这里插入图片描述

在这里插入图片描述

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

为什么要学习大模型?

2025人工智能大模型的技术岗位与能力培养随着人工智能技术的迅速发展和应用 , 大模型作为其中的重要组成部分 , 正逐渐成为推动人工智能发展的重要引擎 。大模型以其强大的数据处理和模式识别能力, 广泛应用于自然语言处理 、计算机视觉 、 智能推荐等领域 ,为各行各业带来了革命性的改变和机遇 。

在这里插入图片描述

适合人群

  • 在校学生:包括专科、本科、硕士和博士研究生。学生应具备扎实的编程基础和一定的数学基础,有志于深入AGI大模型行业,希望开展相关的研究和开发工作。
  • IT行业从业人员:包括在职或失业者,涵盖开发、测试、运维、产品经理等职务。拥有一定的IT从业经验,至少1年以上的编程工作经验,对大模型技术感兴趣或有业务需求,希望通过课程提升自身在IT领域的竞争力。
  • IT管理及技术研究领域人员:包括技术经理、技术负责人、CTO、架构师、研究员等角色。这些人员需要跟随技术发展趋势,主导技术创新,推动大模型技术在企业业务中的应用与改造。
  • 传统AI从业人员:包括算法工程师、机器视觉工程师、深度学习工程师等。这些AI技术人才原先从事机器视觉、自然语言处理、推荐系统等领域工作,现需要快速补充大模型技术能力,获得大模型训练微调的实操技能,以适应新的技术发展趋势。
    在这里插入图片描述

课程精彩瞬间

大模型核心原理与Prompt:掌握大语言模型的核心知识,了解行业应用与趋势;熟练Python编程,提升提示工程技能,为Al应用开发打下坚实基础。

在这里插入图片描述

RAG应用开发工程:掌握RAG应用开发全流程,理解前沿技术,提升商业化分析与优化能力,通过实战项目加深理解与应用。 在这里插入图片描述

Agent应用架构进阶实践:掌握大模型Agent技术的核心原理与实践应用,能够独立完成Agent系统的设计与开发,提升多智能体协同与复杂任务处理的能力,为AI产品的创新与优化提供有力支持。
在这里插入图片描述

模型微调与私有化大模型:掌握大模型微调与私有化部署技能,提升模型优化与部署能力,为大模型项目落地打下坚实基础。 在这里插入图片描述

顶尖师资,深耕AI大模型前沿技术

实战专家亲授,让你少走弯路
在这里插入图片描述

一对一学习规划,职业生涯指导

  • 真实商业项目实训
  • 大厂绿色直通车

人才库优秀学员参与真实商业项目实训

以商业交付标准作为学习标准,具备真实大模型项目实践操作经验可写入简历,支持项目背调

在这里插入图片描述
大厂绿色直通车,冲击行业高薪岗位
在这里插入图片描述

文中涉及到的完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐