LLM上下文学习的致命陷阱:示例位置如何影响大模型表现?
本文揭示了LLM上下文学习中的演示位置偏差(DPP Bias):示例位置变化会导致模型预测系统性变化。研究量化了四种位置(ssp/esp/sum/eum)的影响,发现系统提示开头(ssp)通常最佳,用户消息末尾(eum)常导致性能崩溃。最佳位置由模型规模和任务类型共同决定,不存在普遍适用的"黄金位置"。文章提出测试时校准和训练时干预两种缓解策略,为提示工程提供新思路。
大型语言模型(LLM)如ChatGPT、Llama、Qwen等,拥有一种神奇的能力——上下文学习(In-Context Learning, ICL)。只需在输入提示(Prompt)中放入几个任务示例(Demos),模型就能“举一反三”,无需额外训练直接完成新任务(如分类、问答、摘要)。这被视为LLM的核心突破。

- 论文:Where to show Demos in Your Prompt: A Positional Bias of In-Context Learning
- 链接:https://arxiv.org/pdf/2507.22887
然而,这篇由马里兰大学团队发表的论文揭示了一个被长期忽视的陷阱:同样的示例,放在提示的不同位置,竟会导致模型答案天差地别! 例如,在AG新闻分类任务中,仅将示例从用户消息开头(sum)移到末尾(eum),小模型(Qwen-1.5B)的预测竟有45.5%被“翻转”(从正确变错误或反之),准确率也剧烈波动。这种现象被命名为演示位置偏差(Demos’ Position in Prompt Bias, DPP Bias)。
这一发现意义重大:
- 挑战常识:传统认为“只要示例写得好,放哪都一样”,但位置本身成了关键变量。
- 影响可靠性:位置变动引发大规模预测翻转,威胁模型应用的稳定性。
- 优化新维度:为提示工程(Prompt Engineering)开辟全新优化方向。
论文通过严谨实验,首次系统量化了DPP偏差的规模、规律与成因,并为开发者和研究者提供了实用指南。接下来,我们将深入解析这一“位置之谜”。
核心发现:DPP偏差——位置决定表现
现象定义:什么是DPP偏差?
DPP偏差指:在提示内容(指令、示例、问题)完全不变的情况下,仅改变示例块(Demos Block)在提示中的结构位置,导致LLM预测结果和准确率发生系统性变化的现象。这不是示例内容或顺序问题,而是纯粹的“空间位置”效应。
量化冲击:准确率波动与预测翻转
论文引入两个核心指标量化DPP偏差:
- 准确率变化(Accuracy-Change, Δ_metric):
Δ_metric = Accuracy_position - Accuracy_zero-shot
衡量添加示例后,相比“零示例”基线的净性能增益或损失。正值表示有帮助,负值表示反而有害。 - 预测变化率(Prediction-Change, Δ_pred):
Δ_pred = (# 预测答案改变的数量) / (# 总问题)
衡量当示例位置从默认位置(通常是sum)变动到其他位置时,模型输出发生翻转的比例,反映输出稳定性。
关键观察:早期位置(ssp, esp)的稳定性优势

四种示例位置配置(ssp, esp, sum, eum)在提示中的结构示意图。
实验结果一致表明:
ssp(系统提示开头)是“稳健之王”:在大多数任务和模型上,ssp位置带来最高且最稳定的性能提升。例如在MMLU(大学级多选题库)上,相比零示例基线,ssp平均提升准确率高达+18%。esp(系统提示末尾)表现次优:紧接指令后放置示例,效果通常接近ssp,尤其在小模型上。sum(用户消息开头,常见默认位置)表现中等:虽被广泛使用,但并非总是最佳,尤其在大型模型上可能被其他位置超越。
极端案例:eum位置的破坏性影响
最惊人的发现出现在 **eum(用户消息末尾,问题之后)**位置:
- 性能崩溃:在QA(如SQuAD)和推理(如GSM8K)任务中,
eum常导致性能显著低于零示例基线(Δ_metric为负)。例如,Cohere-8B模型在SQuAD上使用eum时,F1分数暴跌至10.9%(ssp时为84.34%)。 - 预测大翻转:
eum引发最高预测波动(Δ_pred常 >30%)。例如在MMLU上,小模型(如Qwen-1.5B)有近30%的答案因位置变动而翻转,且多为“正确变错误”(C→I)。 - 逻辑反直觉:将示例放在问题之后,违背人类“先看例子再答题”的直觉,模型更难有效利用上下文。
研究方法:如何科学测量位置效应
问题定义:控制内容,只变位置

不同位置(ssp/esp/sum/eum)下预测变化率(Δ_pred)对比,显示eum位置波动最大。
研究核心是隔离位置效应:
- 固定内容:对同一任务(τ)、同一问题(q)、使用完全相同的示例集(D_τ)和指令。
- 只变位置:将示例块整体移动到提示中四个预定义位置之一。
- 对比输出:测量不同位置下模型输出的准确性(Δ_metric)和一致性(Δ_pred)。
四种位置配置详解
基于主流聊天式提示结构(System + User)定义:
ssp(Start of System Prompt):示例放在系统消息最开头,任何指令之前。
结构:<system>[Demos] + [Instruction]</system> <user>[Question]</user>esp(End of System Prompt):示例放在系统消息末尾,指令之后,用户问题之前。
结构:<system>[Instruction] + [Demos]</system> <user>[Question]</user>sum(Start of User Message - 默认):示例放在用户消息开头,问题之前。
结构:<system>[Instruction]</system> <user>[Demos] + [Question]</user>eum(End of User Message):示例放在用户消息末尾,问题之后。
结构:<system>[Instruction]</system> <user>[Question] + [Demos]</user>
两大核心指标
Accuracy-Change (Δ_metric):
Δ_metric = Metric_position - Metric_zero-shot
Metric_position:在特定位置放置示例后,模型在该任务标准指标(如分类用Accuracy,QA用F1/EM,摘要用ROUGE-L)上的得分。Metric_zero-shot:无任何示例时(仅指令+问题)的得分。- 重要性:直接量化添加示例带来的净收益或损失。正值越大,说明该位置利用示例越有效。
Prediction-Change (Δ_pred):
Δ_pred = (# 答案改变数) / (# 总问题数)
- 以默认位置
sum为基准,计算切换到ssp/esp/eum时,预测答案发生变化的样本比例。 - 对生成任务(如摘要),定义“变化”:若
sum和eum位置生成答案的ROUGE-L分数差异 > 0.05,则视为翻转。 - 重要性:揭示模型输出的脆弱性。高Δ_pred意味着位置微小变动导致决策边界剧烈抖动,即使Δ_metric变化不大。
实验设计:广度与深度兼具



十种LLM在四大类任务(分类/QA/摘要/推理)八个数据集上,四种位置的详细性能数据表。
- 模型多样性:涵盖4大主流开源模型家族(Qwen, Llama3, Mistral/Mixtral, Cohere),10个具体模型,参数规模从1.5B 到 72B。
- 任务覆盖面:8个经典NLP数据集,代表:
- 分类:AG News (新闻主题), MNLI (文本蕴含), ARC (科学推理), MMLU (综合知识)
- 问答QA:SQuAD (抽取式), GSM8K (数学推理)
- 摘要:CNN/DailyMail, XSum (极端摘要)
- 控制变量:示例数量固定为5个(k=5),示例内容和顺序固定,仅位置变化。
实验结果:位置效应的全景图
任务差异:敏感度天壤之别

四种位置(ssp/esp/sum/eum)在四个数据集上相比零示例的准确率变化(Δ_metric)平均值。
- 分类与推理任务(如 MMLU, ARC, AG News):
- 强烈偏好
ssp和esp(系统提示区)。 - 增益显著:在MMLU上,
ssp平均提升+18%(vs. 零示例)。 eum危害大:性能常低于零示例基线(Δ_metric为负),预测翻转率高。
- 数学推理任务(如 GSM8K):
-
小模型(如 Llama3-3B):
ssp最佳(Δ_metric=42.0%),eum极差(Δ_metric=11%)。 -
大模型(如 Llama3-70B):
eum反超(Δ_metric=88% vs.ssp的21.5%)! -
行为最反常,且高度依赖模型规模:
-
表明:复杂推理任务需要特定位置激发模型的“思维链”能力,且大模型能更好利用后期上下文。
- 生成摘要任务(如 XSum, CNN/DM):
- 对
eum位置极度敏感:预测翻转率(Δ_pred)常接近100%,即使在大模型(如 Qwen-72B)上。 - 性能暴跌:如 Llama3-3B 在 CNN/DM 上,
ssp有49%样本提升(vs. 零示例),eum仅1%。 - 原因推测:将示例放在问题之后,严重干扰了自回归生成过程的连贯性。
规模定律:越大越稳,但非免疫

模型规模(1.5B–72B)对MMLU任务上预测变化率(Δ_pred, 左)和准确率变化(Δ_metric, 右)的影响。显示规模增大,波动减小。
- 总体趋势:模型参数规模增大,DPP引起的预测波动(Δ_pred)和准确率波动(Δ_metric)均降低。大模型(70B+)对位置变动更鲁棒。
- 关键限制:
- 小模型(Qwen-1.5B, Mistral-7B):
ssp最优。 - 超大模型(Qwen-72B):
eum略优于ssp。
- 鲁棒性≠消失:即使最大模型(如 Llama3-70B),在复杂任务(如GSM8K, XSum)上仍有显著预测翻转(Δ_pred >50%)。位置效应未根除。
- 任务依赖性:在数学推理(GSM8K)和长文摘要任务上,规模带来的鲁棒性提升较弱。
- 最优位置转移:小模型的最佳位置(常是
ssp/esp)在大模型上可能失效。例如在ARC任务上:
位置跃迁分析:预测如何“变脸”
不同位置切换时,样本从“正确→错误”(C→I)和“错误→正确”(I→C)的比例(Sankey图或柱状图)。



- 核心发现:从默认
sum切换到eum,引发最高比例的**“正确→错误”(C→I)跃迁**。这表明eum位置不仅没带来新知识,反而干扰了模型原有的正确判断。 - 小模型更脆弱:如 Qwen-1.5B 在 AG News 上,
ssp带来40%的“错误→正确”(I→C)提升,但切换到eum后,这些增益几乎消失,并新增大量错误。 - 大模型也难幸免:如 Qwen-72B 在 GSM8K 上,不同位置间预测翻转率仍超50%。说明位置效应是底层机制问题。
“最佳位置”之谜:模型大小与任务类型的双重依赖
不同规模模型(Qwen-1.5B小, Cohere-8B中, Llama3-70B大)在八项任务上,各位置相比零示例的“赢-平-输”分析图。



- 小模型(如 Qwen-1.5B):极度依赖
esp和ssp(系统提示区)。在这些位置“赢”得大多数任务,极少“输”给零示例。将示例“前置”是生命线。 - 中等模型(如 Cohere-8B):
ssp仍主导,但sum(用户消息开头)开始在部分任务(如XSum摘要、SQuAD QA)上展现竞争力。灵活性初显。 - 大模型(如 Llama3-70B):偏好反转!
sum(用户消息开头)成为最稳定赢家 ,在多项任务上超越ssp和esp。可能原因:大模型具有更强的长程依赖处理能力,示例紧邻问题(sum)更符合其微调数据格式。 - 核心结论:不存在普遍最优的示例位置! 最佳位置由模型规模和任务类型共同决定。提示工程必须“量体裁衣”。
深入讨论:偏差根源与应对之道
成因假说:为什么位置如此重要?
论文提出两大互补根源:
- 架构缺陷(Architectural Bias) - 注意力机制的“早鸟特权”:
- LLM(尤其仅解码器架构如GPT系列)采用自回归训练:预测下一个词时,只能看前面的词(Token)。
- 这导致早期Token对模型隐藏状态(Hidden State)影响更大,形成“先入为主”(Primacy Bias)。
- 机制解释研究(如Olsson等, 2022)发现“归纳头”(Induction Heads)等机制,会强化模型对提示开头信息的依赖。
- DPP效应体现:放在系统提示开头(
ssp)的示例,因其位置最早,获得了不成比例的影响力,从而稳定提升后续预测。
- 数据偏好(Data Bias) - 指令微调的“位置记忆”:
- 主流LLM通过指令微调(Instruction Tuning)对齐人类偏好。其训练数据(如对话、指令数据集)本身包含固定的位置模式(例如,示例常放于系统提示末尾或用户消息开头)。
- 模型在训练中学习并内化了这些位置-角色关联(如“系统提示包含通用指令”,“用户消息包含具体问题/示例”)。
- DPP效应体现:当示例位置违背模型在微调数据中学习到的常见模式(如放在用户消息末尾
eum),模型难以有效解析和利用这些信息,导致性能下降和预测不稳定。
实用指南:如何减轻DPP偏差?
论文提出两种缓解策略:
- 测试时校准(Test-Time Calibration) - 动态选择位置:
- 思路:既然最优位置依赖具体问题和模型,那就为每个问题动态选择。
- 方法:
- 优势:无需重新训练模型,轻量灵活,适应输入分布变化。
-
构建一个标注好的参考集(包含问题、其已知的最佳位置)。
-
对于一个新问题,用外部模型(如嵌入模型)找到它在参考集中的 K个最近邻问题。
-
对这些邻居的最佳位置进行多数投票(Majority-Vote),选出新问题的示例位置。
-
训练时干预(Training-Time Intervention) - 注入位置鲁棒性:
- 思路:在指令微调或持续预训练阶段,主动打破位置固定模式。
- 方法:构建一个位置随机排列的ICL训练集。每个训练样本中,示例块在
ssp/esp/sum/eum位置随机出现。 - 预期效果:迫使模型学习位置不变的特征表示,削弱对特定位置的依赖,提升泛化能力。
伦理警示:位置可能放大社会偏见
- 潜在风险:若示例本身隐含偏见(如刻板印象、标签分布不均),将其置于高影响力位置(如
ssp),可能放大偏见在输出中的体现。 - 建议:开发者需谨慎筛选示例集,并在不同位置配置下评估模型输出的公平性。
结论与展望:重新审视提示工程
核心贡献
- 发现并量化新偏差:首次系统揭示并严格量化了上下文学习中长期被忽视的演示位置偏差(DPP Bias)。
- 揭示广泛性与严重性:在10个LLM、8个多样NLP任务上证实,位置变动可导致**准确率波动高达±20%、预测翻转率超30%**,尤其在小模型和
eum位置。 - 提出诊断工具:定义
Accuracy-Change (Δ_metric)和Prediction-Change (Δ_pred)指标,精准量化位置带来的净收益与输出波动。 - 阐明规模-任务交互:发现模型增大可缓解但不消除DPP偏差,且最优位置由模型规模与任务类型共同决定,颠覆“一处适用”的假设。
- 提供实用方案:提出测试时校准(动态位置选择)和训练时干预(位置随机排列)两种缓解策略。
核心启示
- 提示词结构是功能性的,非装饰性的:示例的“物理位置”深刻影响模型认知,是提示工程不可分割的一环。
- 没有免费的“黄金位置”:
ssp虽常优,但非万能。开发者必须针对特定模型和任务进行位置调优(Model-Aware & Task-Sensitive Prompting)。 - 位置鲁棒性是评估新维度:在评估LLM(尤其在关键应用如QA、摘要)时,需加入对位置扰动的鲁棒性测试。
未来方向
- 机制深挖:结合可解释性工具,精确定位Transformer中导致位置敏感性的模块(如特定注意力头、层)。
- 链式思维(CoT)位置研究:探索复杂提示(如多步推理CoT)中,理由(Rationale)和示例的相对位置如何影响推理质量。
- 自动化位置优化:开发联合优化示例内容、顺序和位置的算法,集成到提示工程工具链。
- 跨语言/架构验证:研究不同语言(语法结构不同)和模型架构(如编码器-解码器)下的DPP偏差特性。
- 长上下文场景:探索在超长提示(>100K tokens)中,位置效应的演变规律。
零基础如何高效学习大模型?
你是否懂 AI,是否具备利用大模型去开发应用能力,是否能够对大模型进行调优,将会是决定自己职业前景的重要参数。
为了帮助大家打破壁垒,快速了解大模型核心技术原理,学习相关大模型技术。从原理出发真正入局大模型。在这里我和鲁为民博士系统梳理大模型学习脉络,这份 LLM大模型资料 分享出来:包括LLM大模型书籍、640套大模型行业报告、LLM大模型学习视频、LLM大模型学习路线、开源大模型学习教程等, 😝有需要的小伙伴,可以 扫描下方二维码免费领取🆓**⬇️⬇️⬇️

【大模型全套视频教程】
教程从当下的市场现状和趋势出发,分析各个岗位人才需求,带你充分了解自身情况,get 到适合自己的 AI 大模型入门学习路线。
从基础的 prompt 工程入手,逐步深入到 Agents,其中更是详细介绍了 LLM 最重要的编程框架 LangChain。最后把微调与预训练进行了对比介绍与分析。
同时课程详细介绍了AI大模型技能图谱知识树,规划属于你自己的大模型学习路线,并且专门提前收集了大家对大模型常见的疑问,集中解答所有疑惑!

深耕 AI 领域技术专家带你快速入门大模型
跟着行业技术专家免费学习的机会非常难得,相信跟着学习下来能够对大模型有更加深刻的认知和理解,也能真正利用起大模型,从而“弯道超车”,实现职业跃迁!

【精选AI大模型权威PDF书籍/教程】
精心筛选的经典与前沿并重的电子书和教程合集,包含《深度学习》等一百多本书籍和讲义精要等材料。绝对是深入理解理论、夯实基础的不二之选。

【AI 大模型面试题 】
除了 AI 入门课程,我还给大家准备了非常全面的**「AI 大模型面试题」,**包括字节、腾讯等一线大厂的 AI 岗面经分享、LLMs、Transformer、RAG 面试真题等,帮你在面试大模型工作中更快一步。
【大厂 AI 岗位面经分享(92份)】

【AI 大模型面试真题(102 道)】

【LLMs 面试真题(97 道)】

【640套 AI 大模型行业研究报告】

【AI大模型完整版学习路线图(2025版)】
明确学习方向,2025年 AI 要学什么,这一张图就够了!

👇👇点击下方卡片链接免费领取全部内容👇👇

抓住AI浪潮,重塑职业未来!
科技行业正处于深刻变革之中。英特尔等巨头近期进行结构性调整,缩减部分传统岗位,同时AI相关技术岗位(尤其是大模型方向)需求激增,已成为不争的事实。具备相关技能的人才在就业市场上正变得炙手可热。
行业趋势洞察:
- 转型加速: 传统IT岗位面临转型压力,拥抱AI技术成为关键。
- 人才争夺战: 拥有3-5年经验、扎实AI技术功底和真实项目经验的工程师,在头部大厂及明星AI企业中的薪资竞争力显著提升(部分核心岗位可达较高水平)。
- 门槛提高: “具备AI项目实操经验”正迅速成为简历筛选的重要标准,预计未来1-2年将成为普遍门槛。
与其观望,不如行动!
面对变革,主动学习、提升技能才是应对之道。掌握AI大模型核心原理、主流应用技术与项目实战经验,是抓住时代机遇、实现职业跃迁的关键一步。

01 为什么分享这份学习资料?
当前,我国在AI大模型领域的高质量人才供给仍显不足,行业亟需更多有志于此的专业力量加入。
因此,我们决定将这份精心整理的AI大模型学习资料,无偿分享给每一位真心渴望进入这个领域、愿意投入学习的伙伴!
我们希望能为你的学习之路提供一份助力。如果在学习过程中遇到技术问题,也欢迎交流探讨,我们乐于分享所知。
*02 这份资料的价值在哪里?*
专业背书,系统构建:
-
本资料由我与鲁为民博士共同整理。鲁博士拥有清华大学学士和美国加州理工学院博士学位,在人工智能领域造诣深厚:
-
- 在IEEE Transactions等顶级学术期刊及国际会议发表论文超过50篇。
- 拥有多项中美发明专利。
- 荣获吴文俊人工智能科学技术奖(中国人工智能领域重要奖项)。
-
目前,我有幸与鲁博士共同进行人工智能相关研究。

内容实用,循序渐进:
-
资料体系化覆盖了从基础概念入门到核心技术进阶的知识点。
-
包含丰富的视频教程与实战项目案例,强调动手实践能力。
-
无论你是初探AI领域的新手,还是已有一定技术基础希望深入大模型的学习者,这份资料都能为你提供系统性的学习路径和宝贵的实践参考,助力你提升技术能力,向大模型相关岗位转型发展。



抓住机遇,开启你的AI学习之旅!

更多推荐



所有评论(0)