文章介绍字节跳动等机构提出的核心参数隔离微调框架CPI-FT,通过识别各任务核心参数区域,实现任务分组并迁移特有参数,其他参数通过球面线性插值融合。该方法能有效缓解多任务微调中的任务干扰与灾难性遗忘问题,实验显示其性能优于标准多任务微调和多阶段微调基线方法。

监督微调(SFT)是将大型语言模型(LLMs)适配于下游任务的关键方法。现有的SFT方法包括联合多任务微调、简单的参数共享以及分阶段课程。这些方法通常假设任务之间参数的重要性相同,因此无差别地更新所有参数,导致某些任务的性能提升会以牺牲其他任务的性能为代价。虽然多阶段训练通过顺序任务结构缓解了直接梯度冲突,但这仍是一种粗粒度的隔离策略,反而加剧了灾难性遗忘,进一步削弱模型在不同任务上的泛化能力。

针对上述挑战,字节跳动联合新南威尔士大学、 复旦大学的研究者们提出一种新颖的核心参数隔离微调框架CPI-FT。该框架包括:(i)通过独立微调和参数更新幅度分析,识别出各任务的核心参数区域;(ii)基于参数区域的重叠实现任务分组;(iii)将各任务特有的核心参数直接从其对应的独立模型迁移至统一模型中,其他参数则通过球面线性插值进行融合。此外,研究团队还设计了一个流水线式微调训练阶段,通过冻结核心参数区域以巩固知识并确保模型的鲁棒性。实验表明,CPI-FT显著缓解了任务间的干扰与遗忘问题,其性能持续优于标准的多任务微调和多阶段微调基线方法。

  • 论文标题:Not All Parameters Are Created Equal: Smart Isolation Boosts Fine-Tuning Performance
  • 论文链接:https://arxiv.org/pdf/2508.21741

01

方法

CPI-FT框架基于LLMs中存在参数异质性的假设,即不同任务依赖于模型参数的不同子集。CPI-FT的工作流程如图1所示。

(1)识别任务特定的核心参数区域

研究团队通过衡量以任务为中心的微调过程中,引发的参数更新幅度来识别任务特定的核心参数区域。因为参数更新幅度直接反映了参数为适应特定任务而偏离预训练状态的程度

对于每个任务 开始进行独立的监督微调。微调仅在特定任务的数据集上进行有限步骤或轮次。该探测(probe)的持续时间旨在诱导有意义的任务特定参数变化,同时避免完全收敛。将经过探测微调后的参数表示为

向量差的绝对值

研究团队在所有模型参数上计算更新幅度,包括权重、偏差和归一化层参数。

任务核心****参数区域 定义为那些表现出最大更新幅度的参数对应的索引集合。识别出更新幅度排序的前 参数的索引:

(2)通过核心区域相似性进行任务分组与阶段划分

为了构建多阶段监督微调流程,研究团队根据识别出的核心参数区域的相似性对任务进行分组

  • 相似性度量:使用Jaccard Index 量化核心区域

表示核心区域相同,则表示核心区域不相交。

  • 分组策略:采用基于阈值的聚类方法。如果任务的核心区域相似度 达到或超过一个超参数阈值 ,则认为它们足够相关可以分在同一组中。

最终的任务组(K≤N)通过计算任务相似图中的连通分量形成。

  • 阶段排序:当形成K个任务组后,需要按顺序进行排列以定义监督微调阶段。排序策略会影响最终性能,因为它决定了知识获取和参数冻结的顺序。研究团队主要评估随机排序策略以及一种潜在的原理性启发(potentially one principledheuristic)。

(3)跨任务的参数融合

该阶段引入了一种参数融合机制,旨在构建一个统一模型以整合来自所有任务组的任务特定知识。该融合过程选择性地整合了为每个任务识别的关键参数,同时在非核心区域应用平滑插值以保持模型的一致性。

  • 基础模型选择:选择来自最后一个多阶段微调组的模型参数 作为初始基础模型。这确保了基础模型受益于多阶段训练期间积累的信息。

  • 核心参数覆盖:对于每个任务,将识别出的核心参数区域使用来自 的对应微调参数覆盖到基础模型中:

  • 非核心参数融合:对于核心区域外的参数

(4)通过多阶段训练进行统一微调

在参数融合之后,最终阶段通过简化的多阶段训练过程来优化融合后的模型。与早期监督微调阶段不同,本阶段使用采样后的训练数据子集,并专注于最终校准,同时通过动态冻结保持特定任务参数的完整性。

  • 动态冻结机制:在微调期间,所有在早期探测阶段识别出的核心参数区域都会被冻结,以保留特定任务的知识并减轻破坏性干扰。在每个训练阶段 k ,冻结的参数集由所有已训练任务组的核心区域组成:

构建二进制掩码来定义冻结与可训练参数:当,否则 。训练期间的参数更新被严格限制在未冻结参数范围内:

其中,

  • 采样数据校准:在此阶段,创建一个采样数据集,包含每个任务组的一小部分数据。采样比例的选择需确保任务间的平衡,同时保持计算效率。这种数据选择可防止对个别大规模数据集的过拟合,并支持跨任务的代表性梯度更新。

  • 多阶段训练过程:微调按顺序在任务组 上进行。对于每个组,从中的任务数据中采样以创建 ,训练从上一阶段的模型参数开始。在此阶段的更新由动态冻结机制和采样数据指导:

其中, 代表了所有任务知识的整合:

利用采样数据并冻结任务特定的核心参数区域,最终的微调流程在降低计算成本的同时防止了灾难性遗忘。其中,动态冻结确保了任务关键知识的安全,而采样校准则在适应新任务与保留已有能力之间实现了平衡。

02

评估

表1总结了CPI-FT框架在不同任务、模型和评估指标下相对于基线方法的性能对比结果。

  • CPI-FT在四种不同的基础模型LLaMA-2-7B、Mistral-8B、Qwen1.5-7B 和 Gemma-9B,以及五个异构任务GSM8K(数学推理)、CodeAlpaca(代码生成)、LogiQA(逻辑推理)、Alpaca(指令微调)和UltraChat(交互式对话)上,始终优于所有基线方法。CPI-FT在所有基础模型配置下的平均归一化得分也表现最佳,表明其缓解任务干扰和灾难性遗忘的能力在不同模型架构中均具有一致性和鲁棒性
  • Full SFT基线方法是在所有任务上统一更新全部模型参数而不进行隔离,在所有任务和模型配置下始终表现最差,凸显了在异构任务混合中进行简单微调时梯度冲突带来的负面影响。虽然随机多阶段(Random Multi-Stage)和启发式多阶段(Heuristic Multi-Stage)基线方法通过临时分离任务组,能够在一定程度上缓解任务间的干扰,但其性能仍低于CPI-FT。可以发现,若没有显式的结构参数隔离,仅依靠临时任务调度不足以解决跨任务干扰问题

如何系统学习掌握AI大模型?

AI大模型作为人工智能领域的重要技术突破,正成为推动各行各业创新和转型的关键力量。抓住AI大模型的风口,掌握AI大模型的知识和技能将变得越来越重要。

学习AI大模型是一个系统的过程,需要从基础开始,逐步深入到更高级的技术。

这里给大家精心整理了一份全面的AI大模型学习资源,包括:AI大模型全套学习路线图(从入门到实战)、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等,资料免费分享

1. 成长路线图&学习规划

要学习一门新的技术,作为新手一定要先学习成长路线图方向不对,努力白费

这里,我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。

在这里插入图片描述

2. 大模型经典PDF书籍

书籍和学习文档资料是学习大模型过程中必不可少的,我们精选了一系列深入探讨大模型技术的书籍和学习文档,它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础(书籍含电子版PDF)

在这里插入图片描述

3. 大模型视频教程

对于很多自学或者没有基础的同学来说,书籍这些纯文字类的学习教材会觉得比较晦涩难以理解,因此,我们提供了丰富的大模型视频教程,以动态、形象的方式展示技术概念,帮助你更快、更轻松地掌握核心知识

在这里插入图片描述

4. 大模型行业报告

行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

在这里插入图片描述

5. 大模型项目实战

学以致用 ,当你的理论知识积累到一定程度,就需要通过项目实战,在实际操作中检验和巩固你所学到的知识,同时为你找工作和职业发展打下坚实的基础。

在这里插入图片描述

6. 大模型面试题

面试不仅是技术的较量,更需要充分的准备。

在你已经掌握了大模型技术之后,就需要开始准备面试,我们将提供精心整理的大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。

在这里插入图片描述

全套的AI大模型学习资源已经整理打包,有需要的小伙伴可以微信扫描下方CSDN官方认证二维码,免费领取【保证100%免费

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐