本周精选 12篇大模型领域前沿论文,覆盖LLM安全与对抗防御、LLM推理与优化、LLM多模态与跨领域应用、LLM系统优化与部署等核心方向。全部200多篇论文皆可扫码免费领取。 词云图

➔➔➔➔点击查看原文,获取本期大模型周报合集https://mp.weixin.qq.com/s/EaSssp2WITakFZhTN8DwYw

一、LLM安全与对抗防御

1. Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction

  • 作者:Yuanbo Xie, Yingjie Zhang, Tianyun Liu, Duohe Ma, Tingwen Liu

  • 亮点:针对现有LLM安全对齐方法深度不足、内部防御机制鲁棒性差,易受预填充攻击和拒绝方向操纵等问题,提出DeepRefusal安全对齐框架。通过在微调过程中对各层和令牌深度的拒绝方向进行概率消融,强制模型从越狱状态动态重建拒绝机制。在4个开源LLM家族和6种典型攻击上的评估显示,该方法能将攻击成功率降低约95%,同时仅造成极小的性能损失,且对未见过的越狱策略也具备强抗性。
    Conceptual diagram of jailbreak and safety mechanisms at the representation level

  • 论文:http://arxiv.org/abs/2509.15202

  • 备注:Accepted by EMNLP2025 Finding

2. LLM Jailbreak Detection for (Almost) Free!

  • 作者:Guorui Chen, Yifan Xia, Xiaojun Jia, Zhijiang Li, Philip Torr, Jindong Gu

  • 亮点:发现越狱提示与良性提示的输出分布差异可用于检测越狱行为,提出Free Jailbreak Detection(FJD)方法。该方法通过在输入前添加肯定指令,并通过温度参数缩放logits,利用第一个令牌的置信度区分两类提示;进一步结合虚拟指令学习提升检测性能。实验表明,FJD在LLM推理过程中几乎无额外计算成本,却能有效检测越狱提示,解决了现有检测方法计算开销大的问题。
     Jailbreak prompt Detection through FJD

  • 论文:http://arxiv.org/abs/2509.14558

  • 代码:https://github.com/GuoruiC/FJD

3. A Systematic Evaluation of Parameter-Efficient Fine-Tuning Methods for the Security of Code LLMs

  • 作者:Kiho Lee, Jungkon Kim, Doowon Kim, Hyoungshick Kim

  • 亮点:针对代码生成LLM常生成不安全代码的问题,系统评估7种参数高效微调(PEFT)技术对代码LLM安全性的提升效果。发现提示调优是最有效的PEFT方法,在CodeGen2 16B模型上实现80.86%的总体安全率,较基线提升13.5个百分点;结合采样温度优化解码策略后,安全率进一步提升至87.65%,相当于每百万生成代码中减少约20.37万个漏洞片段。同时,提示调优和前缀调优还能增强模型对投毒攻击的鲁棒性,在Python和Java语言上均有一致效果。
    Overview of our study

  • 论文:http://arxiv.org/abs/2509.12649

二、LLM推理与优化(RL/训练策略)

4. FlowRL: Matching Reward Distributions for LLM Reasoning

  • 作者:Xuekai Zhu, Daixuan Cheng, Dinghuai Zhang, et al.

  • 亮点:针对现有LLM强化学习(如PPO、GRPO)中奖励最大化方法易过度优化主导奖励信号、忽略低频但有效的推理路径,导致多样性降低的问题,提出FlowRL框架。将标量奖励通过可学习的配分函数转换为归一化目标分布,最小化策略与目标分布间的反向KL散度,实现基于流平衡的优化,促进多样化探索和可泛化推理轨迹。在数学和代码推理任务上,FlowRL较GRPO和PPO在数学基准上平均提升显著,在代码推理任务中表现也持续更优。

  • 论文:http://arxiv.org/abs/2509.15207

  • 代码:https://github.com/Xuekai-Zhu/FlowRL

5. TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference

  • 作者:Dan Zhang, Min Cai, Jonathan Li, Ziniu Hu, Yisong Yue, Yuxiao Dong, Jie Tang

  • 亮点:针对现有LLM奖励模型缺乏时间一致性,导致策略更新无效、RL训练不稳定的问题,提出TDRM方法。通过在训练中最小化时间差异(TD),学习更平滑、可靠的奖励模型,提升与长期目标的对齐度。将TDRM融入演员-评论家式在线RL循环,在Best-of-N(最高提升6.6%)和树搜索(最高提升23.7%)场景中均提升性能;与带可验证奖励的RL(RLVR)结合时,仅用2.5k数据就能达到基线50.1k数据的性能,实现数据高效的RL,在8种模型变体上均获得更高质量的LLM策略。 Figure 1

  • 论文:http://arxiv.org/abs/2509.15110

  • 开源代码:https://github.com/THUDM/TDRM

6. Teaching According to Talents! Instruction Tuning LLMs with Competence-Aware Curriculum Learning

  • 作者:Yangning Li, Tingwei Lu, Yinghui Li, Yankai Chen, Wei-Chieh Huang, Wenhao Jiang, Hui Wang, Hai-Tao Zheng, Philip S. Yu

  • 亮点:针对现有LLM指令微调中课程学习依赖静态启发式难度指标,无法适应模型训练过程中能力变化,导致学习轨迹次优的问题,提出CAMPUS框架。该框架支持子课程动态选择、基于能力的课程进度调整和多难度调度,实现“因材施教”的指令微调。实验证明,CAMPUS在高效指令微调任务上优于现有最先进基线,有效提升LLM在指令数据集上的最终性能。
    Framework of our CAMPUS to demonstrate how to schedule the sub-curricula.

  • 论文:http://arxiv.org/abs/2509.13790

  • 备注:EMNLP 2025 Findings

➔➔➔➔点击查看原文,获取本期大模型周报合集https://mp.weixin.qq.com/s/EaSssp2WITakFZhTN8DwYw

三、LLM多模态与跨领域应用

7. Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding

  • 作者:Zaiquan Yang, Yuhao Liu, Gerhard Hancke, Rynson W. H. Lau

  • 亮点:针对时空视频定位(STVG)任务,利用多模态LLM(MLLM)探索零样本解决方案。发现MLLM会动态分配“定位令牌”用于文本查询定位,但因无法充分整合文本中的属性、动作等线索导致定位次优。据此提出MLLM-based零样本框架,包含分解式时空高亮(DSTH)和时间增强组装(TAS)策略:DSTH将查询解耦为属性和动作子查询,通过logit引导重注意力(LRA)模块学习时空提示;TAS利用原始和时间增强帧组装预测以提升时间一致性。在多种MLLM上评估,该方法在3个STVG基准上优于现有SOTA。
    Overview of the proposed approach for zero-shot STVG

  • 论文:http://arxiv.org/abs/2509.15178

  • 开源代码:https://github.com/zaiquanyang/LLaVA_Next_STVG

  • 备注:Journal ref: NeurIPS2025

8. From Pixels to Urban Policy-Intelligence: Recovering Legacy Effects of Redlining with a Multimodal LLM

  • 作者:Anthony Howell, Nancy Wu, Sharmistha Bagchi, Yushim Kim, Chayn Sun

  • 亮点:展示多模态LLM(MLLM)在扩展城市测量能力、支持基于地点的政策干预跟踪中的应用。利用GPT-4o在街景图像上执行“推理-估计”结构化流程,推断社区贫困状况和树冠覆盖度,并嵌入准实验设计评估1930年代“红线划区”政策的遗留影响。结果显示,GPT-4o能恢复红线划区的不利社会环境遗留效应,估计值与权威来源无统计差异,且优于传统基于像素的分割基线,证明MLLM可作为政策级社区测量工具。
    Spatial Distribution of main variables across Maricopa County, Arizona

  • 论文:http://arxiv.org/abs/2509.15132

9. ECG-aBcDe: Overcoming Model Dependence, Encoding ECG into a Universal Language for Any LLM

  • 作者:Yong Xia, Jingxuan Li, YeTeng Sun, Jiarui Bu

  • 亮点:针对LLM在心电图(ECG)分析中存在的可迁移性差、难以捕捉时间尺度信息、可解释性低的问题,提出ECG-aBcDe编码方法。将ECG信号转换为通用“ECG语言”,使任何LLM均可直接解读;通过构建ECG语言与自然语言的混合数据集,实现预训练LLM的直接微调(无需修改架构),达成“一次构建,随处使用”。该方法支持ECG与ECG语言的双向转换,可提取注意力热力图提升可解释性,同时明确表示时间尺度信息以缓解Transformer局限。在BLEU-4指标上,数据集内和跨数据集评估分别达到42.58和30.76,较现有方法提升2.8倍和3.9倍。
    Comparison between Two-Stage Methods and End-to-End Methods

  • 论文:http://arxiv.org/abs/2509.12625

四、LLM系统优化与部署

10. LEAP: LLM Inference on Scalable PIM-NoC Architecture with Balanced Dataflow and Fine-Grained Parallelism

  • 作者:Yimin Wang, Yue Jiet Chong, Xuanyao Fong

  • 亮点:针对LLM推理中张量规模大、计算复杂导致的内存、计算和数据总线挑战,提出LEAP架构——一种计算/内存/通信协同设计的非冯·诺依曼加速器,集成存内计算(PIM)和计算型片上网络(NoC)。根据数据动态性将LLM中的矩阵乘法分配给PIM或NoC以最大化数据局部性,通过启发式设计空间探索优化模型划分与映射,结合专用细粒度并行和分块技术实现分布式资源间的高吞吐量数据流。在Llama 1B/8B/13B模型上评估,LEAP较A100 GPU提升2.55倍吞吐量(tokens/sec)和71.94倍能效(tokens/Joule)。
    The proposed aggregated PIM-NoC architecture

  • 论文:http://arxiv.org/abs/2509.14781

  • 备注:Accepted to the 2025 International Conference on Computer-Aided Design (ICCAD'25)

11. TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge

  • 作者:Zhirui Huang, Rui Ma, Shijie Cao, Ran Shu, Ian Wang, Ting Cao, Chixiao Chen, Yongqiang Xiong

  • 亮点:针对三元量化LLM在边缘设备部署中,传统平台(如GPU)缺乏原生三元算术和内存支持、低批次实时场景利用率低的问题,提出TENET架构——稀疏感知的查找表(LUT)中心架构,协同优化算法、计算和内存。引入稀疏三元LUT(STL)核心优化三元混合精度GEMM,利用动态激活N:M稀疏性挖掘令牌激活稀疏性,设计基于LUT的64B:80B三元权重解压缩模块;系统级集成STL核心与高精度核心构建异构加速器,结合线性投影感知稀疏注意力数据流优化内存访问。在FPGA和ASIC平台实现,TENET-FPGA和TENET-ASIC较A100 GPU分别提升4.3倍和21.1倍能效,TENET-ASIC端到端推理延迟平均提升2.7倍。
    (a) Conventional Ternary LLM Architecture(e.g. BitNet). Ternary Linear module are colored red and high precision GEMM are blue (b) Attention mechanism variants (c) The computation flow of Ternary Linear

  • 论文:http://arxiv.org/abs/2509.13765

12. StreamTensor: Make Tensors Stream in Dataflow Accelerators for LLMs

  • 作者:Hanchen Ye, Deming Chen

  • 亮点:针对数据流架构执行LLM等深度学习任务时,核间关联、外部内存访问管理和缓冲区优化难题,提出StreamTensor编译器框架。引入迭代张量类型系统显式编码流布局,支持无缝核融合、缓冲区分配和内存优化;通过系统探索张量分块、核融合、资源分配三个层级的设计空间,平衡计算强度、内存效率和数据流以最大化性能。在FPGA上对LLM评估,StreamTensor较现有最先进FPGA LLM加速器和GPU分别降低0.76倍和0.64倍延迟,较GPU提升1.99倍能效,为可扩展数据流深度学习加速提供有效方案。
    Proposed StreamTensor framework.

  • 论文:http://arxiv.org/abs/2509.13694

➔➔➔➔点击查看原文,获取本期大模型周报合集https://mp.weixin.qq.com/s/EaSssp2WITakFZhTN8DwYw

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐