本周精选 12篇大模型领域前沿论文,覆盖 LLM 强化学习优化、LLM 评估与偏见缓解、LLM 多指令与代码任务、LLM 安全与隐私保护、LLM 推理与知识增强、LLM 跨领域应用等方向。全部200多篇论文皆可扫码免费领取。

➔➔➔➔点击查看原文,获取论文合集https://mp.weixin.qq.com/s/uwMdDJ4_c1r-H4RoPSZxCg 词云图

一、LLM强化学习优化方向

1、It's Not You, It's Clipping: A Soft Trust-Region via Probability Smoothing for LLM RL

作者:Madeleine Dwyer, Adam Sobey, Adriane Chapman

亮点:针对LLM强化学习(如PPO、GRPO)中比率裁剪导致的信息丢失与梯度不连续问题,提出概率平滑策略优化(PSPO)。通过将当前策略概率向旧策略平滑构建软信任域,既保留梯度信号,又避免不稳定更新;在Qwen2.5系列模型上验证,GSM8K任务性能较裁剪GRPO提升超20%,同时优化推理响应的逻辑性与简洁性。  Illustrative plot of ratio r vs. the surrogate term A

论文:https://arxiv.org/abs/2509.21282

Comments:研究聚焦LLM RL核心技术痛点,方法创新性与落地价值突出,适合投稿至NeurIPS(神经信息处理系统大会),该会议对强化学习与LLM结合方向接纳度高,易引发学术界与工业界关注。

2、Tree Search for LLM Agent Reinforcement Learning

作者:Yuxiang Ji, Ziyu Ma, Yong Wang, Guanhua Chen, Xiangxiang Chu, Liaoni Wu

亮点:针对LLM智能体长程多轮任务的奖励稀疏问题,提出Tree-GRPO方法。以树节点表示交互步骤,通过共享前缀提升token预算内的rollout数量,并基于树结构轨迹构建步级过程监督信号;在11个数据集、3类QA任务上验证,性能显著优于链式RL方法,为LLM智能体推理优化提供新范式。 The overview of the Tree-GRPO training pipeline

论文:https://arxiv.org/abs/2509.21240

开源代码:https://github.com/AMAP-ML/Tree-GRPO

Comments:将树搜索与RL结合解决LLM智能体关键瓶颈,实验覆盖度广,适合投稿至ICML(国际机器学习大会),该会议重视智能体强化学习与推理方向,成果易推动领域技术迭代。

二、LLM评估与偏见缓解方向

1、TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them

作者:Yidong Wang等

亮点:发现LLM评估者存在分数比较不一致(低分红利优于高分红利)与成对传递性不一致(循环偏好链)问题,提出TrustJudge概率框架。通过分布敏感评分(保留信息熵)与似然感知聚合(解决传递性冲突),两类不一致分别降低8.43%和10.82%,且无需额外训练或人工标注。 Left: Average entropy of Llama-3 Grattafiori et al.Right: Breakdown of circular- vs. inequalitytransitivity errors in pairwise-comparison tests.

论文:https://arxiv.org/abs/2509.21117

开源代码:https://github.com/TrustJudge/TrustJudge

Comments:解决LLM评估核心一致性难题,方法通用性强,适合投稿至ACL(计算语言学协会年会),该会议对LLM评估工具优化方向重视度高,开源代码可增强成果可复现性与影响力。

2、Which Cultural Lens Do Models Adopt? On Cultural Positioning Bias and Agentic Mitigation in LLMs

作者:Yixin Wan, Xingrun Chen, Kai-Wei Chang

亮点:揭示LLM存在文化定位偏见(默认采用美国主流文化视角,对非主流文化呈“外部性”),构建含4000个提示的CultureLens基准与3类评估指标。提出MFA智能体框架(规划、批判、优化智能体协同),有效缓解偏见,为LLM文化公平性优化提供实践路径。

 (L): CultureLens evaluation framework. (R): Qualitative examples of excerpts from generated interview questions contexted in US vs. non-US cultures.

(L): CultureLens evaluation framework. (R): Qualitative examples of excerpts from generated interview questions contexted in US vs. non-US cultures.

论文:https://arxiv.org/abs/2509.21080

Comments:聚焦LLM文化偏见这一新兴痛点,基准与方法具创新性,适合投稿至EMNLP(自然语言处理经验方法会议),该会议对LLM偏见缓解与跨文化NLP方向接纳度高,成果可推动领域公平性实践。

三、LLM多指令与代码任务方向

1、When Instructions Multiply: Measuring and Estimating LLM Capabilities of Multiple Instructions Following

作者:Keno Harada, Yudai Yamazaki, Masachika Taniguchi, Edison Marrese-Taylor, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

亮点:针对LLM多指令跟随能力缺乏系统评估的问题,构建ManyIFEval(文本生成,最多10条指令)与StyleMBPP(代码生成,最多6条指令)基准。发现LLM性能随指令数量增加而下降,提出逻辑回归模型,仅需500/300样本即可预测未见过指令组合的性能,误差约10%。 Examples from our proposed ManyIFEval (top) and StyleMBPP (bottom) benchmarks.

论文:https://arxiv.org/abs/2509.21051

开源代码:https://github.com/kenoharada/Multiple-Instructions-Following/releases

Comments:已被EMNLP 2025接收,该会议是NLP领域顶会,成果为LLM多指令跟随评估与预测提供关键工具,基准数据集可推动领域后续研究。

2、Fine-Tuning LLMs to Analyze Multiple Dimensions of Code Review: A Maximum Entropy Regulated Long Chain-of-Thought Approach

作者:Yongda Yu, Guohao Shi, Xianwei Wu, Haochuan He, XueMing Gu, Qianqian Zhao, Kui Liu, Qiushi Wang, Zhao Tian, Haifeng Shen, Guoping Rong

亮点:针对LLM代码审查维度单一、长思维链(CoT)处理易丢失上下文与逻辑的问题,提出MelcotCR方法。结合最大熵建模与预定义推理路径,增强长CoT知识利用与推理逻辑性;14B Qwen2.5模型经微调后,代码问题检测精度超越现有方法,媲美671B DeepSeek-R1。 A schematic overview of the MelcotCR approach

论文:https://arxiv.org/abs/2509.21170

Comments:聚焦代码审查LLM微调细分场景,性能优势显著,适合投稿至ICSE(国际软件工程大会),该会议对AI辅助软件工程方向重视度高,成果可推动工业界代码审查工具升级。

3、Leveraging What's Overfixed: Post-Correction via LLM Grammatical Error Overcorrection

作者:Taehee Park, Heejin Do, Gary Geunbae Lee

亮点:针对小LLM(sLMs)语法纠错召回率低、大LLM过纠错导致精度低的问题,提出PoCO方法。先通过大LLM触发过纠错以最大化召回率,再用微调小模型进行目标后修正,平衡召回率与精度,显著提升语法纠错整体质量。

Overview of the POCO Framework

Overview of the POCO Framework

论文:https://arxiv.org/abs/2509.20811

Comments:已被EMNLP 2025接收,该会议在NLP纠错领域具权威影响力,方法创新性结合大小LLM优势,为语法纠错任务提供高效解决方案,易引发工业界落地关注。

➔➔➔➔点击查看原文,获取论文合集https://mp.weixin.qq.com/s/uwMdDJ4_c1r-H4RoPSZxCg

四、LLM安全与隐私保护方向

1、RLCracker: Exposing the Vulnerability of LLM Watermarks with Adaptive RL Attacks

作者:Hanbo Huang, Yiran Zhang, Hao Zheng, Xuan Gong, Yihan Li, Lin Liu, Shiyu Liang

亮点:挑战现有LLM水印技术鲁棒性宣称,提出自适应鲁棒性半径 metric 并理论证明攻击优化可降低该半径;设计RLCracker自适应RL攻击,仅需100个短样本训练,3B模型即可实现98.5%水印移除成功率,且在10种水印方案、5种模型规模上具泛化性。 The RLCracker algorithm for watermark removal

论文:https://arxiv.org/abs/2509.20924

Comments:揭示LLM水印技术核心漏洞,方法攻击性与泛化性强,适合投稿至S&P(IEEE安全与隐私研讨会),该会议是AI安全领域权威会议,成果对LLM内容溯源防护具重要警示意义。

2、Automatic Red Teaming LLM-based Agents with Model Context Protocol Tools

作者:Ping He, Changjiang Li, Binbin Zhao, Tianyu Du, Shouling Ji

亮点:针对LLM智能体集成MCP工具引发的投毒攻击风险,提出AutoMalTool自动化红队框架。可生成恶意MCP工具,操纵主流LLM智能体行为并规避现有检测机制,揭示LLM智能体工具集成场景下的新安全漏洞。

The overview of AutoMalTool

The overview of AutoMalTool

论文:https://arxiv.org/abs/2509.21011

Comments:聚焦LLM智能体工具安全细分痛点,研究具前瞻性,适合投稿至USENIX Security(USENIX安全研讨会),该会议对LLM安全漏洞挖掘方向关注度高,成果可推动LLM安全防护技术发展。

五、LLM推理与知识增强方向

1、A Fano-Style Accuracy Upper Bound for LLM Single-Pass Reasoning in Multi-Hop QA

作者:Kaiyang Wan, Lang Gao, Honglin Mu, Preslav Nakov, Yuxia Wang, Xiuying Chen

亮点:针对LLM单轮推理在多跳QA中因输出容量有限导致的性能瓶颈,建立Fano型精度上界,揭示任务复杂度超模型容量时精度必然下降的规律。提出InfoQA多调用框架,通过容量感知任务分解与推理轨迹剪枝,在噪声基准上实现性能稳定提升。

Comparison of single-pass and multi-call reasoning paradigms.

Comparison of single-pass and multi-call reasoning paradigms.

论文:https://arxiv.org/abs/2509.21199

开源代码:https://github.com/KaiyangWan/InfoQA

Comments:为LLM多跳推理提供理论上界与实践框架,开源成果增强可复现性,适合投稿至NeurIPS,该会议对LLM推理理论与多跳QA优化方向重视度高,理论与实践结合的成果易获领域认可。

2、Enrich-on-Graph: Query-Graph Alignment for Complex Reasoning with LLM Enriching

作者:Songze Li, Zhiqiang Liu, Zhengke Gui, Huajun Chen, Wen Zhang 亮点:针对LLM在知识图谱QA(KGQA)中因语义鸿沟导致的幻觉问题,提出EoG框架。通过LLM先验知识丰富KG,桥接语义 gap,同时设计3类图质量评估指标;在KGQA基准上实现SOTA性能,为知识增强LLM推理提供新路径。

论文:(arxiv论文网址:https://arxiv.org/abs/2509.20810) 开源代码:https://github.com/zjukg/Enrich-on-Graph Comments:结合LLM与知识图谱解决推理幻觉难题,方法具通用性与高效性,适合投稿至WWW(国际万维网大会),该会议对知识图谱与LLM推理融合方向关注度高,开源代码可推动领域技术落地。

六、LLM跨领域应用方向

1、Beyond Stars: Bridging the Gap Between Ratings and Review Sentiment with LLM

作者:Najla Zuhir, Amna Mohammad Salim, Parvathy Premkumar, Moshiur Farazi

亮点:针对移动应用评分无法捕捉评论文本细微反馈的问题,提出LLM驱动的模块化框架。量化评分与文本情感差异、提取特征级洞察、支持RAG-QA交互式评论探索;在AWARE、Google Play等数据集上验证,性能超越传统NLP方法,解决sarcasm与领域术语理解难题。 Modular LLM-based review analysis framework

论文:https://arxiv.org/abs/2509.20953

Comments:已被AICCSA 2025(ACS/IEEE国际计算机系统与应用会议)接收,该会议对AI在用户反馈分析方向重视度高,成果可直接服务于应用开发者优化产品与提升用户体验。

➔➔➔➔点击查看原文,获取论文合集https://mp.weixin.qq.com/s/uwMdDJ4_c1r-H4RoPSZxCg

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐