本周精选 12篇大模型领域前沿论文,覆盖大模型辅助多智能体与语义网络建模、大模型迭代优化与自调试、大模型翻译与文本理解优化、大模型评估与鲁棒性、大模型工业应用与工具开发等方向。全部200多篇论文皆可扫码免费领取。

➔➔➔➔点击查看原文,获取本周大模型周报https://mp.weixin.qq.com/s/JE1EPmUVfmsIog2KtrOtLw

大模型词云图

大模型词云图

一、大模型辅助多智能体与语义网络建模

1、LLM-Assisted Modeling of Semantic Web-Enabled Multi-Agents Systems with AJAN

作者:Hacane Hechehouche, Andre Antakli, Matthias Klusch

亮点:针对AJAN框架(基于语义网标准的多智能体系统开发框架)建模中的核心痛点——RDF/RDFS知识表示与SPARQL行为定义易出错(如URI拼写错误)、学习成本高,提出集成开发环境(IDE)解决方案。该IDE首次将大语言模型(LLM)融入AJAN智能体工程流程,降低非专业开发者使用门槛,同时解决大规模环境下复杂SPARQL查询构建难题,扩展了AJAN框架的用户群体。

Overview of the LLM-based AJAN modeling interface

Overview of the LLM-based AJAN modeling interface

论文:https://arxiv.org/abs/2510.06911

开源代码:https://anonymous.4open.science/r/HYENA-69FF

Comments:聚焦语义网与多智能体系统的工程化落地,LLM的引入为标准化智能体建模提供了效率突破。

2、SID: Multi-LLM Debate Driven by Self Signals

作者:Xuhang Chen, Zhifan Song, Deyi Ji, Shuo Gao, Lanyun Zhu

亮点:突破现有多LLM辩论(MAD)方法依赖外部结构(如辩论图、LLM裁判)的局限,提出基于“自信号”的辩论框架SID。通过提取模型级置信度(高置信度智能体提前退出辩论)和token级语义焦点(基于注意力压缩冗余内容),在提升辩论准确性的同时,显著降低token消耗。实验覆盖多类LLM与多模态LLM,在多个基准测试中优于现有MAD技术,兼顾性能与效率。

Overall framework of SID

Overall framework of SID

论文:https://arxiv.org/abs/2510.06843

开源代码:https://github.com/xuhang2019/SID

Comments:首次将LLM生成过程中的内生信号(置信度、注意力)用于多智能体协作,为高效多LLM系统设计提供新范式。

二、大模型迭代优化与自调试

1、TGPR: Tree-Guided Policy Refinement for Robust Self-Debugging of LLMs

作者:Daria Ozerova, Ekaterina Trofimova

亮点:针对LLM迭代优化中“巨大搜索空间难以有效探索”的核心问题,提出树引导策略优化(TGPR)框架。结合GRPO(梯度正则化策略优化)与汤普森采样树搜索,主动探索失败与成功的优化路径,生成更密集的训练轨迹与自适应策略。在HumanEval、MBPP、APPS基准测试中,相比GRPO基线,pass@1(MBPP)提升4.2个百分点,pass@10(APPS)提升12.51个百分点,同时为LLM状态推理与迭代优化提供通用框架。

The overall architecture of the TGPR pipeline

The overall architecture of the TGPR pipeline

论文:https://arxiv.org/abs/2510.06878

Comments:通过结构化搜索与策略学习结合,解决了迭代优化的“探索-利用困境”,在代码调试等任务中表现突出。

2、Scaling LLM Multi-turn RL with End-to-end Summarization-based Context Management

作者:Miao Lu, Weiwei Sun, Weihua Du, Zhan Ling, Xuesong Yao, Kang Liu, Jiecao Chen

亮点:针对LLM多轮强化学习(RL)中“上下文长度瓶颈”问题,提出基于摘要的上下文管理框架SUPO。通过LLM生成任务相关摘要,周期性压缩工具使用历史,在保持信息完整性的同时突破固定上下文窗口限制;进一步设计端到端策略梯度,同步优化工具使用行为与摘要策略。在交互式函数调用与搜索任务中,成功提升任务成功率,且保持更低的上下文长度;测试时扩展摘要轮次可进一步提升复杂任务性能。

An illustration of the different rollout processes of MV (upper) and MsumV (lower)

An illustration of the different rollout processes of MV (upper) and MsumV (lower)

论文:https://arxiv.org/abs/2510.06727

Comments:将摘要能力与RL结合,为长 horizon 多轮LLM智能体训练提供可扩展方案。

三、大模型翻译与文本理解优化

1、Unlocking Latent Discourse Translation in LLMs Through Quality-Aware Decoding

作者:Wafaa Mohammed, Vlad Niculae, Chrysoula Zerva

亮点:聚焦LLM机器翻译中的“语篇现象处理短板”(如代词指代、文档级词汇衔接),通过实验证实LLM内部已编码语篇知识,并提出质量感知解码(QAD)方法有效提取该知识。相比传统解码方式,QAD不仅提升语篇翻译准确性,还增强译文语义丰富度,更符合人类偏好。为LLM在复杂文本翻译(如长文档、多句子连贯翻译)中的优化提供新方向。

Examples of discourse phenomena.

Examples of discourse phenomena.

论文:https://arxiv.org/abs/2510.06866

Comments:从解码层挖掘LLM潜在能力,为解决翻译中的“上下文连贯性”问题提供实证与方法支持。

2、TWIST: Training-free and Label-free Short Text Clustering through Iterative Vector Updating

作者:I-Fan Lin, Faegheh Hasibi, Suzan Verberne

亮点:针对短文本聚类(如客服对话意图聚类)中“无标签、未知聚类数、计算成本高”的痛点,提出无训练、无标签的迭代向量更新方法TWIST。基于LLM引导,通过代表性文本构建稀疏向量并迭代优化,无需对比学习或聚类先验知识,即可在多数据集上达到或超越SOTA性能。支持任意嵌入模型与聚类方法,适配小参数量LLM,且可扩展至大规模数据集,降低LLM使用成本,更贴合工业场景(如客服 utterance 分析)。

Construction of Sparse vectors.

Construction of Sparse vectors.

论文:https://arxiv.org/abs/2510.06747

开源代码:https://anonymous.4open.science/r/sparse_vector-F4C9/

Comments:打破短文本聚类对标签与训练数据的依赖,为低资源场景下的文本理解提供实用工具。

3、Learning to Rewrite Prompts for Bootstrapping LLMs on Downstream Tasks

作者:Qinhao Zhou, Xiang Xiang, Kun He, John E. Hopcroft

亮点:针对现有提示工程“重指令优化、轻输入优化”的局限(尤其在机器翻译等NLG任务中,输入组件比指令更关键),提出基于回译的小模型提示重写方法。无需大参数量辅助LLM,仅通过小模型训练即可优化翻译任务的“输入型提示”,显著降低单任务提示优化成本;经适配后可扩展至其他下游任务,为LLM在特定任务的快速 bootstrap 提供轻量方案。

The pipeline of our proposed method for boostrapping Large Language Models

The pipeline of our proposed method for boostrapping Large Language Models

论文:https://arxiv.org/abs/2510.06695

Comments:填补了“输入型提示优化”的方法空白,为低资源任务的LLM提示设计提供新思路。

四、大模型评估与鲁棒性

1、PTEB: Towards Robust Text Embedding Evaluation via Stochastic Paraphrasing

作者:Manuel Frank, Haithem Afli

亮点:针对现有文本嵌入评估(如MTEB)依赖“静态测试集易导致性能虚高”的问题,提出动态评估基准PTEB。通过LLM在评估时随机生成语义一致但token不同的 paraphrase,多轮聚合结果,有效检测嵌入模型对“表面形式变化”的鲁棒性。在7个MTEB任务与10种语言的多语言数据集上验证:即使语义不变,token变化仍会影响嵌入性能,且模型大小与鲁棒性无显著关联。为NLP评估提供“动态化、抗过拟合”的新范式。

论文:https://arxiv.org/abs/2510.06730

开源代码:https://huggingface.co/blog/rteb

Comments:突破静态基准局限,推动文本嵌入评估向“真实场景鲁棒性”靠拢。

2、Are LLMs Reliable Rankers? Rank Manipulation via Two-Stage Token Optimization

作者:Tiancheng Xing, Jerry Li, Yixuan Du, Xiyang Hu

亮点:揭示LLM作为信息检索重排器的“鲁棒性漏洞”——通过微小自然语言扰动即可操控排序结果。提出两阶段token优化方法RAF:第一阶段用贪心坐标梯度结合可读性分数筛选候选token;第二阶段通过熵加权方案平衡排序效果与自然度,温度采样选择token。实验表明,RAF能以自然语言持续提升目标项排名,且比现有方法更鲁棒,为LLM重排系统的“对抗性安全”提供警示与研究方向。

 Overview of RAF prompt optimization

Overview of RAF prompt optimization

论文:https://arxiv.org/abs/2510.06732

开源代码:https://github.com/glad-lab/RAF

Comments:首次系统分析LLM排序的脆弱性,为检索系统的安全防护提供实证依据。

3、Foundations of LLM Knowledge Materialization: Termination, Reproducibility, Robustness

作者:Luca Giordano, Simon Razniewski

亮点:针对LLM知识结构化提取(如GPTKB)的“关键属性未明确”问题,通过miniGPTKB(领域特定子爬取)系统研究知识物化的终止性、可复现性与鲁棒性。在历史、娱乐、金融三个领域验证:(1)终止率高但依赖模型;(2)可复现性参差不齐;(3)对种子、温度扰动鲁棒性高,对语言、模型扰动鲁棒性低。为LLM知识提取的“可靠性工程”提供首个系统性分析与量化结论。

Overview of research questions and methodology

Overview of research questions and methodology

论文:https://arxiv.org/abs/2510.06780

开源代码:https://anonymous.4open.science/r/miniGPTKB-0DE7/

Comments:填补LLM知识物化“基础理论空白”,为结构化知识提取的工程落地提供指导。

4、Evaluating LLMs for Historical Document OCR: A Methodological Framework

作者:Maria Levchenko

亮点:针对数字人文领域“LLM-based 历史文档OCR缺乏专用评估框架”的问题,提出包含新指标与协议的评估体系:新增历史字符保留率(HCPR)、古体插入率(AIR),解决传统指标无法捕捉“时代偏差”(如插入错误历史时期字符)的问题;设计污染控制与稳定性测试协议。在18世纪俄语文档上评估12个多模态LLM:Gemini与Qwen优于传统OCR,但存在“过度历史化”问题;OCR后修正反而降低性能。为数字人文学者选择LLM-OCR工具提供实操指南。

CER distribution by models (full page mode)

CER distribution by models (full page mode)

论文:https://arxiv.org/abs/2510.06743

Comments:首个聚焦历史文档LLM-OCR的评估框架,推动LLM在人文领域的精准应用。

五、大模型工业应用与工具开发

1、Agent-in-the-Loop: A Data Flywheel for Continuous Improvement in LLM-based Customer Support

作者:Cen Mia Zhao, Tiantian Zhang, Hanchen Su, Yufeng Wayne Zhang, Shaowei Su, Mingzhi Xu, Yu Elaine Liu, Wei Han, Jeremy Werner, Claire Na Cheng, Yashar Mehdad

亮点:提出AITL框架,将“人工反馈飞轮”嵌入LLM客服系统实时运营:通过四种实时标注( pairwise 响应偏好、 agent 采纳与理由、知识相关性检查、缺失知识识别),将模型更新周期从数月缩短至数周。在北美客服场景试点:检索召回率@75提升11.7%、精确率@8提升14.8%,生成有用性提升8.4%,agent采纳率提升4.5%。为LLM客服系统的“持续迭代”提供可落地的工业方案。

Overview of the agent-in-the-loop architecture.

Overview of the agent-in-the-loop architecture.

论文:https://arxiv.org/abs/2510.06674

Comments:EMNLP 2025工业 track 投稿,聚焦真实运营场景的反馈闭环,实用性强。

2、AISysRev: LLM-based Tool for Title-abstract Screening in Systematic Reviews

作者:Aleksi Huotala, Miikka Kuutila, Olli-Pekka Turtio, Mika Mäntylä

亮点:针对软件工程系统综述“标题摘要筛选耗时”的痛点,开发Web化LLM筛选工具AISysRev(Docker部署)。支持CSV输入论文数据、自定义纳入/排除标准,兼容多LLM(通过OpenRouter),提供零样本/少样本筛选与人工筛选辅助界面。试验137篇论文发现:可将论文分为易纳入、易排除、边界纳入、边界排除四类,LLM虽不能替代人工,但能显著降低筛选负担。为学术综述效率提升提供实用工具。

The AiSysRev tool architecture

The AiSysRev tool architecture

论文:https://arxiv.org/abs/2510.06708

开源代码:https://github.com/EvoTestOps/AISysRev

Comments:工具附视频演示(https://www.youtube.com/watch?v=jVbEj4Y4tQI),侧重工程落地与学术场景适配。

3、LLM-Powered Nuanced Video Attribute Annotation for Enhanced Recommendations

作者:Boyuan Long, Yueqi Wang, Hiloni Mehta, Mick Zomnir, Omkar Pathak, Changping Meng, Ruolin Jia, Yajun Peng, Dapeng Hong, Xia Wu, Mingyan Gao, Onkar Dalal, Ningren Han

亮点:在工业级短视频推荐系统中,首次将LLM作为“精细化属性标注器”(如识别视频“氛围”),解决传统分类器开发周期长、无法捕捉细微属性的问题。设计端到端流程:(1)通过离线指标与在线A/B测试迭代属性定义;(2)LLM结合多模态特征批量标注,优化推理与知识蒸馏;(3)标注结果融入推荐(如个性化限制检索)。实验表明:LLM标注质量优于人类,在线A/B测试提升用户参与度与满意度。为推荐系统的“深度内容理解”提供工业范例。

Workflow Diagram

Workflow Diagram

论文:https://arxiv.org/abs/2510.06657

Comments:RecSys 2025工业 track 论文,聚焦LLM在推荐系统中的规模化应用,落地价值高。

➔➔➔➔点击查看原文,获取本周大模型周报https://mp.weixin.qq.com/s/JE1EPmUVfmsIog2KtrOtLw

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐