训练数据相关

  • SynGen-Vision: Synthetic Data Generation for training industrial vision models (https://arxiv.org/abs/2509.04894):
    该研究提出了一种生成合成数据来训练计算机视觉(CV)模型用于工业磨损检测的方法。该方法利用视觉语言模型以及3D模拟和渲染引擎来生成不同锈蚀条件下的合成数据。实验结果表明,使用该方法生成的合成数据训练的CV模型,在真实锈蚀工业物体图像上的测试中,性能优于其他方法。

Agent相关

  • AI Agents for Web Testing: A Case Study in the Wild (https://arxiv.org/abs/2509.05197):
    该研究提出了 WebProber,一个基于AI Agent的Web测试框架。该框架能够自主探索网站,模拟用户交互,识别bug和可用性问题,并生成人类可读的报告。通过对120个学术个人网站的案例研究,WebProber发现了传统工具未能发现的29个可用性问题。该研究表明,基于Agent的测试是一个有前景的方向,并为下一代以用户为中心的测试框架的发展指明了方向。

  • TalkToAgent: A Human-centric Explanation of Reinforcement Learning Agents with Large Language Models (https://arxiv.org/abs/2509.04809):
    这篇论文介绍了 TalkToAgent,一个多Agent的大语言模型框架,可以为强化学习策略提供交互式的自然语言解释。该框架包含五个专门的LLM Agent,能够自动将用户查询映射到相关的XRL工具,并从关键状态变量、预期结果或反事实解释的角度阐明Agent的行为。通过四罐过程控制问题的验证,证明了TalkToAgent能够有效地解释Agent的行为,并在问题领域中对其含义进行语境化。

  • First Steps Towards Overhearing LLM Agents: A Case Study With Dungeons & Dragons Gameplay (https://arxiv.org/abs/2505.22809):
    该研究提出了一种与LLM Agent交互的新范式——“overhearing agents”。这些Agent不主动参与对话,而是“监听”人与人之间的对话,并在后台执行任务或提供建议来辅助用户。该研究以《龙与地下城》游戏为例,使用大型多模态音频-语言模型作为overhearing agents来辅助地下城主。实验结果表明,一些大型音频-语言模型具有使用隐式音频线索执行overhearing Agent任务的新兴能力。

  • Advancing Mobile GUI Agents: A Verifier-Driven Approach to Practical Deployment (https://arxiv.org/abs/2503.15937):
    这篇论文提出了 V-Droid,一个移动GUI任务自动化Agent。与以往直接生成动作的Agent不同,V-Droid 使用 LLM 作为验证器来评估候选动作,然后再做出最终决定。论文提出了一个全面的框架来实现这种新的范式,包括离散化动作空间构建、预填充工作流程以加速验证过程、成对的进度偏好训练以增强验证器的决策能力,以及可扩展的人-Agent联合注释方案以高效地收集必要的数据。V-Droid 在多个公共移动任务自动化基准测试中获得了显著的任务成功率,并且延迟非常低。

  • Caution for the Environment: Multimodal LLM Agents are Susceptible to Environmental Distractions (https://arxiv.org/abs/2408.02544):
    本文研究了多模态大语言模型(MLLM)Agent在图形用户界面(GUI)环境中的可靠性,旨在解决多模态GUI Agent是否会被环境上下文分散注意力的问题。通过模拟数据集对各种MLLM作为GUI Agent进行评估,结果表明,即使是最强大的模型也容易受到干扰。

大模型的行业应用

  • GenAI-based test case generation and execution in SDV platform (https://arxiv.org/abs/2509.05112):
    该论文介绍了一种基于 GenAI 的自动化测试用例生成方法,利用大型语言模型和视觉-语言模型将自然语言需求和系统图转换为结构化的 Gherkin 测试用例。该方法集成了车辆信号规范建模,以标准化车辆信号定义,提高汽车子系统之间的兼容性,并简化与第三方测试工具的集成。通过儿童存在检测系统的用例评估了该方法,结果表明,手动测试规范工作量大大减少,并且可以快速执行生成的测试。

  • TPA: Temporal Prompt Alignment for Fetal Congenital Heart Defect Classification (https://arxiv.org/abs/2508.15298):
    这篇论文提出了一种名为“时间提示对齐”(TPA)的方法,该方法利用基础图像-文本模型和提示感知的对比学习,对心脏超声视频中的胎儿先天性心脏缺陷(CHD)进行分类。TPA 使用图像编码器从视频子片段的每一帧中提取特征,使用可训练的时间提取器聚合它们以捕获心脏运动,并通过边缘铰链对比损失将视频表示与特定于类别的文本提示对齐。为了提高临床可靠性的校准,引入了条件变分自动编码器风格调制(CVAESM)模块,该模块学习潜在风格向量来调节嵌入并量化分类不确定性。

文生图/文生视频

  • Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper (https://arxiv.org/abs/2509.04957):
    该研究提出了一种名为“多基础模型映射器”(MFM-Mapper)的视频到音频(V2A)生成方法。该方法通过融合来自双视觉编码器的特征,受益于更丰富的语义和时间信息。此外,通过用GPT-2替换线性映射器,MFM-Mapper 改进了特征对齐,将跨模态特征映射与自回归翻译任务进行了类比。实验结果表明,MFM-Mapper 具有显著的训练效率,并且在语义和时间一致性方面实现了更好的性能,同时减少了训练消耗。

编辑精选

  1. AI Agents for Web Testing: A Case Study in the Wild (https://arxiv.org/abs/2509.05197):Agent在Web测试领域的成功应用,预示着自动化测试的新方向。
  2. Advancing Mobile GUI Agents: A Verifier-Driven Approach to Practical Deployment (https://arxiv.org/abs/2503.15937):通过验证器驱动的方法显著提高了移动GUI Agent的性能和效率,加速了实际部署。
Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐