多模态大模型研究每日简报【2025-09-23】
Agent相关
-
Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent (https://arxiv.org/abs/2509.17917)
该论文提出了一种名为Orcust的GUI Agent框架,通过整合Principle-Constrained Reward Modeling (PCRM)和Online VM-Grounded Trajectory Construction (OVTC),提升了推理的可靠性和交互式GUI任务中的数据效率。Orcust在多个GUI基准测试中取得了领先性能,展现了其在提升GUI Agent推理、适应性和可扩展性方面的有效性。 -
V2V-GoT: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models and Graph-of-Thoughts (https://arxiv.org/abs/2509.18053)
该论文提出了一个新颖的graph-of-thoughts框架,专为基于MLLM的协同自动驾驶设计,包含提出的遮挡感知(occlusion-aware)感知和规划感知(planning-aware)预测的新颖想法。论文整理了V2V-GoT-QA数据集,并开发了V2V-GoT模型,用于训练和测试协同驾驶graph-of-thoughts。实验结果表明,该方法在协同感知、预测和规划任务中优于其他基线。
大模型的行业应用
-
ClassMind: Scaling Classroom Observation and Instructional Feedback with Multimodal AI (https://arxiv.org/abs/2509.18020)
该论文介绍了一个AI驱动的课堂观察系统ClassMind,它整合了生成式AI和多模态学习,用于分析课堂视频等资料,并提供及时的、个性化的反馈。该系统旨在解决教师发展中课堂观察成本高昂和专家教练短缺的问题。教师对该系统的实用性、易用性和创新性表示肯定,同时也提出了对隐私和人为判断作用的担忧。 -
Beyond Diagnosis: Evaluating Multimodal LLMs for Pathology Localization in Chest Radiographs (https://arxiv.org/abs/2509.18015)
该论文评估了通用MLLM(GPT-4和GPT-5)和领域特定模型(MedGemma)在胸部X光片中定位病变的能力。结果表明,MLLM在医学影像方面具有潜力和局限性,需要与特定任务工具集成才能可靠使用。GPT-5在定位精度上表现最佳,但仍低于专门的CNN基线和放射科医生的水平。 -
A Multimodal Conversational Assistant for the Characterization of Agricultural Plots from Geospatial Open Data (https://arxiv.org/abs/2509.17544)
该论文提出了一个开源的对话式助手,集成了多模态检索和大语言模型(LLM),以支持与异构农业和地理空间数据进行自然语言交互。该架构结合了正射影像、Sentinel-2植被指数和用户提供的文档,通过检索增强生成(RAG),使系统能够灵活地决定在形成答案时是依赖多模态证据、文本知识还是两者兼而有之。
模型预训练相关
- Visual Instruction Pretraining for Domain-Specific Foundation Models (https://arxiv.org/abs/2509.17562)
该论文提出了一种新的范例,用于在下游领域预训练基础模型:Visual insTruction Pretraining (ViTP),一种直接利用推理来增强感知的创新方法。ViTP将视觉Transformer (ViT)骨干嵌入到视觉语言模型中,并使用从目标下游领域中精选的大量视觉指令数据对其进行端到端预训练。
训练策略
-
TACTFL: Temporal Contrastive Training for Multi-modal Federated Learning with Similarity-guided Model Aggregation (https://arxiv.org/abs/2509.17532)
该论文提出了一个用于半监督多模态联邦学习的统一框架TACTFL。TACTFL引入了一种与模态无关的时间对比训练方案,通过利用跨模态的时间对齐从未标记的客户端数据中进行表征学习。此外,TACTFL还包含一种相似性引导的模型聚合策略,该策略基于客户端模型表征的一致性动态地对客户端模型进行加权,从而促进全局对齐。 -
COLA: Context-aware Language-driven Test-time Adaptation (https://arxiv.org/abs/2509.17598)
该论文研究了一种更通用的源模型,该模型能够适应多个目标域,而无需共享标签。这是通过使用一个预训练的视觉-语言模型(VLM)来实现的,该模型能够通过与类描述匹配来识别图像。论文提出了一种新的方法——上下文感知语言驱动TTA (COLA)。
Benchmark
-
AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing? (https://arxiv.org/abs/2509.17641)
该论文提出了AuditoryBench++,一个综合性的基准测试,用于评估纯文本设置中语言模型的听觉知识和推理能力。它包含了一系列任务,从基本的听觉比较到上下文相关的推理。此外,论文还提出了一种新颖的听觉想象推理方法AIR-CoT,通过跨度检测和知识注入在推理过程中生成和整合听觉信息。 -
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios (https://arxiv.org/abs/2509.17421)
该论文介绍了RealBench,第一个中文多模态多图像数据集,它包含9393个样本和69910张图片。RealBench通过结合真实的用户生成内容来确保与真实世界应用的高度相关性。此外,该数据集涵盖了各种场景、图像分辨率和图像结构,进一步增加了多图像理解的难度。 -
ChartHal: A Fine-grained Framework Evaluating Hallucination of Large Vision Language Models in Chart Understanding (https://arxiv.org/abs/2509.17481)
该论文提出了ChartHal,一个基准测试,它具有图表理解中幻觉场景的细粒度分类法,以及一个经过人工验证的1062个样本的数据集。评估表明,最先进的LVLM在ChartHal上遭受严重的幻觉,强调迫切需要更强大的缓解策略。 -
From Benchmarks to Reality: Advancing Visual Anomaly Detection by the VAND 3.0 Challenge (https://arxiv.org/abs/2509.17615)
该论文介绍了VAND 3.0挑战赛,旨在展示异常检测领域在不同实际环境中的最新进展,同时解决该领域的关键问题。挑战赛设置了两个赛道,分别促进了异常检测方法的发展,这些方法对现实世界中的分布偏移具有鲁棒性(类别1),并探索了视觉语言模型在少样本制度中的能力(类别2)。
文生图/文生视频
-
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models (https://arxiv.org/abs/2509.17627)
该论文专注于mask-free的视频插入任务,旨在解决三个关键挑战:数据稀缺、主体-场景平衡和插入协调。论文提出了一种新的数据管道InsertPipe,自动构建多样化的交叉配对数据,并开发了OmniInsert,一个用于从单个和多个主体参考进行mask-free视频插入的统一框架。 -
CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration (https://arxiv.org/abs/2509.17458)
该论文提出了Category-Aware Reward-based Initial Noise Optimization and Exploration (CARINOX),这是一个统一的框架,它结合了噪声优化和探索,以及基于与人类判断相关性的原则性奖励选择程序。在涵盖各种组合挑战的两个互补基准上的评估表明,CARINOX将平均对齐分数提高了+16%(T2I-CompBench++)和+11%(HRS基准),在所有主要类别中始终优于最先进的优化和基于探索的方法,同时保持了图像质量和多样性。
底层模型架构
-
Qwen3-Omni Technical Report (https://arxiv.org/abs/2509.17765)
该论文介绍了Qwen3-Omni,一个在文本、图像、音频和视频方面均保持最先进性能的单模态模型,与同等规模的单模态模型相比没有性能下降,尤其在音频任务上表现出色。Qwen3-Omni采用了Thinker-Talker MoE架构,统一了文本、图像、音频和视频的感知和生成,产生了流畅的文本和自然的实时语音。 -
M3ET: Efficient Vision-Language Learning for Robotics based on Multimodal Mamba-Enhanced Transformer (https://arxiv.org/abs/2509.18005)
该论文提出了多模态Mamba增强Transformer (M3ET),这是一种轻量级模型,专为高效的多模态学习而设计,尤其是在移动平台上。通过结合Mamba模块和一个基于语义的自适应注意机制,M3ET优化了特征融合、对齐和模态重建。 -
DA-Mamba: Dialogue-aware selective state-space model for multimodal engagement estimation (https://arxiv.org/abs/2509.17711)
论文介绍了一种对话感知的多模态架构DA-Mamba,用基于Mamba的选择性状态空间处理取代了注意密集型对话编码器,以实现线性时间和内存复杂性,同时保留了表达性的跨模态推理。DA-Mamba由三个核心模块组成:一个对话感知编码器和两个基于mamba的融合机制:模态组融合和伙伴组融合。
重点推荐
- Qwen3-Omni Technical Report (https://arxiv.org/abs/2509.17765): 业界首个真正的全模态大模型,各模态能力均衡,性能优秀,值得关注。
- Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent (https://arxiv.org/abs/2509.17917): 在GUI Agent任务上取得了显著进展,利用强化学习提高Agent与图形界面交互的可靠性和效率,在人机交互领域有重要参考价值。
- ClassMind: Scaling Classroom Observation and Instructional Feedback with Multimodal AI (https://arxiv.org/abs/2509.18020): 将AI应用于教育领域,通过多模态分析提供个性化教学反馈,有助于解决教育资源不平衡问题,具有社会意义。
- RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios (https://arxiv.org/abs/2509.17421): 填补了中文多图理解数据集的空白,真实场景数据更具挑战性,对推动中文多模态研究具有重要意义。
更多推荐


所有评论(0)