多模态大模型研究每日简报【2025-09-15】
·
Agent相关
- TASC: Task-Aware Shared Control for Teleoperated Manipulation (https://arxiv.org/abs/2509.10416)
该论文提出了一种任务感知的共享控制框架TASC,用于远程操作。TASC通过视觉输入构建一个开放词汇的交互图,来表示功能性对象关系,从而推断用户意图。共享控制策略在抓取和对象交互过程中提供旋转辅助,并由视觉语言模型预测的空间约束引导。该框架旨在提高任务效率并减少用户输入,特别是在日常操作任务中实现零样本泛化。
训练数据相关
- MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation (https://arxiv.org/abs/2509.10260)
该论文介绍了 MagicMirror,一个用于文本到图像生成中细粒度伪影评估的综合框架。该框架包含一个详细的生成图像伪影分类法,以及一个包含34万张带有细粒度伪影标签的大规模人工标注数据集 MagicData340K。基于此数据集,训练了一个名为 MagicAssessor 的视觉语言模型 (VLM),用于提供详细的评估和相应的标签。同时,构建了一个自动化基准 MagicBench,用于评估当前 T2I 模型的图像伪影。
大模型的行业应用
- GLAM: Geometry-Guided Local Alignment for Multi-View VLP in Mammography (https://arxiv.org/abs/2509.10344)
该论文提出了 GLAM,一种用于乳腺摄影中多视图 VLM 预训练的几何引导局部对齐方法。该模型利用关于乳腺摄影多视图成像过程的先验知识,通过联合全局和局部、视觉-视觉和视觉-语言对比学习,学习局部交叉视图对齐和细粒度局部特征。在 EMBED 上进行预训练后,该模型在不同设置下的多个数据集上优于基线模型。 - Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration (https://arxiv.org/abs/2509.10059)
该论文介绍了 AVI-Math,首个旨在严格评估无人机图像中多模态数学推理能力的基准。该数据集包含 3,773 个高质量的车辆相关问题,涵盖几何、逻辑和代数等领域的 6 个数学科目和 20 个主题。通过对 14 个主流 VLM 的全面评估表明,这些模型在 AVI-Math 中的推理任务中表现不佳。 - SignClip: Leveraging Mouthing Cues for Sign Language Translation by Multimodal Contrastive Fusion (https://arxiv.org/abs/2509.10266)
该论文提出了 SignClip,一种通过多模态对比融合来利用口语线索进行手语翻译的新框架。SignClip 融合了手动和非手动线索,特别是空间手势和嘴唇运动特征。此外,SignClip 引入了一个具有多层次对齐目标的分层对比学习框架,确保了跨符号-嘴唇和视觉-文本模态的语义一致性。
文生图/文生视频
- Immunizing Images from Text to Image Editing via Adversarial Cross-Attention (https://arxiv.org/abs/2509.10359)
该论文提出了一种新颖的攻击,通过使用源图像的自动生成标题作为编辑提示的代理来破坏文本提示和图像的视觉表示之间的交叉注意,从而破坏图像编辑方法。 - Color Me Correctly: Bridging Perceptual Color Spaces and Text Embeddings for Improved Diffusion Generation (https://arxiv.org/abs/2509.10058)
该论文提出了一个无需训练的框架,该框架通过利用大型语言模型 (LLM) 来消除与颜色相关的提示的歧义,并直接在文本嵌入空间中指导颜色混合操作,从而提高颜色保真度。
其他
- VARCO-VISION-2.0 Technical Report (https://arxiv.org/abs/2509.10105)
该论文介绍了 VARCO-VISION-2.0,一个用于韩语和英语的开源双语视觉语言模型 (VLM),与之前的模型 VARCO-VISION-14B 相比,该模型的功能得到了改进。该模型支持对文档、图表和表格等复杂输入的多图像理解,并通过预测文本内容及其空间位置来提供布局感知的 OCR。 - LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA (https://arxiv.org/abs/2509.10026)
该论文介绍了LaV-CoT,第一个具有多方面奖励优化的语言感知视觉 CoT 框架。LaV-CoT 包含一个可解释的多阶段推理管道,包括带有边界框的文本摘要 (BBox)、语言识别、空间对象级字幕和逐步逻辑推理。 - Towards Understanding Visual Grounding in Visual Language Models (https://arxiv.org/abs/2509.10345)
该论文对现代通用视觉语言模型 (VLM) 的关键研究领域进行了回顾。论文概述了 grounding 在 VLM 中的重要性,然后描述了用于开发 grounded 模型的当代范例的核心组件,并检查了它们的实际应用,包括用于 grounded 多模态生成的基准和评估指标。
编辑精选
-
TASC: Task-Aware Shared Control for Teleoperated Manipulation (https://arxiv.org/abs/2509.10416): 该研究在远程操作领域具有重要意义,通过任务感知共享控制提升了操作效率和用户体验。
-
MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation (https://arxiv.org/abs/2509.10260):针对文生图领域中伪影问题,构建了大规模数据集和评估基准,有助于推动更高质量的图像生成。
-
LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA (https://arxiv.org/abs/2509.10026):该研究在多语言视觉问答方面取得了显著进展,提出的 LaV-CoT 框架在多个数据集上超越了现有模型,并在实际应用中展现出潜力。
更多推荐



所有评论(0)