多模态大模型研究每日简报【2025-09-16】
·
Agent相关
- Agentic Temporal Graph of Reasoning with Multimodal Language Models: A Potential AI Aid to Healthcare (https://arxiv.org/abs/2509.11944): 该论文提出了一种基于Agent的、时序图推理框架,用于处理医疗领域的多模态数据,旨在辅助医护人员进行疾病诊断。该框架通过有向图模拟推理过程中的动态变化,支持回溯、内容优化以及增删理由,以达成更佳的推荐或答案。
- VisDocSketcher: Towards Scalable Visual Documentation with Agentic Systems (https://arxiv.org/abs/2509.11942): 提出VisDocSketcher,这是第一个使用Agentic LLM系统自动生成可视化文档的方法。该方法结合静态分析和LLM Agent,以识别代码中的关键元素并生成相应的可视化表示。同时提出了一个评估框架,用于评估生成的视觉文档的质量。
- PrivWeb: Unobtrusive and Content-aware Privacy Protection For Web Agents (https://arxiv.org/abs/2509.11939): 针对Web Agent访问界面带来的隐私风险,设计并实现了PrivWeb,这是一款在Web Agent上的插件,利用本地LLM根据用户偏好对界面上的私人信息进行匿名化处理。通过用户研究表明,PrivWeb能够降低用户感知的隐私风险,且不会增加认知负担,并提高了整体满意度。
训练数据相关
- OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling (https://arxiv.org/abs/2509.12201): 为了推动通用4D世界建模的发展,该论文推出了OmniWorld数据集,它是一个大规模、多领域、多模态的数据集,专为捕捉空间几何和时间动态而设计。该数据集包括新收集的OmniWorld-Game数据集和多个精选的公共数据集,涵盖了不同的领域,提供了更丰富的模态覆盖、更大的规模和更真实的动态交互。
- Advancing Medical Artificial Intelligence Using a Century of Cases (https://arxiv.org/abs/2509.12194): 为了促进医学AI的发展,研究人员构建了CPC-Bench,一个基于《新英格兰医学杂志》临床病理讨论会(CPCs)百年病例的医学AI基准。CPC-Bench涵盖10个基于文本和多模态的任务,通过医生标注和自动化处理创建,并发布了AI讨论者“Dr. CaBot”。
- MVQA-68K: A Multi-dimensional and Causally-annotated Dataset with Quality Interpretability for Video Assessment (https://arxiv.org/abs/2509.11589): 针对视频质量评估(VQA)缺乏全面性和可解释性的问题,论文提出了一个新型多维VQA数据集MVQA-68K,该数据集包含超过68,000个精心标注的视频,涵盖七个关键质量维度:整体美学、相机运动、动态程度、纹理细节、构图、视觉质量和事实一致性。每个注释都包含详细的思维链推理,以促进可解释性和全面理解。
大模型的行业应用
- Multi Anatomy X-Ray Foundation Model (https://arxiv.org/abs/2509.12146): 该论文介绍了一种多解剖结构的X射线基础模型XR-0,该模型使用自监督学习在包含不同解剖区域的115万张图像的大型私有数据集上进行训练,并在包括分类、检索、分割、定位、视觉定位和报告生成在内的12个数据集和20个下游任务上进行评估。研究结果表明,解剖多样性和监督对于构建鲁棒的通用医学视觉模型至关重要。
- EMeRALDS: Electronic Medical Record Driven Automated Lung Nodule Detection and Classification in Thoracic CT Images (https://arxiv.org/abs/2509.11714): 本文提出了一种计算机辅助诊断(CAD)系统,该系统利用大型视觉语言模型(VLM)对计算机断层扫描(CT)图像中的肺结节进行精确检测和分类。
- CoachMe: Decoding Sport Elements with a Reference-Based Coaching Instruction Generation Model (https://arxiv.org/abs/2509.11698): 本文提出了一种基于参考的模型CoachMe,该模型分析学习者的运动与参考运动之间在时间和物理方面的差异。这种方法能够学习领域知识,并获得类似教练的思维过程,从而有效地识别运动错误并提供改进方法的反馈。
- Adapting and Evaluating Multimodal Large Language Models for Adolescent Idiopathic Scoliosis Self-Management: A Divide and Conquer Framework (https://arxiv.org/abs/2509.11645): 本研究对多模态大语言模型(MLLM)在青少年特发性脊柱侧弯(AIS)自我管理中的应用进行了首次全面评估。研究发现MLLM在解释复杂的脊柱X光片和理解AIS护理知识方面的能力存在局限性。
- Measuring Visual Understanding in Telecom domain: Performance Metrics for Image-to-UML conversion using VLMs (https://arxiv.org/abs/2509.11667): 在电信领域,大量3GPP文档包含序列图,而VLM的进步简化了此类图像到机器可读PlantUML (puml) 格式的转换。本文设计了一套评价指标,通过比较各种组件的puml脚本,来衡量这种转换的效果。
底层模型架构
- SENSE models: an open source solution for multilingual and multimodal semantic-based tasks (https://arxiv.org/abs/2509.12093): 本文介绍了一种名为SENSE (Shared Embedding for N-lingual Speech and tExt) 的开源解决方案,它基于SAMU-XLSR框架,并在概念上类似于Meta AI的SONAR模型。
文生图/文生视频
- LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence (https://arxiv.org/abs/2509.12203): 本文提出LazyDrag,这是一种用于多模态扩散Transformer的首个基于拖拽的图像编辑方法,它直接消除了对隐式点匹配的依赖。具体来说,该方法从用户拖拽输入生成显式对应图,作为提升注意力控制的可靠参考。
- Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking (https://arxiv.org/abs/2509.12046): 论文提出了一种名为Structured Masking for AR-based Layout-to-Image (SMARLI) 的框架,用于布局到图像的生成,该框架有效地将空间布局约束集成到基于AR的图像生成中。
- Learning to Generate 4D LiDAR Sequences (https://arxiv.org/abs/2509.11959): 本文提出了LiDARCrafter,一个统一的框架,可以将自由形式的语言转换成可编辑的LiDAR序列。
- Do It Yourself (DIY): Modifying Images for Poems in a Zero-Shot Setting Using Weighted Prompt Manipulation (https://arxiv.org/abs/2509.11878): 论文提出了一种新的加权提示操纵(WPM)技术,该技术系统地修改扩散模型中的注意权重和文本嵌入。通过动态调整特定词的重要性,WPM增强或抑制它们在最终生成图像中的影响,从而生成在零样本设置中能够修改图像以适应诗歌的系统。
其他
- Preservation of Language Understanding Capabilities in Speech-aware Large Language Models (https://arxiv.org/abs/2509.12171): 论文提出了C3T (Cross-modal Capabilities Conservation Test),一个新的基准,用于评估语音感知大语言模型的性能。该基准利用文本任务和语音克隆文本到语音模型,量化当模型通过语音输入访问时,语言理解能力被保留的程度。C3T量化了模型对于不同类别说话者的公平性以及在文本和语音模态之间的鲁棒性。
- Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models (https://arxiv.org/abs/2509.12132): 论文提出了一个新的视觉推理模型Reflection-V,通过构建以视觉为中心的推理数据和基于视觉注意力的奖励模型来增强视觉语言模型中的视觉反射能力。
- Embodied Navigation Foundation Model (https://arxiv.org/abs/2509.12129): 本文介绍了一种跨具身、跨任务的导航基础模型 (NavFoM),该模型在包含四足动物、无人机、轮式机器人和车辆的八百万个导航样本上进行训练,涵盖了视觉语言导航、目标搜索、目标跟踪和自动驾驶等不同任务。
- MMORE: Massive Multimodal Open RAG & Extraction (https://arxiv.org/abs/2509.11937): 论文介绍了一个开源管道MMORE,用于大规模多模态开放检索增强生成和提取。MMORE支持超过15种文件类型,并将它们处理成统一的格式,以支持LLM的下游应用。
- EgoMem: Lifelong Memory Agent for Full-duplex Omnimodal Models (https://arxiv.org/abs/2509.11914): 论文介绍EgoMem,这是一种为处理实时全模态流的全双工模型量身定制的终身记忆Agent。EgoMem使实时模型能够直接从原始视听流中识别多个用户,以提供个性化响应,并维护从视听历史中提取的用户的长期知识,包括事实、偏好和社交关系。
- Integrating Prior Observations for Incremental 3D Scene Graph Prediction (https://arxiv.org/abs/2509.11895): 论文介绍了一种用于增量3D场景图预测的新型异构图模型,该模型将额外的多模态信息(例如,先前的观察)直接集成到消息传递过程中。
- Synthetic Captions for Open-Vocabulary Zero-Shot Segmentation (https://arxiv.org/abs/2509.11840): 论文通过密集地将图像与由VLM生成的合成描述对齐来桥接这两个方向。合成字幕成本低廉、可扩展且易于生成,是密集对齐方法的高级语义理解的绝佳来源。
- SpecVLM: Fast Speculative Decoding in Vision-Language Models (https://arxiv.org/abs/2509.11815): 论文介绍了SpecVLM,一个实用的系统,它(1)建立了一个强大的EAGLE-2风格的基线EagleVLM,与完全自回归推理相比,提供了1.5-2.3倍的端到端加速,并且(2)通过弹性视觉压缩器进一步加速了VLM推理,该压缩器自适应地在剪枝、池化、卷积和重采样器原语之间进行选择,以平衡每个输入的FLOP/参数和准确性。
- FineQuest: Adaptive Knowledge-Assisted Sports Video Understanding via Agent-of-Thoughts Reasoning (https://arxiv.org/abs/2509.11796): 论文提出了一种训练自由的框架FineQuest,该框架利用认知科学启发的双模推理:i) 用于直接体育查询的反应式推理和 ii) 用于更复杂查询的审议式推理。
- AssemMate: Graph-Based LLM for Robotic Assembly Assistance (https://arxiv.org/abs/2509.11617): 论文提出AssemMate,它利用图(一种简洁而准确的知识表示形式)作为输入。这种基于图的LLM支持知识图问答(KGQA),支持人机交互和特定产品的装配任务规划。
编辑精选
- OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling (https://arxiv.org/abs/2509.12201): 高质量的数据集是AI研究的基础,OmniWorld的发布将有助于推动4D世界建模领域的发展。
- Advancing Medical Artificial Intelligence Using a Century of Cases (https://arxiv.org/abs/2509.12194): 结合百年医学病例构建的benchmark,对于医学AI研究具有重要的价值,值得关注。
- AssemMate: Graph-Based LLM for Robotic Assembly Assistance (https://arxiv.org/abs/2509.11617): 提出了一种基于图的LLM框架,用于机器人装配辅助,将知识图作为输入,实现了机器人与人类的自然语言交互和装配任务规划。
更多推荐



所有评论(0)