Agent相关

  • GDS Agent: A Graph Algorithmic Reasoning Agent (https://arxiv.org/abs/2508.20637): 本文提出了一个名为GDS(Graph Data Science)Agent,它通过将一系列图算法作为工具集成到大型语言模型(LLM)中,从而增强LLM处理和推理大规模图结构数据的能力。该Agent包含预处理(检索)和后处理算法结果,使得用户能够询问需要图算法推理的问题,并获得准确且有根据的答案。同时,该Agent还提出了一个新的基准,用于评估中间工具调用和最终响应。
  • Multi-Agent Penetration Testing AI for the Web (https://arxiv.org/abs/2508.20816): 本文提出了MAPTA,一个用于自主Web应用程序安全评估的多智能体系统,它将大型语言模型编排与工具基础执行和端到端漏洞验证相结合。实验结果表明,MAPTA在XBOW基准测试中取得了76.9%的总体成功率,并在实际应用中发现了多个关键漏洞。
  • Persode: Personalized Visual Journaling with Episodic Memory-Aware AI Agent (https://arxiv.org/abs/2508.20585): 论文介绍了一个名为Persode的个性化视觉日记系统,该系统专为Z世代和Alpha世代设计。Persode利用情景记忆感知对话代理和自动视觉叙事,通过定制化的引导流程和检索增强生成(RAG)框架,将用户体验转化为引人入胜的视觉故事,从而弥合传统日记与新兴用户偏好之间的差距。

训练数据相关

  • “Humor, Art, or Misinformation?”: A Multimodal Dataset for Intent-Aware Synthetic Image Detection (https://arxiv.org/abs/2508.20670): 为了弥补现有AI生成图像数据集缺乏意图标注的不足,该研究引入了S-HArM数据集,该数据集包含9,576个来自Twitter/X和Reddit的图像-文本对,并标注为幽默/讽刺、艺术或虚假信息。该研究还探索了三种提示策略来构建大规模合成训练数据集,结果表明,在图像和多模态引导数据上训练的模型能更好地泛化到真实世界的场景。
  • InterAct-Video: Reasoning-Rich Video QA for Urban Traffic (https://arxiv.org/abs/2507.14743): 该论文提出了InterAct VideoQA,这是一个专门为交通监控任务设计的数据集,旨在评估和提升VideoQA模型在理解复杂交通场景中的能力。数据集包含从不同路口收集的8小时真实交通视频,并标注了超过25,000个问答对,涵盖了时空动态、车辆交互、事件检测等关键交通属性。

大模型的行业应用

  • DrivingGaussian++: Towards Realistic Reconstruction and Editable Simulation for Surrounding Dynamic Driving Scenes (https://arxiv.org/abs/2508.20965): 本文提出了一个高效且有效的框架DrivingGaussian++,用于真实地重建和可控地编辑周围的动态自动驾驶场景。该框架使用增量3D高斯模型建模静态背景,并使用复合动态高斯图重建移动物体,从而确保准确的位置和遮挡。通过集成LiDAR先验,实现了详细和一致的场景重建,并在动态场景重建和照片级真实感环视合成方面优于现有方法。DrivingGaussian++支持动态驾驶场景的免训练可控编辑,包括纹理修改、天气模拟和物体操作,从而显著提高场景多样性。
  • MedGR 2 ^2 2: Breaking the Data Barrier for Medical Reasoning via Generative Reward Learning (https://arxiv.org/abs/2508.20549): 提出了一种用于医学推理的生成奖励学习框架(MedGR 2 ^2 2),旨在克服医学领域高质量标注数据稀缺的问题。该框架通过共同开发数据生成器和奖励模型,自动生成高质量多模态医学数据,从而实现自我完善的良性循环。实验表明,使用MedGR 2 ^2 2生成的数据进行监督微调(SFT)已经超越了在大型人工数据集上训练的基线模型。

文生图/文生视频

  • Dress&Dance: Dress up and Dance as You Like It - Technical Preview (https://arxiv.org/abs/2508.21070): 本文提出了一种视频扩散框架Dress&Dance,可以生成高质量的虚拟试穿视频,视频分辨率为1152x720,帧率为24 FPS,时长为5秒。该框架仅需单张用户图像,支持各种上衣、下装和连衣裙的试穿,以及单次同时试穿上衣和下装。
  • Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning (https://arxiv.org/abs/2508.20751): 本文提出了一种基于成对偏好奖励的GRPO(Group Relative Policy Optimization)方法,用于稳定文本到图像的强化学习,从而解决使用点式奖励模型进行打分时容易出现的奖励利用问题。此外,本文还提出了UniGenBench,一个统一的文本到图像基准测试,包含600个提示,涵盖5个主要主题和20个子主题。
  • MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation (https://arxiv.org/abs/2508.19320): 提出了一种自回归视频生成框架,该框架支持交互式多模态控制和低延迟外推,可用于实时生成交互式数字人视频。该框架接受包括音频、姿势和文本在内的多模态条件编码,并输出空间和语义连贯的表示,以指导扩散头的去噪过程。

底层模型架构

  • MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs (https://arxiv.org/abs/2508.21044): 本文提出了一种名为MMG-Vid的无需训练的视觉token剪枝框架,通过在片段级别和token级别最大化边际收益来减少冗余。该框架根据帧相似度将视频分割成片段,然后动态地为每个片段分配token预算,以最大化每个片段的边际收益。此外,还提出了一种时间引导的DPC算法,该算法共同建模帧间唯一性和帧内多样性,从而最大化每个token的边际收益。
  • Escaping Plato’s Cave: JAM for Aligning Independently Trained Vision and Language Models (https://arxiv.org/abs/2507.01201): 本文提出了一种名为Joint Autoencoder Modulator (JAM)的方法,该方法通过联合训练具有协同重建和跨模态对齐目标的模态特定自编码器来对齐冻结的单模态模型。实验结果表明,JAM能够可靠地诱导对齐,即使在独立训练的表示之间也是如此。

训练策略

  • Improving Alignment in LVLMs with Debiased Self-Judgment (https://arxiv.org/abs/2508.20655): 提出了一种新的方法,通过生成去偏的自我判断分数,使模型能够自主地提高对齐效果,从而减少幻觉、增强安全性和提高整体能力,无需依赖外部资源。该方法可以增强解码策略和偏好调整过程。

多模态理解

  • CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification (https://arxiv.org/abs/2508.21046): 提出了一种名为CogVLA的认知对齐视觉-语言-动作框架,该框架利用指令驱动的路由和稀疏化来提高效率和性能。CogVLA借鉴了人类多模态协调的灵感,并引入了一个三阶段渐进式架构。在LIBERO基准测试和真实机器人任务上的大量实验表明,CogVLA实现了最先进的性能,同时降低了训练成本和推理延迟。
  • Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation (https://arxiv.org/abs/2508.19958): 提出了一种名为Long-VLA的端到端VLA模型,专为长程机器人任务设计。Long-VLA采用了一种新的阶段感知输入掩蔽策略,该策略自适应地将每个子任务分割成移动和交互阶段,使模型能够专注于与阶段相关的感觉线索,并增强子任务兼容性。
  • See then Tell: Enhancing Key Information Extraction with Vision Grounding (https://arxiv.org/abs/2409.19573): 提出了一种名为STNet(See then Tell Net)的新型端到端模型,旨在提供具有相关视觉基础的精确答案,实现关键信息提取(KIE)性能的显著进步。STNet利用一个独特的 token来观察相关的图像区域,并由一个解码器解释与该token相关的物理坐标。
  • CVBench: Evaluating Cross-Video Synergies for Complex Multimodal Understanding and Reasoning (https://arxiv.org/abs/2508.19542): 提出一个名为CVBench 的基准测试,用于评估多模态大语言模型在跨视频关系推理方面的能力。 该基准测试包含 1,000 个问题-答案对,涵盖三个层次:跨视频对象关联、跨视频事件关联和跨视频复杂推理。对 10 多个领先的多模态大语言模型的评估表明,即使是像 GPT-4o 这样的顶级模型,在因果推理任务上也仅达到 60% 的准确率,而人类的准确率则为 91%。
  • Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models (https://arxiv.org/abs/2508.19650): 提出了一个名为Video-LevelGauge的基准测试,旨在系统地评估大型视频语言模型(LVLM)中的位置偏差。该基准测试采用标准化的探测和定制的上下文设置,允许灵活控制上下文长度、探测位置和上下文类型,以模拟不同的真实场景。

安全

  • Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application (https://arxiv.org/abs/2503.06989): 该研究引入了越狱概率的概念,以量化输入破坏多模态大型语言模型(MLLM)的潜力,并基于此提出了基于越狱概率的攻击(JPA)和多模态JPA(MJPA),以及基于越狱概率的微调(JPF)防御方法,实验结果表明,这些方法能够有效提升攻击成功率并降低越狱风险。
  • Towards Mechanistic Defenses Against Typographic Attacks in CLIP (https://arxiv.org/abs/2508.20570): 本文分析了CLIP视觉编码器在印刷攻击下的行为,定位了模型后半部分中专门的注意力头,这些注意力头有因果关系地提取印刷信息并将其传输到cls token。在此基础上,本文提出了一种通过选择性地消融由注意力头组成的印刷电路来防御CLIP模型免受印刷攻击的方法。
  • When Memory Becomes a Vulnerability: Towards Multi-turn Jailbreak Attacks against Text-to-Image Generation Systems (https://arxiv.org/abs/2504.20376): 本文揭示了文本到图像生成系统中的记忆机制可能加剧越狱攻击的风险,并提出了一种名为Inception的多轮越狱攻击方法,该方法通过在对话开始时将恶意信息嵌入记忆中,从而绕过安全过滤器,诱导生成不安全图像。

编辑精选

  1. MedGR 2 ^2 2: Breaking the Data Barrier for Medical Reasoning via Generative Reward Learning (https://arxiv.org/abs/2508.20549): 解决了医学领域数据稀缺的问题,提出了一种新颖的生成奖励学习框架,具有很高的实际应用价值。
  2. GDS Agent: A Graph Algorithmic Reasoning Agent (https://arxiv.org/abs/2508.20637): 通过集成图算法,显著增强了LLM处理和推理图结构数据的能力,为知识图谱等领域的应用提供了新的思路。
  3. CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification (https://arxiv.org/abs/2508.21046): 在VLA模型中引入认知对齐机制,提高了模型效率和性能,对机器人控制等领域具有重要意义。
  4. DrivingGaussian++: Towards Realistic Reconstruction and Editable Simulation for Surrounding Dynamic Driving Scenes (https://arxiv.org/abs/2508.20965): 提出了一个高效且有效的框架,用于真实地重建和可控地编辑周围的动态自动驾驶场景。该框架支持动态驾驶场景的免训练可控编辑,包括纹理修改、天气模拟和物体操作,从而显著提高场景多样性。
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐