提升模型推理、规划和验证能力、增强多模态模型理解图表和文档的能力、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升模型推理、规划和验证能力、增强多模态模型理解图表和文档的能力、提升 RAG 检索和知识库问答可靠性。
本期从 2026-07-30 论文源抓取并去重 469 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1FiRE:通过用于复杂图像检索的细粒度上下文学习增强MLLM🔗
- 2视觉语言模型中基于方向的推理时间防御的跨架构审计🔗
- 3CoRE-UIR:Prior-guided common 与 residual experts 面向 efficient all-in-one remote sensing image restoration🔗
- 4在视觉语言模型中统一对抗性强的模型专家🔗
- 5DECODE:Tackling Representation 与 Decision Degradation in Continual AI-Generated Image Detection🔗
- 6RoboBRIDGE:A Modular 框架 面向 Bridging Policies to Robust Real-World Robotic Agents🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升模型推理、规划和验证能力、增强多模态模型理解图表和文档的能力、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升模型推理、规划和验证能力
中文标题FiRE :通过用于复杂图像检索的细粒度上下文学习增强MLLM
信号显示由于其强大的可广义多模态处理和推理能力,多模态大语言模型( MLLM )已显示出作为通用图像检索器的巨大潜力,有效地解决了现实世界中各种图像检索任务
关键词retrievalalignmentmultimodalfine-tuning
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题视觉语言模型中基于方向的推理时间防御的跨架构审计
信号显示针对视觉语言模型越狱的推理时间防御通常会从所选解码器层的残留流中减去校准方向
关键词inferencealignmentcodemultimodal
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题CoRE-UIR:Prior-guided common 与 residual experts 面向 efficient all-in-one remote sensing image restoration
信号显示无人机( UAV )和卫星获取的遥感图像通常会因恶劣天气、光照变化和成像伪影而退化,这可能共同发生并共同诱发全球分布变化和局部结构性损坏
关键词ragevaluationcodememory
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题在视觉语言模型中统一对抗性强的模型专家
信号显示视觉语言模型( VLM ) (如CLIP )容易受到对抗性攻击,给现实应用和部署带来严重问题
关键词servingdeploymentalignmentevaluation
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题DECODE:Tackling Representation 与 Decision Degradation in Continual AI-Generated Image Detection
信号显示随着生成模型的不断发展,人工智能生成的图像检测器必须逐步适应新兴的生成领域,同时保留从以前的生成领域获得的知识
关键词ragservingalignmentcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题RoboBRIDGE:A Modular 框架 面向 Bridging Policies to Robust Real-World Robotic Agents
信号显示视觉-语言-动作( VLA )模型作为一种可扩展的机器人操作方法吸引了越来越多的兴趣
关键词agentdeploymentvision-languagefine-tuning
代码/数据需查看原文确认
其他值得关注
中文标题从头开始多Agent编码中作为一流公民的协调模式的实证研究
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题MemTxn:A Transaction Boundary 面向 Source-Supported Updates 与 Complete-State Recovery in Agent Memory
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Thinking Once Is Enough: Intermediate-Layer Evidence Routing for High-Resolution VQA
中文标题Thinking Once Is Enough:Intermediate-Layer Evidence Routing 面向 High-Resolution VQA
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Hallucinations Leave a Grounding Signature:Verifier-Guided Decoding for Selective Object Correction
中文标题幻觉留下基础特征:验证者引导的选择性物体校正解码
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Semantic-Aligned Structural Abstraction for Multimodal Sentiment Analysis
中文标题多模态情感分析的语义对齐结构抽象
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Gradient-free Task-Conditioned Retrieval for On-Device In-Context Learning
中文标题用于设备上下文学习的无梯度任务条件检索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation
中文标题RefineSVG:Visual Feedback-Driven Reinforcement Learning 面向 Image-to-SVG Generation
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Stop Shipping AI Agents on Faith: Capability Is Not Production Readiness
中文标题停止运送人工智能代理:能力不是生产就绪
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers
中文标题见证证据组合:封闭式多式联运答案的单次预填充风险检测
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
FedOGL: Combating Catastrophic Forgetting in Federated Open-World Multimodal Graph Learning
中文标题FedOGL :在联邦开放世界多模态图学习中打击灾难性遗忘
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models
中文标题MMOOC:A Comprehensive 基准 面向 Out-of-Context 评测 in Multimodal Large Language Models
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题DualAnchor:Preserving Language Priors 与 Improving Lexical Fidelity in Gloss-Free Sign Language Translation
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Back from the Future: Key-Value Cache Management by Counter-Causal Surprise
中文标题Back 来自 the Future:Key-Value Cache Management by Counter-Causal Surprise
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
A Systems Engineering Framework for Vision-Language-Enabled UAV Triage and Disaster Response
中文标题支持视觉语言的无人机分流和灾难响应的系统工程框架
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Compliance2LoRA :通过超网络生成的LoRA适配器对任意策略子集进行按需安全协调
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
MUGEN: A Unified Framework for Efficient Motion Understanding and Generation
中文标题MUGEN:A Unified 框架 面向 Efficient Motion Understanding 与 Generation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA
中文标题Objective-Aligned Direct Answer SFT 面向 Robust Multi-Frame Medical VQA
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
KAISEN: Reproducible Subgroup Fairness Auditing for Clinical Risk Models
中文标题KAISEN:Reproducible Subgroup Fairness Auditing 面向 Clinical Risk Models
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs
中文标题重新思考本地计算机使用代理中的推理时间缩放:故障模式和计算权衡
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
APO: Unsupervised Atomic Policy Optimization for 3D Structure Prediction of Atomic Systems
中文标题APO:Unsupervised Atomic Policy Optimization 面向 3D Structure Prediction of Atomic Systems
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。