增强多模态模型理解图表和文档的能力、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:增强多模态模型理解图表和文档的能力、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-06-24 论文源抓取并去重 337 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:增强多模态模型理解图表和文档的能力、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
增强多模态模型理解图表和文档的能力
中文标题Action ControlNet:A Lightweight Delay-Aware Adapter 面向 Smooth Asynchronous Control in 视觉-语言-动作模型
信号显示视觉-语言-动作( VLA )模型已显示出通用机器人操纵的强大潜力,但其推理延迟仍然是稳定高频控制的主要障碍
关键词inferencelatencyvision-languagerobot
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题半监督胎儿超声分割的双协议一致性学习
信号显示母胎超声是监测胎儿发育的主要成像方式,但由于像素级注释的稀缺性,精确的自动分割仍然具有挑战性
关键词ragdeploymentalignmentcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题泄漏电路秘密:对图神经网络的梯度泄漏攻击
信号显示随着图神经网络( GNN )成为电路设计和分析中关键任务的标准工具,其安全和隐私风险需要仔细关注
关键词servingcompressionevaluationbenchmark
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题从稀疏和不完美的2D锚点到一致的3D高斯街景:支持感知外观
信号显示图像先验可以合成3D高斯街景的目标条件,但独立编辑的视图不会定义相干的3D目标
关键词inferencedeploymentalignmentevaluation
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题使用VLM进行零点噪声测试时间适应的双重分布估计
信号显示虽然测试时间适应( TTA )使视觉语言模型能够适应而无需昂贵的再培训,但它仍然非常容易受到现实应用中普遍存在的分布外( OOD )异常值的影响
关键词inferencebenchmarkcodevision-language
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题通过物理启发的全球-局部解耦实现高效的真实世界除雾
信号显示由于散射的空间和光谱变化,真实世界的单图像去雾定位非常糟糕,而实际部署需要轻量级和低延迟模型
关键词raginferencedeploymentlatency
代码/数据需查看原文确认
其他值得关注
OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning
中文标题OPERA :通过基于客观困惑的强化学习来调整开放式推理
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction
中文标题MedGuards:Multi-Agent System 面向 Reliable Medical Error Detection 与 Correction
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题SSMNBench :通过单视图充分性和多视图必要性来诊断基于图像的跨视图人体-对象理解
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
TACO: Towards Task-Consistent Open-Vocabulary Adaptation in Video Recognition
中文标题TACO :在视频识别中实现任务一致的开放式词汇适应
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models
中文标题PolicyAlign:Direct Policy-Based Safety Alignment 面向 Large Language Models
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Beyond Visual Forensics: Auditing Multimodal Robustness for Synthetic Medical Image Detection
中文标题超越视觉取证:审核合成医学图像检测的多模式鲁棒性
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题V-Zero :使用对比证据选通进行细粒度视觉推理的无答案标签政策性蒸馏
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
OrthoTrack: Continuous 6-DoF UAV Trajectory Estimation Anchored in Public Orthophotos
中文标题OrthoTrack :锚定在公共正射照片中的连续6自由度无人机轨迹估计
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Autodata: An agentic data scientist to create high quality synthetic data
中文标题Autodata :代理数据科学家,创建高质量的合成数据
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation
中文标题MVTrack4Gen:Multi-View Point Tracking as Geometric Supervision 面向 4D Video Generation
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Same Evidence, Different Answer: Auditing Order Sensitivity in Multimodal Large Language Models
中文标题相同的证据,不同的答案:多式联运大型语言模型中的审核顺序敏感性
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题不可触发的安全内核:人工智能代理和其他可逃避的人工智能系统的执行时间AI对齐
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题OCR推理有多强大?评估视觉扰动下视觉语言模型的OCR推理鲁棒性
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning
中文标题检测、取消学习、还原:保护文本摘要模型免受数据中毒
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It
中文标题为什么要使用多步骤工具-使用强化学习崩溃以及监督信号如何修复它
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题表格基础模型中注意层的隐私漏洞和高风险查询的保护
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models
中文标题SpeechEQ:基准ing Emotional Intelligence Quotient in Socially Aware Voice Conversational Models
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题Pulmonary Embolism Risk Stratification 来自 CTPA 与 Medical Records:Vascular Graphs Are Not All You Need
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
DSP-SLAM++: A Unified Framework for Multi-Class, High-Fidelity Object SLAM in the Wild
中文标题DSP-SLAM + + :野外多类高保真对象SLAM的统一框架
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning
中文标题USS :具有潜在动态学习的体验式视觉跟踪的统一空间语义提示
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。