让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力、增强多模态模型理解图表和文档的能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力、增强多模态模型理解图表和文档的能力。
本期从 2026-06-05 论文源抓取并去重 344 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1Beyond Waypoints:A Trajectory-Centric Waypointing Paradigm 面向 Vision-Language Navigation🔗
- 2Seeing Without Exposing:Adaptive Privacy Control 面向 Open-World,Context-Hungry MLLMs🔗
- 3When Recovery Matters:The Blind Spot of Surrogate Privacy in MLLM Editing🔗
- 4来自 Privacy to Workflow Integrity:Communication-Graph Metadata in Autonomous Agent Interoperability🔗
- 5Native3D:End-to-End 3D Scene Generation via Unified Mesh-Texture Modeling 与 Semantic Alignment🔗
- 6Beyond Post-hoc Explanation:面向 Glassbox AI via Probabilistic Mediation🔗
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力、增强多模态模型理解图表和文档的能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
核心:这篇论文主要解决让 Agent 更可靠地调用工具和复用技能这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 agent、benchmark、vision-language、agents 等线索来组织Agent 与工具调用任务、数据或评测流程实现让 Agent 更可靠地调用工具和复用技能;主要论点是标题、摘要和公开信号显示:Vision-Language Navigation in Continuous Environments (VLN-CE) requires agents to follow natural-language instructions while navigating in real-world-like environments。关键词:agent、benchmark、vision-language、agents。代码/数据可用性需查看原文确认。
提升模型推理、规划和验证能力
核心:这篇论文主要解决提升模型推理、规划和验证能力这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 rag、evaluation、benchmark、multimodal 等线索来组织基准与评测任务、数据或评测流程实现提升模型推理、规划和验证能力;主要论点是标题、摘要和公开信号显示:Multimodal large language models (MLLMs) have raised new privacy challenges。关键词:rag、evaluation、benchmark、multimodal。代码/数据可用性需查看原文确认。
增强多模态模型理解图表和文档的能力
核心:这篇论文主要解决增强多模态模型理解图表和文档的能力这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 serving、evaluation、benchmark、multimodal 等线索来组织基准与评测任务、数据或评测流程实现增强多模态模型理解图表和文档的能力;主要论点是标题、摘要和公开信号显示:Multimodal Large Language Models (MLLMs) enable flexible instruction-driven image editing, but privacy risks arise when user images expose diverse and user-specific private content。关键词:serving、evaluation、benchmark、multimodal。代码/数据可用性需查看原文确认。
让 Agent 更可靠地调用工具和复用技能
核心:这篇论文主要解决让 Agent 更可靠地调用工具和复用技能这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 agent、workflow、rag、inference 等线索来组织Agent 与工具调用任务、数据或评测流程实现让 Agent 更可靠地调用工具和复用技能;主要论点是标题、摘要和公开信号显示:Agent-interoperability protocols such as A2A and MCP standardize what agents say to one another, but assume address-based transport over HTTP(S)。关键词:agent、workflow、rag、inference。代码/数据可用性需查看原文确认。
提升 RAG 检索和知识库问答可靠性
核心:这篇论文主要解决提升 RAG 检索和知识库问答可靠性这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 rag、alignment、code、diffusion 等线索来组织视觉与图像生成任务、数据或评测流程实现提升 RAG 检索和知识库问答可靠性;主要论点是标题、摘要和公开信号显示:This paper presents Native3D, the first end-to-end 3D scene generation framework that completely bypasses 2D intermediate representations。关键词:rag、alignment、code、diffusion。代码/数据可用性需查看原文确认。
提升模型推理、规划和验证能力
核心:这篇论文主要解决提升模型推理、规划和验证能力这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 inference、alignment、code、api 等线索来组织代码智能任务、数据或评测流程实现提升模型推理、规划和验证能力;主要论点是标题、摘要和公开信号显示:Large language models are rapidly becoming infrastructural components in high-stakes institutional settings, including public administration, legal reasoning, and healthcare, where opacity is not merely inconvenient but institutionally and legally untenable。关键词:inference、alignment、code、api。代码/数据可用性需查看原文确认。
其他值得关注
Decision-Aware Evaluation of Physics-Informed Surrogates:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
REMEDI: A Benchmark for Retention and Unlearning Evaluation in Multi-label Clinical Disease Inference:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
GP-Adapter: Gaussian Process CLIP-Adapter for Few-Shot Out-of-Distribution Detection:涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
LARA: Latent Action Representation Alignment for Vision-Language-Action Models:涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
dots.tts Technical Report:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Beyond Rubrics: Exploration-Guided Evaluation Skills for Reward Modeling:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
STREAM: Stochastic Riemannian Flow Matching with Anisotropic Decoder for Digital Histopathology Image Generation:涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
GuideCAD: A Lightweight Multimodal Framework for 3D CAD Model Generation via Prefix Embedding:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
A Geometric View for Understanding Concept Learning and Neuron Interpretation in Sparse Autoencoders:涉及可解释性中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization:涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Principles of Concept Representation in Sentence Encoders:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Accelerating Reproducible Research in Synthetic EHR Generation:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
From Vision to Text: A Compact Multimodal Approach for Robust, Cross-Domain Presentation Attack Detection on ID Cards:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
ActionMap: Robot Policy Learning via Voxel Action Heatmap:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Workflow-to-Skill: Skill Creation via Routing-Workflow-Semantics-Attachments Decomposition:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Stability beyond Bounded Differences: Sharp Generalization Bounds under Finite $L_p$ Moments:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
SEAM: Shortcut-Aware Real-Time Detection of Scripted vs. Spontaneous Speech for Interview Guardrails:涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
AdMem: Advanced Memory for Task-solving Agents:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。