提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-06-10 论文源抓取并去重 383 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1Per面向mance Analysis of YOLOv11 与 YOLOv8 面向 Mixed Traffic Object Detection under Adverse Weather Conditions in Developing Countries🔗
- 2ParseFixer:An Agentic 框架 面向 Document Parsing via Selective Multimodal Correction🔗
- 3AutoMine Solution 面向 AV2 2026 Scenario Mining Challenge🔗
- 4PROJECTMEM:A Local-First,Event-Sourced Memory 与 Judgment Layer 面向 AI Coding Agents🔗
- 5Corpus Augmentation 面向 Sign Language Translation via LLM-Guided Video Stitching🔗
- 6来自 Uni面向m to Learned Graph Priors:Diffusion 面向 Structure Discovery🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
核心:这篇论文主要解决提升 RAG 检索和知识库问答可靠性这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 rag、inference、deployment、safety 等线索来组织基准与评测任务、数据或评测流程实现提升 RAG 检索和知识库问答可靠性;主要论点是标题、摘要和公开信号显示:In modern vehicular systems, robust performance under harsh conditions has become a critical problem of autonomous driving。关键词:rag、inference、deployment、safety。代码/数据可用性需查看原文确认。
让 Agent 更可靠地调用工具和复用技能
核心:这篇论文主要解决让 Agent 更可靠地调用工具和复用技能这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 agent、serving、code、multimodal 等线索来组织多模态模型任务、数据或评测流程实现让 Agent 更可靠地调用工具和复用技能;主要论点是标题、摘要和公开信号显示:In this report, we present our third-place solution for the DataMFM Challenge Track 1: Document Parsing。关键词:agent、serving、code、multimodal。代码/数据可用性需查看原文确认。
让 Agent 更可靠地调用工具和复用技能
核心:这篇论文主要解决让 Agent 更可靠地调用工具和复用技能这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 serving、safety、evaluation、code 等线索来组织Agent 与工具调用任务、数据或评测流程实现让 Agent 更可靠地调用工具和复用技能;主要论点是标题、摘要和公开信号显示:With the development of autonomous driving systems, mining high-value, safety-critical, and planning-relevant scenarios from large-scale driving logs has become essential for data-driven evaluation。关键词:serving、safety、evaluation、code。代码/数据可用性需查看原文确认。
让 Agent 更可靠地调用工具和复用技能
核心:这篇论文主要解决让 Agent 更可靠地调用工具和复用技能这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 agent、rag、code、open-source 等线索来组织Agent 与工具调用任务、数据或评测流程实现让 Agent 更可靠地调用工具和复用技能;主要论点是标题、摘要和公开信号显示:AI coding assistants now support a growing share of software work, from quick scripts to production applications。关键词:agent、rag、code、open-source。代码/数据可用性需查看原文确认。
增强多模态模型理解图表和文档的能力
核心:这篇论文主要解决增强多模态模型理解图表和文档的能力这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 alignment、code、vision-language、synthetic data 等线索来组织数据工程任务、数据或评测流程实现增强多模态模型理解图表和文档的能力;主要论点是标题、摘要和公开信号显示:Sign language translation (SLT) converts sign language video into spoken language text and holds significant promise for improving accessibility and enabling communication between signing and non-signing communities。关键词:alignment、code、vision-language、synthetic data。代码/数据可用性需查看原文确认。
提升模型推理、规划和验证能力
核心:这篇论文主要解决提升模型推理、规划和验证能力这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 inference、alignment、benchmark、code 等线索来组织训练与后训练任务、数据或评测流程实现提升模型推理、规划和验证能力;主要论点是标题、摘要和公开信号显示:Neural relational inference (NRI) methods discover interaction graphs from trajectories through variational reasoning on discrete potential edges。关键词:inference、alignment、benchmark、code。代码/数据可用性需查看原文确认。
其他值得关注
FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
A Lightweight Multi-Agent Framework for Automated Concrete Barrier Design:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Human-Enhanced Loop Modeling (HELM): Agent-Based Finite Element Modeling of Concrete Bridge Barriers:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Tail-Aware Adaptive-k: Query-Adaptive Context Selection for Retrieval-Augmented Generation:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MoCA-Agent: A Market-of-Claims Code Agent for Financial and Numerical Reasoning:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
CCKS: Consensus-based Communication and Knowledge Sharing:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
AGE-MIL: Anchor-Guided Evidence Learning for Patient-Level Prediction:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
GraspLLM: Towards Zero-Shot Generalization on Text-Attributed Graphs with LLMs:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Critic Architecture Matters: Dual vs. Unified Critics for Humanoid Loco-Manipulation:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
When Do Data-Driven Systems Exhibit the Capability to Infer?:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
SAFER-Nav: Enhancing Safety for Visual Robot Navigation via Segmentation-Aware Fine-Tuning:涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
DeMix: Debugging Training Data with Mixed Data Error Types by Investigating Influence Vectors:涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
FreqKD: Frequency-Decoupled Cross-Modal Knowledge Distillation for Infrared Object Detection:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Context-Driven Incremental Compression for Multi-Turn Dialogue Generation:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Redesign Mixture-of-Experts Routers with Manifold Power Iteration:涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
System Report for CCL25-Eval Task 5: New Dataset and LoRA-Fine-Tuned Qwen2.5:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Latent World Recovery for Multimodal Learning with Missing Modalities:涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ALIGNBEAM : Inference-Time Alignment Transfer via Cross-Vocabulary Logit Mixing:涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。