提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-06-11 论文源抓取并去重 395 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
核心:这篇论文主要解决提升 RAG 检索和知识库问答可靠性这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 rag、safety、evaluation、benchmark 等线索来组织机器人与具身智能任务、数据或评测流程实现提升 RAG 检索和知识库问答可靠性;主要论点是标题、摘要和公开信号显示:Wet-lab robots can improve the reproducibility, throughput, and safety of biomedical experiments, but scaling their learning requires customizable simulators for safe and reproducible task generation, open editable laboratory assets, and efficient pipelines th。关键词:rag、safety、evaluation、benchmark。代码/数据可用性需查看原文确认。
让 Agent 更可靠地调用工具和复用技能
核心:这篇论文主要解决让 Agent 更可靠地调用工具和复用技能这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 agent、workflow、safety、benchmark 等线索来组织Agent 与工具调用任务、数据或评测流程实现让 Agent 更可靠地调用工具和复用技能;主要论点是标题、摘要和公开信号显示:Hierarchical multi-agent systems (MAS) are rapidly being deployed in high-stakes workflows across domains such as finance and software engineering。关键词:agent、workflow、safety、benchmark。代码/数据可用性需查看原文确认。
提升 RAG 检索和知识库问答可靠性
核心:这篇论文主要解决提升 RAG 检索和知识库问答可靠性这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 rag、retrieval、alignment、safety 等线索来组织基准与评测任务、数据或评测流程实现提升 RAG 检索和知识库问答可靠性;主要论点是标题、摘要和公开信号显示:Large language models (LLMs) are increasingly used to access organisational documentation, including standard operating procedures (SOPs), HR policies and institutional guidelines。关键词:rag、retrieval、alignment、safety。代码/数据可用性需查看原文确认。
提升 RAG 检索和知识库问答可靠性
核心:这篇论文主要解决提升 RAG 检索和知识库问答可靠性这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 rag、serving、evaluation、benchmark 等线索来组织基准与评测任务、数据或评测流程实现提升 RAG 检索和知识库问答可靠性;主要论点是标题、摘要和公开信号显示:Spiking Neural Networks (SNNs) are well-regarded for their biological plausibility and energy efficiency in processing sequential data。关键词:rag、serving、evaluation、benchmark。代码/数据可用性需查看原文确认。
提升 RAG 检索和知识库问答可靠性
核心:这篇论文主要解决提升 RAG 检索和知识库问答可靠性这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 rag、serving、alignment、code 等线索来组织多模态模型任务、数据或评测流程实现提升 RAG 检索和知识库问答可靠性;主要论点是标题、摘要和公开信号显示:Multimodal-attributed graphs (MAGs) couple graph topology with node semantics from text, images, and other modalities。关键词:rag、serving、alignment、code。代码/数据可用性需查看原文确认。
提升模型推理、规划和验证能力
核心:这篇论文主要解决提升模型推理、规划和验证能力这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 workflow、rag、benchmark、vision-language 等线索来组织检索与 RAG任务、数据或评测流程实现提升模型推理、规划和验证能力;主要论点是标题、摘要和公开信号显示:Scientific laboratories increasingly rely on AI systems to reason about experiments, but the physical act of doing science remains largely outside their reach。关键词:workflow、rag、benchmark、vision-language。代码/数据可用性需查看原文确认。
其他值得关注
DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Multimodal Graph Negative Learning:涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
The Internet of Agentic AI: Communication, Coordination, and Collective Intelligence at Scale:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Fantastic Scientific Agents and How to Build Them: AgentBuild for Rietveld Refinement:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ProPlay: Procedural World Models for Self-Evolving LLM Agents:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Beyond Runtime Enforcement: Shield Synthesis as Defensibility Analysis for Adversarial Networks:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Reward Modeling for Multi-Agent Orchestration:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
See What I See, Know What I Think: Dense Latent Communication Across Heterogeneous Agents:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
A Three-Layer Framework for AI in Scientific Discovery:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Uncertainty-Aware Hybrid Retrieval for Long-Document RAG:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
OneRetrieval: Unifying Multi-Branch E-commerce Retrieval with an Editable Generative Model:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MoVerse: Real-Time Video World Modeling with Panoramic Gaussian Scaffold:涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
ERTS: Adversarial Robustness Testing of Ethical AI via Semantic Perturbation in a Bounded Consequence Space:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
EPIG: Emotion-Based Prompting for Personalised Image Generation:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
From Uncertain Judgments to Calibrated Rankings: Conformal Elo Estimation for LLM Evaluation:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
CoDeR: Local Constraint-Compatible Retrieval Beyond Semantic Similarity:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Getting Better at Working With You: Compiling User Corrections into Runtime Enforcement for Coding Agents:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
The Clustering Strikes Back: Building Cost-Effective and High-Performance ANNS at Scale with Helmsman:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MP3: Multi-Period Pattern Pre-training forSpatio-Temporal Forecasting:涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
MÖVE: A Holistic LLM Benchmark for the German Public Sector:涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。