让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力、提升 RAG 检索和知识库问答可靠性
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。
本期从 2026-06-09 论文源抓取并去重 558 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1MPC-Patch-Bench:Security-Aware LLM Code Patch 面向 Multi-Party Computation🔗
- 2Periodic Table of LLM Reasoning:A Structured Survey of Reasoning Paradigms,Methods,与 Failure Modes🔗
- 3Globally Localizing Lunar Rover in Pixels via Graph Alignment🔗
- 4i1:A Simple 与 Fully Open Recipe 面向 Strong Text-to-Image Models🔗
- 5ABC-Bench:An Agentic Bio-Capabilities 基准 面向 Biosecurity🔗
- 6SceneMiner:Identity-Preserving Multi-Task Fine-Tuning 面向 Unified BEV Scene Mining🔗
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
核心:这篇论文主要解决让 Agent 更可靠地调用工具和复用技能这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 agent、serving、evaluation、benchmark 等线索来组织代码智能任务、数据或评测流程实现让 Agent 更可靠地调用工具和复用技能;主要论点是标题、摘要和公开信号显示:Repository-level benchmarks for evaluating Large Language Model (LLM) code repair on Secure Multi-Party Computation (MPC) software do not yet exist, and directly transplanting general-purpose benchmarks such as SWE-bench fails on three structural fronts: (i) M。关键词:agent、serving、evaluation、benchmark。代码/数据可用性需查看原文确认。
让 Agent 更可靠地调用工具和复用技能
核心:这篇论文主要解决让 Agent 更可靠地调用工具和复用技能这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 agent、retrieval、inference、evaluation 等线索来组织推理与规划任务、数据或评测流程实现让 Agent 更可靠地调用工具和复用技能;主要论点是标题、摘要和公开信号显示:Large Language Models (LLMs) have achieved strong performance across natural language processing tasks, yet reliable reasoning remains an open challenge。关键词:agent、retrieval、inference、evaluation。代码/数据可用性需查看原文确认。
提升模型推理、规划和验证能力
核心:这篇论文主要解决提升模型推理、规划和验证能力这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 rag、alignment、code、data 等线索来组织数据工程任务、数据或评测流程实现提升模型推理、规划和验证能力;主要论点是标题、摘要和公开信号显示:Precise rover localization is a prerequisite for autonomous lunar exploration, yet the absence of Global Navigation Satellite System (GNSS) signals and the cumulative drift of local localization methods severely constrain long-range missions。关键词:rag、alignment、code、data。代码/数据可用性需查看原文确认。
提升 RAG 检索和知识库问答可靠性
核心:这篇论文主要解决提升 RAG 检索和知识库问答可靠性这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 rag、inference、benchmark、code 等线索来组织基准与评测任务、数据或评测流程实现提升 RAG 检索和知识库问答可靠性;主要论点是标题、摘要和公开信号显示:Diffusion models have consistently driven progress in text-to-image generation。关键词:rag、inference、benchmark、code。代码/数据可用性需查看原文确认。
让 Agent 更可靠地调用工具和复用技能
核心:这篇论文主要解决让 Agent 更可靠地调用工具和复用技能这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 agent、rag、benchmark、code 等线索来组织检索与 RAG任务、数据或评测流程实现让 Agent 更可靠地调用工具和复用技能;主要论点是标题、摘要和公开信号显示:Large language models (LLMs) are rapidly acquiring capabilities relevant to biological research, from literature synthesis to interpretation of experimental data。关键词:agent、rag、benchmark、code。代码/数据可用性需查看原文确认。
让 Agent 更可靠地调用工具和复用技能
核心:这篇论文主要解决让 Agent 更可靠地调用工具和复用技能这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 retrieval、serving、safety、code 等线索来组织训练与后训练任务、数据或评测流程实现让 Agent 更可靠地调用工具和复用技能;主要论点是标题、摘要和公开信号显示:Mining hard, safety-critical scenes from driving logs is bottlenecked by the absence of difficulty labels, and no single proxy, collision risk, trajectory ambiguity, or semantic rarity suffices to find such scenes on its own。关键词:retrieval、serving、safety、code。代码/数据可用性需查看原文确认。
其他值得关注
Energy-Efficient On-Device RAG on a Mobile NPU: System Design and Benchmark on Snapdragon X Elite:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Agent Skill Evaluation and Evolution: Frameworks and Benchmarks:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
GLACIER: A Multimodal Student-Teacher Foundation Model for Molecular Property Prediction:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Schützen: Evaluating LLM Safety in Bulgarian and German Contexts:涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
When to Align, When to Predict: A Phase Diagram for Multimodal Learning:涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations:涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
FADA: Accessible fetal ultrasound interpretation and annotation with a selectively distilled unified vision-language model:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Dep-LLM: Training-Free Depression Diagnosis via Evidence-Guided Structured Multi-factor with Reliable LLM Reasoning:涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Misalignment:涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
GUI-AC: Enhancing Continual Learning in GUI Agents:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
KCSAT-ML: Probing Reasoning Models with Nationwide-Cohort Human Difficulty:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Dissect and Prune: Enhancing Robustness in AI-Generated Image Detection:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
When Metrics Disagree: A Meta-Analysis of Knowledge-Graph-Completion Model Benchmarking:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
From Simulation to Real-World: An In-Field 6D Pose Dataset and Baseline for Robotic Strawberry Harvesting:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Overcoming Rank Collapse in Feedback Alignment:涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Do Transformers Actually Help Intrusion Detection? A Temporal Sequence Evaluation on CIC-IDS2017:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
RedAct: Redacting Agent Capability Traces for Procedural Skill Protection:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ChartLens: A Dual-Branch Framework for Chart Data Correction and Factual Summary Refinement:涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
STORM: Stepwise Token Optimization with Reward-Guided Beam Search:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。