提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-08-06 论文源抓取并去重 388 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题PaDoc:Layout-Grounded Parallel Decoding 面向 Document Parsing
信号显示端到端文档解析器提供统一的界面,但将页面布局和区域内容序列化为一个自回归序列
关键词raglatencycodethroughput
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题针对搜索代理的上下文信息策略优化
信号显示搜索代理将大语言模型扩展到静态参数内存之外,使他们能够在多步推理期间获取和使用外部证据
关键词agentragretrievalalignment
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题来自 Siloed Algorithms to Compliance-First Agentic 平台s:A Multi-Layered Architecture 面向 Hospital AI Systems
信号显示医院正在迅速采用人工智能进行分类、成像、调度等,但大多数部署仍然是锁定在部门孤岛内的孤立点解决方案,导致重复工作、隐藏风险和未实现的企业价值
关键词agentworkflowragserving
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题ECHO :具有时间记忆、安全护栏和言语评估的本地部署代理健康助理
信号显示本文介绍了ECHO ( Enhanced Care\ & Health Observer ) ,一种用于长期慢性病护理管理的本地部署会话健康助手
关键词agentsafetybenchmarkmultimodal
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题评估大型语言模型中的投资逻辑:面向个性化金融代理的现实世界基准
信号显示投资能力本质上是个性化的:相同的市场证据可以为具有不同目标、视野、投资组合和风险界限的投资者提供不同行动的理由
关键词agentretrievalevaluationbenchmark
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题混合自适应线程调整以缓解高性能强化学习推理中的模拟执行瓶颈
信号显示在仿真在环决策系统中,强化学习( RL )推理通常受到模拟器侧执行开销的限制,其中工作负载高度动态且对运行时线程配置敏感
关键词raginferencecodefine-tuning
代码/数据需查看原文确认
其他值得关注
From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models
中文标题从经济主体到经济主体:世界经济模型的系统蓝图
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ProDVI: Programmatic Dynamics Priors for Value Network Initialization
中文标题ProDVI:Programmatic Dynamics Priors 面向 Value Network Initialization
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards
中文标题HERALD:Counterfactual Audits 与 Minimal Repairs 面向 Proof-of-Retrieval Rewards
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题使用经过LLM生成合成数据培训的模型进行临床沟通处理:结构化调查和新型应用案例研究
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Universal Concept Disruption for SAM3 Image Segmentation
中文标题SAM3图像分割的通用概念中断
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models
中文标题大、亮或隐形: 3D CT基础模型的冻结特征基准
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models
中文标题Robust-WAM:Bridging Generative Pretraining 与 Semantic Foresight in World-Action Models
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents
中文标题AppDeltaWorld:Transition-Grounded Delta Code World Model 面向 Mobile GUI Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents
中文标题CodeGrep:An RL-Trained Retrieval Agent 面向 LLM Coding Agents
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MACRO: Markov Chain Routing of Transformer Layers
中文标题模板:变压器层的马尔可夫链布线
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
RepoOMP: Repository-Aware Hotspot OpenMP Parallelization via Dependency-Aware Context Reduction
中文标题RepoOMP :通过依赖感知上下文缩减实现存储库感知热点OpenMP并行化
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
M$^3$R-Bench: A Unified Benchmark for Evidence-Grounded Multimodal Metaphor Understanding
中文标题M$^3$R-Bench:A Unified 基准 面向 Evidence-Grounded Multimodal Metaphor Understanding
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题能量引导流匹配
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
STAIL: Semantic Text-Anchored Incremental Learning for Medical Imaging via Large Language Models
中文标题STAIL :通过大型语言模型进行医学成像的语义文本锚定增量学习
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Ordered Diffusion for 3D Human Registration
中文标题Ordered Diffusion 面向 3D Human Registration
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
KVAE: Family of Tokenizers for Multimodal Generative Models
中文标题KVAE:Family of Tokenizers 面向 Multimodal Generative Models
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
When Agentic AI Meets Integrated Sensing and Communication
中文标题When Agentic AI Meets Integrated Sensing 与 Communication
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ChainClaw: A Layered Agent Framework for Reliable On-Chain Execution
中文标题ChainClaw:A Layered Agent 框架 面向 Reliable On-Chain Execution
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
GROM: Gradient-Free Rapid One-Shot Machine Unlearning
中文标题GROM :无梯度快速一次性机器学习
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Beyond Relevance: Bayesian Evidence Acquisition for Agentic Whole-Slide Image Reasoning
中文标题超越相关性:用于代理全幻灯片图像推理的贝叶斯证据采集
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。