让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-09-18 论文源抓取并去重 379 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题基于三信号互补的LLM代理可解释存储器决策控制器:解耦置信度和一致性
信号显示大语言模型的内存系统主要侧重于有效的检索,而是否应该信任检索到的内存的决策则相对较少受到关注
关键词agentragretrievalevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题TrialAtlas:Multi-Agent Research Organization 面向 Clinical Trial Design 与 Optimization
信号显示尽管投入了数十亿美元,但进入临床开发的近90 %的药物最终都失败了
关键词agentevaluationmemoryagents
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题MIST :具有基因组引导的组织学注意力的多峰生存预测
信号显示多模式生存模型可以结合来自全载玻片图像和基因组谱的互补预后信息,但在外部队列转移和计算复杂性中,有效融合仍然具有挑战性
关键词alignmentevaluationcodemultimodal
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题CIBuzzBench:A 基准 面向 Cross-Lingual Understanding of Chinese Internet Buzzwords
信号显示中国社交媒体产生了庞大且不断发展的互联网流行语词汇,其含义通常是非文字的,并深深植根于当地的文化和语用背景
关键词ragsafetyevaluationbenchmark
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题并行仿真中机器人操纵的缩放视觉-语言奖励学习
信号显示视觉语言模型( VLM )可以在基于偏好的奖励学习中取代人工注释器,但连续的API请求和单一环境数据收集使训练速度缓慢且成本高昂
关键词latencyevaluationcodevision-language
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题TERMon :通过硬件原生三元运行时监视器检测Edge AI中的持续行为威胁
信号显示边缘AI加速器越来越多地部署在安全关键型环境中,模型输出可能会控制物理执行器、做出访问控制决策或触发警报
关键词inferenceservinglatencysafety
代码/数据需查看原文确认
其他值得关注
Risk-Aware Occupancy for Safety-Oriented End-to-End Autonomous Driving
中文标题以安全为导向的端到端自动驾驶的风险意识占用
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
SIRA: Reasoning-Aware Surgical Instrument Segmentation via Query-Anchored Alignment
中文标题SIRA :通过查询锚定对齐进行推理感知手术器械分割
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题强大的无结构单目视觉惯性初始化开发线特征和消失点
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents
中文标题RecreationWorld:可扩展 与 Verifiable Environments 面向 Hybrid Computer-Use Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题学习移动城市:城市网络校准和控制的深层元模型和加强政策
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
VIRGA: Virtual-Agent-Intermediated Riemannian Geometry for Active-Sensing Air-Ground Coordination
中文标题VIRGA:Virtual-Agent-Intermediated Riemannian Geometry 面向 Active-Sensing Air-Ground Coordination
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Samsone: A Family of Open Small Audio Language Models for On-Device Inference
中文标题Samsone:A Family of Open Small Audio Language Models 面向 On-Device Inference
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
中文标题登记驾驶,风险推理:基于登记的端到端自动驾驶的风险意识占用
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
PSEE: Progressive Sensor Event Expansion for Point-Supervised Temporal Action Localization
中文标题PSEE:Progressive Sensor Event Expansion 面向 Point-Supervised Temporal Action Localization
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Hallucination-R1: Robustness-Oriented Paraphrase Generation for Factual Consistency
中文标题幻觉-R1 :以鲁棒性为导向的释义生成,以实现事实一致性
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
AirSplan: Risk-Aware Motion Planning for Quadrotors in Cluttered 3D Gaussian Splats
中文标题AirSplan:Risk-Aware Motion Planning 面向 Quadrotors in Cluttered 3D Gaussian Splats
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design
中文标题Designer-RSI:Evolving Procedural Memory 来自 User Traffic 面向 Agentic Graphic Design
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
CodeMidas: Scaling Agentic Coding RL Environments from Code Itself
中文标题CodeMidas:Scaling Agentic Coding RL Environments 来自 Code Itself
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题BrainWideBench:基准ing large-scale pretraining 与 across-animal transfer in multi-region neural recordings
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Available Guardrails: Certifying Selective Prediction across ML Systems
中文标题可用的护栏:跨机器学习系统的选择性预测认证
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
DiaVLo: Diagnosing Behaviours of Vision-Language Models
中文标题DiaVLo :诊断视觉语言模型的行为
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Info3R: Information-Adaptive Test-Time Training for 3D Reconstruction
中文标题Info3R:Information-Adaptive Test-Time Training 面向 3D Reconstruction
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Catena: A Comprehensive Software Suite for Large-Scale Connectomics
中文标题Catena:A Comprehensive Software Suite 面向 Large-Scale Connectomics
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Benchmarking the Explanatory Quality of Open-Weight Vision-Language Models in Face Recognition
中文标题对人脸识别中开放式视觉语言模型的解释性质量进行基准测试
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
EnterpriseVal: Quantifying the Efficacy, Reliability and Value of Generative AI in the Enterprise
中文标题EnterpriseVal:Quantifying the Efficacy,Reliability 与 Value of Generative AI in the Enterprise
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。