让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-09-24 论文源抓取并去重 497 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题仪器监视器逃避在普通任务压力下出现
信号显示人工智能安全的一个主要问题是,当监督与完成目标相冲突时,代理可能会将监督视为障碍
关键词agentsafetyevaluationbenchmark
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题从兴趣到语义ID :生成推荐的检索基础学分分配
信号显示语义ID ( SID )将每个目录项编码为短令牌序列,使生成式推荐器能够自动回归预测下一项
关键词retrievalcodereasoningsearch
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题3GPP通道估计器的多代理编排
信号显示导频辅助信道估计是5G新无线电( 5G-NR )和长期演进( LTE )的正交频分复用( OFDM )接收器中的一个决定性块
关键词agentdeploymentlatencyagents
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题SAGE :通过拓扑引导缓解长视野推理偏差
信号显示长期推理仍然是稀疏奖励制度下大语言模型( LLM )的核心挑战
关键词benchmarkcodereasoningReasoning and Planning
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题返回还是修改?学习何时修改有助于检索-增强的QA
信号显示我们会考虑是否退回现有答案草稿或使用检索到的证据进行修订的决定,如答案修订系统
关键词ragretrievalevaluationRetrieval and RAG
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题AV-GRPO:Modality-Anchored Decoupling Diffusion Reinforcement Learning 面向 Joint Audio-Video Generation
信号显示近年来,在联合音视频生成方面取得了重大进展
关键词alignmentevaluationcodemultimodal
代码/数据需查看原文确认
其他值得关注
中文标题TTLab at AlexandriaX-2026:A Fine-Tuned Surface Tagger 面向 Arabic Machine-Translation Error-Span Detection 与 Classification
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
SWE-Prometheus: Measuring Engineering Governance Improvements in Real-World Repositories
中文标题SWE-Prometheus :测量真实世界存储库中的工程治理改进
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Decoupled Early Exits for Task-Dependent Compute Allocation in Flow-Matching VLAs
中文标题流匹配VLA中任务相关计算分配的解耦早期退出
关注理由涉及机器人与具身智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
UpDown-SC: Gravity-Canonicalized Dual-Envelope Scan Context for Indoor LiDAR Place Recognition
中文标题UpDown-SC:Gravity-Canonicalized Dual-Envelope Scan Context 面向 Indoor LiDAR Place Recognition
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
CrossSafe: Towards Cross-Embodiment Latent Safety Filters
中文标题CrossSafe :面向Cross-Embodiment潜在安全过滤器
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Learning Better Reasoning for Generative Recommendation with Semantic IDs
中文标题使用语义ID学习生成推荐的更好推理
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
An Empirical Study of VLM Pipelines for Long-Document QA
中文标题用于长文档QA的VLM管道的实证研究
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
When Can Agents Forget Their Reasoning? ICLR for Long-Horizon Agent Context Compression
中文标题When Can Agents Forget Their Reasoning? ICLR 面向 Long-Horizon Agent Context Compression
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Anatomy-Aligned Surface Field Learning for Myocardial Reconstruction from Sparse Short-Axis Cine MRI
中文标题Anatomy-Aligned Surface Field Learning 面向 Myocardial Reconstruction 来自 Sparse Short-Axis Cine MRI
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Just Ask Jev:Reinforcement Learning 面向 Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
SEE Challenge 2026: Event-Guided Brightness Adjustment Across a Broad Illumination Range
中文标题请参阅挑战2026 :在广泛的照明范围内进行事件引导的亮度调整
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
ASIRF: An Agentic Framework for Context-Dependent Sensitive Information Redaction
中文标题ASIRF:An Agentic 框架 面向 Context-Dependent Sensitive Information Redaction
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
DAWN: Noise-Robust Quadruped Parkour via Depth-Denoising World Models
中文标题黎明:通过深度去噪世界模型探索噪音强劲的四足跑酷
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Learning from Mixed-Quality Deployment Experience for Robot Manipulation
中文标题学习机器人操纵的混合质量部署经验
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MoVISA: Multi-Token Reasoning for Video Object Segmentation
中文标题MoVISA:Multi-Token Reasoning 面向 Video Object Segmentation
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Control the Harness, Control the Cost: Routing and Governing AI Coding Agents in the Enterprise
中文标题控制线束、控制成本:在企业中路由和管理AI编码代理
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Towards Practical Compression of 3D Gaussian Splatting
中文标题三维高斯溅射的实用压缩
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
SemMSA: Latent Semantic-Aided Robust Multimodal Sentiment Analysis with Incomplete Data
中文标题SemMSA :不完整数据的潜在语义辅助鲁棒多模态情绪分析
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
A Living Benchmark for Information Retrieval from Electronic Health Records
中文标题从电子健康记录中检索信息的活基准
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
AERIAL: Adversarial Evaluation of Robustness in Accuracy-Preserving Low-Precision EEG Decoders
中文标题AERIAL:Adversarial 评测 of Robustness in Accuracy-Preserving Low-Precision EEG Decoders
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。