让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性、改进图像生成、视觉理解和可控渲染
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-09-08 论文源抓取并去重 398 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题Miles v0.1 :生产级培训后
信号显示我们推出了Miles v0.1 ,这是一个用于前沿后培训的全栈生产就绪系统
关键词agentdeploymentalignmentfine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题ExecCritic:Learn to Test,Test to Improve 面向 Coding Agents
信号显示执行反馈可以引导编码代理进行正确的存储库修复,但仅当测试捕获问题请求的行为时
关键词agentevaluationcodepost-training
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题从坐标到候选区域:通过遥感多模态LLM中的区域选择进行时间变化定位
信号显示遥感多模态大语言模型( RS-MLLM )在卫星图像上具有先进的场景理解和视觉问答功能,但定位特定物体或变化的区域仍然具有挑战性
关键词ragevaluationcodemultimodal
代码/数据需查看原文确认
改进图像生成、视觉理解和可控渲染
中文标题用于帕金森氏症中步态检测的零穿戴式冻结的监督交叉模式特征对齐
信号显示帕金森病( PD )步态冻结( FoG )的客观评估主要依赖于可穿戴的惯性测量单元( IMU )
关键词inferencedeploymentalignmentevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题驱逐摧毁了什么:对代理记忆中遗忘的恢复-反事实审计
信号显示当历史记录超出固定令牌预算时,代理内存系统必须丢弃存储的信息
关键词agentretrievalbenchmarkmemory
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题SAEScientist-Bench :人工智能代理可以进行自主SAE可解释性研究吗?
信号显示虽然递归自我改进( RSI )的研究主要是自动化模型培训管道,但可靠的自主开发需要缺少一个支柱:事后监控和审计,以了解哪些模型学习并确保安全对齐
关键词agentalignmentevaluationcode
代码/数据需查看原文确认
其他值得关注
中文标题评测 Principles 面向 MRI-MRA Registration in Trigeminal Neuralgia:An ROI-Centered Neurovascular 基准
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题结构性越狱泛化但不复合:非自愿上下文学习的跨提供者和多语言研究
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
A Measurement Study of LLM Inference Trade-offs Across Edge Continuum Hardware
中文标题一种Measurement Study of LLM Inference Trade-offs Across Edge Continuum Hardware
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Human-Centric Image Captioning with Subject-Centered Spatial Understanding
中文标题以人为本的图像字幕与以主体为中心的空间理解
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题超越一致性:对标专业编辑-多镜头音频视频生成中的技术执行
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
SchemeArena: Factorized Stress Testing of Scheming in LLM Agents
中文标题SchemeArena : LLM代理商中Scheming的因素压力测试
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题共同发展的线束和模型:政策纠正有助于较弱的模型追赶模仿失败的地方
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
TASTE2: Text-Aligned Speech Modeling and Deployment toward Full-Duplex Voice Interaction
中文标题TASTE2:Text-Aligned Speech Modeling 与 Deployment 面向 Full-Duplex Voice Interaction
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题CoSA :相关性引导的变化利用可学习的残差选通进行遥感变化检测
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
SynthRCT: Scalable Conditional Deformation Synthesis for Synthetic Repeat CT Generation
中文标题SynthRCT:可扩展 Conditional Deformation Synthesis 面向 Synthetic Repeat CT Generation
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Do New Attention Mechanisms Actually Fix Attention Sinks at Million-Token Context?
中文标题新的注意力机制实际上修复了百万代币背景下的注意力下沉吗?
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Beyond Agent Harnesses: Cross-Substrate Authority for Multi-Agent Systems
中文标题Beyond Agent Harnesses:Cross-Substrate Authority 面向 多智能体系统
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Safe Task Planning with Long-Term Graph Memory for Embodied Agents
中文标题为具体代理提供长期图形内存的安全任务规划
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
To Adapt or Not to Adapt? Selective Adaptation for Vision-Language Models
中文标题适应还是不适应?视觉语言模型的选择性适应
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Rank Without an Oracle: Deviation-Aware Interaction-Rank Selection from Offline Multi-Agent Logs
中文标题Rank Without an Oracle:Deviation-Aware Interaction-Rank Selection 来自 Offline Multi-Agent Logs
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
HoneyRoute: Honeypot-Model Routing for Adversarial LLM Serving
中文标题HoneyRoute:Honeypot-Model Routing 面向 Adversarial LLM Serving
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Qiushi Engine on AstaBench E2E-Bench-Hard
中文标题AstaBench E2E-Bench-Hard上的Qiushi发动机
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Snugi-AI-v2 @ eRisk 2026任务2 :通过持续信心门禁的学习停止策略进行早期抑郁症检测
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
SyncWorld: Visual Calibration Enables World Models as Zero-Shot Simulators
中文标题SyncWorld:Visual Calibration Enables 世界模型 as Zero-Shot Simulators
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题MeClear:Cooperative Game-Theoretic Attribution 与 Risk-Aware Memory Clearance 面向 Long-Horizon LLM Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。