让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-09-17 论文源抓取并去重 468 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1红队自动模式:改进针对恶意编码代理的阻塞分类器🔗
- 2超越稳定性--流媒体目标扬声器提取的可塑性前沿🔗
- 3推理引擎指纹攻击实用:探索模型驱动的环境发现、利用和逃避🔗
- 4一种Unified 评测 框架 面向 Trustworthy Large Language Models,Agentic AI,与 Multimodal Systems🔗
- 5CoreSense:Traceable Failure Recall 与 Conflict-Aware Belief Gating 面向 Auditable Robot Decisions🔗
- 6Video DeltaNet:A Video-Native Hybrid Attention 面向 Livestream Video Generation🔗
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题红队自动模式:改进针对恶意编码代理的阻塞分类器
信号显示为了防止编码代理偏离轨道,生产系统现在使用阻止监视器审查每个建议的操作,该监视器可以在运行之前拒绝它( Claude Code中的自动模式, OpenAI Codex中的Guardian )
关键词agentragsafetyevaluation
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题超越稳定性--流媒体目标扬声器提取的可塑性前沿
信号显示流式目标扬声器提取必须保持提取对象的表示,而目标可能会沉默、被干扰掩盖或在声学上远离注册
关键词codememorytablemultimodal
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题推理引擎指纹攻击实用:探索模型驱动的环境发现、利用和逃避
信号显示前沿人工智能模型正在迅速获得利用复杂软件中漏洞的能力
关键词agentraginferencecode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题一种Unified 评测 框架 面向 Trustworthy Large Language Models,Agentic AI,与 Multimodal Systems
信号显示仅基准分数就为评估现代人工智能系统的可信度提供了不完整的基础
关键词agentdeploymentsafetyevaluation
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题CoreSense:Traceable Failure Recall 与 Conflict-Aware Belief Gating 面向 Auditable Robot Decisions
信号显示机器人可以在不知道召回的证据是否仍然有效、是否与当前观察结果冲突或是否足以指导决策的情况下召回先前的故障
关键词ragdeploymentsafetyevaluation
代码/数据需查看原文确认
改进图像生成、视觉理解和可控渲染
中文标题Video DeltaNet:A Video-Native Hybrid Attention 面向 Livestream Video Generation
信号显示视频扩散模型在去噪过程中反复处理长时空令牌序列,使注意力成为主要的计算瓶颈
关键词servingalignmentmemoryvideo
代码/数据需查看原文确认
其他值得关注
中文标题GPT模型中的危害洗钱:性别歧视在经过安全培训的几代人中发生了转变而不是减少的证据
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
CoRef-GS: Cooperative Referring Gaussian Splatting for Multi-Agent Scene Understanding
中文标题CoRef-GS:Cooperative Referring Gaussian Splatting 面向 Multi-Agent Scene Understanding
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
SAFARI: An Industrial Benchmark for LLM-Assisted Hazard Analysis and Risk Assessment
中文标题SAFARI:An Industrial 基准 面向 LLM-Assisted Hazard Analysis 与 Risk 评估
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题SenseFuse:Label-Free Fusion of Image 与 Shape Encoders 面向 Open-Vocabulary 3D Instance Segmentation
关注理由涉及机器人与具身智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
A Multi-Modal Generative Model for Tomato Disease Leaves Understanding
中文标题一种多模态番茄病害生成模型
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Coding Agents with an Obstacle-Aware Harness for Safe Robot Manipulation
中文标题具有安全机器人操纵障碍感知线束的编码代理
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
RAFT: A Stateful Retrieval-Augmented Framework for Troubleshooting Agents
中文标题RAFT:A Stateful Retrieval-Augmented 框架 面向 Troubleshooting Agents
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题MILER:Semantic Mid-Level Representation 面向 Sim-to-Real Reinforcement Learning in Unstructured Autonomous Driving
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Towards Scaling Marine Perception with Synthetic Data
中文标题利用合成数据扩展海洋感知
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
INSPECT: Learning Robot View Selection from Assistant Use
中文标题检查:从助手使用中选择学习机器人视图
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
AgriScope: Pixel-Grounded Multimodal Understanding for Agricultural Images
中文标题AgriScope:Pixel-Grounded Multimodal Understanding 面向 Agricultural Images
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Reproducibility is not construct validity: LLM measurement of institutionally situated communication
中文标题可复现性 is not construct validity:LLM measurement of institutionally situated communication
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Towards High-DoF Dexterous Manipulation through VLA Post-Training
中文标题通过VLA训练后实现高自由度灵巧操纵
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
PrefixBench-H100: Characterizing Prefix Reuse and Time-to-First-Token in H100 LLM Serving
中文标题PrefixBench-H100:Characterizing Prefix Reuse 与 Time-to-First-Token in H100 LLM Serving
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ScientistTwo: Pioneering the Human Knowledge Frontier with Autonomous AI
中文标题科学家二:通过自主人工智能开拓人类知识前沿
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
PosteriorBench: From Point Estimates to Posterior Matching in Evaluating Generative Inverse Solvers
中文标题PosteriorBench:来自 Point Estimates to Posterior Matching in Evaluating Generative Inverse Solvers
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
OPTED: On-Policy Fine-Tuning for End-to-End Driving using a Render-Free Teacher
中文标题选择:使用免渲染教师对端到端驾驶进行随机微调
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Should This Case Be Adapted? Prediction Fragmentation Controls Test-Time Adaptation
中文标题是否应调整此案例?预测碎片化控制测试时间适应
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
RISC-V and machine learning: a survey
中文标题RISC-V 与 machine learning:a survey
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
UniPolicy: Unified Objective-Specific Policies for Generative Search Advertising
中文标题UniPolicy:Unified Objective-Specific Policies 面向 Generative Search Advertising
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。