让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力、提升代码生成、执行反馈和自动修复能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力、提升代码生成、执行反馈和自动修复能力。
本期从 2026-07-16 论文源抓取并去重 326 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力、提升代码生成、执行反馈和自动修复能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题当言语是安全的,但行动是致命的:在隐藏状态风险空间中探测文本安全之外的物理危险
信号显示大语言模型( LLM )越来越多地成为具体代理的高级规划者,一旦在物理世界中接地,语言良性的指令可能会变得不安全
关键词agentsafetybenchmarkagents
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题可解释抑郁症症状注释的自我进化以人为中心的框架
信号显示注释质量是构建用于心理健康研究的可靠且可解释的人工智能( XAI )系统的主要瓶颈
关键词alignmentevaluationmemoryeval
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题MedFailBench:A Clinician-Built Open-Source 基准 面向 Medical AI Safety Boundary Inspection
信号显示大多数医学AI基准衡量模型是否知道正确答案
关键词safetybenchmarkopen-sourcedata
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题随机三角洲蒸馏
信号显示策略提取是强化学习中的一种替代后训练方法,通过从教师模型提供令牌级监督来减轻奖励模型施加的约束
关键词benchmarkcodepost-trainingtraining
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题漂移世界:通过漂移快速建模世界
信号显示预测世界模型使机器人能够通过想象其行动的结果来进行规划,但它们对控制的价值取决于快速生成许多部署
关键词raginferenceevaluationbenchmark
代码/数据需查看原文确认
改进图像生成、视觉理解和可控渲染
中文标题JADE-GS :由3D高斯拼接事件引导的联合交替去模糊
信号显示当相机在曝光期间快速移动时,模糊会破坏3D模型恢复锐利场景所需的曝光内运动,而事件相机则以微秒分辨率准确捕获此信号
关键词servingbenchmarkrenderingvision-generation
代码/数据需查看原文确认
其他值得关注
CoSimRec: Measuring Coordinated-Content Penetration in Recommender Feedback Loops
中文标题CoSimRec :测量推荐者反馈循环中的协调内容渗透率
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题用于疾病分类器中偏差缓解和偏差检测的人口统计学条件合成医学图像
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems
中文标题RW-Voice-EQ Bench:A Real World 基准 面向 Evaluating Voice AI Systems
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Physics-Informed Diffusion for Biomechanically Plausible 3D Sign Language Generation
中文标题Physics-Informed Diffusion 面向 Biomechanically Plausible 3D Sign Language Generation
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Evaluating Epistemic Uncertainty: Beyond OOD Detection and Active Learning
中文标题评估认知不确定性:超越OOD检测和主动学习
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Transcoders for Investigating Deception in Language Models
中文标题用于调查语言模型中欺骗的转码器
关注理由涉及可解释性中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Rare Concept Generation via Counterfactual Inference in Diffusion Models
中文标题扩散模型中通过反事实推断的罕见概念生成
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
AE-UAV: An Air-to-Air Event-Based UAV Tracking Benchmark and a Real-Time Frequency-Domain Tracker
中文标题AE-UAV:An Air-to-Air Event-Based UAV Tracking 基准 与 a Real-Time Frequency-Domain Tracker
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Causal-Adversarial Probing of Clinical Covariates for Prostate MRI Grading
中文标题Causal-Adversarial Probing of Clinical Covariates 面向 Prostate MRI Grading
关注理由涉及可解释性中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题完整草莓收获过程的强化学习:障碍物分离、分离和放置
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Harnessing LLMs for Reliable Academic Supervision: A Comparative Study
中文标题利用法学硕士进行可靠的学术监督:一项比较研究
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Dendrite:A Real-Time Python Application 面向 Online Brain-Computer Interface Research 与 Development
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
NavCMPO: Critic-Guided MeanFlow Policy Optimization for Adaptive Navigation
中文标题NavCMPO:Critic-Guided MeanFlow Policy Optimization 面向 Adaptive Navigation
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题ExaGEMM :基于低位GEMM关联寄存器内计算的CPU驱动ML推理探索框架
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Auditing Fairness-Privacy Trade-offs: Subpopulation-Level Effects of Fairness-Enhancing Algorithms
中文标题审计公平性-隐私权衡:公平性增强算法的亚群级影响
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Breaking the Model Forgetting Cycle in Long-Incremental 3D Object Detection
中文标题打破长增量三维目标检测中的模型遗忘循环
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题基于栖息地拟合先验的多尺度ViT推断和多物种植物鉴定的kNN检索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Hierarchical Denoising For Multi-Step Visual Reasoning
中文标题多步骤视觉推理的分层去噪
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题桥接证据:静态检索实用程序无法预测多步代理搜索中的因果效用
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题ARMOR++:Agentic Orchestration of a Multi-Domain Primitive Set 面向 Transferable Attacks on Deepfake Detectors
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。