让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。
本期从 2026-07-29 论文源抓取并去重 339 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题FARI:Robust One-Step Inversion 面向 Watermarking in Diffusion Models
信号显示基于反转的水印是验证扩散生成图像的一种有前途的方法,但实际使用受到反转的瓶颈,反转既缓慢又容易出错
关键词inferenceevaluationcodefine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题MindForge :通过无源程序合成教授小语言模型全生命周期软件工程
信号显示编码代理在修改现有代码库的软件工程任务方面取得了实质性进展,包括错误修复和功能实现
关键词agentragbenchmarkcode
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题宪法中级培训:内容呈现推动一致性收益
信号显示训练后校准通常很浅,在微调下会受到侵蚀
关键词ragalignmentbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题带有损坏观测值的适形变化点定位和根本原因分析
信号显示检测工程系统的统计行为何时发生变化,并确定哪个组件负责,是监控电信网络、机器人平台、安全基础设施和多智能体系统的核心问题
关键词agentragdeploymentsafety
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题SecRespond:基准ing AI Agents 面向 Real-World Post-Compromise Incident Response
信号显示大语言模型( LLM )代理在现实世界的安全操作中越来越多地被采用,可以访问主机制品和命令行界面( CLI ) ,因此彻底评估其安全能力至关重要
关键词agentworkflowbenchmarkcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题无人机反无人机跟踪的语义感知时间自适应
信号显示无人机反无人机跟踪是一种新兴的低空安全任务,用于使用移动观察者无人机的机载摄像头定位对抗性无人机
关键词raginferencealignmentbenchmark
代码/数据需查看原文确认
其他值得关注
Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text
中文标题诊断财务披露文本中的细粒度不一致性分类
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
PowerAtlas: Towards Electricity-Computing Co-Scheduling for Power Systems
中文标题PowerAtlas:Towards Electricity-Computing Co-Scheduling 面向 Power Systems
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
NMKFR: A Robust Framework for Time-Aware Cold-Start Recommendation
中文标题NMKFR:A Robust 框架 面向 Time-Aware Cold-Start Recommendation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
中文标题TurboVLA : < 1 GB VRAM的RTX 4090上32 Hz的实时视觉语言动作模型
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion
中文标题VidMap:Exploiting Temporal Structure 面向 Video-Based Structure-来自-Motion
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Can AI agents conduct open-ended AI research? Early evidence from two case studies
中文标题Can AI agents conduct open-ended AI research? Early evidence 来自 two case studies
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题SpecFirst:Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis 来自 Scratch
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Minimal Markovization via Stable Quotients in Holonomy-Cover Decision Processes
中文标题全局覆盖决策过程中通过稳定商的最小马尔可夫化
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment
中文标题OptimismBench :语言模型判断中的预测偏差与对齐效应
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
When Knowledge Changes: Metamorphic Testing of RAG Systems with Mutations
中文标题当知识发生变化时:具有突变的RAG系统的变质测试
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
FedTopo: Relation-Level Topology Sharing for Model-Heterogeneous Federated Learning
中文标题FedTopo:Relation-Level Topology Sharing 面向 Model-Heterogeneous Federated Learning
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题Safety-Gated Autoscaling:A Multi-Layered Defense Architecture 面向 Kubernetes Vertical Resource Optimization
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
LLMET: Enabling Cross-Layer Evaluation of Emerging M3D Memories for Energy-Efficient LLM Serving
中文标题LLMET:Enabling Cross-Layer 评测 of Emerging M3D Memories 面向 Energy-Efficient LLM Serving
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
HumanCLAW: Can Vision-Language Models Act Through a Body?
中文标题HumanCLAW :视觉语言模型可以通过身体起作用吗?
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题OmegaUse-OfficeVal :在经济基础上对LLM代理商的长期办公套件任务进行基准测试
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题用于决策关键型应用的多模态LLM中的可解释且资源效率高的空间推理
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
KAMR: Grounding Generation via Knowledge-Aligned Multi-hop Retrieval
中文标题KAMR :通过知识一致的多跳检索进行接地生成
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context
中文标题SciFigQual-Bench :具有完整手稿背景的科学人物质量评估基准
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment
中文标题LLM安全的随机蒸馏:模板-鲁棒调整的路线方法
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair
中文标题MemSecBench:Tracking Agent Memory Poisoning 来自 Persistence to Consequence 与 Repair
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。