让 Agent 更可靠地调用工具和复用技能
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-07-30 论文源抓取并去重 469 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题基于LLM推荐的分层潜在推理
信号显示大语言模型( LLM )通过利用其语义理解和上下文建模能力显示出强烈的推荐潜力
关键词raginferencealignmentbenchmark
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题忠诚不是安全:轻轻压缩的LLM通过每个无数据的质量保护,但在代理执行中发明程序步骤
信号显示一旦压缩语言模型清除了一堆数据便宜的质量保护,从业人员就会接受:原始数据的一小部分内的困惑,置信区间内的下游精度(例如MMLU ) ,以及无数据的输出保真信号
关键词agentdeploymentcompressionsafety
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题PAIChecker:Uncovering 与 Checking PR-Issue Misalignment in SWE-Bench-Like 基准s
信号显示SWE-bench样基准被广泛用于评估LLM的问题解决能力
关键词agentalignmentbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Frontis-MA1 :训练AI4AI模型实现机器学习工程中的递归自我改进
信号显示递归自我改进( RSI )需要人工智能系统来改善构建人工智能的过程(即AI4AI ) ;机器学习工程( MLE )为研究这种能力提供了一个具体的可执行测试平台
关键词agentraginferenceevaluation
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题知道自己正在老化的机器:硬件感知自主智能的框架
信号显示自主系统不可避免地会老化,但他们的人工智能通常假设硬件保持原始状态
关键词inferencesafetyroboticsmemory
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题QAdapt:A Noise-Adaptive Neural Pre-Decoding 框架 面向 Quantum Error Correction
信号显示容错量子计算( FTQC )依靠量子纠错来抑制物理错误并大规模保存逻辑信息
关键词latencybenchmarkcodefine-tuning
代码/数据需查看原文确认
其他值得关注
DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness
中文标题DataClawEval:A 基准 面向 Data Engineering Agents in Real Industrial Harness
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题耦合蒸馏基准上的安全门禁代理监督控制:制度图、可审计门和共同设计结果
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
PAC-MAN: Perception-Aware CBF-RL for Whole-Body Safety in Humanoid Dodgeball
中文标题PAC-MAN:Perception-Aware CBF-RL 面向 Whole-Body Safety in Humanoid Dodgeball
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments
中文标题Change2Task:来自 Repository Changes to Executable Coding Agent Tasks 与 Environments
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation
中文标题ROAD:Reciprocal-Objective Alignment of Discriminative Semantics 面向 3D Shape Generation
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Towards Real-Time PixOOD: Efficient Anomaly Segmentation for Autonomous Vehicles
中文标题Towards Real-Time PixOOD:Efficient Anomaly Segmentation 面向 Autonomous Vehicles
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate
中文标题ReGenVC :超低比特率的端到端实时生成视频编码
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Diversifying Personalized Research Ideation against AI-Induced Homogenization
中文标题针对人工智能引发的同质化,实现个性化研究理念的多元化
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题One Patch Is Enough:Reinforcement-Optimized Visual Token 落地 面向 M基于 LLM 的 Scene Text Spotting
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion
中文标题MIND:Multimodal Intent-Driven Network via Diffusion Transformers 面向 Medical Image Fusion
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题为什么GUI代理正确但迟到?在决策时间关键路径上解码,使用预编译的策略树进行测试
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
How Benchmarks Mis-Score Computer-Use Agents
中文标题如何对计算机使用代理进行基准测试错误评分
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Agentic Method for Deterministic Validation of Legacy Code Migration
中文标题遗留代码迁移确定性验证的代理方法
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Driving up Inference Energy on SNNs: Per-Sample and Universal Sponge Attacks
中文标题Driving up Inference Energy on SNNs:Per-Sample 与 Universal Sponge Attacks
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs
中文标题One Anchor 面向 All:Unified Multilingual 与 Multimodal Safety Alignment 面向 LVLMs
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
S-CEReBrO: Breaking the Memory Barrier in Continuous EEG Monitoring
中文标题S-CEReBrO :打破连续脑电监测中的记忆障碍
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
ChronoMem: Version Control and Semantic Rollback for Large Language Model Agent Memory
中文标题ChronoMem:Version Control 与 Semantic Rollback 面向 Large Language Model Agent Memory
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
LabEvolver: Training-Free Experience Evolution for Safe and Grounded Wet-Lab Agents
中文标题LabEvolver:Training-Free Experience Evolution 面向 Safe 与 Grounded Wet-Lab Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch
中文标题排练:自我完善自动搜索的信心悬崖后退
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Recognition and Label-Free Adaptation Across Recording Sessions in Surface-EMG Gesture Decoding
中文标题Recognition 与 Label-Free Adaptation Across Recording Sessions in Surface-EMG Gesture Decoding
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。