让 Agent 更可靠地调用工具和复用技能、评测视频生成的时间一致性和运动真实感、提升模型推理、规划和验证能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、评测视频生成的时间一致性和运动真实感。
本期从 2026-07-15 论文源抓取并去重 289 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、评测视频生成的时间一致性和运动真实感。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题探索性、沟通性和可部署性:面向开放世界移动操作的视觉驱动型嵌入式代理
信号显示具体化Agent的实际部署需要主动探索、可视化接地和交互式意图消歧义
关键词agentdeploymentbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题类比深度研究:检索和整合历史类比进行前瞻性分析
信号显示历史(即历史类比)中当前情况和结构相似的过去事件之间的系统比较是前瞻性分析的最强大工具之一
关键词agentragalignmentbenchmark
代码/数据需查看原文确认
评测视频生成的时间一致性和运动真实感
中文标题Live Gurbani Tracking:A 基准 与 Reference System 面向 Captioning Sikh Kirtan
信号显示我们为锡克教Kirtan的实时字幕提供了一个基准和参考系统-持续不断地背诵Sri Guru Granth Sahib Ji ( SGGS )的诗句
关键词deploymentevaluationbenchmarkeval
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题GFlowRL :将分布匹配RL扩展到大型语言模型
信号显示生成流网络( GFlowNets )为大型推理模型提供了有希望的奖励最大化强化学习( RL )替代方案,通过匹配奖励分布而不是崩溃到主导模式来鼓励不同的推理路径
关键词ragservingbenchmarkcode
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题WAVE-Stereo:Warp-Aligned Volume Encoding 面向 Stereo Matching
信号显示现有的迭代立体匹配方法主要采用两种类型的对应表示:通过相关体显式匹配搜索和通过扭曲特征的局部残差细化,但两者仍然单独建模
关键词inferencealignmentbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题AI-accelerated End-to-End 框架 面向 Rapid Professional Upskilling
信号显示到2030年,每100名工人中将有59人需要再培训或提升技能,但缩小企业技能差距的平均时间从2014年的约3天增加到2018年的36天
关键词agentragknowledgeRetrieval and RAG
代码/数据需查看原文确认
其他值得关注
Screening of Biosecurity Features in Metagenomic Data with Evo 2 Probes
中文标题使用EVO 2探针筛选宏基因组数据中的生物安全性特征
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
A Self-Evolving Agent for Longitudinal Personal Health Management
中文标题一种Self-Evolving Agent 面向 Longitudinal Personal Health Management
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0
中文标题Do Agent Optimizers Compound? A Continual-Learning 评测 on Terminal-Bench 2.0
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Peak-End-Net: A Peak-End Rule Inspired Framework for Generalizable Video Aesthetic Assessment
中文标题Peak-End-Net:A Peak-End Rule Inspired 框架 面向 Generalizable Video Aesthetic 评估
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Protective Capacity Hallucination: When Large Language Models Claim Nonexistent Capabilities
中文标题保护能力幻觉:当大型语言模型声称不存在能力时
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
UniPhysGen: Unified Physical Grounding for Simulation-Ready 3D Assets
中文标题UniPhysGen:Unified Physical 落地 面向 Simulation-Ready 3D Assets
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Cost-Pragmatic Quality Gating and Selection-Fusion Multi-Model Combiners for BioASQ Phases A+ and B
中文标题Cost-Pragmatic Quality Gating 与 Selection-Fusion Multi-Model Combiners 面向 BioASQ Phases A+ 与 B
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Temperature Scaling Is Not Enough: Calibration Gaps Under Human Label Distributions
中文标题温度缩放是不够的:人类标签分布下的校准差距
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题Earthquaker-AI :基于评分的小学地震教育检索增强生成框架
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题优化发电机中的可见性:发电机优化的批判性调查( 2023-2026 )
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Rethinking Penetration Testing 面向 AI-Enabled Systems:来自 Resource Compromise to Behavioral Objective Violation
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Dynamic Verifiable Multi-Agent Human Agentic Loyalty Loop (DVM-HALL) Model 与 the Net Human-Agent Score (NHAS) in Autonomous Commerce
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题CF-Net :冲突融合与说话者标准化和确定性加权,用于矛盾/犹豫识别
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Discriminative Barrier Functions for Safe Adversarial Imitation Learning from Observation
中文标题从观察中进行安全对抗性模仿学习的判别性屏障函数
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning
中文标题SIVA-RL:Sensitivity-Invariance Visual Alignment 面向 Multimodal Reinforcement Learning
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding
中文标题使用器官调节模式令牌进行精细视觉-语言预训练,以了解CT
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models
中文标题增强医学多模态大型语言模型中的三维空间推理
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题Post-Training Shifts Confidence:A Three-Stage Analysis of How SFT,RL,与 OPD Shape Pre-,Intra-,与 Post-CoT Calibration
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
CAVA: Canonical Action Verification and Attestation for Runtime Governance of Agentic AI Systems
中文标题CAVA:Canonical Action Verification 与 Attestation 面向 Runtime Governance of Agentic AI Systems
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Barnamala: Parameter-Efficient Handwritten Devanagari Recognition at Benchmark Saturation
中文标题Barnamala:Parameter-Efficient Handwritten Devanagari Recognition at 基准 Saturation
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。