让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-08-06 论文源抓取并去重 388 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1LAWM-3D:Learning 3D-Aware Latent Actions 来自 Human Videos 面向 Generalizable Robot 世界模型🔗
- 2DreamGuard:通过风险意识世界模型为LLM代理提供高效的运行时保护栏🔗
- 3DistMedVL:Distributional Vision-Language Alignment 面向 Uncertainty-Aware Medical Image Segmentation🔗
- 4ChronoVision:通过潜伏状态重建进行时间推理🔗
- 5SkillHEX:Improving Agent Skills via Hypothesis-Driven Autonomous Exploration 与 Exploitation🔗
- 6TruthLens:通过LVLM中的自我评估真实性评分进行物体幻觉检测🔗
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题LAWM-3D:Learning 3D-Aware Latent Actions 来自 Human Videos 面向 Generalizable Robot 世界模型
信号显示世界模型使座席能够在无需实际交互的情况下执行前瞻性推出和规划
关键词agentalignmentcodefine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题DreamGuard :通过风险意识世界模型为LLM代理提供高效的运行时保护栏
信号显示随着大语言模型( LLM )代理越来越多地调用外部工具并与现实世界的系统进行交互,不安全的操作可能会对外部状态、用户数据和下游服务造成不可逆转的后果
关键词agentraglatencysafety
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题DistMedVL:Distributional Vision-Language Alignment 面向 Uncertainty-Aware Medical Image Segmentation
信号显示视觉和文本表示的跨模态对齐是多模态医学图像理解的基础,但在现实世界的临床条件下,这两种模式的不确定性仍然受到阻碍
关键词ragalignmentbenchmarkcode
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题ChronoVision :通过潜伏状态重建进行时间推理
信号显示多模态大语言模型擅长被动感知,但难以处理需要多步时间推理的复杂视觉认知任务
关键词alignmentbenchmarkmultimodalfine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题SkillHEX:Improving Agent Skills via Hypothesis-Driven Autonomous Exploration 与 Exploitation
信号显示虽然客服代表的技能为LLM提供了可重复使用的程序知识,但手动维护的成本高昂、无法扩展和错位
关键词agentragdeploymentalignment
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题TruthLens :通过LVLM中的自我评估真实性评分进行物体幻觉检测
信号显示尽管大型视觉语言模型( LVLM )取得了显着进展,但物体幻觉仍然是一个阻碍其可信部署的根本挑战
关键词inferencedeploymentevaluationbenchmark
代码/数据需查看原文确认
其他值得关注
FOCUS: Decoupling Expert Personas in LLMs to Enhance Domain Expert Capabilities
中文标题重点:解耦LLM中的专家角色以增强领域专家能力
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution
中文标题SkillTV-Bench:基准ing How Well Judges Perform on Skill-Augmented Agentic Execution
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs
中文标题从运动到安全:对标传销中的主动风险推断
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing
中文标题VideoArgus:Agentic Rubric-Grounded Unified 评测 面向 Video Generation 与 Editing
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Scalable estimation of VARMA models
中文标题可扩展 estimation of VARMA models
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Minimax Optimal Early-Stopped Gradient Descent for Gaussian Mixture Classification
中文标题用于高斯混合分类的最小最优早期停止梯度下降
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models
中文标题DASH:Divergence-Adaptive Supervision Horizons 面向 On-Policy Self-Distillation of Reasoning Models
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Reversible Unlearnable Examples: Towards the Copyright Protection in Deep Learning Era
中文标题可逆不可学习的例子:走向深度学习时代的版权保护
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Beyond Marginal Validity: Finite-Sample Guarantees for Localized Conformal Prediction
中文标题超越边际效度:本地化保形预测的有限样本保证
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题CFGPNet:Cross-Attention-Based Fused Gradient Programmed Network 框架 面向 Multispectral Object Detection
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
EvReflection: Event-Driven Micro-Dynamics for Reflection Removal
中文标题EvReflection:Event-Driven Micro-Dynamics 面向 Reflection Removal
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Routing Is Least Learnable Where It Is Most Valuable:Bounds on Representation Routing 面向 Web Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
LLM Inference Under Bursty Workload Distribution: Modifying the WAIT Algorithm
中文标题突发工作负载分布下的LLM推理:修改WAIT算法
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Is Self-Pretraining really useful to improve diagnosis in medical Time Series?
中文标题自我预训练是否真的有助于改善医疗时间序列的诊断?
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题BioKD :通过情感识别的可靠性门户进行选择性生理学到视频知识蒸馏
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Iterate or Widen? When Test-Time Refinement Helps LiDAR Scene Completion:A Controlled Study of Evidence Geometry,Training Coverage,与 Compute
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Wan-Animate-2: Pushing the Application Boundaries of Character Animation
中文标题Wan-Animate-2 :突破角色动画的应用边界
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
中文标题Operating Multi-Node Full Fine-Tuning on NVIDIA B300:A Field Report on Telemetry-Based Triage,Negative Results,与 Operational Hardening
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题浮动辐射网络
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
GSBF: Gaussian Splatting for Environment-Aware Beamforming
中文标题GSBF:Gaussian Splatting 面向 Environment-Aware Beamforming
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。