让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力、提升 RAG 检索和知识库问答可靠性
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。
本期从 2026-07-09 论文源抓取并去重 291 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1AUTOPILOT VQA:基准ing Vision-Language Models 面向 Incident-Centric Dashcam Underst与ing🔗
- 2Cognitive-structured Multimodal Agent 面向 Multimodal Underst与ing,Generation,与 Editing🔗
- 3Best-of-$N$ TTS 评测 is Confounded by ASR Family Alignment🔗
- 4Collate:Collaborative Neural Network Learning 面向 Latency-Critical Edge Systems🔗
- 5EVIS:A Physics-Grounded Event Camera Plugin 面向 NVIDIA Isaac Sim🔗
- 6机械地理解为什么记忆知识在大型语言模型微调中不能泛化🔗
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题AUTOPILOT VQA:基准ing Vision-Language Models 面向 Incident-Centric Dashcam Understanding
信号显示视觉语言模型、大语言模型和多模态大语言模型的最新进展改善了自动驾驶任务,如场景理解、决策、轨迹预测和视觉问答
关键词safetybenchmarkmultimodalvision-language
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Cognitive-structured Multimodal Agent 面向 Multimodal Understanding,Generation,与 Editing
信号显示最近的统一多模态模型表明,单个架构可以联合执行视觉/语言理解和图像生成/编辑
关键词agentretrievalinferenceserving
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题Best-of-$N$ TTS 评测 is Confounded by ASR Family Alignment
信号显示最佳$ N $ (BoN)推理通过从带有自动语音识别(ASR)验证器的$ N $候选项中进行选择,提高了零拍摄文本到语音的内容一致性
关键词raginferencealignmentevaluation
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题Collate:Collaborative Neural Network Learning 面向 Latency-Critical Edge Systems
信号显示联合学习( FL )使多个客户能够协同学习模型,扩展每个客户的培训数据以实现高准确性,同时保护数据隐私
关键词raginferencelatencycode
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题EVIS:A Physics-Grounded Event Camera Plugin 面向 NVIDIA Isaac Sim
信号显示事件相机提供微秒时间分辨率、低延迟和高动态范围,使其对机器人技术具有吸引力
关键词latencycoderoboticstemporal
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题机械地理解为什么记忆知识在大型语言模型微调中不能泛化
信号显示微调LLM以注入新知识面临严峻挑战: LLM可以快速记住新事实,但不能将其用于下游推理任务
关键词alignmentfine-tuningrepresentationmechanistic
代码/数据需查看原文确认
其他值得关注
Log-Insight: Automating Microservice Incident Diagnosis via Neuro-Symbolic Log Analysis
中文标题Log-Insight :通过神经符号日志分析实现微服务事件诊断自动化
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Cross-seed explainability using Procrustes-conditioned Joint End-to-end Top-K Sparse Autoencoders
中文标题Cross-seed explainability 使用 Procrustes-conditioned Joint End-to-end Top-K Sparse Autoencoders
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题Dual-Correlation Hypergraph Network 面向 Unaligned RGBT Video Object Detection 与 A Large-scale 基准
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题具有差分隐私的等变量量子聚类:跨异构敏感数据集的参数高效隐私保护分析
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Mixture of Enhanced-View Experts for Multi-Query Vehicle ReID and A Large-Scale Benchmark
中文标题Mixture of Enhanced-View Experts 面向 Multi-Query Vehicle ReID 与 A Large-Scale 基准
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Who Analyses the Analyser? Self-Validating LLM Hazard Analysis with Constitutional Meta-STPA
中文标题谁来分析分析器?使用宪法Meta-STPA进行自我验证法学硕士风险分析
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation
中文标题ARDY:Autoregressive Diffusion with Hybrid Representation 面向 Interactive Human Motion Generation
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
WaspMOT: A Benchmark for Long-Term Multi-Object Tracking of Trichogramma Wasps
中文标题WaspMOT:A 基准 面向 Long-Term Multi-Object Tracking of Trichogramma Wasps
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models
中文标题重新采样或重新路由?大型语言模型的预算感知测试时间模型选择
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
It Takes a MAESTRO To Prune Bad Experts
中文标题修剪糟糕的专家需要大师
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题早期共享,晚期保存:带宽受限的协作VLN中的同步驱动通信选通
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题人格识别中原型网络的理论不可知自适应度量对齐中的大型语言模型即法官
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Prediction-Powered Active Testing
中文标题预测驱动的主动测试
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech
中文标题Diarization-Guided Qwen-ASR Adaptation 面向 Multilingual Two-Speaker Conversational Speech
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Modular Pretraining Enables Access Control
中文标题模块化预训练实现访问控制
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment
中文标题重新思考小型VLM量化:从组件分析到硬件边缘部署
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Wat3R: Underwater 3D Geometry Learning without Annotations
中文标题Wat3R :无标注的水下3D几何学习
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题LongE2V:Long-Horizon Event-based Video Reconstruction,Prediction,与 Frame Interpolation with Video Diffusion Models
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
中文标题UniClawBench:A Universal 基准 面向 Proactive Agents on Real-World Tasks
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales
中文标题HumanForge :以人为本的Deepfake视频基准与多Agent伪造原理
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。