提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-07-17 论文源抓取并去重 267 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1MemoGuard:An Adaptive Runtime 面向 Guarding Against Memory Traps in Communication-Limited Robot Navigation🔗
- 2PRISA:Proactive Infrastructure LiDAR 框架 面向 Intersection Safety 评估🔗
- 3Sci面向ge:An AI-Native,Multimodal Workbench 面向 Scientific Discovery🔗
- 4AgentFAIR:A Multi-Agent Collaborative 框架 面向 FAIRness 评测 of Geospatial Datasets🔗
- 5GoStop:Rein面向cement Learning 面向 Adaptive Temporal Aggregation in Event-Based Feature Tracking🔗
- 6使用表格基础模型重新审视数据驱动的动态安全评估🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升模型推理、规划和验证能力
中文标题MemoGuard:An Adaptive Runtime 面向 Guarding Against Memory Traps in Communication-Limited Robot Navigation
信号显示在灾难检查和搜索救援等关键任务场景中,通信受限的机器人必须在无需远程操作员或高容量推理服务的情况下做出可靠的机载决策
关键词retrievalsafetyopen-sourcememory
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题PRISA:Proactive Infrastructure LiDAR 框架 面向 Intersection Safety 评估
信号显示城市交叉路口是道路网络中最危险的地方之一,对车辆和弱势道路使用者( VRU ) (如行人和骑自行车者)构成重大风险
关键词agentragservinglatency
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题SciForge:An AI-Native,Multimodal Workbench 面向 Scientific Discovery
信号显示科学工作越来越多地跨越异构工件-论文,代码,数据集,科学文件格式,模型输出,数字,手稿和团队决策-但通用AI助手很少将这些对象保存为一个连贯的,可审计的
关键词agentworkflowcodemultimodal
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题AgentFAIR:A Multi-Agent Collaborative 框架 面向 FAIRness 评测 of Geospatial Datasets
信号显示地理空间数据集支持从城市规划到气候建模的应用,但很难对公平合规性进行一致的评估
关键词agentragalignmentevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题GoStop:Reinforcement Learning 面向 Adaptive Temporal Aggregation in Event-Based Feature Tracking
信号显示特征跟踪在理解场景运动中起着基础性作用,并支持各种下游任务
关键词agentinferencelatencycode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题使用表格基础模型重新审视数据驱动的动态安全评估
信号显示数据驱动的故障前动态安全评估( DSA )使用机器学习快速评估电力系统上可信意外事件的动态风险
关键词ragdatabasetrainingrl
代码/数据需查看原文确认
其他值得关注
中文标题路边多激光雷达、多摄像头测量系统的硬件触发时间同步,实现精确的数据对准
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation
中文标题动态感知元模拟,用于泛化到看不见的机器人操纵
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Von Mises-Fisher Mixture Model with Dynamic Shrinkage for Realistic Test-Time Transduction
中文标题具有动态收缩的Von Mises-Fisher混合模型,用于真实的测试时间转换
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion
中文标题通过交叉注意和门控融合进行多模态矛盾和犹豫识别
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling
中文标题StruCTGen :通过结构化上下文建模消除多引用图像生成的歧义
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching
中文标题缓存感知提示压缩: LLM API缓存的两层成本模型
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA
中文标题以树的形式搜索视频:接地长视频QA的自校正代理
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
CLIFE: Camera-LiDAR Fusion Framework for Edge-Deployable Roadside VRU Perception
中文标题CLIFE:Camera-LiDAR Fusion 框架 面向 Edge-Deployable Roadside VRU Perception
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
CADAQUES: A Cost-Aware Dual Architecture for Query-Efficient Autonomous Discovery
中文标题CADAQUES:A Cost-Aware Dual Architecture 面向 Query-Efficient Autonomous Discovery
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题LLM-Powered Agentic AI 面向 5G/6G Networks:A Tutorial 与 Survey on Architectures,Protocols,与 标准化
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题DPNeXt:A Lightweight Multi-Scale Feature Fusion 框架 面向 Efficient ViT-Based Multi-Task Dense Prediction
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe
中文标题少花钱多办事:大型遥感VLM ,配方简单
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题知识引导的跨模式融合,用于通过标签条件对比对齐进行成人-儿科心电图转移
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
DSWorld: A Data Science World Model for Efficient Autonomous Agents
中文标题DSWorld:A Data Science World Model 面向 Efficient Autonomous Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ContinuityBench: A Benchmark and Systems Study of Stateful Failover in Multi-Provider LLM Routing
中文标题ContinuityBench:A 基准 与 Systems Study of Stateful Failover in Multi-Provider LLM Routing
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
An MLIR-Based Compilation Method for Large Language Models
中文标题一种MLIR-Based Compilation Method 面向 Large Language Models
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
中文标题QUADS :通过跨双侧的QUantization-error对齐来稳定MoE的NVFP4强化学习
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题Making Agent-Mediated Contributions Governable:A Project-Level Governance Manifest 面向 Open-Source AI Collaboration
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
GeoChrono: Benchmarking and Rethinking Long-Term Temporal Understanding in Remote Sensing
中文标题GeoChrono:基准ing 与 Rethinking Long-Term Temporal Understanding in Remote Sensing
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery
中文标题行动前:对LLM进行前瞻性假设发现基准测试
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。