让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-07-21 论文源抓取并去重 305 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题CodeRescue:Budget-Calibrated Recovery Routing 面向 Coding Agents
信号显示编码代理越来越多地在可执行环境中运行,在这种环境中,失败的尝试会产生可操作的反馈,而不仅仅是错误的答案
关键词agentdeploymentbenchmarkcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题点阶梯调整:用于三维点云理解的高参数分层自适应
信号显示微调预训练的点云骨干通常会更新所有参数,从而导致大量计算和内存开销
关键词ragcodefine-tuningmemory
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题跨代理活动归因:跨LLM代理链接异步攻击
信号显示LLM代理防御通常每次评估一个会话
关键词agentragdeploymentevaluation
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题案例:提高思想链忠诚度的因果对齐和结构执行
信号显示思维链( CoT )推理被广泛用于提高大语言模型( LLM )的性能和可解释性,但生成的推理可能无法忠实地支持最终答案
关键词raginferencealignmentbenchmark
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题Wave2Body :将毫米波人体姿态估计重新思考为雷达到人体令牌转换
信号显示毫米波( mmWave )雷达可实现隐私友好的人体感应,但其稀疏的点云是对视图相关电磁反射的物理测量,仅间接表征人体关节
关键词raginferencealignmentcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题我们没有计量的安全故障:对现代人工智能系统中隐藏的安全关键挑战的看法
信号显示当前的人工智能安全话语仍然不成比例地关注可见的故障,包括明显的危害、戏剧性的滥用和假设的灾难性场景
关键词workflowretrievaldeploymentsafety
代码/数据需查看原文确认
其他值得关注
中文标题具有结构化场景知识和可验证推理-行动一致性的自动驾驶认知双流程规划
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Delineate Anything v2: A Global Foundation Model for Field Delineation
中文标题描绘任何内容v2 :现场描绘的全球基础模型
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Beyond Noisy Signals: Dual-Level Denoising for Multi-modal Sequential Recommendation
中文标题超越噪声信号:针对多模态顺序推荐的双级去噪
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation
中文标题无需培训,更好的飞行:用于无人机导航的测试时间缩放VLM
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs
中文标题LLM中跨语言事实一致性的推理时间指导
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
中文标题ABot-World-0 :在单个桌面GPU上推出无限互动世界
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
中文标题Mage-Flow:An Efficient Native-Resolution Foundation Model 面向 Image Generation 与 Editing
关注理由涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
CoGoal3D: Collaborative 3D Object Detection with 3D-Aware Fusion and Refinement
中文标题CoGoal3D :具有3D感知融合和细化的协作3D对象检测
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Measuring Reward-Seeking via Contrastive Belief Updates
中文标题通过对比信念更新来衡量奖励寻求
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题来自 a Multilingual Streaming ASR Backbone to Kenyan-Language Systems:Data-Centric Adaptation of Nemotron 3.5 面向 Kikuyu,Dholuo,与 Kalenjin
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题Spaghetti ArchiteCT :一种抗污染、附带施工标签的多语言代码数据集生成器
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题BRIDGE:Bottleneck-Aware Regulator-Set Inference 与 Diagnosis 面向 Cooperative Gene Regulatory Recovery
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题ExpertVerse:A General-Purpose 基准 面向 Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
OmniReasoner: Thinking with Long Audio-Video via Native Tool Use
中文标题OmniReasoner :通过原生工具使用长音频视频进行思考
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Agents in the Wild: Where Research Meets Deployment
中文标题野外特工:研究与部署相遇的地方
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Two-Level Meta-Rubrics 面向 Evaluating Open-Ended Generation:GAMUT,a 基准 面向 Factual Completeness
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D
中文标题ResearchArena:Evaluating Sabotage 与 Monitoring in Automated AI R&D
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
CircuitKIT : Circuit Discovery, Evaluation, and Application Toolkit for Mechanistic Interpretability
中文标题CircuitKIT:Circuit Discovery,评测,与 Application Toolkit 面向 Mechanistic Interpretability
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题超越分数预测:基于法学硕士的论文评分和通过强化学习与评分细则表奖励生成反馈
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents
中文标题Agentic Real2Sim :使用视觉语言代理进行基于物理的世界建模
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。