让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性、提升代码生成、执行反馈和自动修复能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-08-14 论文源抓取并去重 281 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1CoDS:通过专家驱动的检测和BEV细分实现强大的协作感知🔗
- 2Nanbeige4.2-3B on Apple Silicon:Fixing Deployment Bugs 与 Decreasing Looped Trans面向mer Memory Overhead🔗
- 3Tripwire:通过统计认证的安全神经元触发一致的拒绝🔗
- 4CORAL:Curriculum-Optimized Reward Adaptation 面向 LiDAR-Based Goal-Directed Urban Driving🔗
- 5Envs-面向GE:Frontier-Optimized Reward-Grounded Environment Synthesis 面向 Agent RL🔗
- 6HAM-RAG:Hierarchy-Aware Multimodal RAG 面向 Structure-Faithful Interleaved Generation🔗
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题CoDS :通过专家驱动的检测和BEV细分实现强大的协作感知
信号显示协作感知通过多智能体信息交换突破单视图限制
关键词agentcodesegmentationdetection
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Nanbeige4.2-3B on Apple Silicon:Fixing Deployment Bugs 与 Decreasing Looped Transformer Memory Overhead
信号显示Nanbeige4.2-3B是围绕环形变压器( LT )构建的3B参数代理模型,它重复使用一堆层进行第二次向前通过,无需额外参数即可增加有效深度
关键词agentdeploymentevaluationbenchmark
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题Tripwire :通过统计认证的安全神经元触发一致的拒绝
信号显示神经元和路径级干预措施为保护大语言模型( LLM )免受越狱攻击提供了最精细的途径,但现有方法没有达到这一承诺,即它们往往会严重损害模型实用性
关键词raginferencedeploymentalignment
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题CORAL:Curriculum-Optimized Reward Adaptation 面向 LiDAR-Based Goal-Directed Urban Driving
信号显示强化学习对城市自动驾驶很有希望,但长视野目标导航要求政策一次获得几种相互竞争的行为--达到远距离目标、跟踪路线、避开障碍物、服从信号--以及解决办法
关键词safetyevaluationcodenavigation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Envs-FORGE:Frontier-Optimized Reward-Grounded Environment Synthesis 面向 Agent RL
信号显示终端代理的强化学习( RL )需要具有可靠奖励和有用难度的可执行培训环境
关键词agentragcodeagents
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题HAM-RAG:Hierarchy-Aware Multimodal RAG 面向 Structure-Faithful Interleaved Generation
信号显示现有的多模式RAG方法通常将结构化文档压缩为孤立的文本和图像单元,削弱了可靠证据选择和放置所需的源组织和本地文本图像逻辑
关键词ragretrievalservingalignment
代码/数据需查看原文确认
其他值得关注
Accelerating Large-scale Bundle Adjustment for LiDAR Mapping via Parallel Computing
中文标题通过并行计算加速LiDAR映射的大规模捆绑调整
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Content Based Video Narration of Gameplay with Vision Language Models
中文标题基于内容的视频讲述视觉语言模型的游戏玩法
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题CMCNet :将超声图像嵌入与文本TI-RADS表示对齐,用于细粒度甲状腺分类
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge
中文标题为第二届MLC-SLM挑战赛提供领先的静音增强和多阶段合成监控
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题试点:部分可观测性下自主无人机端到端运动规划特权模仿学习
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
CForce: Boosting Parallel Decoding for dLLMs via Consistency Forcing
中文标题CForce :通过一致性强制提升dLLM的并行解码
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
CPI-Bench: A Comprehensive,Practical and Intelligent Benchmark for Real-World Image Editing
中文标题CPI-Bench:A Comprehensive,Practical 与 Intelligent 基准 面向 Real-World Image Editing
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments
中文标题PACE-Bench :通过动态环境中的代码演进对物理适应进行基准测试
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic 评测 of Detectors,Generators 与 Social Dissemination
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
AgentRewind: Recoverable Execution for Long-Horizon LLM Agents
中文标题AgentRewind:Recoverable Execution 面向 Long-Horizon LLM Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
A Survey of Large Models in Sports
中文标题大模特体育综述
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
On the Robustness of Temporal Vision-Language Models for Surgical Endoscopy Videos
中文标题关于手术内窥镜视频中时间视觉语言模型的鲁棒性
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
APTER: Adaptive Post-Training with Expert-Grounded Rubrics
中文标题APTER :基于专家评分细则表的适应性后期培训
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
MINT: A Universal Zero-Shot Predictor for Transaction Data
中文标题MINT:A Universal Zero-Shot Predictor 面向 Transaction Data
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题语言模型能理解毫米波数据吗?对大型语言模型进行基准测试,以实现基于毫米波雷达的人类理解
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
AlignFace: Human-Aligned Face Similarity Metric with Interpretable Concept Relations
中文标题AlignFace :具有可解释概念关系的人类对齐人脸相似度指标
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题用于自主LLM Agent结构化漂移诊断和恢复的基于图的强化学习框架
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
P2Skill: Privacy Preserving Skill Distillation for Cloud-Local LLM Inference Systems
中文标题P2Skill:Privacy Preserving Skill Distillation 面向 Cloud-Local LLM Inference Systems
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
中文标题制度条件验证:调整和监测安全分类器的正确性估计
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use
中文标题使用实时工具将视觉-语言-行动模型演变为客服代表
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。