让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。
本期从 2026-08-10 论文源抓取并去重 453 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题DREAM技术报告
信号显示Industrial 推荐系统 commonly use cascaded retrieval, ranking, and re-ranking pipelines
关键词agentragretrievalserving
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题从专有LLM API中窃取推理痕迹
信号显示该研究围绕题名与摘要所揭示的问题展开,具体信号需结合原文进一步核验:Leading large language model providers now conceal their models' step-by-step reasoning, or chain-of-thought, to protect intellectual property and limit information leakage
关键词agentragcodereasoning
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题MedPixel:A Unified Pixel-Language Model 面向 Medical Reasoning 与 Segmentation
信号显示该研究围绕题名与摘要所揭示的问题展开,具体信号需结合原文进一步核验:Reliable medical image understanding requires models to connect clinical language and visual reasoning with pixel-level grounding
关键词benchmarkcodevision-languagefine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题ActBench:Self-Evolving 基准 of Behavioral Safety in Cowork Agents
信号显示该研究围绕题名与摘要所揭示的问题展开,具体信号需结合原文进一步核验:Cowork agents may complete benign tasks while disclosing protected data, manipulating unauthorized state, invocate unauthorized API
关键词agentsafetybenchmarkopen-source
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题用于现实存储库迁移的基于熵的代码对抗翻译
信号显示该研究围绕题名与摘要所揭示的问题展开,具体信号需结合原文进一步核验:LLMs have demonstrated strong capabilities in code generation and automated program repair, but migrating an entire repository rarely produces a runnable application because long-horizon translation challenges LLM-based agents' ability to maintain repository-l
关键词agentalignmentbenchmarkcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题双轴模式下的多模态联合学习缺失
信号显示该研究围绕题名与摘要所揭示的问题展开,具体信号需结合原文进一步核验:Multimodal federated learning (FL) supports collaborative modeling in privacy-sensitive health-sensing and medical settings, but realistic deployments often exhibit dual-axis modality missingness: clients have different modality sets, and individual samples ma
关键词ragdeploymentcodemultimodal
代码/数据需查看原文确认
其他值得关注
中文标题把握:粒度感知区域对齐和语义原型学习,用于无人机视图中的细粒度跨模态理解
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Governing the KV Cache: Preventing Timing Side-Channel Leakage in Multi-Tenant LLM Inference
中文标题管理KV缓存:防止多租户LLM推断中的定时侧通道泄漏
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题具有局部到全局循环闭包的多子图隐式神经SLAM ,用于大规模场景重建
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision
中文标题SI-Edit :使用像素级精度进行本地图像编辑的草图指导
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
PolicyKG: An Agentic LLM Pipeline for Translating Institutional Policies into SHACL Knowledge Graphs
中文标题PolicyKG:An Agentic LLM Pipeline 面向 Translating Institutional Policies into SHACL Knowledge Graphs
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
TeaMatch: Teachable Cross-Modal Representation Learning for 2D-3D Matching
中文标题TeaMatch:Teachable Cross-Modal Representation Learning 面向 2D-3D Matching
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题朝着富有表现力和忠实的音频图像生成:统一的多模态数据集和合成框架
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题通过语言强化学习实现大型语言模型个性化的学习偏好适应
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题VANE :通过未来视觉表示预测为视觉-语言-动作模型提供可靠的测试时间培训
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law
中文标题Temporal Mis落地 in Legal RAG:A Versioned-Corpus 基准 面向 French Tax Law
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
SAFE-CHEM: Uncertainty-Aware Policy Switching for Robust Robotic Chemistry
中文标题SAFE-CHEM:Uncertainty-Aware Policy Switching 面向 Robust Robotic Chemistry
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation
中文标题宫腔镜手术场景分割的引导视觉语言模型
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题超越自然:探索基于语言学维度的自动文本到语音评估器
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Multimodal Model Diffing for Feature Discovery and Control
中文标题用于特征发现和控制的多模态模型差异
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Beyond Hazard Resemblance: Contrastive Event Adjudication for Training-Free Video Anomaly Detection
中文标题Beyond Hazard Resemblance:Contrastive Event Adjudication 面向 Training-Free Video Anomaly Detection
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题DistMoE:Private-data Rehearsal-free Routing in Mixture-of-Experts 面向 Distributed Instruction Tuning
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness
中文标题Decoding-Level Taboo:A Diagnostic Stress Test 面向 LLM Robustness
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
SHE: Trajectory-driven Safety Harness Evolution for LLM Agents
中文标题SHE:Trajectory-driven Safety Harness Evolution 面向 LLM Agents
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Mismatch Matters: On-Policy Distillation Beyond Token Agreement
中文标题Mismatch Matters:On-Policy Distillation Beyond Token Agreement
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Multi-Agent AI Safety as an Institutional Design Problem
中文标题多Agent AI安全作为制度设计问题
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。