提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-08-20 论文源抓取并去重 291 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1学习如何忘记:长上下文稀疏注意力的微调🔗
- 2Projecting BrowseComp-Plus onto ClimbMix:面向 More Realistic Corpora 面向 Agentic Search🔗
- 31C的自然语言代码检索:企业:开放的基准和高效的双编码器🔗
- 4One Success Isn't Reliability:Thinkingbox,a S与box 与 基准 面向 Agents in Stateful Business Workflows🔗
- 5MOSAIC:Modality-agnostic Spectral Alignment 面向 Federated Image-level Weakly Supervised Tumor Segmentation under Client-specific Missing Modalities🔗
- 6电子导航图变更分类🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题学习如何忘记:长上下文稀疏注意力的微调
信号显示以前的许多工作都是通过稀疏的关注来解决键值( KV )缓存选择和压缩问题,以便在没有过多硬件预算的情况下为变压器语言模型实现长上下文推理
关键词inferencecompressioncodefine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Projecting BrowseComp-Plus onto ClimbMix:面向 More Realistic Corpora 面向 Agentic Search
信号显示BrowseComp-Plus基准测试通过用固定语料库替换不透明的Web搜索来解开代理搜索的评估,以便可以将代理的角色与检索器的角色分开
关键词agentretrievalevaluationbenchmark
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题1C的自然语言代码检索:企业:开放的基准和高效的双编码器
信号显示自然语言代码检索是计算机科学中一项快速发展的任务
关键词ragretrievalevaluationbenchmark
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题One Success Isn't Reliability:Thinkingbox,a Sandbox 与 基准 面向 Agents in Stateful Business Workflows
信号显示最近的代理基准测试越来越多地在可执行环境中进行评估,从代码修复到Web导航、应用程序API和函数调用
关键词agentworkflowevaluationbenchmark
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题MOSAIC:Modality-agnostic Spectral Alignment 面向 Federated Image-level Weakly Supervised Tumor Segmentation under Client-specific Missing Modalities
信号显示临床环境中值得信赖的多模式融合需要处理跨机构的不完整和异构模式子集,其中隐私限制禁止集中式数据共享
关键词alignmentbenchmarkcodemultimodal
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题电子导航图变更分类
信号显示电子导航图( ENC )是海上导航系统中使用的地理空间矢量数据集,表示水文和导航信息,如深度、导航辅助、交通方案和危险
关键词workflowragsafetycode
代码/数据需查看原文确认
其他值得关注
G-MARK: Grounded Multi-Agent Reasoning for Cooperative Driving via Knowledge Graphs
中文标题G-MARK :通过知识图谱进行合作驾驶的基础多Agent推理
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题从噪音到信号:使用具有端点特定日志的LLM改进安全日志异常检测
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Repo0: Design-Driven Zero-to-All Code Generation
中文标题Repo0 :设计驱动的零到全部代码生成
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving
中文标题FlashPrefill V2:Block-Sparse Prefill Attention 面向 Long-Context LLM Serving
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
From Retrieved Context to Runtime Control: Adaptive Compression for Edge-based RAG
中文标题从检索的上下文到运行时控制:基于边缘的RAG的自适应压缩
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题LLM自动驾驶常识推理能力的多Agent编排
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
OenoBench: A Wine-Domain Benchmark for Knowledge-Grounded Evaluation of Large Language Models
中文标题OenoBench:A Wine-Domain 基准 面向 Knowledge-Grounded 评测 of Large Language Models
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
On the Applicability of Safety Nets: A Safety-By-Design Solution for Certifying Neural Networks
中文标题论安全网的适用性:神经网络认证的安全设计解决方案
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题从街景图像到街道质量指标:郊区15分钟城市的视觉语言推断
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Stopping and Routing LLM Judge Panels
中文标题停止和路由LLM法官小组
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Truncate Bad, Upweight Good: BoN-Style Distillation via Rank-Based Classification
中文标题截断不良,增重货物:通过基于等级的分类进行BoN型蒸馏
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Escaping the Quicksand: A Call to Arms
中文标题逃离流沙:武器召唤
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
FleetSieve: Decision-Critical Profiling for SLO-Aware LLM Fleet Configuration
中文标题FleetSieve:Decision-Critical Profiling 面向 SLO-Aware LLM Fleet Configuration
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
ConceptGuard: Benchmarking Context-Sensitive Unlearning in Large Language Models
中文标题ConceptGuard:基准ing Context-Sensitive Unlearning in Large Language Models
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
中文标题AI4AI-Bench:基准ing LLM Agents in Algorithmic Design 面向 Recursive Self-Improvement
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization
中文标题注入、对齐、恢复:无检索文档知识内化的分阶段后期培训
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models
中文标题多模态大型语言模型的规则兼容视觉空间规划
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题RoMAN-Flow:Taming Autoregressive Normalizing Flows 面向 Offline Reinforcement Learning in Robotic Manipulation
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题第三次软件形态重构:从三层架构到存储、模型、代理
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
ID-VTG: Image-Disambiguated Video Temporal Grounding
中文标题ID-VTG:Image-Disambiguated Video Temporal 落地
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。