让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力、提升代码生成、执行反馈和自动修复能力。
本期从 2026-09-01 论文源抓取并去重 486 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力、提升代码生成、执行反馈和自动修复能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题Compile,Don't Memorize:A Context Compilation Architecture (CCA) 面向 In-Context Learning
信号显示大语言模型( LLM )越来越多地处理上下文学习( ICL )任务,其中冗长、新颖的上下文定义了一系列问题的规则、知识和输出模式
关键词agentretrievalbenchmarkcode
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题对真实退化下的面部伪造检测的空间、光谱和自我监督线索进行基准测试
信号显示人脸伪造检测仪通常在受控基准上取得强劲结果,但其在真实图像退化下的可靠性仍然有限
关键词compressionevaluationbenchmarkcode
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题RadMatch :通过发现级匹配进行可审核放射学报告评估
信号显示随着人工智能系统越来越多地用于起草放射学报告,可靠地评估其临床质量仍然是一个关键挑战
关键词deploymentsafetyevaluationbenchmark
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题模仿学习是否在灵巧操纵中保持了时间鲁棒性?跨任务执行速度的专家学习者比较
信号显示通过模仿学习的灵巧操纵策略通常会被评估为对场景、对象或指令变化的鲁棒性,但它们在任务执行速度上的表现不太经常被检查
关键词alignmentevaluationcoderobot
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题论像素文本表示学习的设计基础
信号显示文本丰富的视觉输入需要能够直接在像素空间中读取、检索和压缩语言的模型,但现有的像素文本编码器难以解决固定分辨率预训练、视觉快捷学习、弱视觉接地和多语言视觉
关键词compressionalignmentevaluationcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题P-PatchDiff:Progressive Patch Diffusion Models 面向 Low-light Image Enhancement
信号显示弱光图像增强的最新进展利用了扩散模型,因为它们具有生成感知逼真、细致图像的强大能力
关键词ragalignmentcodememory
代码/数据需查看原文确认
其他值得关注
One Prompt Is Enough: Watermark Laundering Through Foundation Image Models
中文标题一个提示就足够了:通过基础图像模型进行水印清洗
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Dotting the Eye: An Intent-Driven Image Retouching Agent for Visual Focus Enhancement
中文标题Dotting the Eye:An Intent-Driven Image Retouching Agent 面向 视觉聚焦 Enhancement
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Post-hoc Alignment of LLM-judges to Human Judgment Distribution
中文标题LLM评委与人类判断分布的事后一致性
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题On-the-Fly3R:Towards Robust Online 3D Reconstruction with Feed-Forward 3R Models 面向 Large-Scale UAV Scenarios
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
A multicenter benchmark and clinically structured metric for coronary CTA report generation
中文标题一种multicenter 基准 与 clinically structured metric 面向 coronary CTA report generation
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Escaping Redundant Reasoning: Structure-Aware Search for Inference-Time LLMs
中文标题逃避冗余推理:结构感知搜索推理时间LLM
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
SCoNE: Selective Context-aware Neuron Editing for Robust Retrieval-Augmented Generation
中文标题SCoNE:Selective Context-aware Neuron Editing 面向 Robust Retrieval-Augmented Generation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
DGNet: Dual-knowledge Guided Network for Infrared Small Target Detection
中文标题DGNet:Dual-knowledge Guided Network 面向 Infrared Small Target Detection
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
REVISE: Validity-Guided Recovery for Online Revisions in Agent Workflows
中文标题REVISE:Validity-Guided Recovery 面向 Online Revisions in Agent Workflows
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
EM^2Mem: Event-Centric Multimodal Memory for Large Language Models
中文标题EM^2Mem:Event-Centric Multimodal Memory 面向 Large Language Models
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题缩小文档VLM的成本-质量差距:难度感知数据整理和质量调整的部署经济学
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Gradient-Update Mismatch: Rethinking Conflict-Free Training of Physics-Informed Neural Networks
中文标题梯度-更新不匹配:重新思考物理知情神经网络的无冲突训练
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Bandits in Prod: Hyperparameter Optimization at Inference Time
中文标题PROD中的Bandits :推理时间的超参数优化
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
CopyShield: A Cross-Level Benchmark of Copyright Defenses in LLMs
中文标题CopyShield:A Cross-Level 基准 of Copyright Defenses in LLMs
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题HiveTraceGuard-Pro:A Compact Generative Guardrail 面向 Prompt Injection,Jailbreaks,与 Adversarial Obfuscation
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
ReFlowSET: Representation-Aligned Latent Flow Matching for SAR-to-EO Image Translation
中文标题ReFlowSET:Representation-Aligned Latent Flow Matching 面向 SAR-to-EO Image Translation
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Candidate-Expanding Routing with Permutation-Stabilized Experts for Mixed-Format Medical VQA
中文标题针对混合格式医疗VQA的排列稳定专家的候选人扩展路由
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Differentially Private Paired Table-Image Multimodal Synthesis
中文标题差异化私有配对表图像多模态合成
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Trust Your Guide Only When Certain: Uncertainty-Aware Sparse Alignment at Inference Time
中文标题仅在确定时才信任您的向导:在推理时具有不确定性感知的稀疏对齐
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation
中文标题通过轨迹感知评估进行高效的SWE Agent基准测试
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。