提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-09-21 论文源抓取并去重 432 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题面向森林点云的基础模型
信号显示森林库存越来越依赖于人工智能( AI )模型从大规模3D点云中获取森林属性
关键词benchmarkcodeevalevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题RRSI :药剂线束的规则化递归自我改善
信号显示LLM代理的能力在很大程度上通过其利用来放大,即围绕冷冻骨干模型的提示、控制流、工具、内存和上下文管理
关键词agentragbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题DUMA-Bench :评估LLM Agent安全性的双控多Agent基准
信号显示基于LLM的代理越来越多地在与用户、工具和外部系统交互的环境中运行
关键词agentragdeploymentevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题MedRSI :通过临床一致性自我进化对医疗人员进行递归自我改善
信号显示医疗代理商越来越多地将一般推理模型与专门的临床工具相结合,但他们的能力在很大程度上仍然取决于临床医生和工程师在部署前的设计
关键词agentdeploymentsafetybenchmark
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题0.5\ % > 100\ % :引用图像分割的双向相互学习
信号显示视觉基础模型(VFM)的最新进展在各种单模态视觉任务中显示出非凡的能力
关键词alignmentbenchmarkcodevision-language
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题具有自适应阈值和可解释性的高维在线变更点检测
信号显示变更点检测( CPD )识别连续数据的突然和重大变化,应用于人类活动识别、金融市场、网络安全、制造和自主系统
关键词ragdeploymentcodeinterpretability
代码/数据需查看原文确认
其他值得关注
Incentive Noise and Structural Prior Infusion for Multi-modal Object Re-Identification
中文标题用于多模式物体重新识别的激励噪声和结构事先输注
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
When Evidence Conflicts: Reliability-aware Meta-review Generation
中文标题当证据发生冲突时:具有可靠性感知的元审核生成
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题谁为KV缓存付费?在Kubernetes和LLM提供商账单中归因共享AI推断支出
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Rare Event Estimation via Iterative Unalignment
中文标题通过迭代不对齐的罕见事件估计
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
PrismGPT: Proxy-Guided Learning for Region-Aware Photo Editing with Self-Synthesized Reasoning
中文标题PrismGPT :基于自合成推理的区域感知照片编辑代理引导式学习
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
D-JEPA: A Decision-Aligned Latent World Model
中文标题D-JEPA :与决策相一致的潜在世界模型
关注理由涉及机器人与具身智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
AlignMorph: Tuning-Free Diffusion Image Morphing via Explicit Semantic Transport
中文标题AlignMorph :通过显式语义传输实现无调整扩散图像变形
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题A$^2$Safe:Counterfactual Evidence-Aligned Adaptive Agent Collaboration 面向 Safe 与 Effective Visual Question Answering
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
ACLArena: Agent Continue Learning in Multi-stage Post-training
中文标题ACLArena :客服代表在多阶段培训后继续学习
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
LEAP-NBV: Lightweight Edge Active-Perception for Foundation-Model Next-Best-View Planning
中文标题LEAP-NBV:Lightweight Edge Active-Perception 面向 Foundation-Model Next-Best-View Planning
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
SPHQuant: Efficient extreme low bit weight quantization for Vision-Language Models
中文标题SPHQuant:Efficient extreme low bit weight quantization 面向 Vision-Language Models
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
中文标题当量化保持准确性但没有证据时:医疗LLM的解释感知训练后量化
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
GraphSVR: q-Space--Aware Graph-Based Slice-to-Volume Registration for Diffusion MRI
中文标题GraphSVR:q-Space--Aware Graph-Based Slice-to-Volume Registration 面向 Diffusion MRI
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
ReSTI: A Source-Grounded Audit and Repair of STI-Bench
中文标题ReSTI:A Source-Grounded Audit 与 Repair of STI-Bench
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题像世界模型一样思考,像VLA一样行动:将世界模型表征提炼成紧凑型机器人政策
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Augmented Hypothesis Testing with Persona-Based LLM Simulations
中文标题使用基于角色的LLM模拟进行增强假设测试
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题FedMust:Semi-supervised Multi-task Student-Teacher Federated Learning 面向 Multi-organ CT Segmentation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Learning tactile perception from high-bandwidth single-point sensing
中文标题从高带宽单点感知中学习触觉感知
关注理由涉及机器人与具身智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Taking a Second Look: Correcting Sea Ice Forecasts with Sparse Observations
中文标题重新审视:用稀疏观测修正海冰预报
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
HyperCLIP++: Fine-tuning CLIP forOpen-vocabulary Semantic Segmentation in Hyperbolic Space
中文标题HyperCLIP + + :双曲空间中开放词汇语义分割的微调剪辑
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。