提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力。
本期从 2026-07-27 论文源抓取并去重 335 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1LCMamNet:A Lightweight Cross-scale Mamba Network 面向 Infrared Small Target Detection🔗
- 2通过物理感知策略蒸馏进行可解释的强化学习🔗
- 3Stress-Testing EEG Foundation Models 面向 Clinical Decoding:Dataset Identity 与 Targeted Negative Controls🔗
- 4多模态分类中缺失任意模式的共同学习🔗
- 5通过大型语言模型集成,使数学知识可解释、可访问和可互操作🔗
- 6MobiWave:Dispatch-Oriented Graph Wavelets 与 Drift-Guided Selective Optimization 面向 Autonomous Fleet Rebalancing🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题LCMamNet:A Lightweight Cross-scale Mamba Network 面向 Infrared Small Target Detection
信号显示红外小目标探测( IRSTD )对于低空感知、无人系统预警和安全监控非常重要
关键词inferencedeploymentlatencycode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题通过物理感知策略蒸馏进行可解释的强化学习
信号显示在机器人和汽车工程等安全关键领域,深度强化学习( DRL )的部署经常受到深度神经网络黑箱性质的阻碍
关键词agentragdeploymentsafety
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题Stress-Testing EEG Foundation Models 面向 Clinical Decoding:Dataset Identity 与 Targeted Negative Controls
信号显示越来越多地提出用于临床解码的预训练脑电图基础模型,但它们在人群之间的转移以及对阴性对照的鲁棒性仍不清楚
关键词evaluationbenchmarkcodefine-tuning
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题多模态分类中缺失任意模式的共同学习
信号显示多模态分类利用跨不同数据源的互补信息来增强预测性能
关键词raginferencebenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题通过大型语言模型集成,使数学知识可解释、可访问和可互操作
信号显示数学模型是形式化研究问题的核心,但其文档往往不符合公平原则
关键词ragretrievalsafetyopen-source
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题MobiWave:Dispatch-Oriented Graph Wavelets 与 Drift-Guided Selective Optimization 面向 Autonomous Fleet Rebalancing
信号显示自动驾驶车队使移动平台能够直接协调闲置车辆,从而使全车队重新平衡成为可能
关键词deploymentsafetycodedata
代码/数据需查看原文确认
其他值得关注
中文标题Gubernaut:A Deterministic Homeostatic Controller 面向 Affect-Regulated LLM Agents,Validated Across Independent Model Families
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models
中文标题DICA :多模态大型语言模型中的双指标引导对比对齐
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding
中文标题LOCKS:Page-Local Compact Key Summaries 面向 Efficient Long-Context Decoding
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Grounding latent algorithm routing in transformer reasoning
中文标题变压器推理中的接地潜在算法路由
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation
中文标题PRISM :通过基于图像的自我奖励机制快速细化文本图像生成
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG
中文标题通过本地多Agent RAG进行能量受限的分层水下监测
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Epistemic Norms for AI Safety and Alignment Research
中文标题Epistemic Norms 面向 AI Safety 与 Alignment Research
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Constrained Reinforcement Learning Using Successor Representations
中文标题使用后继表示的约束强化学习
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Mosaic: A Fleet of User Embedding Specialists for Recommendation at Meta
中文标题Mosaic:A Fleet of User Embedding Specialists 面向 Recommendation at Meta
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Adaptive Data Admission and Retention for Streaming Federated Learning
中文标题用于流媒体联合学习的自适应数据录入和保留
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Embodied GPT-5.1: Evidence of a World Model?
中文标题体现GPT-5.1 :世界模型的证据?
关注理由涉及机器人与具身智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Data Pyramid for Embodied Manipulation
中文标题嵌入式操作的数据金字塔
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams
中文标题ERUnderstand :在结构化ER图上评估视觉语言模型
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Spatio-Temporal Conditional Denoising Transformer for Modality-Missing RGBT Tracking
中文标题Spatio-Temporal Conditional Denoising Transformer 面向 Modality-Missing RGBT Tracking
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Beyond Scale and Generation: Understanding Language Model-based Entity Matching
中文标题超越规模和生成:了解基于语言模型的实体匹配
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Test-Time Adaptation via Dual Distillation for Videos Under Severe Distribution Shifts
中文标题通过双蒸馏对严重分布变化下的视频进行测试时间适应
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题循环不是可靠性:代理代码修复的状态绑定证据和类型化修订合同
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
SIREN: Towards End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents
中文标题SIREN :与经验丰富的LLM专员一起实现端到端极端天气预警
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Evaluating Fuzz Testing for Reinforcement Learning Agents
中文标题评估强化学习代理的模糊测试
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
EgoPlay: Event-Triggered Video Editing for Egocentric Streams
中文标题EgoPlay:Event-Triggered Video Editing 面向 Egocentric Streams
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。