提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升代码生成、执行反馈和自动修复能力、提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-07-01 论文源抓取并去重 393 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题BaseRT :通过Native Metal对Apple Silicon进行一流的LLM推断
信号显示我们展示了BaseRT ,这是Apple Silicon上大语言模型(LLM)的原生金属推理运行时,并报告了迄今为止该硬件上最高的推理吞吐量
关键词inferencedeploymentlatencycode
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题高实用性在文本图像扩散模型安全对齐中的错觉
信号显示文本到图像( T2I )扩散模型的安全对齐旨在抑制有害世代,同时保持对良性提示的实用性
关键词servingalignmentsafetyevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题性能优化基准是否可靠地衡量编码代理?
信号显示存储库级性能优化基准(如GSO、SWE-Perf和SWE-效率)通过将补丁应用于真实存储库并将运行时间与未优化的基线和官方参考补丁进行比较来评估编码代理
关键词agentragbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题从预测不确定性到安全运动规划的适形距离场
信号显示动态环境中的安全运动规划需要在不牺牲实时性能的情况下推理预测障碍物运动的不确定性
关键词ragsafetybenchmarkplanning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Rise 来自 The Ashes:基于 LLM 的 Static Analysis 面向 Deep Learning 框架 Bugs
信号显示深度学习( DL )框架是关键的人工智能基础设施,通常会隐藏具有严重安全影响的漏洞
关键词agentworkflowragretrieval
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题EquiSteer :交叉注意力转向更公平的文本引导图像生成
信号显示文本到图像的扩散模型为日常创意任务提供了动力,但它们仍然在训练数据中重现了人口统计学偏差
关键词raginferencealignmentcode
代码/数据需查看原文确认
其他值得关注
Seahorse: A Unified Benchmarking Framework for Spatiotemporal Event Modeling
中文标题Seahorse:A Unified 基准ing 框架 面向 Spatiotemporal Event Modeling
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Human-Machine Collaboration on Generative Meta-Learning: Model and Algorithm
中文标题生成元学习中的人机协作:模型和算法
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题ClinRAG-GRAPH :乳腺pCR预测领域对抗学习的临床先验检索-增强图模型
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Phantom References: Hallucinated Citations That Survive Peer Review at Top-Tier Conferences
中文标题幻影引用:在顶级会议上经得起同行评审的幻觉引用
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题从结构方程建模到双机学习:基于调查研究的鲁棒性分析
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
PAPA: Online Personalized Active Preference Alignment
中文标题PAPA :在线个性化主动偏好调整
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces
中文标题超越提示:通过模拟审核跟踪越狱功能调用LLM
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Learning Gait-Aware Quadruped Locomotion with Temporal Logic Specifications
中文标题使用时间逻辑规格学习步态感知四足运动
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
LIST3R: Long-sequence Instance-aware 3D Reconstruction
中文标题LIST3R :长序列实例感知3D重建
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
SoK: Attack and Defense Landscape of Mobile On-device AI Systems
中文标题SoK:Attack 与 Defense Landscape of Mobile On-device AI Systems
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Managed Autonomy at Runtime:Gear-Based Safety 与 Governance 面向 Single- 与 Multi-Agent Cyber-Physical Systems
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Autonomous Scientific Discovery via Iterative Meta-Reflection
中文标题通过迭代元反射实现自主科学发现
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
MemSyco-Bench: Benchmarking Sycophancy in Agent Memory
中文标题MemSyco-Bench:基准ing Sycophancy in Agent Memory
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
The Model Organism Lottery: Model Organism Interpretability Strongly Depends on Training Methodology
中文标题模式生物体彩票:模式生物体的可解释性很大程度上取决于培训方法
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Svarna: An Open Corpus Workbench for Modern Greek
中文标题Svarna:An Open Corpus Workbench 面向 Modern Greek
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Meta-Transfer Learning for mmWave Beam Alignment
中文标题Meta-Transfer Learning 面向 mmWave Beam Alignment
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts
中文标题领域算法:环境变化下的一次性VLA适应
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Active Spatial Guidance: Eliminating Injected Positional Mechanisms in Vision Transformers
中文标题主动空间引导:消除视觉变压器中的注入位置机制
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment
中文标题HARC:Coupling Harmfulness 与 Refusal Directions 面向 Robust Safety Alignment
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
MedCAGD: Context-Aware Gated Decoder for Efficient Medical Image Segmentation
中文标题MedCAGD:Context-Aware Gated Decoder 面向 Efficient Medical Image Segmentation
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。