提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-07-23 论文源抓取并去重 321 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1Identifying Good Rules 面向 Efficient SAT Encodings of Single-Constant Multiplication 使用 Machine Learning🔗
- 2Safeguards 面向 Speech2Speech LLM-Assistants:A Case Study in Automotive Applications🔗
- 3Decoupling Cross-Modality Manifold Discrepancy:Leveraging Visible Diffusion Priors 面向 Infrared Super-Resolution🔗
- 4基于风险图神经网络的人口统计学热死亡风险曲线🔗
- 5GlucoTune:A Unified 框架 面向 Blood Glucose Preprocessing,面向ecasting,与 基准ing in Diabetes🔗
- 6导览:线下强化学习的轨迹级学习基准🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题Identifying Good Rules 面向 Efficient SAT Encodings of Single-Constant Multiplication 使用 Machine Learning
信号显示单常数乘法问题是硬件设计中基本的NP难优化任务,它试图仅使用加法、减法和位移来分解固定常数
关键词servingcodememorycoding
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Safeguards 面向 Speech2Speech LLM-Assistants:A Case Study in Automotive Applications
信号显示最近的进步引入了能够产生自然互动的语音到语音( S2S )对话助手,包括音调和情绪等非语言暗示
关键词deploymentlatencyevaluationspeech
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题Decoupling Cross-Modality Manifold Discrepancy:Leveraging Visible Diffusion Priors 面向 Infrared Super-Resolution
信号显示红外图像超分辨率( IISR )减轻了低空间分辨率带来的限制
关键词ragservingcodeframe
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题基于风险图神经网络的人口统计学热死亡风险曲线
信号显示估算与热相关的死亡风险是环境流行病学的核心任务,通常通过分布式滞后非线性模型( DLNM )解决;可解释的暴露-响应曲面拟合到温度-死亡率时间序列
关键词ragservingcodeRetrieval and RAG
代码/数据需查看原文确认
评测视频生成的时间一致性和运动真实感
中文标题GlucoTune:A Unified 框架 面向 Blood Glucose Preprocessing,Forecasting,与 基准ing in Diabetes
信号显示预处理血糖时间序列数据是开发糖尿病管理数据驱动方法的关键但经常被忽视的步骤,特别是对于1型糖尿病
关键词workflowevaluationbenchmarkeval
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题导览:线下强化学习的轨迹级学习基准
信号显示离线强化学习( RL )代理接受固定行为轨迹的培训,这使得在训练后必须删除选定数据时,轨迹级删除非常重要
关键词agentbenchmarkfine-tuningagents
代码/数据需查看原文确认
其他值得关注
Reexamining zero-shot summarization: Empirical investigation of trustworthiness of LLM-summarizers
中文标题重新审视零点总结: LLM总结者可信度的实证调查
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Explainable Deepfake Detection Challenge
中文标题可解释 Deepfake Detection Challenge
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
ADABORD: a novel AdaBoost approach for ordinal classification
中文标题ADABORD:a novel AdaBoost approach 面向 ordinal classification
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
GuardianAgentBench: Where Agents Fail and How to Guard Them
中文标题GuardianAgentBench:Where Agents Fail 与 How to Guard Them
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer
中文标题MagicMakeup:A Region-Controllable Diffusion Transformer 面向 High-Fidelity Makeup-Transfer
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Three-Pronged Spectral Control for Federated Parameter Efficient Fine Tuning
中文标题用于联邦参数高效微调的三管齐下的频谱控制
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Code Monitor Red Teaming for Public-Test-Passing Code
中文标题公开测试通过代码的代码监控红色团队
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
3D-Aware VLMs with Implicit and Explicit Geometries
中文标题具有隐式和显式几何形状的3D感知VLM
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
MedGame: Storytelling Gamification Empowered by Large Language Models for Medical Education
中文标题MedGame:Storytelling Gamification Empowered by Large Language Models 面向 Medical Education
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning
中文标题Beyond Sycophancy:Structured Resistance 与 Compliance in LLM Moral Reasoning
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
OpenForgeRL: Train Harness-native Agents in Any Environment
中文标题OpenForgeRL :在任何环境中训练线束本地代理
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
MIRROR: Learning from the Other View for Multi-Modal Reasoning
中文标题镜像:从另一种视角学习多模态推理
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages
中文标题DONDO:Open w2v-BERT Speech-Recognition Base Models 面向 African Languages
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题来自 Resource Flow to Executable Tests:Petri-Net-Guided LLM Test Generation 面向 Concurrent Stateful Rust APIs
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
GS-Agent: Creating 4D Physical Worlds With Generative Simulation
中文标题GS-Agent :通过生成模拟创建4D物理世界
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Diffusion Language Model for Recommendation
中文标题Diffusion Language Model 面向 Recommendation
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题Agentic Context Management:Solving Agent Memory 与 Cost by Treating Them as Lifecycle 与 Architecture Problems
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Compact Latent Coordination for Autonomous Vehicles at Unsignalized Intersections
中文标题无信号交叉路口自动驾驶车辆的紧凑潜伏协调
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
SPDCN: Strip-based Deformable Convolutional Network for Steel Surface Defect Segmentation
中文标题SPDCN:Strip-based Deformable Convolutional Network 面向 Steel Surface Defect Segmentation
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Test-Time Scaling via Error Localization
中文标题通过错误本地化进行测试时间缩放
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。