提升代码生成、执行反馈和自动修复能力、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升代码生成、执行反馈和自动修复能力、提升代码生成、执行反馈和自动修复能力、提升代码生成、执行反馈和自动修复能力。
本期从 2026-07-28 论文源抓取并去重 355 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1OmniPhys:Knowledge-Graph-Driven 基准ing 与 Collective Optimization 面向 Physical Commonsense in Text-to-Image Generation🔗
- 2人脸去识别:从捕获到处理的以领域为中心的调查🔗
- 3日夜无人机视图地理定位的统一基准和模态自适应网络🔗
- 4ReLATE:Reliability-Guided Evidence Fusion 面向 Robust UAV--Satellite cross-view Geo-Localization🔗
- 5Group Equivariant Diffusion 面向 Anomaly Detection in Computational Cytology🔗
- 6DensFiLM:Density-Conditioned Video Saliency 面向 Crowd Scenes🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、提升代码生成、执行反馈和自动修复能力、提升代码生成、执行反馈和自动修复能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题OmniPhys:Knowledge-Graph-Driven 基准ing 与 Collective Optimization 面向 Physical Commonsense in Text-to-Image Generation
信号显示虽然文本到图像模型表现出显着的视觉保真度,但它们经常违反基本的物理常识
关键词alignmentevaluationbenchmarkcode
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题人脸去识别:从捕获到处理的以领域为中心的调查
信号显示面部去识别( De-ID )旨在删除或隐藏图像或视频中的个人可识别面部特征,以防止身份识别,同时保留下游任务的实用性
关键词servingevaluationbenchmarkcode
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题日夜无人机视图地理定位的统一基准和模态自适应网络
信号显示大多数现有的无人机视图地理定位( DVGL )基准包含在单个照明条件下捕获的无人机图像,并且缺乏来自相同位置的地理对齐的可见无人机图像、红外无人机图像和卫星图像
关键词alignmentevaluationbenchmarkcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题ReLATE:Reliability-Guided Evidence Fusion 面向 Robust UAV--Satellite cross-view Geo-Localization
信号显示无人机( UAV )卫星交叉视图地理定位将无人机图像与卫星图像相匹配,并在清洁(非退化)图像基准上实现了令人印象深刻的准确性
关键词ragretrievalcompressionbenchmark
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题Group Equivariant Diffusion 面向 Anomaly Detection in Computational Cytology
信号显示全幻灯片图像的计算细胞学是具有挑战性的,因为恶性细胞是罕见的,异质性的,并且注释的幻灯片是稀缺的
关键词raginferencealignmentcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题DensFiLM:Density-Conditioned Video Saliency 面向 Crowd Scenes
信号显示视频显著性模型通常在人群场景中应用单一固定策略,尽管人群密度会系统地改变注意力
关键词ragevaluationcodevideo
代码/数据需查看原文确认
其他值得关注
CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model
中文标题CoTinyVLA:Chain-of-Thought Distillation 面向 a Sub-Billion-Parameter Vision-Language-Action Model
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response
中文标题Cyber-Capable AI Agents:Vulnerabilities,评测 Containment,与 Defensive Response
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题ContractHIL-HLS:Contract-Aligned Multi-Agent Workflow with Hardware-in-the-Loop Feedback 面向 HLS Design
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ObliCity: A Benchmark and Baseline for Roof-to-Ground Projection Displacement Correction
中文标题ObliCity:A 基准 与 Baseline 面向 Roof-to-Ground Projection Displacement Correction
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models
中文标题RepoReasoner :评估长语境语言模型的存储库级代码推理能力
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
中文标题模式:多种模式的仅解码器任意建模
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models
中文标题视觉-语言-动作模型的SAM3D引导的以对象为中心的表示对齐
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Less is More: Modality-Decoupling for General AIGC Audio-Video Detection
中文标题Less is More:Modality-Decoupling 面向 General AIGC Audio-Video Detection
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
A Control System, a Dataset, and a Recipe for Making Frozen LLM Agents Learn a Domain
中文标题冷冻LLM代理学习领域的控制系统、数据集和配方
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening
中文标题VetClaw:An Edge-Cloud Multimodal Agentic System 面向 Veterinary Disease Screening
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Empirical Evaluation of Out-Of-Distribution Performance of Tabular Foundation Models
中文标题表格基础模型分布外性能实证评估
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
MemLens: A Value-Aware Memory Management System with Interactive Analytics for LLM-based Agents
中文标题MemLens :具有交互式分析的价值感知内存管理系统,适用于基于LLM的座席
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题针对不规则临床时间序列进行问答的具有成本效益的多模态LLM推理框架
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement
中文标题RSIBench-Data:基准ing Data-Centric Research 面向 Recursive Self-Improvement
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Shieldstral
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Hypothesis-Driven Shelf Generation for Personalised Recommendation
中文标题个性化推荐的假设驱动的货架生成
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Fine-Grained Food Image Understanding via Target-Aware Data Alignment
中文标题通过目标感知数据对齐理解细粒度食品图像
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
FLASH: Efficient Impact Fall Detection with Unified Hypergraph State-Space Model
中文标题FLASH :使用统一超图状态空间模型进行有效的冲击坠落检测
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing
中文标题WorkSurface-Bench:基准ing Enterprise Agents on Multi-Surface Knowledge Routing
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题通过系统化多Agent深度强化学习实现复杂环境中的协同多无人机导航
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。