提升 RAG 检索和知识库问答可靠性、提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升 RAG 检索和知识库问答可靠性、提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-07-02 论文源抓取并去重 445 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题通过优化实现针对安全的嵌入式漏洞利用
信号显示大语言模型( LLM )的安全培训主要用英语进行,因此不确定安全机制在低资源语言和混合语言代码切换中的推广程度
关键词ragservingalignmentsafety
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题EHHN:An Event-driven Heterogeneous Hypergraph Network 面向 Object-Centric Next Activity Prediction
信号显示下一个活动预测有助于面向服务的流程在发生延迟、异常或服务级别风险之前预测即将到来的步骤
关键词benchmarkcodememoryexecution
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题视觉语言导航中语义探索的路径级事后指导
信号显示策略探索是培训强大的视觉语言导航代理的关键组成部分,因为它将策略暴露于更广泛的状态分布
关键词agentragevaluationbenchmark
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题LLM在线安全监控
信号显示尽管进行了校准培训,但LLM在部署时仍然容易产生不安全的输出
关键词deploymentalignmentsafetyred teaming
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题ReContext:Recursive Evidence Replay as LLM Harness 面向 Long-Context Reasoning
信号显示对长语境的理解和推理已成为在现实应用中部署大语言模型( LLM )的关键要求
关键词ragretrievalinferenceserving
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题具有行为潜力的可控模拟代理
信号显示逼真的流量模拟需要模拟记录行为的代理,也可以沿着可解释的轴引导
关键词agentservingsafetybenchmark
代码/数据需查看原文确认
其他值得关注
中文标题What LLM Agents Say When No One Is Watching:Social Structure 与 Latent Objective Emergence in Multi-Agent Debates
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Seek to Segment: Active Perception for Panoramic Referring Segmentation
中文标题寻找细分市场:全景参考细分市场的主动感知
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
TestEvo-Bench: An Executable and Live Benchmark for Test and Code Co-Evolution
中文标题TestEvo-Bench:An Executable 与 Live 基准 面向 Test 与 Code Co-Evolution
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Hardware-Enforced Semantic Coordination for Safety-Critical Real-Time Autonomous Systems
中文标题用于安全关键型实时自治系统的硬件强制语义协调
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces
中文标题SkillFuzz:Fuzzing Skill Composition 面向 Implicit Intents Discovery in Open Skill Marketplaces
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Search-based Testing of Vision Language Models for In-Car Scene Understanding
中文标题基于搜索的视觉语言模型测试,用于了解车内场景
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Optimizing Visual Generative Models via Distribution-wise Rewards
中文标题通过分销奖励优化可视化生成模型
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval
中文标题FlowCIR :通过流匹配进行语义传输,用于零拍摄合成图像检索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
CheckRLM: Effective Knowledge-Thought Coherence Checking in Retrieval-Augmented Reasoning
中文标题CheckRLM :检索中的有效知识思维一致性检查-增强推理
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Cross Domain Few-Shot Class-Incremental Audio Classification Via Adversarial Contrastive Learning
中文标题通过对抗对比学习实现跨域少拍类增量音频分类
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Copewell: A Multi-Agent Swarm Architecture for Equitable Mental Wellness Support
中文标题Copewell:A Multi-Agent Swarm Architecture 面向 Equitable Mental Wellness Support
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation
中文标题DetAIlAnywhere :通过跨模式特征对齐蒸馏生成时尚细节
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Criticality-Based Guard Rail Validation for AI Agent Decisions in Autonomous Telecom Networks
中文标题Criticality-Based Guard Rail Validation 面向 AI Agent Decisions in Autonomous Telecom Networks
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
The Eticas AI Risk Taxonomy: Open Infrastructure for Operationalizing AI Audits
中文标题Eticas AI Risk Taxonomy:Open Infrastructure 面向 Operationalizing AI Audits
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
An Optimisation Framework for the Well-Conditioned Training of Physics-Informed Neural Networks
中文标题物理知情神经网络良好训练的优化框架
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring
中文标题拒绝背后:通过行为监测确定护栏激活
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
WBMM: Windowed Batch Matrix Multiplication for Efficient Large Receptive Field Convolution
中文标题WBMM:Windowed Batch Matrix Multiplication 面向 Efficient Large Receptive Field Convolution
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Multimodal Fusion for Fine-Grained Classification of Breast Fibroadenoma and Phyllodes Tumors
中文标题多模式融合治疗乳腺纤维腺瘤和叶状肿瘤的细粒度分类
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction
中文标题DeepGaze3.5-VL :通过自回归令牌预测对扫描路径建模
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety
中文标题HaloGuard 1.0:An Open Weights Constitutional Classifier 面向 Multilingual AI Safety
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。