提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升 RAG 检索和知识库问答可靠性、提升 RAG 检索和知识库问答可靠性、提升 RAG 检索和知识库问答可靠性。
本期从 2026-07-31 论文源抓取并去重 296 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、提升 RAG 检索和知识库问答可靠性、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题无需人工智能生成的视频归因的检索驱动培训
信号显示人工智能生成的视频越来越逼真,难以与真实视频区分开来,这助长了恶意滥用,并对网络安全和社会治理构成越来越大的威胁
关键词ragretrievalbenchmarkcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题TerraNova :人类世的基础模型
信号显示人类世的一个决定性问题是将物理地球和人类社会建模为一个耦合系统,但没有学到的表示跨越其观测广度
关键词ragalignmentcodeRetrieval and RAG
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题MoPET:Parameter-Efficient Mixture-of-Experts 面向 Unified Medical Image Classification
信号显示将深度学习模型适应深刻的临床异构性通常依赖于参数高效微调( PEFT ) ,以避免与完整的端到端网络更新相关的严重过度拟合
关键词ragevaluationbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Tool Specifications Matter:Uncovering 与 Mitigating Safety Risks in AI Agents
信号显示人工智能代理使用外部工具扩展大语言模型( LLM ) ,使他们能够执行复杂的任务,并将模型输出转换为相应的现实世界操作
关键词agentraginferencesafety
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题使用双语义引导和全局互调的多模态对象重新识别
信号显示多模态对象重新识别( ReID )旨在通过利用跨模态的互补信息来检索目标实例
关键词ragalignmentbenchmarkcode
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题时间策略:从演示中生成机器人学习的历史初始化动作
信号显示通过依赖于非信息性高斯先验的独立耦合,标准扩散和流量匹配模型被迫学习复杂、高成本的矢量场,以达到物理动作空间
关键词inferencelatencybenchmarkcode
代码/数据需查看原文确认
其他值得关注
CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding
中文标题CodeShrink:Adaptive Visual Compression 面向 Efficient Multimodal Code Understanding
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
DreamQAS: Learning a Decision-Useful World Model for VQE-Efficient Quantum Architecture Search
中文标题DreamQAS:Learning a Decision-Useful World Model 面向 VQE-Efficient Quantum Architecture Search
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题VFAD:Variational Semantic Prompting Meets Frequency-Adaptive Representation Learning 面向 Zero-Shot Anomaly Detection
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Domain-Division based Progressive Learning for Source-Free Domain Adaptation
中文标题基于域划分的无源域自适应渐进式学习
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Reproducing LightMem: Naive RAG Is Just as Good for Memory Management
中文标题Reproducing LightMem:Naive RAG Is Just as Good 面向 Memory Management
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark
中文标题在黑暗中实现强大的3D感知RGB-NIR成像
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
中文标题ExtractBench:A 基准 面向 Schema-Guided Enterprise Document 抽取
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
TraceViT: Grounded Trace Supervision for Visual Abstract Reasoning
中文标题TraceViT:Grounded Trace Supervision 面向 Visual Abstract Reasoning
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题多源多视图图形域自适应,采用双曲残差编码,用于rs-fMRI的跨站点MDD识别
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
STAGE: STyle-controllable Action GEneration for personalized autonomous driving
中文标题STAGE:STyle-controllable Action GEneration 面向 personalized autonomous driving
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
From Code Review to Code Critique: Intent, Drift, and Spotlight for AI-Generated Diffs at Scale
中文标题从代码审查到代码批判: AI生成差异的规模意图、漂移和焦点
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Remember
中文标题自我游戏与技能进化:呈现、解决和记忆的自我进化搜索代理
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Weight-Space Mixture-of-Experts for Implicit Neural Representation Classification
中文标题用于隐式神经表示分类的加权空间混合专家
关注理由涉及可解释性中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models
中文标题针对红外视觉语言模型的针对性语义攻击的QR结构热触发器
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
AgenticRepair: Multi-Faceted Program Context Engineering for Agentic Vulnerability Repair
中文标题AgenticRepair:Multi-Faceted Program Context Engineering 面向 Agentic Vulnerability Repair
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Beyond Component Testing: Validating Agentic AI Systems
中文标题组件测试之外:验证Agentic AI系统
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Bridging the Question-Answer Gap in Retrieval-Augmented Generation: Hypothetical Prompt Embeddings
中文标题弥合检索增强生成中的问答差距:假设的快速嵌入
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
OSEF: One-Step Evidence Fusion for Cross-Video Scene Procedure Planning
中文标题OSEF:One-Step Evidence Fusion 面向 Cross-Video Scene Procedure Planning
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Zero-Mem: Zero-Token Memory Operations for LLM Agents
中文标题Zero-Mem:Zero-Token Memory Operations 面向 LLM Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
BWM: A Low-Cost High-Fidelity World Simulator for Robot Learning
中文标题BWM:A Low-Cost High-Fidelity World Simulator 面向 Robot Learning
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。