提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力
今天主要跟进:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。
本期从 2026-07-08 论文源抓取并去重 287 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1Heterogeneity-Adaptive Diffusion Schrodinger Bridge 面向 PET-Guided Whole-Body MRI Translation🔗
- 2Beyond Attack-Success Rate:Action-Graded Severity Scale 面向 Tool-使用 AI Agents🔗
- 3Behavior Foundations 面向 Quadruped Robots:ABot-C0 Technical Report🔗
- 4InfraQR:边缘QR启发的结构化补丁攻击红外视觉语言模型🔗
- 5Latency-Constrained DNN Architecture Learning 面向 Edge Systems 使用 Zerorized Batch Normalization🔗
- 6Recursive Self-Improvement in AI:来自 Bounded Self-Refinement to Autonomous Research Loops🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题Heterogeneity-Adaptive Diffusion Schrodinger Bridge 面向 PET-Guided Whole-Body MRI Translation
信号显示虽然全身多模态医学成像扫描仪已被越来越多地认可用于更有效的医疗应用,但PET-MR扫描中过长的采集时间是更高效的临床实践的主要障碍
关键词ragcodemultimodalvision-language
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Beyond Attack-Success Rate:Action-Graded Severity Scale 面向 Tool-使用 AI Agents
信号显示Agentic red-teaming基准测试报告注入的agent是否被泄露为单个bit :攻击成功或未成功
关键词agentsafetybenchmarkcode
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题Behavior Foundations 面向 Quadruped Robots:ABot-C0 Technical Report
信号显示在具体化的智能系统中,运动控制器充当语义推理和物理执行之间的关键桥梁
关键词ragdeploymentsafetymultimodal
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题InfraQR :边缘QR启发的结构化补丁攻击红外视觉语言模型
信号显示红外视觉语言模型越来越多地用于低光和不利视觉条件下的感知,但其对局部结构化扰动的鲁棒性仍未得到充分探索
关键词evaluationbenchmarkcodevision-language
代码/数据需查看原文确认
改进图像生成、视觉理解和可控渲染
中文标题Latency-Constrained DNN Architecture Learning 面向 Edge Systems 使用 Zerorized Batch Normalization
信号显示深度学习应用在边缘设备上被广泛采用,以缓解访问云服务器的隐私和延迟问题
关键词inferencelatencyquantizationsystems
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题Recursive Self-Improvement in AI:来自 Bounded Self-Refinement to Autonomous Research Loops
信号显示人工智能系统越来越多地参与其自身的改进:修改其输出,在部署过程中调整其自身的线束,对其生成的数据进行培训,以及越来越多地自行进行人工智能研究
关键词deploymentsafetyevaluationverifier
代码/数据需查看原文确认
其他值得关注
中文标题Large Language Models (LLMs) 与 Generative AI in Cybersecurity 与 Privacy:A Survey of Dual-Use Risks,AI-Generated Malware,Explainability,与 Defensive Strategies
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Collaborative Synthetic Data Generation for Knowledge Transfer in Federated Learning
中文标题在联合学习中用于知识转移的协作合成数据生成
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
TimEE: End-to-end Time Series Classification via In-Context Learning
中文标题TimEE :通过上下文学习进行端到端时间序列分类
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题在哪里进行干预?在差异化私有合成表格数据上对公平意识学习进行基准测试
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Validate the Dream Before You Trust Its Verdict: Admissibility for World-Model Simulators
中文标题在您相信其判决之前验证梦想:世界模拟器的可接受性
关注理由涉及机器人与具身智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题ASFR-Net:Adversarial Alignment 与 Spatio-Frequency Refinement Network 面向 Heterogeneous Remote Sensing Image Change Detection
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题SHTA:Semantic Hard Token Correction 与 Center Alignment 面向 Semi-Supervised Medical Image Segmentation
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
中文标题Scaling Mixture-of-Experts Video Pretraining 面向 Embodied Intelligence
关注理由涉及机器人与具身智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models
中文标题HIVE :理解视觉语言模型中的幻觉后推理
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Safe Reinforcement Learning using Ideas from Model Predictive Control
中文标题使用模型预测控制的创意进行安全强化学习
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题2026-2030年内存稀缺、开放模型和人工智能产业重组--推理经济学、培训成本差异和基础设施偿付能力的定量情景分析
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Comparative Study of Domain-adapted VLMs for General Document Visual Question Answering
中文标题适用于一般文档视觉问答的领域VLM的比较研究
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning
中文标题AnchorPrune:Relevance-Anchored Contextual Expansion 面向 Visual Token Pruning
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Ensemble Deep Learning Approaches for AI-Altered Video Detection
中文标题Ensemble Deep Learning Approaches 面向 AI-Altered Video Detection
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题突破数据库锁定:用于数据库旁路的高性能存储读卡器的代理再生
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Institutional Red-Teaming: Deployment Rules, Not Just Models, Causally Shape Multi-Agent AI Safety
中文标题机构红队:部署规则,而不仅仅是模型,因果关系塑造多Agent AI安全
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题MedPMC:A Systematic 框架 面向 Scaling High-Fidelity Medical Multimodal Data 面向 Foundation Models
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation
中文标题DiaLLM :对英语方言适应中稳健性-生成差距的调查
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Think Big, Search Small: Where Capacity Matters in Hierarchical Search Agents?
中文标题大思维,小搜索:在分层搜索代理中,容量在哪里很重要?
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Creativity from Friction: Human-AI Interaction for Exploratory Structural Design
中文标题Creativity 来自 Friction:Human-AI Interaction 面向 Exploratory Structural Design
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。