提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力
今天主要跟进:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-06-26 论文源抓取并去重 269 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1RPM-Distill:Physiology-guided Adaptive Cross-modal Distillation 面向 Robust Remote Physiological Measurement🔗
- 2使用Google的论文助手工具实现科学审查自动化🔗
- 3管理存储库,而不是代理:衡量AI原生软件中的生态系统级风险🔗
- 4非结构化环境中沿任意测量路径的物理引导机器人辐射源定位🔗
- 5Agent-Native Immune System:Architecture,Taxonomy,与 Engineering🔗
- 6MLVC:Multi-平台 Learned Video Codec 面向 Real-World Deployment🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题RPM-Distill:Physiology-guided Adaptive Cross-modal Distillation 面向 Robust Remote Physiological Measurement
信号显示基于视频的远程生理测量( RPM )非常容易获得,但在不同的照明、肤色和运动下仍然很脆弱
关键词raginferencedeploymentalignment
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题使用Google的论文助手工具实现科学审查自动化
信号显示人工智能正在推动科学发现的革命,加速从假设生成到数学定理证明的一切
关键词agentinferenceservingdeployment
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题管理存储库,而不是代理:衡量AI原生软件中的生态系统级风险
信号显示自主编码代理现在大规模打开和合并共享存储库中的拉取请求,该字段以其始终评估组件的方式进行评估,一次一个代理,用于孤立的基准任务
关键词agentbenchmarkcodecoding
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题非结构化环境中沿任意测量路径的物理引导机器人辐射源定位
信号显示使用机器人估计辐射源的位置是提高效率和安全性的有效方法
关键词ragdeploymentsafetyevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Agent-Native Immune System:Architecture,Taxonomy,与 Engineering
信号显示从静态聊天机器人到自主代理的过渡--配备持久内存、工具使用协议和多代理协作--从根本上扩展了人工智能威胁格局
关键词agentalignmentevaluationmemory
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题MLVC:Multi-平台 Learned Video Codec 面向 Real-World Deployment
信号显示神经视频编解码器在编码效率方面超过了经典编解码器,但由于跨平台不兼容和计算成本高,仍然不适合部署
关键词raginferencedeploymentcompression
代码/数据需查看原文确认
其他值得关注
Halt Fast! Early Stopping for Certified Robustness
中文标题快速停止!提前停止以获得认证的稳健性
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views
中文标题StructSplat:Generalizable 3D Gaussian Splatting 来自 Uncalibrated Sparse Views
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
CSD: Content-aware Speculative Decoding for Efficient Image Generation
中文标题CSD:Content-aware Speculative Decoding 面向 Efficient Image Generation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Hippocampus-DETR: An Explicit Memory Object Detection Framework Based on Hippocampus Modeling
中文标题Hippocampus-DETR:An Explicit Memory Object Detection 框架 Based on Hippocampus Modeling
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment
中文标题通过平滑MMD对齐增强LLM中的数值预测
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Low-Agreeableness Persona Conditioning for Safe LLM Fine-Tuning
中文标题用于安全LLM微调的低亲和力角色调节
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Democratic ICAI: Debating Our Way to Steering Principles from Preferences
中文标题Democratic ICAI:Debating Our Way to Steering Principles 来自 Preferences
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning
中文标题RSICCLLM:A Multimodal Large Language Model 面向 Remote Sensing Image Change Captioning
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
中文标题HAT-4D:Lifting Monocular Video 面向 4D Multi-Object Interactions via Human-Agent Collaboration
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题中医康复训练交叉视角多模态视觉评估框架
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题TextDS:Parameter-Efficient Representation Alignment 面向 Scene Text Detection under Distribution Shifts
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents
中文标题ToolPrivacyBench:基准ing Purpose-Bound Privacy in Tool-使用 LLM Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题AIrGroundBench :探索异构多视点具体协作下多模态大型模型的空间智能
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
From Detection to Action: Using LLM Agents for Fault-Tolerant Control
中文标题从检测到行动:使用LLM代理进行容错控制
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Dialogue to Detection: A Multimodal Hybrid NLP Pipeline for Insurance Fraud Detection
中文标题Dialogue to Detection:A Multimodal Hybrid NLP Pipeline 面向 Insurance Fraud Detection
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
SHARD: cell-keyed residual splitting for alignment-resistant private dense retrieval
中文标题碎片:细胞密钥残留分裂,用于抗比对的私人密集检索
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering
中文标题ProMSA:Progressive Multimodal Search Agents 面向 Knowledge-Based Visual Question Answering
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题从黑盒到临床洞察:基于言语的认知障碍检测的多阶段可解释框架
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Two-Stage Fine-Tuning for Protein Sequence Generation with Targeted Amino-Acid Composition
中文标题使用靶向氨基酸组合物生成蛋白质序列的两阶段微调
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Verifiable Geometry Problem Solving: Solver-Driven Autoformalization and Theorem Proposing
中文标题可验证的几何问题解决:求解器驱动的自形式化和定理提出
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。