提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力
今天主要跟进:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。
本期从 2026-06-16 论文源抓取并去重 499 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题LiveStarPro:面向长时程视频流的层级记忆主动式流式视频理解
信号显示尽管 Video-LLM 已取得显著进展,现有在线架构仍难以同时处理连续视频流、自主判断何时回应,并保留长时程上下文记忆
关键词retrievalinferencealignmentevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题烟雾缭绕却未报警:Agent 编写测试代码中的 Oracle 信号
信号显示软件从业者越来越多地使用 AI 编码 Agent,它们会在开源 PR 中与生产代码一起生成测试代码
关键词agentcodecodingsoftware
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题推理即交集:面向 Video-MLLM 视觉聚焦的共识帧对齐
信号显示强化学习提升了大语言模型的推理能力,但将仅基于结果的奖励用于 Video-MLLM 时,难以充分指示哪些视觉证据应支撑答案
关键词ragalignmentbenchmarkmultimodal
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题RubricsTree:面向个人健康 Agent 的健康记忆与医疗技能开放式可扩展评测
信号显示由 LLM 驱动、结合用户健康传感指标的个人健康 Agent,为缓解全球医疗服务可及性差异提供了有前景的路径
关键词agentdeploymentalignmentevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题生成式推荐会加深信息茧房吗?基于 LLM 用户模拟器的闭环仿真
信号显示推荐系统可以缓解信息过载,但推荐与用户交互之间的反复反馈会强化既有偏好、收窄用户接触范围,从而形成信息茧房
关键词agentservingcodeagents
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题无监督检索的时间偏好优化
信号显示无监督稠密检索器通过对未标注文档进行对比学习来学习语义相似性,具备良好扩展性,但它们难以捕捉时间相关性,可能检回语义相关却时间错位的文档
关键词ragretrievalalignmentcode
代码/数据需查看原文确认
其他值得关注
Spatio-Temporal Fusion Model for Standard View Classification of Echocardiographic Videos
中文标题用于超声心动图视频标准切面分类的时空融合模型
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题单调 Kolmogorov-Arnold 网络:作为归纳偏置的单调性的理论与实证研究
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Flux-Guard: Facial Identity Protection using diffusion models
中文标题Flux-Guard:使用扩散模型保护人脸身份
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement
中文标题通过认知特权评估 LLM 的二阶偏差
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
RSRank: Learning Relevance from Representational Shifts
中文标题RSRank:从表征偏移中学习相关性
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models
中文标题CheckMIABench:面向语言模型成员推断攻击的坚实基准基础
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
TS-Fault: Benchmarking Time Series Forecasters Against Structural Faults
中文标题TS-Fault:针对结构性故障评测时间序列预测器
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题基于学习的多燃料压燃发动机燃烧相位控制决策:结合潜在燃料反应性估计
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
EventDrive: Event Cameras for Vision-Language Driving Intelligence
中文标题EventDrive:面向视觉语言驾驶智能的事件相机
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Stanford EDGAR 申报数据集:将美国企业与金融披露重构为版面忠实且 Token 高效的预训练数据
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Knowledge Reutilization in Meta-Reinforcement Learning
中文标题元强化学习中的知识复用
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
MoonSplat: Monocular Online Gaussian Splatting with Sim(3) Global Optimization
中文标题MoonSplat:结合 Sim(3) 全局优化的单目在线高斯溅射
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space
中文标题PearlVLA:潜在空间中的渐进式具身动作计划优化
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
When Multiple Scripts Matter: Evaluating ASR in Clinical Settings
中文标题当多种文字体系变得重要:临床场景中的 ASR 评估
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
EComAgentBench: Benchmarking Shopping Agents on Long-Horizon Tasks with Distributed Hidden Intent
中文标题EComAgentBench:在分布式隐藏意图长时程任务上评测购物 Agent
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization
中文标题MGUP:面向随机优化的动量-梯度对齐更新策略
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
When Robots Sleep: Offline Skill Consolidation for Shared-Policy Robot Learning
中文标题当机器人休眠时:共享策略机器人学习中的离线技能巩固
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
StereoFactory: A Unified Merging Framework for Robust Stereo Matching
中文标题StereoFactory:面向鲁棒立体匹配的统一融合框架
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题面向对抗性航天器近距离操作中自适应安全关键控制的内存高效元强化学习
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Do as the Romans Do: Learning Universal Behaviors from Heterogeneous Agents
中文标题入乡随俗:从异构 Agent 中学习通用行为
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。