提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力
今天主要跟进:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。
本期从 2026-07-30 论文源抓取并去重 469 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1ReToken:One Token to Improve Vision-Language Models 面向 Visual Retrieval🔗
- 2OSReward:Instituting St与ardized 评测 面向 Cross-平台 Computer-Use Reward Models🔗
- 3引入语言模型来维护自己的意识,恢复人类的信仰和价值观🔗
- 4SVR:通过联合判决-信心强化学习进行自适应测试时间计算的自我验证细化🔗
- 5ShadowDancer:Teaching Video 世界模型 Any Action by Learning Unified Dynamics Representations 来自 a Video 与 Its Shadow🔗
- 6HARGO:Heterogeneity-Aware Reward-Guided Optimization 面向 RL Post-Training of LLMs on HPC Tasks🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题ReToken:One Token to Improve Vision-Language Models 面向 Visual Retrieval
信号显示长时间的视觉上下文给视觉语言模型带来了挑战:性能会随着干扰源数量的增加而下降,并且在GPU内存限制下,一次处理所有令牌在计算上是不可行的
关键词retrievalinferencebenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题OSReward:Instituting Standardized 评测 面向 Cross-平台 Computer-Use Reward Models
信号显示使用计算机的代理( CUA )正在数字世界中迅速发展
关键词agentalignmentevaluationbenchmark
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题引入语言模型来维护自己的意识,恢复人类的信仰和价值观
信号显示调整大语言模型以防止他们将意识归因于自己,无意中改变了他们在其他实体中与人类信仰和价值观一起的思想表征
关键词alignmentsafetyfine-tuningharmful
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题SVR :通过联合判决-信心强化学习进行自适应测试时间计算的自我验证细化
信号显示缩放测试时间计算可以改进语言模型推理,但统一的预算浪费了简单输入的计算,而验证者引导的细化依赖于外部反馈
关键词raginferencebenchmarkreasoning
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题ShadowDancer:Teaching Video 世界模型 Any Action by Learning Unified Dynamics Representations 来自 a Video 与 Its Shadow
信号显示我们展示了ShadowDancer ,这是一种对交互式视频世界模型进行任意动作、帧级控制的新方法
关键词ragcodefine-tuningvideo
代码/数据需查看原文确认
识别并缓解模型安全、越狱和对齐风险
中文标题HARGO:Heterogeneity-Aware Reward-Guided Optimization 面向 RL Post-Training of LLMs on HPC Tasks
信号显示监督微调( SFT )可以为大语言模型( LLM )提供高性能计算( HPC )任务的领域知识,例如数据竞赛检测和基准问答
关键词alignmentbenchmarkfine-tuningpost-training
代码/数据需查看原文确认
其他值得关注
Oracle-Budgeted Molecular Optimization with Short-Term Graph Memory
中文标题使用短期图形内存的Oracle预算分子优化
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题大型基础模型时代的手对象交互:重建、生成和具体化转移
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Structural Validation of LLM-Generated Microservice Decompositions Using Source-Code Dependencies
中文标题使用源代码依赖项对LLM生成的微服务分解进行结构验证
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题THEIA :用于无数据蒸馏的大规模多模式字幕和自动验证Incidents1M数据集
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题早期理解:大型语言模型的深度分工及其对无限上下文记忆的使用
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
CDAE: Enhancing Perturbation Robustness in Pretrained Language Models with Contrastive Denoising
中文标题CDAE :使用对比去噪增强预训练语言模型中的扰动鲁棒性
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents
中文标题EMBL AI Librarian:Life-Sciences Knowledge Layer 面向 AI Agents
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation
中文标题Security of World-Model-Based Embodied AI:A Lifecycle of Threats,Defenses,与 评测
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification
中文标题FAIthEyes :通过多代理流程实现忠实工具使用-图像验证
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Scaling Vision-Language Models Is Not Enough to Mitigate Bias
中文标题扩展视觉语言模型不足以减轻偏见
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation
中文标题老技巧,新模型:简单的图像转换如何破坏基于人工智能的现代内容审核
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach
中文标题AgenticASR :通过Agentic方法在真实场景中改进语音识别
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Can Agents Deceive? Evaluating Reasoning 与 Deception in ParliamentBench 使用 a Social Deduction Game
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题LM-GRASP :通过在线模拟学习进行组合构造的实例特定语言模型
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
ConMem: Contribution-Aware Memory for Long-Horizon Manufacturing Inspection Logs
中文标题ConMem:Contribution-Aware Memory 面向 Long-Horizon Manufacturing Inspection Logs
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Temporal Concentration 来自 Rollout Errors:Implicit Preference Optimization 面向 Text-to-Video Diffusion
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
VIG-RL: Learning to Search and Insert for Verified Image Grounding
中文标题VIG-RL:Learning to Search 与 Insert 面向 Verified Image 落地
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题RaDiVe :具有距离限制无损检测和速度差异点不确定性的强大4D雷达里程测量
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents
中文标题ClawTrack:Towards Trace-Level 评测 与 Improvement of Real-World Autonomous Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware
中文标题MMLDSum-LLM :使用视觉对齐和关键词感知的多模态长文档摘要
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。