提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-08-26 论文源抓取并去重 374 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1行星预测引擎:通过智能数据选择和基础模型嵌入进行自主地理空间预测🔗
- 2OmniPhys:A Unified Multimodal 基准 面向 Physics Underst与ing 与 Generation 来自 Chinese Educational Corpora🔗
- 3Beyond Pairwise Feedback:Listwise Vision-Language Supervision 面向 Preference-Based Reward Learning🔗
- 4当修剪满足可解释性时:在LLM中保持稀疏的自动编码器鲁棒性🔗
- 5PRISM:基于投影积分采样的MPC,具有用于双手操作的贝叶斯成本调整🔗
- 6针对LLM越狱攻击的自我进化多Agent框架防御🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题行星预测引擎:通过智能数据选择和基础模型嵌入进行自主地理空间预测
信号显示应对从粮食安全和灾害风险到疾病爆发和社会经济脆弱性等关键全球挑战,需要高保真地理空间建模
关键词workflowragretrievaldeployment
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题OmniPhys:A Unified Multimodal 基准 面向 Physics Understanding 与 Generation 来自 Chinese Educational Corpora
信号显示多模态大语言模型( MLLM )在解决各种视觉和文本推理任务方面表现出强大的能力
关键词evaluationbenchmarkcodemultimodal
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Beyond Pairwise Feedback:Listwise Vision-Language Supervision 面向 Preference-Based Reward Learning
信号显示视觉语言模型( VLM )已成为强化学习的强大监督来源,使代理能够在培训期间利用丰富的语义知识
关键词agentragvision-languagetraining
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题当修剪满足可解释性时:在LLM中保持稀疏的自动编码器鲁棒性
信号显示稀疏自编码器( SAE )被广泛用于解释大语言模型( LLM )的内部表示,但它们在事后模型压缩下的可靠性仍然知之甚少
关键词ragservingcompressioncode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题PRISM :基于投影积分采样的MPC ,具有用于双手操作的贝叶斯成本调整
信号显示在混乱、接触丰富的环境中进行双手动操作仍然具有挑战性,因为它需要协调的运动生成、交互感知规划以及在严格的运动约束下可靠的执行
关键词evaluationcodevideomotion
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题针对LLM越狱攻击的自我进化多Agent框架防御
信号显示大语言模型( LLM )仍然容易受到越狱攻击,这些攻击利用角色扮演、混淆、代码转换和多步间接等技术来引发有害输出
关键词agentservingdeploymentsafety
代码/数据需查看原文确认
其他值得关注
Pointing the Way, Hiding the Destination: Practical Private Dense Retrieval at Scale
中文标题指明方向,隐藏目的地:大规模实用私人密集检索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
ClueWeaver: Reward-Guided Dual-Agent Evidence Reasoning for Compact LLMs on Literary Long Narratives
中文标题ClueWeaver:Reward-Guided Dual-Agent Evidence Reasoning 面向 Compact LLMs on Literary Long Narratives
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Distance Is Not Enough: Forget-Retain Alignment Gap Predicts LLM Relearning Robustness
中文标题距离不够:忘记-保持对齐差距预测LLM重新学习鲁棒性
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
RSFusionDet: Underwater RGB-Sonar Multimodal Object Detection
中文标题RSFusionDet :水下RGB-Sonar多模态物体检测
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题ProgRouter:Online Progress-Guided Orchestration 面向 Multi-Agent LLM Workflows under Quality-Cost Tradeoffs
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities
中文标题MMJailBench:A Factorized 基准 面向 Disentangling Multimodal Jailbreak Vulnerabilities
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
A Storage-Retrieval Gap in Parametric Knowledge Graph Memory
中文标题参数化知识图内存中的存储检索差距
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
中文标题VBVR-Pro:A 可扩展 与 Verifiable Suite 面向 Native Visual Reasoning
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models
中文标题StreamPI:Streaming Multimodal Temporal Modeling 面向 视觉-语言-动作模型
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题LLM数据代理的跟踪完整性:现实世界中可审计结构化推理的愿景
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
When Personality Meets Quantization: A Layer-wise MBTI Analysis of Quantized LLMs
中文标题当人格遇到量化时:量化LLM的分层MBTI分析
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
SciMIF: Understanding Multimodal Instruction Following in Scientific Domains
中文标题SciMIF :理解科学领域中的多式联运指令
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题熊猫-用于部分无配对多模式学习的原型锚定对齐,应用于阿尔茨海默病MRI和TCGA病理学
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
TAU-Agent: An Agentic Retrieval-Augmented Framework for Traffic Anomaly Understanding
中文标题TAU-Agent:An Agentic Retrieval-Augmented 框架 面向 Traffic Anomaly Understanding
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Query-Side Attacks on GNN-Based KGQA: Tracing Failures from Entity Linking to Answer Generation
中文标题Query-Side Attacks on GNN-Based KGQA:Tracing Failures 来自 Entity Linking to Answer Generation
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
VISTA: Visually Inferred Spatial ConTact Attention for Contact-Rich Manipulation
中文标题VISTA:Visually Inferred Spatial ConTact Attention 面向 Contact-Rich Manipulation
关注理由涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
DEFUSE: Generalizable Backdoor Defense for Self-Supervised Encoders with Generative Priors
中文标题DEFUSE :具有生成先验的自我监督编码器的通用后门防御
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Learning Continuous Regional Temperature Fields with Lead-Time and Resolution Queries
中文标题通过提前期和解决方案查询学习连续的区域温度场
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题非IID数据半监督联邦学习中自适应聚合的协作多Agent强化学习
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Why Does Graph Learning Fail to Fully Benefit from a Text Teacher?
中文标题为什么图形学习不能充分受益于文本教师?
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。