提升 RAG 检索和知识库问答可靠性、提升代码生成、执行反馈和自动修复能力
今天主要跟进:提升 RAG 检索和知识库问答可靠性、提升 RAG 检索和知识库问答可靠性、提升代码生成、执行反馈和自动修复能力。
本期从 2026-08-20 论文源抓取并去重 291 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、提升 RAG 检索和知识库问答可靠性、提升代码生成、执行反馈和自动修复能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题流量偏好优化中的歧管漂移:奖励黑客的根本原因
信号显示偏好优化是生成模型的标准对齐方法,但将其扩展到连续时间动态仍然很重要
关键词ragalignmentbenchmarkfine-tuning
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题通过多补丁令牌对齐和混合掩码对时间序列基础模型进行规模感知预训练
信号显示跨异构数据集预训练时间序列基础模型需要有效处理不同的采样频率
关键词ragservingalignmentbenchmark
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题开放式词汇表3D物体检测与共蒸馏发现和双重引导强大培训
信号显示最近,开放式词汇表3D对象检测( 3D-OVD )因其在3D场景中检测看不见的对象的能力而受到越来越多的关注
关键词alignmentcodetrainingdistillation
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题多源Wasserstein分布稳健图学习
信号显示图形信号的网络拓扑推断是图形信号处理的核心,在神经科学、传感器和社交网络中的应用
关键词raginferenceservingbenchmark
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题用于缓解健康查询中患者上下文模糊性的知识引导型代理框架
信号显示患者经常向医疗保健聊天机器人提交简短、不明确的查询,这些机器人缺乏确定适当反应所需的患者特定信息
关键词agentretrievalsafetybenchmark
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题SWE-bench Science :编码代理可以解决科学中的工程任务吗?
信号显示软件越来越多地作为科学仪器本身的一部分发挥作用,使得科学代码的失败不仅会影响程序行为,还会影响科学结论背后的证据
关键词agentragservingevaluation
代码/数据需查看原文确认
其他值得关注
DIFFCZSL: Compositional Zero-Shot Learning Regularized by Diffusion Representations
中文标题DIFFCZSL :由扩散表示规范化的组合零拍学习
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment
中文标题通过增强视觉-语言对齐实现临床上忠实的医学图像字幕
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
LoRA-GA$^2$: Low Rank Adaptation with Multi-step Gradient Adaptive Alignment
中文标题LoRA-GA $ ^ 2 $ :具有多步梯度自适应对齐的低等级适应
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
RecPFN: Prior-Fitted Networks for In-Context-Based Recommendations
中文标题RecPFN:Prior-Fitted Networks 面向 In-Context-Based Recommendations
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
SafeBranch: Branch-Pair Safety Alignment for Embodied Agents
中文标题SafeBranch:Branch-Pair Safety Alignment 面向 Embodied Agents
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Scale-Separated Conditioning for Style-Encoder-Free Diffusion Stylization
中文标题Scale-Separated Conditioning 面向 Style-Encoder-Free Diffusion Stylization
关注理由涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题水下机器人在退化视觉条件下的强大跨模态基础模型感知
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题使用大型语言模型进行智能合约漏洞检测的频率感知持续学习
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents
中文标题ReCache:Efficient KV Cache Reuse 与 Compression 面向 Tool-Augmented LLM Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Scientific Data Skills: Enabling Agent-Ready Scientific Data Services at Scale
中文标题Scientific Data Skills:Enabling Agent-Ready Scientific Data Services 的大规模方法
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Mitigating Identity Essentialism in LLM Agents with Longitudinal Life Trajectories
中文标题缓解具有纵向生活轨迹的LLM代理中的身份本质主义
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment
中文标题PEA-DPO:Perception-Enhanced Alignment Direct Preference Optimization 面向 MLLMs Alignment
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
OrthoSkillVLA: Continual Skill Learning via Gradient-Informed Skill Subspace Adaptation
中文标题OrthoSkillVLA :通过梯度知情技能子空间适应进行持续技能学习
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Enforcing LLM Safety through DMD-based Classification of Prompt-Response Embedding Dynamics
中文标题通过基于DMD的快速响应嵌入动态分类来实施LLM安全
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
CVSD-Reg: Cross-Modal Visual Semantic Prior Distillation for Robust LiDAR Registration
中文标题CVSD-Reg:Cross-Modal Visual Semantic Prior Distillation 面向 Robust LiDAR Registration
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题使用大型语言模型和检索增强生成自动总结金融新闻:早期实证研究( 2023年秋季)
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
A Standardized Framework for Machine Learning in Power System Protection
中文标题电力系统保护中机器学习的标准化框架
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection
中文标题Task-CoEvolve :通过自适应验证任务选择进行高效线束优化
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ExPhy: A Benchmark for Explicit Physical Property Learning in Multi-Object Trajectory Forecasting
中文标题ExPhy:A 基准 面向 Explicit Physical Property Learning in Multi-Object Trajectory Forecasting
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
HealMed: Multilingual Evaluation of Large Language Models in Medicine
中文标题HealMed:Multilingual 评测 of Large Language Models in Medicine
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。