提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-08-27 论文源抓取并去重 399 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题机器学习模型和文本识别应用的系统文献综述
信号显示使用机器视觉进行文本识别的光学字符识别( OCR )得到了显着改进,特别是在处理异构文本数据时
关键词ragevaluationmultimodalsearch
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题CritICL:Inference-Time Weak-to-Strong Generalization 来自 Small Language Model Failure Modes
信号显示推理时间缩放的最新进展显著改善了大语言模型( LLM )的推理性能
关键词raginferencecodereasoning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题SWE-Prime :更少的轨迹,更好的性能
信号显示为了提高大语言模型解决实际软件问题的能力,之前的工作重点是构建大规模代理轨迹数据集,并对成功轨迹进行监督微调( SFT )
关键词agentragfine-tuningtraining
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题超越F1 :评估AI模型安全扫描仪的覆盖范围和故障恢复
信号显示静态扫描仪越来越多地用于识别机器学习工件中的可执行内容或其他不安全的内容,但传统的评估指标仅表征扫描仪产生可用安全判断的情况
关键词ragevaluationbenchmarkeval
代码/数据需查看原文确认
改进图像生成、视觉理解和可控渲染
中文标题Sidecar:Training-Free Semantic Reuse 面向 Character-Consistent Free-form Visual Storytelling
信号显示视觉叙事需要生成遵循叙事的图像,同时跨帧保持一致的角色身份
关键词servingalignmentdiffusionvisual
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题Dose-PlanNet :基于物理的放疗剂量预测与深度学习
信号显示前列腺放射治疗计划的自动化在剂量学上是复杂的,特别是对于极端低分割方案
关键词workflowragdeploymentplanning
代码/数据需查看原文确认
其他值得关注
PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
中文标题PAWBench:How Far Are We 来自 Probabilistically Aligned World Modeling?
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
CODE: Cross-Modal Calibration and Dynamic Suppression for Open World Object Detection
中文标题代码:用于开放世界物体检测的跨模态校准和动态抑制
关注理由涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
KinyaEmbed: Contrastive Sentence Embeddings for Kinyarwanda via Multi-Stage Curriculum Training
中文标题KinyaEmbed :通过多阶段课程培训为基尼亚卢旺达语进行对比句子嵌入
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
中文标题Self-OPD:On-Policy Distillation 面向 Flow Matching Models without Teacher
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
CGS-SLAM: Collaborative Gaussian Splatting based SLAM for Multi-Agent Reconstruction
中文标题CGS-SLAM:Collaborative Gaussian Splatting based SLAM 面向 Multi-Agent Reconstruction
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Reinforcement Learning-Based Control of CAV Platoon Joining Maneuvers in Mixed Traffic
中文标题基于强化学习的混合交通CAV排编队机动控制
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
A Geometry-Driven, Framework-Agnostic Optimization for Object Pose Estimation
中文标题物体姿态估计的几何驱动、框架无关优化
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题从视觉基础模型到茶叶疾病分类的轻量级视觉状态空间模型的跨架构知识蒸馏
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
DEEPCHART: How Far are LLMs from Faithful Data-Science Chart Generation?
中文标题DEEPCHART:How Far are LLMs 来自 Faithful Data-Science Chart Generation?
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Glass Surface Detection Grounded in 3D Visual Geometry
中文标题基于3D视觉几何的玻璃表面检测
关注理由涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Discovering Relationships in Data Lakes Using Large Language Models: An Industrial Case
中文标题使用大型语言模型发现数据湖中的关系:一个工业案例
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training
中文标题知道何时不重复使用:自主法学硕士培训后的有条件经验传授
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
When Does Supervised Fine-Tuning Reduce Instruction Sensitivity?
中文标题监督微调何时降低指令灵敏度?
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Meta-Learning Where to Allocate Experts: Task-Conditioned Layer-Wise Compression for MoEs
中文标题元学习在哪里分配专家:面向教育部的任务条件分层压缩
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Real-time Unsupervised Object Discovery from Asynchronous Event Streams
中文标题异步事件流中的实时无监督对象发现
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMs
中文标题信息引导前沿解码: dMLLM中的上下文效用驱动型承诺
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Which Metrics Save the Most Human Annotation? Prediction-Powered Evaluation and Meta-Evaluation
中文标题哪些指标可保存最人性化的注释?基于预测的评估和元评估
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Who Remains, What Changes: Identity Anchored Composed Gait Retrieval
中文标题谁留下,什么变化:身份锚定组合步态检索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题千图假设:存储库级代码推理中任务条件关系物化的可检验假设
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题不仅仅是理性,不仅仅是扫描:强化学习,用于学术论文的主动科学错误验证
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。