提升模型推理、规划和验证能力、增强多模态模型理解图表和文档的能力、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升模型推理、规划和验证能力、增强多模态模型理解图表和文档的能力、提升 RAG 检索和知识库问答可靠性。
本期从 2026-08-13 论文源抓取并去重 363 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升模型推理、规划和验证能力、增强多模态模型理解图表和文档的能力、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升模型推理、规划和验证能力
中文标题Beyond Correctness:基准ing 与 Aligning Response Behaviors in Hybrid-Thinking MLLMs
信号显示混合思维的多模态大语言模型( MLLM )允许单个模型在审慎思维和延迟效率非思维推理之间交替
关键词inferencelatencyalignmentevaluation
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题自然语言理解在基于视频的多模式登革热诊断中的作用
信号显示从视频数据中检测蚊子的感染相关行为变化具有挑战性,因为蚊子很小,移动迅速且不规则,并且受背景、光照和阴影等环境因素的影响,这可以使
关键词alignmentmultimodalvision-languagefine-tuning
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题隐私保护 RAG by Concealing Sensitive Information 来自 External LLMs
信号显示检索增强生成( RAG )被广泛用于提高大语言模型( LLM )在回答用户查询时的性能
关键词ragretrievalservingfine-tuning
代码/数据需查看原文确认
改进图像生成、视觉理解和可控渲染
中文标题雕刻:用于3D零件生成的减法构图
信号显示部分感知3D生成旨在创建连贯的数字资产作为完整的对象,同时暴露结构部件以进行编辑、材质分配、动画和重用
关键词servingsafetybenchmarkdataset
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题针对自动驾驶汽车中攻击者可触及软件弱点的LLM辅助动态威胁分析
信号显示自动驾驶汽车依赖于大型安全关键型软件堆栈,其中来自对抗性输入的弱点可能会影响转向、制动或其他控制决策
关键词safetycodeopen-sourceprogram
代码/数据需查看原文确认
解释模型内部表征和行为归因
中文标题移动数据的基础模型:它们准备好迎接黄金时段了吗?
信号显示在大规模加速度计数据上训练的基础模型( FM )已被提出作为健康监测的通用特征提取器,但缺乏其优势的系统证据
关键词inferencedeploymentevaluationopen-source
代码/数据需查看原文确认
其他值得关注
Bagging Robustly Learns VC Classes with Linear Sample Complexity
中文标题Bagging以线性样本复杂度稳健地学习VC课程
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Toward a Gricean Retreat: Probing LLMs for Knowledge Boundaries and Referent Specificity
中文标题面向 a Gricean Retreat:Probing LLMs 面向 Knowledge Boundaries 与 Referent Specificity
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
MapRoute++: Surrogate-Guided Semantic Routing for Visual Concept Unlearning
中文标题MapRoute++:Surrogate-Guided Semantic Routing 面向 Visual Concept Unlearning
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Where You Measure Decides What You Measure: Position Selection in Ablation-Based SAE Evaluation
中文标题Where You Measure Decides What You Measure:Position Selection in Ablation-Based SAE 评测
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Follow the Norm: Accounting for Fine-Tuning and Prompt Effects on Model Rationales
中文标题遵循规范:对模型理论的微调和即时效应的核算
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题Capability Sheaves 面向 Compositional Agent-Harness Repair:Controlled Quotients 与 a Real-Repository Stress Test
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
History-informed Lagrangian Neural Networks
中文标题了解历史的拉格朗日神经网络
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题超越模拟基准:评估真实世界数据稀缺情况下的跌倒检测的运动表示
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题更好的分解,自由聚合:多语言多跳问答的合成器折叠框架
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Semantic Radiance Fields as Simulators for Spatial Reasoning in Real-World Scenes
中文标题语义辐射场作为真实场景中空间推理的模拟器
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Paths:Prompt-aware Spatio-temporal Transformer with Hierarchical Multi-modal Fusion 面向 RGB-Event Video Person Re-Identification
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题抽样运气伪装成分配增益:审计神经组合优化的测试时间预算分配
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Behavioral Reprogramming of Open-Weights Models: Cognitive Plasticity and Alignment Bounds
中文标题开放式体重模型的行为重编程:认知可塑性和校准界限
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题BoardroomAI :通过不断演变的决策图进行依赖感知的人性化可操纵多Agent审议
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Static analysis-guided agentic AI translation enables Rust as a full stack bioinformatics language
中文标题静态分析引导的代理人工智能翻译使Rust成为一种全栈生物信息学语言
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Decoupled Contrastive Decoding via Expert-Aligned Drafting
中文标题通过专家对齐的绘图进行解耦对比解码
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Beyond Visual Evidence: Revealing and Mitigating Relational Privacy Leakage in Document MLLMs
中文标题超越视觉证据:揭示和缓解文档传销中的关系隐私泄露
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题HounsWorld:A Multimodal World Model 面向 Hidden Patient-State Readout,Reconstruction,与 Simulation
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题HumanoidVLN:A Physics-Grounded Simulator 与 基准 面向 Vision-Language Navigation Across Diverse Humanoid Embodiments
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
LocusGS: Spatially Grounded Tokens for Feed-Forward 3D Gaussian Splatting
中文标题LocusGS:Spatially Grounded Tokens 面向 Feed-Forward 3D Gaussian Splatting
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。