提升模型推理、规划和验证能力、增强多模态模型理解图表和文档的能力、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升模型推理、规划和验证能力、增强多模态模型理解图表和文档的能力、提升 RAG 检索和知识库问答可靠性。
本期从 2026-06-05 论文源抓取并去重 344 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1ThinkBooster:A Unified 框架 面向 Seamless Test-Time Scaling of LLM Reasoning🔗
- 2Unified Safe In-context Image Generation in Multimodal Diffusion Trans面向mers via Restricting Unsafe In面向mation Flows🔗
- 3Progress-SQL:Improving Rein面向cement Learning 面向 Text-to-SQL via Progressive Rewards🔗
- 4PaperFlow:Profiling,Recommending,与 Adapting Across Daily Paper Streams🔗
- 5LLM-Guided Evolution 面向 Medical Decision Pipelines🔗
- 6Residual-Controlled Multiplier Learning 面向 Stochastic Constrained Decision-Making🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升模型推理、规划和验证能力、增强多模态模型理解图表和文档的能力、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升模型推理、规划和验证能力
核心:这篇论文主要解决提升模型推理、规划和验证能力这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 rag、inference、benchmark、code 等线索来组织推理与规划任务、数据或评测流程实现提升模型推理、规划和验证能力;主要论点是标题、摘要和公开信号显示:Test-time compute (TTC) scaling has emerged as a powerful paradigm for improving large language model (LLM) reasoning by allocating additional compute during inference, e.g., via multi-sample generation and verifier-based reranking。关键词:rag、inference、benchmark、code。代码/数据可用性需查看原文确认。
增强多模态模型理解图表和文档的能力
核心:这篇论文主要解决增强多模态模型理解图表和文档的能力这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 serving、safety、code、multimodal 等线索来组织视觉与图像生成任务、数据或评测流程实现增强多模态模型理解图表和文档的能力;主要论点是标题、摘要和公开信号显示:Diffusion transformers (DiTs) equipped with multimodal attention (MM-Attn) have become a dominant paradigm for image generation。关键词:serving、safety、code、multimodal。代码/数据可用性需查看原文确认。
提升 RAG 检索和知识库问答可靠性
核心:这篇论文主要解决提升 RAG 检索和知识库问答可靠性这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 rag、latency、alignment、evaluation 等线索来组织基准与评测任务、数据或评测流程实现提升 RAG 检索和知识库问答可靠性;主要论点是标题、摘要和公开信号显示:Reinforcement learning has recently shown promise in improving large language models for Text-to-SQL generation, yet existing methods typically optimize one-shot rewards defined over a single SQL state。关键词:rag、latency、alignment、evaluation。代码/数据可用性需查看原文确认。
评测视频生成的时间一致性和运动真实感
核心:这篇论文主要解决评测视频生成的时间一致性和运动真实感这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 alignment、evaluation、benchmark、eval 等线索来组织基准与评测任务、数据或评测流程实现评测视频生成的时间一致性和运动真实感;主要论点是标题、摘要和公开信号显示:Scientific paper recommendation is typically evaluated as static ranking over a fixed candidate set, yet real scientific reading unfolds as a daily, longitudinal process in which interests shift and feedback accumulates。关键词:alignment、evaluation、benchmark、eval。代码/数据可用性需查看原文确认。
增强多模态模型理解图表和文档的能力
核心:这篇论文主要解决增强多模态模型理解图表和文档的能力这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 workflow、inference、serving、safety 等线索来组织多模态模型任务、数据或评测流程实现增强多模态模型理解图表和文档的能力;主要论点是标题、摘要和公开信号显示:Adapting large language models (LLMs) to clinical workflows often requires costly fine-tuning or manual prompt and pipeline engineering。关键词:workflow、inference、serving、safety。代码/数据可用性需查看原文确认。
提升代码生成、执行反馈和自动修复能力
核心:这篇论文主要解决提升代码生成、执行反馈和自动修复能力这一方向中的具体研究问题;方法上通过题名、摘要和公开信号中的 safety、code、memory、Code Intelligence 等线索来组织代码智能任务、数据或评测流程实现提升代码生成、执行反馈和自动修复能力;主要论点是标题、摘要和公开信号显示:Stochastic constrained decision-making requires optimizing performance objectives while enforcing statistical requirements such as safety or fairness。关键词:safety、code、memory、Code Intelligence。代码/数据可用性需查看原文确认。
其他值得关注
Watch, Remember, Reason: Human-View Video Understanding with MLLMs:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
ForensicConcept: Transferable Forensic Concepts for AIGI Detection:涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
SS-TPT: Stability and Suitability-Guided Test-Time Prompt Tuning for Adversarially Robust Vision-Language Models:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
When CLIP Sees More, It Fights Back Harder: Multi-View Guided Adaptive Counterattacks for Test-Time Adversarial Robustness:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution:涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Gated Bidirectional Linear Attention for Generative Retrieval:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
SWE-Explore: Benchmarking How Coding Agents Explore Repositories:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
The Capacity of Information-Theoretic Secure Aggregation in Federated Learning:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
HKVM-RAG: Key-Value-Separated Hypergraph Evidence Organization for Multi-Hop RAG:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Robotic Policy Adaptation via Weight-Space Meta-Learning:涉及机器人与具身智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
TrioPose: Native Triple-Stream Diffusion Transformers for Pose-Guided Text-to-Image Generation:涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Hierarchical Forecast Reconciliation for Urban Rail Transit Demand Prediction under Operational Disruptions:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
DREAM: Dynamic Refinement of Early Assignment Mappings:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
A Cross-view Fusion Framework for Robust 6-DoF Grasp Pose Estimation:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Federated Foundation Models over Vehicular Networks:涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
CoMetaPNS: Continually Meta-learning Personalized Neural Surrogates for Cardiac Electrophysiology Simulations:涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Planning-aligned Token Compression for Long-Context Autonomous Driving:涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。