提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力
今天主要跟进:提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力、提升 RAG 检索和知识库问答可靠性。
本期从 2026-06-25 论文源抓取并去重 386 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1LISA:Likelihood Score Alignment 面向 Visual-condition Controllable Generation🔗
- 2HarmVideoBench:基准ing Harmful Video Underst与ing in Large Multimodal Models🔗
- 3RecallRisk-BERT:A Multi-Task 框架 面向 Post-Report Medical Device Recall Triage🔗
- 4使用迭代自改进代码书进行安全的自回归图像生成🔗
- 5Proposal-Conditioned Latent Diffusion 面向 Closed-Loop Traffic Scenario Generation🔗
- 6继承电路,学习语义:微调如何创建标准评估看不见的规避漏洞🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题LISA:Likelihood Score Alignment 面向 Visual-condition Controllable Generation
信号显示流行的双分支范式,即训练侧网络以编码视觉条件并将其中间层特征融合到冻结的预训练主网络中,在视觉条件可控生成方面取得了显着成功
关键词raginferencealignmentcode
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题HarmVideoBench:基准ing Harmful Video Understanding in Large Multimodal Models
信号显示大型视觉语言模型( LVLM )最近在自动化内容审核方面显示出巨大的潜力,引发了人们对开发有害视频基准的兴趣
关键词ragevaluationbenchmarkmultimodal
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题RecallRisk-BERT:A Multi-Task 框架 面向 Post-Report Medical Device Recall Triage
信号显示医疗器械召回是保护患者安全的关键监管机制
关键词ragsafetycoderisk
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题使用迭代自改进代码书进行安全的自回归图像生成
信号显示与在连续潜伏空间中运行的基于扩散的模型不同,自回归统一多模态模型通过顺序预测离散化的视觉令牌来产生图像
关键词ragsafetycodemultimodal
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Proposal-Conditioned Latent Diffusion 面向 Closed-Loop Traffic Scenario Generation
信号显示闭环流量模拟仍然具有挑战性,因为它必须在整个部署过程中生成场景一致且可控的交互式多Agent行为
关键词agentdeploymentsafetymultimodal
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题继承电路,学习语义:微调如何创建标准评估看不见的规避漏洞
信号显示针对安全分类进行微调的LLM通常根据来自与其训练数据相同分布的公开示例进行评估
关键词servingdeploymentevaluationbenchmark
代码/数据需查看原文确认
其他值得关注
Pseudo-Text-Conditioned 3D Grounding DINO for Organ Localization in Abdominal CT
中文标题用于腹部CT器官定位的伪文本条件3D接地恐龙
关注理由涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA
中文标题你有多确定?改进医学VQA中的言语不确定性校准
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
TriPAH: Imbalance-Aware Tri-Prompt Affinity Hashing for Cross-Modal Medical Retrieval
中文标题TriPAH:Imbalance-Aware Tri-Prompt Affinity Hashing 面向 Cross-Modal Medical Retrieval
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Semantic Early-Stopping for Iterative LLM Agent Loops
中文标题Semantic Early-Stopping 面向 Iterative LLM Agent Loops
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Decision-Aligned Evaluation of Uncertainty Quantification
中文标题基于决策的不确定性定量评估
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
XMSE-Aware Adaptive Empirical Bayes Estimation
中文标题XMSE感知自适应经验贝叶斯估计
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题普通Jane的越狱:通过Bandit算法为自动增强的查询选择最佳越狱
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Chai: Agentic Discovery of Cryptographic Misuse Vulnerabilities
中文标题CHAI :加密滥用漏洞的代理发现
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
GAVEL: Grounded Caption Error Verification and Localization
中文标题GAVEL:Grounded Caption Error Verification 与 Localization
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Risk-Aware Selective Multimodal Driver Monitoring with Driver-State World Modeling
中文标题具有风险意识的选择性多模式驾驶员监控与驾驶员状态世界建模
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation
中文标题PhysRAG :通过检索增强生成增强视频生成中的物理感知
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MedSWFlow: An Open-Source LLM Workflow for Drafting Medical Social Work Case Plans
中文标题MedSWFlow:An Open-Source LLM Workflow 面向 Drafting Medical Social Work Case Plans
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction
中文标题恶劣天气下的多模态图像融合:面罩引导下的特征恢复和交互
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
AIGP: An LLM-Based Framework for Long-Term Value Alignment in E-Commerce Pricing
中文标题AIGP:An 基于 LLM 的 框架 面向 Long-Term Value Alignment in E-Commerce Pricing
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Reproducibility Study of "AlphaEdit: Null-Space Constrained Knowledge Editing for Language Models"
中文标题可复现性 Study of "AlphaEdit:Null-Space Constrained Knowledge Editing 面向 Language Models"
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Anatomy-Guided Residual Motion Diffusion for Controllable 4D Cardiac MRI Synthesis
中文标题Anatomy-Guided Residual Motion Diffusion 面向 Controllable 4D Cardiac MRI Synthesis
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题ConvMemory v3 :通过目标条件关系验证的对话内存的有效性上下文层
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
HyperDFlash: MHC-Aligned Block Speculative Decoding with Gated Residual Reduction
中文标题HyperDFlash :采用门控残差减少的MHC对齐块推测解码
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Knowledge-Based Pull Requests: A Trusted Workflow for Agent-Mediated Knowledge Collaboration
中文标题Knowledge-Based Pull Requests:A Trusted Workflow 面向 Agent-Mediated Knowledge Collaboration
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research
中文标题NebulaExp-8B :通过全规模消融研究的实证培训后管道
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。