提升模型推理、规划和验证能力、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升模型推理、规划和验证能力、提升模型推理、规划和验证能力、提升模型推理、规划和验证能力。
本期从 2026-07-02 论文源抓取并去重 445 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1通过RFM-AGOP快速多维拒绝子空间🔗
- 2DisciplineGen-1M:A Large-Scale Dataset 面向 Multidisciplinary Visual Generation 与 Editing🔗
- 3AnyGroundBench:A Specialized-Domain 基准 面向 Video 落地 in Vision-Language Models🔗
- 4ArcAD:Anomaly-Rectified Calibration 面向 Cold-Start Supervised Anomaly Detection🔗
- 5RadiomicNet:A Hybrid Radiomics-Guided Lightweight Architecture 面向 Interpretable Medical Image Segmentation🔗
- 6AdaCount:Training-Free Similarity-Guided Spatial 与 Feature Adaptation 面向 Zero-Shot Object Counting🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升模型推理、规划和验证能力、提升模型推理、规划和验证能力、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升模型推理、规划和验证能力
中文标题通过RFM-AGOP快速多维拒绝子空间
信号显示大语言模型( LLM )中的转向和监控激活越来越多地用于安全性和可解释性
关键词safetycodeharmfulSafety and Alignment
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题DisciplineGen-1M:A Large-Scale Dataset 面向 Multidisciplinary Visual Generation 与 Editing
信号显示最近的图像生成和编辑模型可以生成具有视觉吸引力的自然图像,但当目标图像是知识密集型图表时,它们仍然不可靠,其正确性取决于学科概念、符号结构和精确的SPAT
关键词evaluationbenchmarkcodeopen-source
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题AnyGroundBench:A Specialized-Domain 基准 面向 Video 落地 in Vision-Language Models
信号显示视觉语言模型(VLM)在时空视频接地(STVG)中展现出巨大的前景
关键词evaluationbenchmarkvision-languageeval
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题ArcAD:Anomaly-Rectified Calibration 面向 Cold-Start Supervised Anomaly Detection
信号显示工业异常检测( IAD )在现实世界制造业中的部署经常遇到一个具有挑战性的冷启动瓶颈,其中有限的正态样本不能代表完全正态分布,只有少数异常可用
关键词ragdeploymentcoderl
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题RadiomicNet:A Hybrid Radiomics-Guided Lightweight Architecture 面向 Interpretable Medical Image Segmentation
信号显示深度学习在医学图像分割方面取得了显着的性能,但它存在严重的局限性:数学难度大,参数要求高,缺乏临床可解释性
关键词ragalignmentcodeknowledge
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题AdaCount:Training-Free Similarity-Guided Spatial 与 Feature Adaptation 面向 Zero-Shot Object Counting
信号显示零拍摄对象计数( ZOC )旨在计数仅通过文本提示指定的任意对象类别的实例
关键词ragservingbenchmarkcode
代码/数据需查看原文确认
其他值得关注
Privacy-Preserving and Verifiable Approximate Distributed Coded Computing
中文标题隐私保护和可验证的近似分布式编码计算
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
ContextNest: Verifiable Context Governance for Autonomous AI Agent
中文标题ContextNest:Verifiable Context Governance 面向 Autonomous AI Agent
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails
中文标题持续多模态学习中的隐性遗忘:当准确性存活但接地失败时
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Liquid Latent State Dynamics for Interpretable Turbofan Degradation Modeling
中文标题用于可解释涡扇降解建模的液体潜伏状态动力学
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding
中文标题MolSight:A Graph-Aware Vision-Language Model 面向 Unified Chemical Image Understanding
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Towards a Phonology-Informed Evaluation of Multilingual TTS
中文标题Towards a Phonology-Informed 评测 of Multilingual TTS
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
NAVER LABS Europe Submission to the Instruction-following 2026 Short Track
中文标题NAVER LABS欧洲提交说明-遵循2026年短轨
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题通过多尺度时间建模和可微分轮廓渲染从电影MRI重建个性化4D全心网格
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
AIriskEval-edu: New Dataset for Risk Assessment in AI-mediated K-12 Educational Explanations
中文标题AIriskEval-edu:New Dataset 面向 Risk 评估 in AI-mediated K-12 Educational Explanations
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Rethinking Post-Hoc Calibration in Semantic Segmentation
中文标题重新思考语义分割中的事后校准
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Gaming Consensus: Coordinated Manipulation in Crowdsourced Fact-Checking
中文标题博彩共识:众包事实核查中的协同操纵
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
On the Limits of Steering Vectors for Preference-Aligned Generation
中文标题关于偏好对齐发电的转向矢量极限
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Verifiable Knowledge Expansion through Retrieval-Grounded Formal Concept Analysis
中文标题通过基于检索的正式概念分析进行可验证的知识扩展
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction
中文标题Mastermind:Strategy-grounded Learning 面向 Repository-Scale Vulnerability Reproduction
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Denser $\neq$ Better: Limits of On-Policy Self-Distillation for Continual Post-Training
中文标题Denser $\neq$ Better:Limits of On-Policy Self-Distillation 面向 Continual Post-Training
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
InterCMDM: Block-Causal Diffusion for Autoregressive Human Interaction Generation
中文标题InterCMDM:Block-Causal Diffusion 面向 Autoregressive Human Interaction Generation
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题Pmeta-TLA :利用音色泄漏攻击通过元学习对语音分类模型进行后门攻击
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing
中文标题认知护目镜:通过梯度编辑诱导认知框架的预训练模块
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Model Merging as Probabilistic Inference in Fine-Tuning Parameter Space
中文标题模型合并作为微调参数空间中的概率推断
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning
中文标题ICDepth:Taming Video Diffusion Models 面向 Video Depth Estimation via In-Context Conditioning
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。