提升模型推理、规划和验证能力、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升模型推理、规划和验证能力、提升模型推理、规划和验证能力、提升模型推理、规划和验证能力。
本期从 2026-07-23 论文源抓取并去重 321 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升模型推理、规划和验证能力、提升模型推理、规划和验证能力、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升模型推理、规划和验证能力
中文标题QuantiBias:基准ing Quantization-Induced Bias in LLMs
信号显示几乎所有接触到广泛受众的大语言模型都经过量化:经过完全精确的训练,然后进行压缩以提高效率
关键词compressionsafetyevaluationbenchmark
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题MVEI和EmObserver :通过情绪陈述判断增强以MLM为导向的视觉情商
信号显示情感图像内容分析( AICA )旨在识别和理解由视觉内容引起的情绪,这是通用人工智能( AGI )不可或缺的一步
关键词evaluationbenchmarkcodemultimodal
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题实现任意粒度的基于文本的人员检索
信号显示基于文本的人员检索面临一个关键但未得到充分探索的挑战:现实场景中查询粒度的固有不确定性
关键词retrievalalignmentevaluationbenchmark
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题GroupVideo :多标识定制文本视频生成
信号显示当前的身份定制视频生成方法主要限于单一身份场景,因为缺乏明确的身份分离机制通常会导致多身份设置中的身份混淆
关键词ragalignmentcodemultimodal
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题HiMe:Real-Time Self-Hosted Personal Agent 平台 面向 Health Insights with Wearable Devices
信号显示智能手表等传统的可穿戴健康信号分析方法受到严格的分析框架和有限的个性化的限制
关键词agentservingopen-sourcedatabase
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题HyWorldVLA :具有自动驾驶混合世界建模的视觉-语言-行动模型
信号显示通过世界建模增强的视觉-语言-行动( VLA )模型代表了端到端自动驾驶的一个有前途的范例
关键词benchmarkcodevision-languagefine-tuning
代码/数据需查看原文确认
其他值得关注
中文标题Workflow-Localized Mechanism Learning:Attribution-Guided Repair 与 Knowledge Reuse 面向 Structured Agent Skills
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval
中文标题用于不确定性感知文本到视频检索的分布对齐桥接
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Fast and Efficient Approximate Nearest Neighbor Search for High-Dimensional LLM Embeddings
中文标题高维LLM嵌入的快速高效近似近邻搜索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题从单词级词典到句子级语义:使用上下文模型进行多语言申诉标注
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Representing Entity Importance in AI Knowledge Systems:A Dual-Signal 框架 of Audience 评测 与 Structural Authority
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题信息-理论上安全聚合以实现轻量级联合学习:抵御辍学和对手
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports
中文标题LegalCiteTrust:基准ing Citation Trustworthiness in Chinese Long-Form Legal Research Reports
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Position Bias is Hidden Behind Ceiling Effects: A Permutation Diagnostic for LLM Benchmarks
中文标题位置偏差隐藏在天花板效应背后: LLM基准的排列诊断
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
CSPF: A Constrained Shared-Private Fusion Method for Non-Verifiable Preference Evaluation
中文标题CSPF:A Constrained Shared-Private Fusion Method 面向 Non-Verifiable Preference 评测
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning
中文标题REFACT:Adaptive Fact Restatement 面向 Compact 与 Faithful Chain-of-Thought Reasoning
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Enhancing Explainable Cardiac Diagnosis with Guide-Grounded Multimodal LLMs
中文标题使用基于指南的多模式LLM增强可解释的心脏诊断
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment
中文标题X $ ^ 3 $ -OPD :通过按策略对齐将推理提炼成大型音频语言模型
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
UnDA: Unpaired Domain Alignment for Cross-Modal Knowledge Transfer in Medical Imaging
中文标题UnDA:Unpaired Domain Alignment 面向 Cross-Modal Knowledge Transfer in Medical Imaging
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
DAPM: UAV Monocular Depth Estimation from Any Height, Pitch, Roll and FOV
中文标题DAPM:UAV Monocular Depth Estimation 来自 Any Height,Pitch,Roll 与 FOV
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
GLAM-SLAM: Real-time Gaussian Large-scale Mapping via Flow Densification and Spatial Decomposition
中文标题GLAM-SLAM :基于流密度和空间分解的实时高斯大规模映射
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Cautious optimism for deep parameterized quantum circuits
中文标题对深度参数化量子电路持谨慎乐观态度
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题ASTRA-Net:Anatomy-Specific Transfer 与 Representation Alignment 面向 Drug-Induced Sleep Endoscopy Segmentation
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Emergent Misalignment Recruits a Pre-existing Persona Subspace
中文标题紧急错位招募预先存在的人物角色子空间
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题M$^3$-Gen:Interpretable Multimodal Generation of Gene Expression Profiles 使用 Clinical 与 Imaging Data
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Flash EQ-Linear: Accelerating Equivariant Linear Layers via Group-wise Discrete Fourier Transform
中文标题Flash EQ-Linear :通过分组离散傅里叶变换加速等变量线性层
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。