提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升 RAG 检索和知识库问答可靠性、提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力。
本期从 2026-08-11 论文源抓取并去重 382 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题ConfTriage :选择性专科延期治疗肺结节恶性肿瘤的校准感知LLM分类框架
信号显示肺结节恶性肿瘤预测通常依赖于图像训练的专业深度学习( DL )模型,这些模型需要大量的注释成像数据和特定任务的训练
关键词raginferencesafetycode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题FedCGR :联合跨域生成推荐
信号显示跨域推荐(CDR)跨相关域传输偏好知识,但联合部署使跨域对齐变得困难,因为对齐项目空间的行为锚点(例如重叠用户和共享交互签名)
关键词ragdeploymentalignmentevaluation
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题通过语义3D高斯拼接实现开放式词汇移动操作的嵌入式多模态接地
信号显示具体的移动操作需要在执行前对齐语言、视觉观察、三维场景结构和动作可行性
关键词evaluationmultimodalvision-languagerobot
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Detecting an Effect Is Not Learning to Act on It:A Reward-SNR Floor 面向 LLM Acquisition Agents
信号显示许多管道可以支付每个示例的成本来获取辅助,模型衍生的观察- LLM的结构化推理,缓慢的预言机,昂贵的测量-然后必须决定获取的信号何时值得使用
关键词agentragcodedata
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题从可解释性到控制性:六年TrustNLP研讨会的见解
信号显示值得信赖的自然语言处理研讨会( TrustNLP )自2021年以来与主要的ACL会议同地举办,六个版本的论文从8篇增加到41篇,记录了整个领域从静态模式事后可解释性的转变
关键词ragalignmentsafetysearch
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题TACTICL :表格ICL模型的任务感知压缩
信号显示表格任务的基础模型的强大性能需要大量的推理成本
关键词inferencecompressionbenchmarkcode
代码/数据需查看原文确认
其他值得关注
PEAK: Precise and Persistent Concept Erasure via k-Sparse Autoencoders
中文标题峰值:通过k-Sparse自动编码器进行精确和持久的概念擦除
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
GitSkills: A Dataset of Agent Skills on GitHub
中文标题GitSkills : GitHub上的代理技能数据集
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation
中文标题DistilVDR :通过双学生蒸馏的紧凑型端到端视觉文档检索器
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation
中文标题用于多语言机器翻译的开放式大型语言模型的无引用后训练
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement
中文标题重新思考LLM验证:证据结构、不确定性和选择性细化
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
SQuaT: Self-Supervised Knowledge Distillation via Student-Aware Quantized Teacher Features
中文标题SQuaT :通过学生感知量化教师功能进行自我监督的知识蒸馏
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
MEGA: Self-Evolving Agent Optimization Infrastructure via Wisdom Graph
中文标题MEGA :通过智能图进行自我进化Agent优化基础设施
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models
中文标题永不停止说话:对端到端语音语言模型的拒绝服务攻击
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Are We Really Making Progress in Group Recommendation? Unmasking the Tie-Breaking Illusion
中文标题我们真的在小组推荐方面取得了进展吗?揭开打破捆绑的幻觉
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
How to Verify Consistency of Probabilistic Claims
中文标题如何验证概率性声明的一致性
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题多模态代码切换:将可视化对象交织到语言中以实现显式对象级对齐
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Agentic Configuration Management (ACM): A Reference Configuration Model for Governed Agentic Systems
中文标题Agentic Configuration Management (ACM):A Reference Configuration Model 面向 Governed Agentic Systems
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题PRMU:A Corpus-Free 基准 面向 Person-Centric Knowledge Unlearning in Multimodal Large Language Models
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
The Illusion of Cross-Lingual Safety in Low-Resource Languages
中文标题低资源语言中的跨语言安全错觉
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding
中文标题为什么CLAUDE.md不断增长? Agentic编码中的灾难性记忆
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Static in Frames, Dynamic in Events: Rethinking Features in Event Cameras as Motion Cues
中文标题帧中的静态,事件中的动态:将事件摄像机中的功能重新思考为运动线索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering
中文标题CapProbe :通过全景密集问答评估详细的图像标题
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Mapping and Measuring the Behavioral Evolution of Large Language Models
中文标题绘制和测量大型语言模型的行为进化
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Data Attribution of Emergent Misalignment with Persona Features
中文标题紧急错位的数据归因与角色特征
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation
中文标题TimeRoute:Time-Aware Modality Routing 与 Diffusion 面向 Multi-Modal Recommendation
关注理由涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。