提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-06-25 论文源抓取并去重 386 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1TGHE:Template-based Graph Homomorphic Encryption 面向 隐私保护 GNN Inference in Edge-Cloud Systems🔗
- 2LAMP:Lane-Aligned Motion Primitives 面向 Feasible Trajectory Prediction🔗
- 3将代理说明自动格式化为策略即代码🔗
- 4LayersReg:A Layer-by-Layer Progressive Regressor 面向 Reliable Intraoperative 3D/2D Registration🔗
- 5SharQ:Bridging Activation Sparsity 与 FP4 Quantization 面向 LLM Inference🔗
- 6创意:在多Agent控制中,通过Sim-to-Real传输的效果对动态不匹配不敏感🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题TGHE:Template-based Graph Homomorphic Encryption 面向 隐私保护 GNN Inference in Edge-Cloud Systems
信号显示现有的基于同态加密( HE )的GNN系统采用以图为中心的范式,将每次查询的成本与全局图大小相结合,将评估限制在最多约2万个节点,并使其与动态的大规模财务图不兼容
关键词raginferenceservingevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题LAMP:Lane-Aligned Motion Primitives 面向 Feasible Trajectory Prediction
信号显示运动预测对于自动驾驶系统在复杂的驾驶场景中实现安全决策和规划至关重要
关键词servingsafetycodemultimodal
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题将代理说明自动格式化为策略即代码
信号显示高风险领域的代理安全需要正式的政策执行,但大多数现有方法要么依赖于没有正式保证的概率护栏(微调的分类器,基于提示的转向) ,要么依赖于手工编码的符号执行
关键词agentsafetybenchmarkcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题LayersReg:A Layer-by-Layer Progressive Regressor 面向 Reliable Intraoperative 3D/2D Registration
信号显示3D/2D配准是手术导航的基石技术
关键词retrievalalignmentmultimodalmemory
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题SharQ:Bridging Activation Sparsity 与 FP4 Quantization 面向 LLM Inference
信号显示现代加速器越来越多地支持低位浮点格式和半结构化稀疏性,但将它们组合用于LLM激活压缩仍然具有挑战性:激活包含主导FP4中块规模的输入相关异常值
关键词inferenceservinglatencycompression
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题创意:在多Agent控制中,通过Sim-to-Real传输的效果对动态不匹配不敏感
信号显示对于传统的基于规则和基于模型的方法,复杂的多智能体控制任务仍然具有挑战性,这促使采用基于学习的方法
关键词agentragdeploymentalignment
代码/数据需查看原文确认
其他值得关注
Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents
中文标题了解太多的代理:以数据为中心的LLM代理隐私调查
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题大型语言模型能否可靠地编码定性人道主义数据?针对人类专家裁决的基准研究
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题NeuraDock Visual Cognitive Load Agent Tutorial:A Quality-Gated Open-Source EEG Workflow 面向 Alpha Dynamics 与 Real-Time Applications
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Speaking Numbers to LLMs: Multi-Wavelet Number Embeddings for Time Series Forecasting
中文标题向LLM讲述数字:用于时间序列预测的多小波数嵌入
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents
中文标题对LLM药剂中针对快速注射的带外防御进行自适应评估
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题不要沉溺于这种模式!通过特征自导缓解预训练流程模型中的多样性崩溃
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
中文标题NOVA:A Verification-Aware Agent Harness 面向 Architecture Evolution in Industrial Recommender Systems
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement
中文标题Ask,Don't Judge:Binary Questions 面向 Interpretable LLM 评测 与 Self-Improvement
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)
中文标题Learning to Fold : LeHome Challenge 2026的获奖解决方案(线上第一,线下第二)
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Mostly Automatic Translation of Language Interpreters from C to Safe Rust
中文标题Mostly Automatic Translation of Language Interpreters 来自 C to Safe Rust
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
TMP: Tree-structured Mixed-policy Pruning for Large-scale Image Generation and Editing
中文标题TMP:Tree-structured Mixed-policy Pruning 面向 Large-scale Image Generation 与 Editing
关注理由涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP
中文标题ShareLock :针对MCP的隐形多工具阈值中毒攻击
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题MinGram :具有高压缩和竞争性形态对齐的极简主义Unigram标记器
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Adaptive Utility driven Resource Orchestration for Resilient AI (AURORA-AI)
中文标题Adaptive Utility driven Resource Orchestration 面向 Resilient AI (AURORA-AI)
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Where Do Models Find Happiness? Emotion Vectors in Open-Source LLMs
中文标题模特儿在哪里找到快乐?开源LLM中的情感向量
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题语境模型预测生成:从语言模型到物理学的开放式词汇运动合成
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
How Much Static Structure Do Code Agents Need? A Study of Deterministic Anchoring
中文标题代码代理需要多少静态结构?确定性锚定研究
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
RedVox: Safety and Fairness Gaps in Speech Models Across Languages
中文标题RedVox:Safety 与 Fairness Gaps in Speech Models Across Languages
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Learning to Recover Task Experts from a Multi-Task Merged Model
中文标题学习从多任务合并模型中恢复任务专家
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
SamaVaani: Auditing and Debiasing Multilingual Clinical ASR for Indian Languages
中文标题SamaVaani:Auditing 与 Debiasing Multilingual Clinical ASR 面向 Indian Languages
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。