让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-08-21 论文源抓取并去重 304 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题软件工程和软件安全交叉领域的大型语言模型:以证据为中心的结构化调查和研究议程
信号显示大语言模型( LLM )正在从代码完成转向存储库规模的代理,这些代理可检索上下文、编辑文件、执行工具并参与安全敏感的工作流
关键词agentworkflowevaluationbenchmark
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题跨LLM开发代理的规范可移植性:规范驱动软件迁移中的跨代理兼容性
信号显示本文研究了使用Oracle到PostgreSQL迁移作为受控软件转换任务的跨代理规范可移植性
关键词agentworkflowretrievalcompression
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题ReFrame :多模式大型语言模型中的循证引导测试时间安全对齐
信号显示虽然多模态大语言模型( MLLM )将模型功能扩展到文本之外,但它们也使安全对齐变得越来越具有挑战性
关键词agentservingalignmentsafety
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题当适应受到伤害时:在MedSAM微调中将表征漂移连接到OOD失败
信号显示医学图像分割的基础模型,如基于提示的MedSAM ,可以很好地泛化各个领域和模式,通常在零或少量设置中进行
关键词servingalignmentbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Trustworthy RAG:An 评测 Agent 面向 Detecting Misinformation 与 Knowledge Poisoning in Generative AI Systems
信号显示检索-增强生成( RAG )将大语言模型( LLM )输出作为外部知识的基础,但RAG系统通常会信任他们检索到的任何内容,从而造成安全可靠性差距:高语义相关性并不能保证事实真相
关键词agentragretrievalinference
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题PromptResponse:Optimizing Prompts 面向 LLM Coding Tasks
信号显示大语言模型( LLM )越来越多地用于研究工作流程和软件开发管道,但其输出对输入提示的变化仍然敏感
关键词workflowalignmentevaluationcode
代码/数据需查看原文确认
其他值得关注
AudioWorldSim: Realistic Binaural Audio Datasets For World Models
中文标题AudioWorldSim:Realistic Binaural Audio Datasets 面向 世界模型
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
RDANet: Relative Degradation Aware Network for Infrared Small Target Detection
中文标题RDANet:Relative Degradation Aware Network 面向 Infrared Small Target Detection
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题通过分步结果推理和聚合对移动座席进行自动轨迹评估
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
CoST: Semantic-Aware Urban Understanding via Spatial-Temporal Alignment
中文标题CoST :通过时空对齐的语义感知城市理解
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Trojaning the Alignment: Stealthy Backdoor Attacks against Graph Foundation Models
中文标题特洛伊木马对齐:针对Graph Foundation模型的隐形后门攻击
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Breaking High Confidence: Practical Face Impersonation under High-Security Thresholds
中文标题打破高置信度:高安全阈值下的实际面部模拟
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
BC-Bench: Evaluating Agentic Engineering in a Domain-Specific Language for ERP
中文标题BC-Bench:Evaluating Agentic Engineering in a Domain-Specific Language 面向 ERP
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Routing Before Looking: Query-Adaptive Evidence Acquisition for Long-form Video Understanding
中文标题查询前路由:长视频理解的查询自适应证据采集
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer
中文标题Generating Multi-view Adversarial Examples 面向 Visual Geometry Grounded Transformer
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题AsmEvo :通过功能等效验证对AMD GPU内核进行代理装配级优化
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
TopoSurfel: Closing the Loop between Gaussian Surfels and Meshes for Surface Reconstruction
中文标题TopoSurfel :关闭高斯表面和网格之间的循环以进行表面重建
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
DreamBench-SWE: A Multi-Session Memory-Hygiene Benchmark for Software Agents
中文标题DreamBench-SWE:A Multi-Session Memory-Hygiene 基准 面向 Software Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
RiskTraf: Risk-Extrapolated Residual Learning for Multi-Variate Traffic Flow Prediction
中文标题RiskTraf:Risk-Extrapolated Residual Learning 面向 Multi-Variate Traffic Flow Prediction
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题乳汁中红外光谱的元聚类识别与早期哺乳期负能量平衡相关的奶牛群
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Rethinking Expressivity and Efficiency in Test-Time Training
中文标题重新思考测试时间培训中的表现力和效率
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
VT-MUSE: Multimodal Unified Sequential Visuotactile Representation Learning for Manipulation
中文标题VT-MUSE:Multimodal Unified Sequential Visuotactile Representation Learning 面向 Manipulation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment
中文标题CLEAR:Continuous Latent Adapter Routing 面向 Utility-Preserving LLM Safety Alignment
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题EnSI-RAG:Entity-Structure-Indexed Retrieval-Augmented Generation 面向 Long-Document Question Answering
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Benchmarking Patent Drafting from Inventor-Style Disclosures
中文标题根据发明人样式披露对专利起草进行基准测试
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Personalized Privacy Control in LLMs via Attention Head Intervention
中文标题通过Attention Head干预实现LLM中的个性化隐私控制
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。