提升代码生成、执行反馈和自动修复能力、提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升代码生成、执行反馈和自动修复能力、提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-09-13 论文源抓取并去重 200 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1人工智能说服是对人类控制的威胁🔗
- 2TriCalRAG:A Three-Strategy,Retrieval-Augmented 基准 面向 On-Premise 基于 LLM 的 Root Cause Analysis in AIOps🔗
- 3Beyond Scene Description:Multi-Agent Orchestration 面向 Non-visual Access to Virtual Worlds🔗
- 4用最小描述长度诊断多通道时间序列分类中的时间错位🔗
- 5SENTINEL:用于检测Windows命令行上的远程APT攻击的多途径架构🔗
- 6EdgeHAR:An Edge-Native Compact Sensor Foundation Model 面向 Human Activity Recognition🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题人工智能说服是对人类控制的威胁
信号显示人工智能说服对人类控制构成的威胁在文献中已经得到承认,但尚未得到系统的研究
关键词safetyevaluationcodeopen-source
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题TriCalRAG:A Three-Strategy,Retrieval-Augmented 基准 面向 On-Premise 基于 LLM 的 Root Cause Analysis in AIOps
信号显示云托管的大语言模型(LLM)越来越多地用于AIOps管道中的根本原因分析(RCA) ,但它们引入了数据隐私风险、网络延迟和每次查询成本,这些成本随生产日志卷而扩展很差
关键词ragretrievaldeploymentlatency
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Beyond Scene Description:Multi-Agent Orchestration 面向 Non-visual Access to Virtual Worlds
信号显示虚拟世界现在拥有教室、会议、大会、商店和社交场所,它们所展示的几乎所有互动都假设用户可以扫描三维场景、关注虚拟形象和阅读浮动面板
关键词agentsafetyevaluationmemory
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题用最小描述长度诊断多通道时间序列分类中的时间错位
信号显示多通道时间序列分类通常假设传感器流同步,尽管延迟、时钟漂移和预处理可能会在数据收集期间或部署后引入相对延迟
关键词deploymentlatencyalignmentevaluation
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题SENTINEL :用于检测Windows命令行上的远程APT攻击的多途径架构
信号显示远离陆地( LOTL )是高级持续威胁( APT )参与者的主要规避技术,利用合法的Windows实用程序进行恶意操作,而无需部署自定义恶意软件,并使国家赞助的活动能够维护
关键词benchmarkcodecodingCode Intelligence
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题EdgeHAR:An Edge-Native Compact Sensor Foundation Model 面向 Human Activity Recognition
信号显示基于传感器的人类活动识别( HAR )是无处不在的可穿戴计算的基础,但现有的基础模型主要是为云规模的部署而设计的,并与现实世界的传感转变作斗争,包括看不见的用户、设备、SAMP
关键词deploymentlatencycodememory
代码/数据需查看原文确认
其他值得关注
中文标题Mind Which Bird You Favour:Parameterizing Adequacy-Fluency Balance in Meta-评测 of Machine Translation
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题ESAFusion :通过局部几何互补和多尺度自适应交互的LiDAR--4-D雷达融合,用于三维物体检测
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题MCIQA-2K:A Multi-Dimensional Dataset 与 No-Reference Quality 评估 基准 面向 Colorized Images
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题一种Hybrid Dependency-Aware 框架 面向 Task Decomposition 与 Dynamic Agent Generation in Oracle-to-PostgreSQL Migration
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
LLMs as Oracles: Reliance on LLMs for Subjective Personal Questions
中文标题LLM作为预言机:依靠LLM解决个人主观问题
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题效率幻觉:基于LLM的代码优化中的行为校准的形式化和测量
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Enemray: Toward Capable Language Models for Hassaniya
中文标题Enemray:面向 Capable Language Models 面向 Hassaniya
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题路由,不修复:依赖于方案的解码校正和轨迹门控路由器,用于可靠的临床LLM答案选择
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ANASSA: An Agentic AI Orchestration Framework for Spatial Intelligence
中文标题ANASSA:An Agentic AI Orchestration 框架 面向 Spatial Intelligence
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Another Blueprint In The Wall: How to Ask Frontier AI Like a Kid?
中文标题墙上的另一个蓝图:如何像孩子一样问前沿人工智能?
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题PC $ ^ 2 $ -AD :点云上采样,使用分辨率受限的边缘设备保护3D异常检测
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
CompCQR: Compositional Query Generation for Training-Free Conversational Search
中文标题CompCQR:Compositional Query Generation 面向 Training-Free Conversational Search
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Open-UniMo: Towards Unified Motion-Language Understanding and Generation in the Open World
中文标题Open-UniMo :走向开放世界中的统一运动语言理解和生成
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题AI Deployment Accountability Engineering:A Vision 面向 Accountable AI in Safety-Critical Socio-Technical Systems
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Beyond Benchmark Scores: How Synthetic and Authentic Query Distributions Diverge in RAG Evaluation
中文标题超越基准分数:合成查询分布和真实查询分布在RAG评估中的差异
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Learning Multi-Agent Task Assignment and Navigation in the Factory: from Simulation to Real Robots
中文标题在工厂中学习多Agent任务分配和导航:从模拟到真实机器人
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Neyshekar: An Open Persian Read-Speech Corpus for Automatic Speech Recognition
中文标题Neyshekar:An Open Persian Read-Speech Corpus 面向 Automatic Speech Recognition
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Selective Tool Use for Agentic Change Visual Question Answering in Remote Sensing
中文标题遥感中代理变革视觉问答的选择性工具使用
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Safety Signals to Verify NetOps Agents with Action-Level Granularity
中文标题通过操作级粒度验证NetOps代理的安全信号
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题一种Generative AI Integrated Multimodal 框架 面向 Low-Latency Multi-Camera Person Re-Identification
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。