提升代码生成、执行反馈和自动修复能力、提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升代码生成、执行反馈和自动修复能力、提升 RAG 检索和知识库问答可靠性、提升 RAG 检索和知识库问答可靠性。
本期从 2026-09-10 论文源抓取并去重 100 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、提升 RAG 检索和知识库问答可靠性、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题从协议到证据:为公共利益服务的人工智能的有限主张
信号显示人工智能不仅会造成治理问题
关键词deploymentsafetyevaluationeval
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题SIRF:A Spec-Internalized Risk Foundation Model 面向 Industrial Content Risk Control
信号显示对于工业内容风险控制,真正的部署约束不是平均精度,而是在高精度和二级延迟下可以自动处理多少风险
关键词ragdeploymentlatencytraining
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题构建py-kvcache : NVMe SSD用于vLLM的外部KV缓存的性能表征
信号显示前缀缓存可以通过重用先前计算的键值( KV )状态来减少长上下文LLM请求的第一个令牌( TTFT )时间,但对于短前缀或快速GPU ,重新计算可以比从外部缓存加载更快
关键词ragbenchmarkmemorysearch
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题自主性、社会规范和一致性:走向自主人工智能的发展框架
信号显示近年来,由于能够泛化的大规模模型和复杂输出的生成,人工智能取得了非凡的进步
关键词agentragalignmentagents
代码/数据需查看原文确认
降低推理成本并提升部署效率
中文标题SpecGuard:Inference-Time Backdoor Detection 面向 Free
信号显示大语言模型通常是从第三方微调、共享或下载的,因此部署的模型可能携带一个隐藏的后门,该后门通常在良性输入上运行,但在出现秘密触发器时切换到攻击者控制的行为
关键词inferenceservingdeploymentlatency
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题多目标反应优化的动态语言模型表示
信号显示优化收率、选择性和安全性等多个目标的化学反应是化学合成的核心,而模型驱动的方法在很大程度上取决于反应组分的表示方式
关键词safetycodecodingCode Intelligence
代码/数据需查看原文确认
其他值得关注
SenseNova-U1.5: Towards Native Unified Visual Intelligence
中文标题SenseNova-U1.5 :迈向本地统一视觉智能
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Artificial Id: Drive and Persistent Alignment in Agentic AI
中文标题Artificial Id:Drive 与 Persistent Alignment in Agentic AI
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
MindTopo: Can Foundation Models Reason in Topological Space?
中文标题MindTopo :基础模型可以在拓扑空间中进行推理吗?
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
AdamX: Cosine similarity meets gradient descent
中文标题AdamX :余弦相似性与梯度下降
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
RetroThinker: Enabling Retrospective Thinking in Speech LLMs
中文标题RetroThinker :在言语法学硕士中实现回顾性思维
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Explainability Assistant: A Conversational XAI Interface for Interpreting Energy Consumption Models
中文标题Explainability Assistant:A Conversational XAI Interface 面向 Interpreting Energy Consumption Models
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Model-Aware Schedules Improve Generation via Fiberwise Optimal Transport
中文标题模型感知调度通过光纤优化传输改进生成
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MotionQ: Operator-Conditioned Motion Quotients for Cross-Observation WiFi Gesture Recognition
中文标题MotionQ:Operator-Conditioned Motion Quotients 面向 Cross-Observation WiFi Gesture Recognition
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Generative Late-Interaction Embeddings For Visual Document Retrieval
中文标题用于可视化文档检索的生成式后期交互嵌入
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Predicting Privacy Leakage from Weight Spectral Density
中文标题根据权重谱密度预测隐私泄露
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Component-Aware Differential Privacy for Federated Multilingual Speech-LLMs
中文标题联合多语言语音LLM的组件感知差分隐私
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Continuous-Time Acoustic Modelling with Neural Controlled Differential Equations
中文标题神经控制微分方程连续时间声学建模
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
The Eloquence submission for Task 2 of the Interspeech 2026 MLC-SLM challenge
中文标题Interspeech 2026 MLC-SLM挑战任务2的口才提交
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Negative Self-Distillation: Learning to Reason by Avoiding Flaws
中文标题消极的自我蒸馏:通过避免缺陷来学习推理
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization
中文标题COBRA-Skills:Contextual Bandit-Guided Evolution 面向 Agent Skill Optimization
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Your Retriever Already Knows: Distribution-Shape QPP for RAG Retrieval Sufficiency
中文标题Your Retriever Already Knows:Distribution-Shape QPP 面向 RAG Retrieval Sufficiency
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MAPLE: Memory-Augmented Planning with Language and Evolution
中文标题MAPLE :使用语言和进化进行记忆增强计划
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Can Edge-Deployable Vision-Language Models Identify Species?
中文标题边缘可部署视觉语言模型可以识别物种吗?
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
TART: A Modular Tool for Technique-Aware Audio-to-Tablature Guitar Transcription
中文标题TART:A Modular Tool 面向 Technique-Aware Audio-to-Tablature Guitar Transcription
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题一次性字幕,按需帧:视觉需求路由,以实现预算感知代理长视频理解
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。