提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-08-18 论文源抓取并去重 328 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1ArguLens:An Open-Source System 面向 Automated Essay Scoring 与 Label-Aware Feedback Generation🔗
- 2aDSL:通过联合代理程序设计进行代理3D创建🔗
- 3Learnware 面向 CSI Feedback:Scene-specific Small Models Can Do Big🔗
- 4Multi-turn Conversational AI 来自 Text to Multimodal Interaction:Data,Models,评测,与 Open Challenges🔗
- 5模型的启示:使用行为量表测量环境泄漏攻击信号🔗
- 6内存树引导的关键帧查询,实现高效的3D问答🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题ArguLens:An Open-Source System 面向 Automated Essay Scoring 与 Label-Aware Feedback Generation
信号显示大多数自动论文评分( AES )系统在没有可解释证据的情况下输出单个整体分数,并依赖于引入数据隐私和成本障碍的封闭API
关键词inferenceevaluationopen-sourceeval
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题aDSL :通过联合代理程序设计进行代理3D创建
信号显示程序化表示为3D内容创建提供了引人注目的范例,实现了精细的编辑、可解释性和显式结构控制
关键词agentworkflowragserving
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题Learnware 面向 CSI Feedback:Scene-specific Small Models Can Do Big
信号显示智能信道状态信息( CSI )反馈对于实现未来6G系统的高容量和频谱效率目标至关重要,但现有的深度学习解决方案面临着模型泛化和场景特定性能之间的权衡
关键词retrievaldeploymentlatencycode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Multi-turn Conversational AI 来自 Text to Multimodal Interaction:Data,Models,评测,与 Open Challenges
信号显示对话式人工智能正在超越孤立的文本提示,转向持续的多模式互动
关键词agentalignmentevaluationbenchmark
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题模型的启示:使用行为量表测量环境泄漏攻击信号
信号显示LLM越来越依赖外部环境,例如预定义的系统提示或检索到的文档,以提高生成质量
关键词deploymentlatencycodetable
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题内存树引导的关键帧查询,实现高效的3D问答
信号显示由于视觉语言模型( VLM )推断的计算和记忆资源有限,在具体场景中准确有效地回答问题面临重大挑战
关键词ragretrievalinferencecode
代码/数据需查看原文确认
其他值得关注
DMT-Dens: Density-preserving manifold visualization for biological data
中文标题DMT-Dens:Density-preserving manifold visualization 面向 biological data
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents
中文标题LEGO-RL:Harness-Native Reinforcement Learning 面向 Coding Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Debate Training Reduces Reward Hacking in RLAIF
中文标题辩论培训减少了RLAIF中的奖励黑客行为
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Benchmarking Automated Security Patch Backporting: How Far Are We?
中文标题对标自动化安全补丁后移:我们还有多远?
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Where a New Concept Must Enter: Entry Point Gates Cross-Task Usability in Unified Multimodal Models
中文标题新概念必须进入的地方:统一多模式模式中的入口点关卡交叉任务可用性
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题利用生成性幻觉和生物物理学建模,实现统一的生物分子序列结构协同设计
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Beyond MSE: Rethinking the Evaluation Metric and Benchmarking for Irregular Time Series Forecasting
中文标题超越MSE :重新思考不规则时间序列预测的评估指标和基准
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
TokEval: A Tokenizer Evaluation Suite
中文标题TokEval:A Tokenizer 评测 Suite
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees
中文标题判断、检索或弃权:具有可证明风险保证的不确定性保护LLM判断
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
PerFact: Perception-Derived Fact Prompting for 3D Brain MRI Report Generation
中文标题PerFact:Perception-Derived Fact Prompting 面向 3D Brain MRI Report Generation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Training with synthetic data for drone detection in thermal imagery
中文标题使用合成数据进行训练,用于热成像中的无人机探测
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification
中文标题TraceSQL:Traceable Answerability Estimation 面向 Reference-Free Text-to-SQL Verification
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题模拟仪表读数的视觉语言模型:专业化、转移和可靠性的实证研究
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题Cross-View Correspondence Is a Measurement Intervention:Two-Sided Validation 面向 Agent 评测 与 Credit Assignment
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
GADR: Gathering Architecture Decision Records from Meeting Transcriptions
中文标题GADR:Gathering Architecture Decision Records 来自 Meeting Transcriptions
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题审计金融代理的自我进化:能力提升、安全漂移和执行接口不匹配
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题MobileWorldSafety:基准ing GUI Agent Safety Against Environmental Injection Attacks in Android Apps
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Denoised Variance-Based Pruning with Optimal Brain Bias Compensation
中文标题基于方差的去噪修剪与最优大脑偏置补偿
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
DEPT: Document Embedding Preservation Tuning for Unified Query Expansion and Retrieval
中文标题部门:文档嵌入式统一查询扩展和检索的保存调整
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
OOD Detection for EEG-based Machine Learning in High-Risk Environments
中文标题OOD Detection 面向 EEG-based Machine Learning in High-Risk Environments
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。