提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-08-12 论文源抓取并去重 328 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题HCGRec :带语义ID的提示条件生成推荐
信号显示语义ID生成推荐器将每个项目表示为离散语义令牌的短序列,并通过自动回归生成此令牌序列来预测下一个项目
关键词alignmentbenchmarkcodefine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题认证什么有助于客户返回时机:对调节信号的筛选和确认测试,以及为什么衰减几乎足够
信号显示从业人员通过更多信号(终身价值、类别、近期/频率、日历、地理位置)丰富客户回报模型,时间点过程( TPP )文献紧随其后,具有协变和外部协变条件强度
关键词evaluationbenchmarkmemoryeval
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Diagram-MMU:A Multi-Modal 基准 面向 Scientific Diagrams
信号显示多模态大语言模型( MLLM )一直在提高科学写作和协作的能力
关键词agentevaluationbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题将代理安全重新思考为网络问题
信号显示人工智能代理正在迅速变得更加强大和广泛部署,有望大幅提高生产力并实现新的应用类别
关键词agentservingsafetyagents
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题Localizing to Debias:A Patch-Level 基准 与 Baseline 面向 Weakly Supervised Spatial Anomaly Detection
信号显示尽管对弱监督视频异常检测( WSVAD )的兴趣日益浓厚,但目前的方法难以弥合粗时间监督和细粒度空间推理之间的差距
关键词servingevaluationbenchmarkvision-language
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题Confucius4-TTS :具有可学习扬声器编码器的免转录跨语言零拍摄TTS
信号显示零拍文本转语音( TTS )的最新进展大大提高了语音质量和语音克隆保真度
关键词raginferenceevaluationbenchmark
代码/数据需查看原文确认
其他值得关注
LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time
中文标题LiveAnimate :稳定的长格式人体动画实时流式传输
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题使用检索增强大型语言模型将动态主逻辑模型构建为复杂系统诊断的知识图
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies
中文标题VAKRA:Evaluating Multi-Hop Reasoning Across APIs 与 Retrieval Under Tool-Use Policies
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Curvature-Aware Zeroth-Order Optimization for Memory-Efficient Test-Time Adaptation
中文标题用于内存高效测试时间自适应的曲率感知零阶优化
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题传统HPC现代化的代理工作流程:转换GAMESS的双电子积分核心
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
VICBench: A Multi-Language Benchmark for Code Vulnerability Detection
中文标题VICBench:A Multi-Language 基准 面向 Code Vulnerability Detection
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ScaleVid: Geometry-Aware Video Object Scaling with Mesh-Free Inference
中文标题ScaleVid :无网格推理的几何感知视频对象缩放
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
ScreenShot: A Foundation Model for Few-Shot Combination Drug Screening
中文标题屏幕截图:少量联合用药筛查的基础模型
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge
中文标题信息丰度悖论:长上下文培训会破坏参数知识
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation
中文标题NetlistBench:Evaluating LLM Reliability in SPICE Netlist Recognition 与 Manipulation
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题Map-Det3D:Metric Feed-Forward 3D Reconstruction Prior 面向 Multi-view 3D Object Detection 来自 Streaming Inputs
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题DPO中的情境盲:通过情境校准偏好优化减轻传销中的对象幻觉
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation
中文标题Who Thinks Best Depends on How Long You Let Them:Budget-Dependent Rankings in LLM 评测
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Confidence Calibration of Deep Learning Systems
中文标题深度学习系统的可信度校准
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Look What the Probes Dragged In! Real-World Chest X-ray Shortcuts in MedCLIP
中文标题看看探头拖进了什么! MedCLIP中的真实世界胸部X光快捷方式
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题忠实、充分、可理解:通过离散扩散反演重新思考图形反事实解释
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations
中文标题偏好树优化:通过前瞻性模拟增强以目标为导向的对话
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题不要忘记显而易见的- RISC :安全自动驾驶的风险知情Slice-CoveRAGe协议
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence
中文标题Mechanist:AI as a Scientific Instrument 面向 Discovering the Mechanisms of Intelligence
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题从安全文档到安全知识支持:基于证据的医疗器械LLM框架
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。