让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力、提升模型推理、规划和验证能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力、增强多模态模型理解图表和文档的能力。
本期从 2026-09-03 论文源抓取并去重 405 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力、增强多模态模型理解图表和文档的能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题Value-Preserving Architectures 面向 Agentic AI Systems
信号显示代理AI和基于LLM的多代理系统( MAS )的出现为复杂任务的自动化提供了前所未有的机会,同时也引发了对保护以人为本的基本价值观的重大担忧,例如隐私,
关键词agentservingalignmentsafety
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题SVG-Score:Human-Aligned 评测 of Text-to-SVG Generation
信号显示随着生成模型的表达性和可控性提高,可缩放矢量图形( SVG )生成越来越受到关注
关键词alignmentevaluationbenchmarkvision-language
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题城市边界、社会障碍:绘制封闭社区和股权影响的基准和以愿景为中心的框架
信号显示社区是塑造城市形态和社会生活的基本空间单元
关键词evaluationbenchmarkcodemultimodal
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题ENEAS:Embedding-guided Neural Ensemble 面向 Adaptive Segmentation
信号显示我们介绍ENEAS ,一种用于跟踪和语义发现的统一、文本可提示的方法
关键词raglatencycodememory
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题LLM可以从源代码提交中提取架构设计决策吗? -初步探索性研究
信号显示背景:架构设计决策( ADD )捕捉了软件系统的结构和演变背后的原理,但很少明确记录,并且通常隐藏在源代码提交中
关键词alignmentcodeopen-sourcesoftware
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题视频生成器是否跨细分市场跟踪世界?视频延续中世界状态推理的基准和方法
信号显示视频生成器通过逐个生成片段或通过自动回归扩展块,通过合成较短的部分来构建长视频
关键词agentbenchmarkcodememory
代码/数据需查看原文确认
其他值得关注
SimSkill: A Lifelong Learning AI Agent for Autonomous Mastery of Traffic Simulation
中文标题SimSkill:A Lifelong Learning AI Agent 面向 Autonomous Mastery of Traffic Simulation
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Proactive Service Agents: A Unified Decision Framework, Methods, and Evaluation
中文标题主动式服务代理:统一的决策框架、方法和评估
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题从先前引导的启发式方法到可部署代理:加速演示驱动的强化学习以实现截止日期受限的网络控制
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
The Attention Triangle in Audio-Video Models
中文标题音视频模型中的注意力三角形
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
GPS-Bench: A Governance Policy Benchmark for Automating Policy Analysis
中文标题GPS-Bench:A Governance Policy 基准 面向 Automating Policy Analysis
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题SafeRI:Recognition 与 Intervention 面向 Token-Level Safety Intervention in Large Vision Language Models
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
EPIC: Explicit Posterior Item Conditioning for Semantic ID Diffusion Recommendation
中文标题EPIC:Explicit Posterior Item Conditioning 面向 Semantic ID Diffusion Recommendation
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题基于传输的剩余优化专家协作,实现模式感知红外可见物体检测
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
An Adversarial Zero-Shot Learning Approach for Anomaly Detection in Multivariate IoT Traffic Data
中文标题一种用于多变量物联网流量数据异常检测的对抗性零拍摄学习方法
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
ExplainRoute: A Pre-Deployment Audit Framework for Non-Answer-Giving Programming Tutors
中文标题ExplainRoute:A Pre-Deployment Audit 框架 面向 Non-Answer-Giving Programming Tutors
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Mind the Gap: Robustness Risks in PII Detection Systems
中文标题注意差距: PII检测系统中的稳健性风险
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
FlowTT: Exploiting Computation Flow Reuse in Irregular Tensor-Train Embedding
中文标题FlowTT :利用不规则张量序列嵌入中的计算流重用
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题解耦分析-评判:在复杂的多步骤创造力任务中使用LLM的自动化创造力评估器
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents
中文标题DuplexSpeechBench-IFEval :评估全双工语音座席中遵循的隐式指令
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题StrixAE:An Intelligent Agent 面向 Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
RecurTrace: Adaptive Latent Reasoning with Loop-Time Memory
中文标题RecurTrace :具有循环时间内存的自适应潜在推理
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Fresh Memory, Stale Plans: Dependency-Scoped Validation for Distributed LLM-Agent Memory
中文标题Fresh Memory,Stale Plans:Dependency-Scoped Validation 面向 Distributed LLM-Agent Memory
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
PACE: Towards Surfacing Hidden Conflicts in User Requests
中文标题PACE :处理用户请求中隐藏的冲突
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
An Ensemble-Based Self-Taught Learning Approach for Parking Space Classification Under Limited Data
中文标题基于集成的自学学习方法在有限数据下的停车位分类
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Speculative Macro Commit for Faster Tool-Using Agents
中文标题更快使用工具的代理人的投机宏观承诺
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。