让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力。
本期从 2026-09-25 论文源抓取并去重 444 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1WeaveAgent:A Two-Stage Tool-Routing Agent 面向 Ultra-High-Resolution Remote Sensing Imagery🔗
- 2MoMHa:Multi-Objective Optimization of LLM Harnesses over Accuracy,Safety,与 Tokens🔗
- 3区域级黑匣子防御隐形嵌入-夹子中的空间后门🔗
- 4Muslim:A Deployed Arabic Voice AI 平台 面向 Grounded Islamic Knowledge🔗
- 5递归自我改进AI的进化安全性:分类、风险发现和评估🔗
- 6G $ ^ 2 $ PTQ:通过广义梯度补偿改进LLM训练后量化🔗
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题WeaveAgent:A Two-Stage Tool-Routing Agent 面向 Ultra-High-Resolution Remote Sensing Imagery
信号显示问题
关键词agentcompressionalignmentevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题MoMHa:Multi-Objective Optimization of LLM Harnesses over Accuracy,Safety,与 Tokens
信号显示大多数改进大语言模型的工作都将准确性视为唯一目标
关键词agentsafetyevaluationbenchmark
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题区域级黑匣子防御隐形嵌入-夹子中的空间后门
信号显示对比语言--由于其强大的可转移性和零拍摄能力,图像预训练( CLIP )已成为主要的视觉支柱
关键词servingdeploymentalignmentcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Muslim:A Deployed Arabic Voice AI 平台 面向 Grounded Islamic Knowledge
信号显示我们介绍穆斯林,这是一个生产阿拉伯语音AI平台,为真实用户提供基础的、来源的伊斯兰知识
关键词agentretrievalservinglatency
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题递归自我改进AI的进化安全性:分类、风险发现和评估
信号显示人工智能正在迅速发展,越来越强大的系统在推理、决策、科学发现和自主开发中发挥着更大的作用
关键词agentsafetyevaluationrisk
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题G $ ^ 2 $ PTQ :通过广义梯度补偿改进LLM训练后量化
信号显示训练后量化( PTQ )是一种实用的方法,可以减少大语言模型( LLM )的内存和计算占用,而无需重新训练
关键词alignmentcodepost-trainingmemory
代码/数据需查看原文确认
其他值得关注
AgentXploit: Autonomous Repository-to-Runtime Red-Teaming for AI Agents
中文标题AgentXploit:Autonomous Repository-to-Runtime Red-Teaming 面向 AI Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ALF: An Active Learning Framework for Scientific Discovery
中文标题ALF:An Active Learning 框架 面向 Scientific Discovery
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
TRACKGRAPH: Online Open-Vocabulary 3D Scene Graphs via Image-Space Tracking
中文标题TRACKGRAPH :通过图像空间跟踪的在线开放词汇表3D场景图
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
CCRV-Bench: Constraint-Based Evaluation of Causal Reasoning in Vision-Language Models
中文标题CCRV-Bench:Constraint-Based 评测 of Causal Reasoning in Vision-Language Models
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Financial Fragility in Societies of LLM Agents: Coordination Failures and Stabilizing Mechanisms
中文标题Financial Fragility in Societies of LLM Agents:Coordination Failures 与 Stabilizing Mechanisms
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Learning Chance-Constrained MDPs with Bellman Distributional Certificates
中文标题具有BeLLMan分配证书的学习机会受限的MDP
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Learning Provable Neural Network Observer for Uncertain Dynamical Systems
中文标题不确定动态系统学习可证明神经网络观测器
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Evaluation Is All You Need for Multi-Modal Autonomous Driving
中文标题评估是多模式自动驾驶所需的一切
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Understanding the Role of Prompt Template in Knowledge Distillation for Safety Alignment
中文标题了解提示模板在知识蒸馏中的作用,以实现安全对齐
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题跳过演讲,重新关注愿景:多模态大型语言模型中推理分割的潜在推理
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Werracle:Sub-Cent Intra-Block AI Reflex Oracles 与 Flash-Loan Circuit Breakers 面向 EVM Smart Contracts
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
CRC-Router: Risk-Constrained Routing for Medical Agentic AI Systems
中文标题CRC-Router:Risk-Constrained Routing 面向 Medical Agentic AI Systems
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
How Far Can INRs Go? Cross-Domain Parameter-efficient INR-Based Semantic Segmentation for Brain MRI
中文标题How Far Can INRs Go? Cross-Domain Parameter-efficient INR-Based Semantic Segmentation 面向 Brain MRI
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Stale-Document Poisoning: When Outdated Retrieval Overrides Correct Model Answers
中文标题过时文档中毒:当过时的检索覆盖正确的模型答案时
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
When the Model Retires: An Empirical Study of LLM Migration in Open-Source Applications
中文标题当模型退出时:开源应用程序中LLM迁移的实证研究
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
MetaPermit: Scalable and Auditable Access Control for AI Agents via LLM-Inferred Meta-Attributes
中文标题MetaPermit:可扩展 与 Auditable Access Control 面向 AI Agents via LLM-Inferred Meta-Attributes
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
FLIP: Final Layer Inference-Time Probing for Vision-Language Models
中文标题FLIP:Final Layer Inference-Time Probing 面向 Vision-Language Models
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Evidence-Grounded Auditing of Identification Assumptions in Climate-Policy Causal Evaluations
中文标题气候政策因果评估中识别假设的循证审计
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
The KV Cache Is the New Memory Wall
中文标题KV缓存是新的记忆墙
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
A Benchmark and Diagnostic Study of Epistemic Admission in Shared Agent Memory
中文标题一种基准 与 Diagnostic Study of Epistemic Admission in Shared Agent Memory
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。