让 Agent 更可靠地调用工具和复用技能
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-08-27 论文源抓取并去重 399 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1Thomson:Continual Learning of Frontier Models 面向 SovereignAI🔗
- 2GRAIN:Bridging Name 与 Narrative Shifts in Real-World Graph Reasoning through Invariance-Rewarded Agentic RL🔗
- 3安全不构成:自主LLM专员的非衰减循环状态🔗
- 4TransMeme:A Multi-Agent 框架 面向 Cross-Cultural Meme Transcreation🔗
- 5DOCTalkBN:孟加拉语远程医疗专家对话的新数据集🔗
- 6PLCBench:自主LLM代理能否将PLC访问转化为持续的物理影响?🔗
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题Thomson:Continual Learning of Frontier Models 面向 SovereignAI
信号显示前沿模型的开发通常被认为是少数资金雄厚的参与者的专属职责,在开发人员和现代人工智能的多样化用户群之间造成了信息、经济和权力的不对称
关键词agentsafetyevaluationfine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题GRAIN:Bridging Name 与 Narrative Shifts in Real-World Graph Reasoning through Invariance-Rewarded Agentic RL
信号显示尽管大语言模型( LLM )在标准化图形任务中具有潜力,但它们在节点标识符和任务制定方面对现实世界的转变仍然很脆弱
关键词agentraglatencybenchmark
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题安全不构成:自主LLM专员的非衰减循环状态
信号显示大语言模型代理越来越多地作为自主循环部署
关键词agentragsafetyevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题TransMeme:A Multi-Agent 框架 面向 Cross-Cultural Meme Transcreation
信号显示互联网模因是多模态在线交流的普遍形式;然而,这种交流往往涉及来自不同语言和文化背景的用户
关键词agentragalignmentevaluation
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题DOCTalkBN :孟加拉语远程医疗专家对话的新数据集
信号显示可靠的医学会话人工智能需要真实的专家-患者互动数据,但这类数据集仍然很少,特别是对于孟加拉语等低资源语言
关键词safetyevaluationbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题PLCBench :自主LLM代理能否将PLC访问转化为持续的物理影响?
信号显示工业控制系统( ICS )依靠可编程逻辑控制器( PLC )将网络计算与物理控制连接起来
关键词agentdeploymentevaluationcode
代码/数据需查看原文确认
其他值得关注
A Contract-Centered Architecture for Scalable and Manageable Agentic Runtimes
中文标题一种Contract-Centered Architecture 面向 可扩展 与 Manageable Agentic Runtimes
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ProRetrieval: Learning to Orchestrate Hybrid Search via Executable Program Synthesis
中文标题ProRetrieval :通过可执行程序合成学习编排混合搜索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models
中文标题MVC-Bench:基准ing Calibration of Medical Vision-Language Models
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing
中文标题RubricRM :通过图像生成和编辑的动态评分细则表进行生成奖励建模
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
When Memory Takes Gradients: Collaborative Vector Memory for Agentic Recommender Systems
中文标题When Memory Takes Gradients:Collaborative Vector Memory 面向 Agentic Recommender Systems
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Evaluating Confidence-Gated Retrieval with Matched Trajectory Replay
中文标题使用匹配轨迹重放评估置信度门控检索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
SAGE: Variate-Wise Semantic Augmentation for Vision-Language Time Series Forecasting
中文标题SAGE:Variate-Wise Semantic Augmentation 面向 Vision-Language Time Series Forecasting
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
LLaVAFlow: Preserving Latent Alignment Flow for Parameter-Efficient Multimodal Fine-Tuning
中文标题LLaVAFlow:Preserving Latent Alignment Flow 面向 Parameter-Efficient Multimodal Fine-Tuning
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Behavior2Trip: Towards Personalized Travel Planning via User Behavior Trajectory
中文标题Behavior2Trip :通过用户行为轨迹实现个性化旅行规划
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
AgentFold: Closed-Loop Agentic Search for Protein Folding Model Design
中文标题AgentFold:Closed-Loop Agentic Search 面向 Protein Folding Model Design
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
G2D: Generative-to-Discriminative Collaborative Inference for Zero-Shot Image Classification
中文标题G2D :零拍摄图像分类的生成式到判别式协作推理
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models
中文标题超越原子布局:使用视觉语言模型理解构图设计
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Towards Expert Financial QA via Self-Improving RAG
中文标题通过自我完善的RAG实现专家级财务QA
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Accelerating Scientific Research with Gemini in the Real-World
中文标题与Gemini一起在现实世界中加速科学研究
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Five Primitives for Governing Autonomous AI Agents at Runtime
中文标题Five Primitives 面向 Governing Autonomous AI Agents at Runtime
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling
中文标题AgentJudgeBench:A Multi-Difficulty 基准 面向 Evaluating LLM Judges on Agentic Tool-Calling
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows
中文标题DuMateBench :在复杂的现实工作流程中评估自主代理
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation
中文标题Multi2AV-Safety:基准ing Safety in Multimodal-to-Audio-Video Generation
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题FAN-LoRA:A Fourier-Adaptive Nonlinear Low-Rank Adaptor 面向 Medical Foundation Model Domain Adaptation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Multi-Expert Conformal Risk Control for Pairwise LLM Judging in Open-Ended Dialogue
中文标题开放式对话中成对LLM评判的多专家适形风险控制
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。