让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。
本期从 2026-09-28 论文源抓取并去重 999 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题结构化知识何时有助于神经定理证明?
信号显示结构化数学知识是否有助于LLM在精益4中证明定理?
关键词agentretrievalcodefine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题eval-unlearn:基准ing unlearning in Text-to-Image Diffusion Models
信号显示文本到图像( T2I )扩散模型的概念去学习技术不断增加,产生了分散的评估格局
关键词raginferenceevaluationbenchmark
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题印记阅读器:从体重更新读数到行为干预
信号显示随着语言模型在人工智能发展中的作用越来越大,他们的自然愿望是像人类一样反思自己的学习过程,并利用这种反思来提高自己
关键词ragsafetycodereasoning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题通过运行时程序状态推理改进代码的大型语言模型
信号显示大语言模型在有关运行时程序状态的推理方面接受有限的显式培训
关键词agentcodefine-tuningpost-training
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题去除多机器人轨迹的噪声
信号显示多机器人轨迹规划是多机器人协调中的一个基本问题,但由于其非凸性、多模态性和高维性,在计算上仍然具有挑战性
关键词ragdeploymentevaluationcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题重新思考视频大型语言模型的视觉令牌压缩:简单而强大的基线
信号显示视频大语言模型( Video LLMs )在视频理解方面取得了显着进展,但其推理效率受到长视频产生的大量视觉令牌的限制
关键词raginferenceservingcompression
代码/数据需查看原文确认
其他值得关注
d-OPD: Future-Aware On-Policy Distillation for Block Diffusion Language Models
中文标题d-OPD:Future-Aware On-Policy Distillation 面向 Block Diffusion Language Models
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
SCBO: Semantically Coherent Batching and Ordering for LLM-Based Social Surveys
中文标题SCBO:Semantically Coherent Batching 与 Ordering 面向 基于 LLM 的 Social Surveys
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
VEX-Bench: Benchmarking Verification Complexity of LLM-Generated Misinformation
中文标题VEX-Bench:基准ing Verification Complexity of LLM-Generated Misinformation
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题TermJudge:A Document-Level Metric Judging,Not Counting,Terminology in Machine Translation 评测
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
ActionUNet: Improving Robustness of VLA Models with Efficient Multi-scale Fine-tuning
中文标题ACTionUNet :通过高效的多尺度微调提高VLA模型的鲁棒性
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题看到它,说出来,分类: LLM中紧急错位的机械诊断和参数空间缓解
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
SEAD: A State-Based Perspective on Attack and Defense in Tool-Using Agents
中文标题SEAD:A State-Based Perspective on Attack 与 Defense in Tool-使用 Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
HPMD: A Historical Persian Manuscript Dataset for Word Spotting with Line-Level Annotation
中文标题HPMD :具有行级注释的单词识别历史波斯手稿数据集
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
ABC-Align: Prediction-Powered Alignment with Adaptive Bias Control
中文标题ABC-Align :采用自适应偏置控制的预测动力对齐
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Predictive Semantic Safety: From Visual Physical Reasoning to Safety-Critical Control
中文标题预测语义安全:从视觉物理推理到安全关键控制
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题学习引导,引导观看:通过可训练向量揭示大型语言模型中RLVR的几何形状
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
AdaGuard: An Adaptive Guard Model with User-defined Policies
中文标题AdaGuard :具有用户定义策略的自适应防护模型
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Behavior-Grounded Semantic Enrichment for Financial Fraud Modeling and Reasoning
中文标题基于行为的金融欺诈建模和推理语义丰富
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Functional Autoencoders for Amplitude-Phase Representation Learning
中文标题用于振幅相位表示学习的功能性自动编码器
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
What Does a Stream Model Buy You in Flow Matching?
中文标题流模型在流匹配中会为您带来什么?
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
AD-E2E-JEPA: A Joint-Embedding Predictive Architecture For End-to-End Autonomous Driving
中文标题AD-E2E-JEPA:A Joint-Embedding Predictive Architecture 面向 End-to-End Autonomous Driving
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
FlowTool: Controlling Tool Parameter in Image Retouching via Flow Matching
中文标题FlowTool :通过流匹配控制图像修饰中的工具参数
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
GPUPhysBench: Benchmarking Coding Agents for Correct and Efficient GPU Physics Simulation
中文标题GPUPhysBench:基准ing Coding Agents 面向 Correct 与 Efficient GPU Physics Simulation
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Source-preserving alignment for robust evidence localization in scientific PDFS
中文标题源代码保持一致,以便在科学PDF中进行强有力的证据本地化
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
EdgeVLN: Runtime-Aware Deployment Ready Quantized Vision Language Navigation Model
中文标题EdgeVLN :运行时感知部署就绪量化视觉语言导航模型
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。