让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力、提升 RAG 检索和知识库问答可靠性
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。
本期从 2026-09-04 论文源抓取并去重 352 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1Qlippy:A Retrieval-Augmented GenAI Assistant 面向 Reproducible Quantum Workflows 与 Experiment Tracking🔗
- 2BioASQ 14B的BIT.UA:使用pg_textsearch和Qdrant进行模块化检索,以及基于Agent的应答生成🔗
- 3基于树的RAG框架,通过自适应规划和拓扑感知证据收集实现证据密集型QA🔗
- 4SAM-D2Q:使多式联运Doc2Query与电子商务的搜索需求和转换保持一致🔗
- 5MCPO:Modality-Contrastive Preference Optimization 面向 Multimodal Chain-of-Thought Compression🔗
- 6One Diffusion Model,Two Roles:Guided Trajectory Planning 与 Safety-Critical Scenario Generation in 闭环仿真🔗
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题Qlippy:A Retrieval-Augmented GenAI Assistant 面向 Reproducible Quantum Workflows 与 Experiment Tracking
信号显示量子软件开发是迭代的,容易出错
关键词workflowretrievalservingdeployment
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题BioASQ 14B的BIT.UA :使用pg_textsearch和Qdrant进行模块化检索,以及基于Agent的应答生成
信号显示本文描述了来自阿威罗大学的BIT.UA团队参与第14届BioASQ任务B生物医学问答挑战
关键词agentragretrievalcode
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题基于树的RAG框架,通过自适应规划和拓扑感知证据收集实现证据密集型QA
信号显示最近的结构化RAG方法利用基于树或图的推理结构来改进多跳QA
关键词ragretrievalbenchmarkcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题SAM-D2Q :使多式联运Doc2Query与电子商务的搜索需求和转换保持一致
信号显示由于短标题无法完全覆盖多样化的用户表达或视觉产品属性,电子商务搜索通常会遇到用户查询与商家撰写的产品标题词汇不匹配的问题
关键词ragretrievalalignmentmultimodal
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题MCPO:Modality-Contrastive Preference Optimization 面向 Multimodal Chain-of-Thought Compression
信号显示最近,多模态大规模推理模型在通过长思维链( M-CoT )解决复杂任务方面表现出了非凡的能力
关键词inferenceservingcompressionalignment
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题One Diffusion Model,Two Roles:Guided Trajectory Planning 与 Safety-Critical Scenario Generation in 闭环仿真
信号显示扩散概率模型可以捕捉驾驶场景中联合未来轨迹的多模态、交互丰富的分布
关键词agentraginferenceserving
代码/数据需查看原文确认
其他值得关注
中文标题股票和加密市场中的人工智能:进展、盈利能力证据和自动化投资的局限性
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Adaptation Interfaces for In-Context Tabular Foundation Models in Time-to-Event Prediction
中文标题事件时间预测中上下文表格基础模型的适应接口
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Refactor平台:An Open-Source Harness 面向 Controlled 评测 of Repository-Scale Refactoring Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
AutoLR: Automating the Path from Research to Launch Review in Industrial Recommender Systems
中文标题AutoLR :工业推荐系统从研究到发布审核的自动化路径
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
From Interaction Traces to Persistent Skills: Online Evolution for Computer-Use Agents
中文标题从交互跟踪到持久技能:计算机使用代理的在线演进
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation
中文标题PRISM-Bench:An Audio-Centric Diagnostic 基准 面向 Text-to-Audio-Video Generation
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题MM-IFEval-Pro:A Multilingual 与 Attack-Resistant 基准 面向 Instruction-Following in Vision-Language Models
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
CoLMIN: LLM-based Multi-Decision Path Negotiation for Cooperative Autonomous Driving
中文标题CoLMIN:基于 LLM 的 Multi-Decision Path Negotiation 面向 Cooperative Autonomous Driving
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Intrinsic Temporal Adaptation of CLIP for Partially Relevant Video Retrieval
中文标题用于部分相关视频检索的剪辑的内在时间适应
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Diffusion Language Models for Mobile Edge Agentic AI: Foundations, Applications, and Challenges
中文标题Diffusion Language Models 面向 Mobile Edge Agentic AI:Foundations,Applications,与 Challenges
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Shadow Queries for Private Retrieval in Vector Databases
中文标题在矢量数据库中进行私有检索的阴影查询
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Knowing What Not to Answer: Selective Non-Compliance in Vision-Language Models
中文标题知道不该回答的问题:视觉语言模型中的选择性违规行为
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题AngelFingerprint:A Traceable,可解释,与 White-Box Stealthy Watermark 面向 Text-Guided Image Editing
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题超越代码生成: Agent软件开发生命周期中的可靠性、验证和成本经济性
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
How Developers Discuss Generative AI: A Longitudinal Study of the Visual Studio Code Community
中文标题开发人员如何讨论生成式AI : Visual Studio代码社区的纵向研究
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ERPBench: Evaluating LLM Agents for Enterprise Decision-Making Across Competitive Market Ecologies
中文标题ERPBench:Evaluating LLM Agents 面向 Enterprise Decision-Making Across Competitive Market Ecologies
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Latent-Aligned Reasoning for Multimodal Recommendation
中文标题多式联运建议的潜在一致推理
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
CrossDepth: Geometry-Constrained Attention for Generalizable Multi-View Surround Depth Estimation
中文标题CrossDepth:Geometry-Constrained Attention 面向 Generalizable Multi-View Surround Depth Estimation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Think-Verify-Revise :使用视觉语言模型和动态逻辑张量网络的神经符号视觉推理
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Towards Neuro-Symbolic Procedural Reasoning for Long-Horizon Vision-Language-Action Manipulation
中文标题长视野视觉-语言-动作操作的神经符号程序推理
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。