让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力、提升 RAG 检索和知识库问答可靠性
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-06-18 论文源抓取并去重 419 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题多代理事务内存
信号显示具有不同能力的LLM代理在不同任务中的分散部署激励了跨异构代理群体的知识共享基础设施
关键词agentragretrievaldeployment
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题通过离散语音令牌Surprisal进行轻量级发音评估
信号显示培训自动发音评估通常依赖于标记的学习者错误或非母语语料库,这些语料库的收集成本很高
关键词inferencealignmentevaluationcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Measuring Biological Capabilities 与 Risks of AI Agents
信号显示本文讨论了一个迅速出现的政策挑战:如何生成和解释关于人工智能科学家或代理人工智能系统的生物能力和风险的可靠证据,这些系统能够自主或协作地执行多步骤科学
关键词agentworkflowragevaluation
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题多模式概念瓶颈模型
信号显示概念瓶颈模型( CBM )通过将从图像中提取的特征与自然概念对齐来增强深度学习网络的可解释性
关键词ragretrievalbenchmarkmultimodal
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题论基于插值的梯度下降的Oracle复杂性
信号显示最近关于经验风险最小化( ERM )的一阶优化器的工作表明,可以利用训练数据中ERM损失函数的平滑度,而不是优化参数,来提高梯度描述的预言机复杂度
关键词ragtrainingTraining and Post-training
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题MMD-SLAM :结构增强型多元高斯分布引导视觉SLAM
信号显示3D高斯拼接( 3DGS )显著提升了新颖的视图合成和高保真场景重建,扩展了基于3DGS的视觉同步定位和映射( SLAM )方法的潜力
关键词ragvisualrenderingvision-generation
代码/数据需查看原文确认
其他值得关注
Large Language Models Do Not Always Need Readable Language
中文标题大型语言模型并不总是需要可读的语言
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题OTCHA:Optimal Transport-driven Confidence-aware Latent Hub Alignment 面向 Multi-View Medical Image Classification
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
World Engine: Towards the Era of Post-Training for Autonomous Driving
中文标题世界发动机:迈向自动驾驶后训练时代
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
JAMER: Project-Level Code Framework Dataset and Benchmark on Professional Game Engines
中文标题JAMER:Project-Level Code 框架 Dataset 与 基准 on Professional Game Engines
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
When, Where, and How: Adaptive Binning for Tabular Self-Supervised Learning
中文标题何时、何地以及如何:表格式自监督学习的自适应分箱
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
TIDY: Thermal Infrared Image Denoising via Wavelet Domain Entropy and Directional Stripe Index
中文标题TIDY :通过小波域熵和定向条纹索引对热红外图像进行去噪
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Human-on-the-Loop Orchestration for AI-Assisted Legal Discovery
中文标题Human-on-the-Loop Orchestration 面向 AI-Assisted Legal Discovery
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
SafeSpec: Fast and Safe LLM via Dynamic Reflective Sampling
中文标题SafeSpec :通过动态反射采样获得快速安全的LLM
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
When Global Gating Is Enough: Admission-Time Hubness Control in Anisotropic Vector Retrieval Systems
中文标题当全局选通足够时:各向异性矢量检索系统中的入场时间毂控制
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Vortex: Multi-Modal Fusion System for Intelligent Video Retrieval
中文标题Vortex:Multi-Modal Fusion System 面向 Intelligent Video Retrieval
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Code-Switching Reveals Language Anchoring in Multilingual LLMs
中文标题代码切换显示多语言LLM中的语言锚定
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
DeepSWIP: Quotient-WMC Counterfactuals for Neural Probabilistic Logic Programs
中文标题DeepSWIP:Quotient-WMC Counterfactuals 面向 Neural Probabilistic Logic Programs
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining
中文标题HumanScale:Egocentric Human Video Can Outperform Real-Robot Data 面向 Embodied Pretraining
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
FlowEdit: Associative Memory for Lifelong Pronunciation Adaptation in Flow-Matching TTS
中文标题FlowEdit:Associative Memory 面向 Lifelong Pronunciation Adaptation in Flow-Matching TTS
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages
中文标题Multi-LCB :将LiveCodeBench扩展到多种编程语言
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Efficient and Sound Probabilistic Verification for AI Agents
中文标题Efficient 与 Sound Probabilistic Verification 面向 AI Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
UltraQuant: 4-bit KV Caching for Context-Heavy Agents
中文标题UltraQuant:4-bit KV Caching 面向 Context-Heavy Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems
中文标题分析针对Agentic AI系统的模型引导自动攻击的防御性误导
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
GEN-Guard: Correcting Generalization Failures for Deployable Federated Surgical AI
中文标题GEN-Guard:Correcting Generalization Failures 面向 Deployable Federated Surgical AI
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题用于检测和缓解跨语言模型家族的紧急错位的可操作激活方向
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。