让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力、提升 RAG 检索和知识库问答可靠性
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力。
本期从 2026-08-13 论文源抓取并去重 363 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题ProME :具有维修感知选择的原型边际环境,可实现团队健壮的学习
信号显示当训练组标签不可用时,群体稳健学习对于保持罕见亚群的准确性至关重要
关键词ragdeploymentalignmentevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题TopoIntent :将安全意图编译为可执行、合规性检查的网络拓扑
信号显示企业安全拓扑设计需要将业务意图、监管要求和风险假设转化为区域、边界设备、区域间路径和访问控制策略
关键词ragretrievalservingalignment
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题缩放表示多样性:视觉基础的调节注意力和重构正则化
信号显示参考表达理解( REC )通常在特定于数据集的微调下进行研究,从而产生具有有限跨数据集泛化的专业模型
关键词inferencealignmentbenchmarkvision-language
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题WHO Speaks Matters: Authority-Aware Multi-View RAG关于意大利议会诉讼
信号显示议会程序是民主审议的主要记录,但其数量和分散性使公民、记者和研究人员难以从多角度进行访问
关键词ragretrievalevaluationsearch
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题学习用于视频人脸伪造检测的统一视频和图像表示
信号显示鉴于人脸处理技术和深度生成模型的快速发展,人脸伪造检测对于保持人脸数据的安全性和完整性至关重要
关键词servingalignmentbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题实践使不安全:自我完善法学硕士代理的技能错误演变
信号显示自我改进的LLM代理将成功轨迹转化为持续的交叉任务状态
关键词agentretrievalsafetybenchmark
代码/数据需查看原文确认
其他值得关注
How Good are Foundation Models in Longitudinal MRI Disease Progression Reasoning?
中文标题纵向MRI疾病进展推理中的基础模型有多好?
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
VALG: An Agentic System for ML Theory Research
中文标题VALG:An Agentic System 面向 ML Theory Research
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
P2Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation
中文标题P2Fusion :通过双优先蒸馏进行基于提示的渐进式红外可见图像融合
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
CoMedBench: A Multi-Source Benchmark of Synthetic Medical Data Fidelity and Downstream Utility
中文标题CoMedBench:A Multi-Source 基准 of Synthetic Medical Data Fidelity 与 Downstream Utility
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
PatchGen: Learning Soft Intra-Image Predictive Subsets for Visual Generalization
中文标题PatchGen:Learning Soft Intra-Image Predictive Subsets 面向 Visual Generalization
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
中文标题AutoDesign:Meta-Harness Optimization 面向 Long-Horizon Agentic Design
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference
中文标题简化矩阵乘法: LLM推理的输入-自适应矩阵-乘积简化
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
中文标题Enhancing Virtual Agents through SLMs 与 Edge-Computing:An Exploratory 评测 of Think 与 Memory Processes
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Rules or Character? Scaling Laws for AI Safety Design
中文标题Rules or Character? Scaling Laws 面向 AI Safety Design
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Operationalizing Cyber Threat Intelligence with GraphRAG
中文标题使用GraphRAG实现网络威胁情报的运营
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
STAR: Structured Tokenization and Target-Aware Interest Representation for PCVR Prediction
中文标题STAR:Structured Tokenization 与 Target-Aware Interest Representation 面向 PCVR Prediction
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Beyond Retrieval: Query-Conditioned Reuse of Long-Horizon Agent Trajectories
中文标题超越检索:长期客服代表轨迹的查询条件重用
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Fast A/B/n Testing: Exact Multi-Policy Comparison via Tree-Coupled Feedback Sharing
中文标题快速A/B/n测试:通过树耦合反馈共享进行精确的多策略比较
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
HiRoute: Hierarchical Routed Prompt Tuning for Safety Alignment of Large Language Models
中文标题HiRoute:Hierarchical Routed Prompt Tuning 面向 Safety Alignment of Large Language Models
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Query Translation vs. Cross-Lingual Embeddings for Sinhala-Tamil E-Government Information Retrieval
中文标题僧伽罗语-泰米尔语电子政务信息检索的查询翻译与跨语言嵌入
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives
中文标题PlayWorld:基准ing 世界模型 with Agent Players over Long-Horizon Objectives
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Vero: Can AI Agents Build Formally Verified Software Repositories?
中文标题Vero :人工智能代理能否构建经过正式验证的软件存储库?
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval
中文标题TraVEL:Trajectory-Guided Video Embedding Learning 面向 Driving-Video Retrieval
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MARC v1: An Open-Source Multi-Agent Framework for Clinical AI Reasoning and Coordination
中文标题MARC v1:An Open-Source Multi-Agent 框架 面向 Clinical AI Reasoning 与 Coordination
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题注意背景:通过环境-社会解体不断学习适合社会的机器人行为
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。