增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力
今天主要跟进:增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。
本期从 2026-07-13 论文源抓取并去重 374 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
增强多模态模型理解图表和文档的能力
中文标题LaGuadia:Language-Guided Adaptive Distillation 来自 Pathology Foundation Models
信号显示病理学基础模型( PFM )提供强大的全幻灯片图像( WSI )表示,但面临巨大的计算成本
关键词alignmentcodevision-languageimage
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题MM-ToolSandBox:A Unified 框架 面向 Evaluating Visual Tool-Calling Agents
信号显示我们推出了MM-ToolSandBox ,这是一个可视化接地工具调用代理的基准和评估框架
关键词agentworkflowevaluationbenchmark
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题RAGU :采用紧凑型领域适应型LLM的多步GraphRAG引擎
信号显示图检索增强生成( GraphRAG )通过结构化知识增强大语言模型,但现有系统在单个提取通道中构建知识图,产生噪声实体和脆性检索
关键词ragretrievalcodeopen-source
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题MAGIC :使用大型语言模型生成可导航的多场景游戏世界的过渡感知
信号显示多场景导航(在一个有界空间中清除目标,然后穿过入口进入下一个)是当代3D游戏的一个定义特征,但创作它是一项艰巨的任务:每个入口必须在两侧都有一致的端点,每个内部
关键词agentevaluationbenchmarkcode
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题TreeThink :使用LLM进行数学推理的模块化树搜索库
信号显示树搜索算法可以系统地探索神经定理证明中的证明空间
关键词inferenceevaluationcodeopen-source
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题针对量子神经网络的输入感知动态后门攻击
信号显示量子神经网络( QNN )是近期量子设备上量子机器学习的一个有前途的框架,但其安全风险仍未得到充分了解
关键词ragdeploymentfine-tuningvisual
代码/数据需查看原文确认
其他值得关注
Technical Report on the CVPR 2026@AdvML Workshop Challenge
中文标题关于CVPR 2026 @ AdvML研讨会挑战的技术报告
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ToFu: A White-Box, Token-Efficient Agent Harness for Researchers
中文标题ToFu:A White-Box,Token-Efficient Agent Harness 面向 Researchers
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
HASTE: A Platform for Rapid Post-Disaster Building Damage Assessment
中文标题HASTE:A 平台 面向 Rapid Post-Disaster Building Damage 评估
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming
中文标题Agent Hacks Agent:Autoresearch 面向 Production-Agent Red-Teaming
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models
中文标题HyperSafe:Inference-Time Safety Recovery 面向 Fine-Tuned Language Models
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
HierCAD: Hierarchical Text-to-CAD Design via Structure Alignment and Parameter Grounding
中文标题HierCAD :通过结构对齐和参数接地实现分层文本到CAD设计
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
SISA-Rec: A Semantically Integrated Sequential Recommender with Contrastive Alignment
中文标题SISA-Rec :具有对比对齐的语义集成顺序推荐器
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception
中文标题SynCLIP:Synonym-Coherent Language-Image Pretraining 面向 Robust Open-Vocabulary Dense Perception
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题PREF-Gate:Provenance-Constrained Relational Evidence Fusion with Validation-Gated Selection 面向 Graph Fraud Detection
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题Amplitude-Only FFN Intervention 面向 Tool-Structured LLM Inference Method:Gated 评测 Protocol,与 Cross-Model Empirical Results
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Revisiting Matching Response and Swept Feature Volumes for Wide-baseline Omnidirectional Stereo
中文标题重新审视宽基线全向立体声的匹配响应和扫描功能音量
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services
中文标题BackendForge :使用后端服务对Agentic端到端代码生成进行基准测试
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding
中文标题TreeSoc:Tree-Structured Dynamic Reasoning 与 Tool Synergy 面向 Soccer Video Understanding
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
中文标题Read It Back:Pretrained MLLMs Are Zero-Shot Reward Models 面向 Text-to-Image Generation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Evidence-Backed Video Question Answering
中文标题证据支持的视频问题答案
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
MicroCharNet: Less is More for License Plate Character Detection
中文标题MicroCharNet:Less is More 面向 License Plate Character Detection
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Higher-Order Cell Tracking Transformer
中文标题高阶单元跟踪变压器
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems
中文标题当本地监视器错过成分危害时:诊断多Agent系统中的分布式后门
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
GFR-SAM: Training-Free Referring Camouflaged Object Segmentation via Cross-Image Prompting
中文标题GFR-SAM :通过交叉图像提示进行无培训的引用伪装对象分割
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry
中文标题FoundationGeo:Learning Spatial Pixel-Wise Fields 面向 Monocular Metric Geometry
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。