让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力、提升 RAG 检索和知识库问答可靠性
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-08-07 论文源抓取并去重 357 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1开源人工智能风险缓解工具的分类驱动分析🔗
- 2Dual-Node NVIDIA DGX Spark over Tailscale:A Remote-Access Testbed 面向 Distributed LLM Training 与 Cyber-Threat-Intelligence Fine-Tuning🔗
- 3LMM Modality Transfer:A Pre-requisite 面向 Autonomous GIS Agents🔗
- 4When GNNs Fail:Quantifying 与 Overcoming Temporal Correlation Volatility in Time Series🔗
- 5稳定的曲线,不稳定的项目:视频LLM中的项目级扩展异构性🔗
- 6通过多阶段后期培训逐步调整推荐者基础模型🔗
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题开源人工智能风险缓解工具的分类驱动分析
信号显示企业环境中大语言模型(LLM)的快速采用引入了运营、安全和治理风险
关键词ragretrievalevaluationcode
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题Dual-Node NVIDIA DGX Spark over Tailscale:A Remote-Access Testbed 面向 Distributed LLM Training 与 Cyber-Threat-Intelligence Fine-Tuning
信号显示紧凑的人工智能系统使本地语言模型实验变得越来越容易获得,但桌面级加速器的多节点培训的实际证据仍然有限
关键词deploymentevaluationcodefine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题LMM Modality Transfer:A Pre-requisite 面向 Autonomous GIS Agents
信号显示人工智能模型越来越擅长理解和处理空间信息,从而促进空间任务和工作流程中的代理问题解决
关键词agentworkflowalignmentmultimodal
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题When GNNs Fail:Quantifying 与 Overcoming Temporal Correlation Volatility in Time Series
信号显示通过将多变量时间序列表示为图来建模它们,其中单个序列充当节点,成对的时间相关充当边缘,已经获得了显著的牵引力
关键词raginferenceservingbenchmark
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题稳定的曲线,不稳定的项目:视频LLM中的项目级扩展异构性
信号显示聚合缩放曲线表明,视频LLM随着视觉预算的增长而平稳或饱和
关键词ragbenchmarkcodevideo
代码/数据需查看原文确认
评测视频生成的时间一致性和运动真实感
中文标题通过多阶段后期培训逐步调整推荐者基础模型
信号显示推荐的基础模型( FM )已显示出对长时间连续用户行为进行建模的强大能力
关键词servingalignmentfine-tuningpost-training
代码/数据需查看原文确认
其他值得关注
EliSeg: Verified Target Construction for Report-Grounded Abnormality Segmentation
中文标题EliSeg:Verified Target Construction 面向 Report-Grounded Abnormality Segmentation
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails 使用 Zero-Knowledge Proofs
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents
中文标题MemOPD:On-Policy Distillation through Memory State Alignment 面向 Long-Horizon Agents
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题更多检索的证据是否有助于使用扩散语言模型的视觉检索增强生成?
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework
中文标题Long-Horizon Agent Trajectory Attribution:A Unified 基准 与 Fine-Grained Annotation 框架
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits
中文标题Diffusion LLMs as Targets 与 Adversaries:Mechanistic Safety Exploits
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题H2AL :基于配准的少量医学图像分割的双曲线层次感知聚合学习
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
TOFD: Target-Oriented Feature Decoupling against Poisoning Attacks in Split Federated Learning
中文标题TOFD :分裂联合学习中针对中毒攻击的面向目标的功能解耦
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MAUPITI: On-Device Prototype-Based Learning on a Smart Infrared Sensor
中文标题MAUPITI :基于智能红外传感器的设备原型学习
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs
中文标题RoRA:Role-Oriented Regional Allocation 面向 Visual Token Pruning in MLLMs
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题IceHorizon:A Dataset 面向 Horizon Detection in Ice-Covered Maritime Environments 与 Comparative 评测 of Detection Methods
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题基于混合分析的大型语言模型推理延迟和能量多层次建模--机器学习预测器
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
中文标题爆炸范围
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ResidencyRL: Reinforcement Learning in Simulated Clinical Environments
中文标题ResidencyRL :模拟临床环境中的强化学习
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
An End-to-End Agent Auditing Engine
中文标题一种End-to-End Agent Auditing Engine
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Aftab:A Comprehensive 基准 of CNN Encoders 与 Advanced Value Functions in Parallelized Q-Networks
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
From Test-Time Scaling to Reusable Memory: Measuring Crystallization in Text-to-SQL
中文标题来自 Test-Time Scaling to Reusable Memory:Measuring Crystallization in Text-to-SQL
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Conformal Fusion Under Missing Modalities
中文标题缺失模式下的适形融合
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation
中文标题表征驱动的内窥镜视觉嵌入对准,用于潜伏生成
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Representation Handoffs for OpenArm-Based Laboratory Mobile Manipulation
中文标题Representation Handoffs 面向 OpenArm-Based Laboratory Mobile Manipulation
关注理由涉及机器人与具身智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。