让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力、提升代码生成、执行反馈和自动修复能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力。
本期从 2026-07-23 论文源抓取并去重 321 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题相同的危险目标,相反的建议:直接接触与多代理调解
信号显示当直接显示危险目标时,即使是当前的高性能LLM也比其他代理人转换和传递其方向时看起来更安全
关键词agentworkflowservingsafety
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题未来渲染$\ neq $未来曲面:观测窗口之外的动态曲面重建的基准和数据集
信号显示动态场景重建几乎总是在观察到的时间窗口内进行评估,但AR叠加、机器人交互和预期规划等部署设置需要未来的表面:几何体有时超出捕获的几何体
关键词deploymentevaluationbenchmarkcode
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题Multimodal Pretraining 面向 Generalizable EEG Representation Learning
信号显示用于癫痫的脑电图( EEG )模型通常仅限于特定的数据集和任务
关键词alignmentevaluationbenchmarkcode
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题通过渐进种子修剪的扩散模型的推理时间缩放
信号显示扩散和流量匹配模型主导了条件图像生成,但这些模型的推理时间缩放远远低于自回归语言模型
关键词inferencealignmentevaluationcode
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard:A Fast Vision-Language Guard 面向 Real-Time Moderation
信号显示视觉语言AI助手将其答案作为生成的令牌流返回
关键词safetybenchmarkcodemultimodal
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题UAM战略消除冲突中的陈述性问题解决
信号显示对城市空中交通( UAM )日益增长的需求给空域管理带来了重大挑战,特别是在人口稠密的大都市地区
关键词benchmarkmemoryprogramexecution
代码/数据需查看原文确认
其他值得关注
中文标题无云代理编码:评估纵向数据准备任务的开放权重大型语言模型
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation
中文标题DINOde:Continuous Vision-Text Alignment 面向 Open-Vocabulary Semantic Segmentation
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题Tencent WorkBuddy Bench:A Multi-Domain Coding-Agent 基准 with Contamination-Resistant Task Construction
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题人行道时刻:更丰富的代表性是否总是更人性化?城市漫步视频中的证据
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
HGeo-TopoMap: Boosting Topological Mapping with Hierarchical Geometric Priors
中文标题HGeo-TopoMap :使用分层几何先验增强拓扑映射
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure
中文标题V-DEAL :将视频安全反校准诊断为理解-拒绝耦合故障
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题Faster IndexTTS-2:Accelerating 与 Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Boosting Robustness for All-Weather Self-Supervised Depth Estimation in Autonomous Driving
中文标题提高自动驾驶中全天候自我监督深度估计的鲁棒性
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题使用基于语音的多模态大型语言模型进行可推广的认知障碍检测
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Toward Continuous Assurance for the Democratization of AI Agent Creation in Industry
中文标题面向产业AI智能体创造民主化的持续保障
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Euclid-MCP: A Model Context Protocol Server for Deterministic Logical Reasoning via Prolog
中文标题Euclid-MCP :通过Prolog进行确定性逻辑推理的模型上下文协议服务器
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题低资源语言品种的语音强制对齐:成都普通话的模型训练和评估
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
SlerpFlow: Spherical Trajectory Correction for Rectified Flow Inversion
中文标题SlerpFlow:Spherical Trajectory Correction 面向 Rectified Flow Inversion
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs
中文标题自适应深度稀疏框架:预训练LLM的相似性驱动资源分配
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题探测器学习错误的东西:针对物理可实现攻击的抗捷径对抗性训练
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders
中文标题ICAE-Bench :评估编码代理作为交互式项目构建商
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Safety-oriented sidewalk and road segmentation for smartphone-based assistive navigation
中文标题以安全为导向的人行道和道路分段,用于基于智能手机的辅助导航
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs
中文标题C-PTQ:Fisher-weighted Channel-wise Sensitivity 面向 Post-training Quantization of MLLMs
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Spectral Transformation 面向 Layer-wise Global Rank Discovery in Federated LoRA 面向 Vision Transformers
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
From Evaluation to Optimisation: Hierarchy-Aware Training Signals for CWE Prediction in Python
中文标题来自 评测 to Optimisation:Hierarchy-Aware Training Signals 面向 CWE Prediction in Python
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。