让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力、提升代码生成、执行反馈和自动修复能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力、提升代码生成、执行反馈和自动修复能力。
本期从 2026-07-16 论文源抓取并去重 326 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、增强多模态模型理解图表和文档的能力、提升代码生成、执行反馈和自动修复能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题Symbal :检测模型生成字幕中的系统性错位
信号显示多模态大语言模型( MLLM )在生成图像标题时经常引入错误,导致图像-文本对错
关键词alignmentevaluationbenchmarkcode
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题RoboTTT:Context Scaling 面向 Robot Policies
信号显示最近的机器人基础模型在单步或短历史视觉运动环境下运行
关键词inferencelatencyvision-languagerobot
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题SUFLECA:Scaling Up Feature Learning 面向 CAD-to-image Alignment
信号显示CAD到图像对齐旨在从单个RGB图像估计物体的9D姿态(旋转、平移和各向异性尺度) ,从而实现机器人和增强现实中的应用
关键词alignmentbenchmarkcoderobotics
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题四足机器人在拥挤环境中学习敏捷导航
信号显示由于严重的传感器阻塞和不可预测的人类运动,在动态和拥挤的环境中导航对四足机器人来说构成了重大挑战
关键词raginferencedeploymentsafety
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题成功与简单:可转移视觉-语言攻击管道的第二个视角
信号显示已知视觉语言预训练模型( VLPM )容易受到对抗性攻击
关键词ragretrievalcodevision-language
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题StructureClaw:Traceable LLM Agents 与 an Executable 基准 面向 Structural Engineering Workflows
信号显示解决结构工程请求需要不止一个答案;它需要一系列相互依赖的工件:解释需求、可计算模型、验证记录、求解器输出、代码检查记录和最终报告
关键词agentworkflowragevaluation
代码/数据需查看原文确认
其他值得关注
The Energy Society: A Simulation Environment for Studying Agent Cooperation under Survival Pressure
中文标题Energy Society:A Simulation Environment 面向 Studying Agent Cooperation under Survival Pressure
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
GlobalForge: Towards Robust AI-Generated Image Detection
中文标题GlobalForge :实现强大的人工智能生成图像检测
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems
中文标题Bad Memory:Evaluating Prompt Injection Risks 来自 Memory in Agentic Systems
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Uni-AdaVD: Universal Concept Erasure for Visual Generation via Orthogonal Value Decomposition
中文标题Uni-AdaVD :通过正交值分解进行视觉生成的通用概念擦除
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions
中文标题通过动态、多轮交互对视觉语言模型进行情境化评估
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
TAMF-VTON: Texture-Aware Mask-Free Virtual Try-On via High-Fidelity Image Synthesis
中文标题TAMF-VTON :通过高保真图像合成实现纹理感知无掩模虚拟试用
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
WorkDrive: Roadwork Chain of Causation for Autonomous Driving
中文标题WorkDrive:Roadwork Chain of Causation 面向 Autonomous Driving
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents
中文标题Alipay-PIBench:A Realistic Payment Integration 基准 面向 Coding Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Democratizing Agent Deployment Safety: A Structural Monitoring Approach
中文标题民主化代理部署安全:结构性监控方法
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi
中文标题一种Modern Multimodal Assistant on a 6 GB 2011 GPU:Stage-Validated,All-GPU CUDA Inference 面向 Fermi
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
中文标题超越成功率:进攻性和防御性安全代理的成本意识评估
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning
中文标题HoloGeo :通过循证推理减轻地理定位中的地标偏差
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
AutoSynthesis: An agentic system for automated meta-analysis
中文标题AutoSynthesis:An agentic system 面向 automated meta-analysis
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
BadWAM: When World-Action Models Dream Right but Act Wrong
中文标题BadWAM :当世界行动模特梦想正确但行动错误时
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题MM-IssueLoc:A Controlled 基准 面向 Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Can We Trust Item Response Theory for AI Evaluation?
中文标题Can We Trust Item Response Theory 面向 AI 评测?
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy
中文标题为科学可视化素养建立多模态大型语言模型的基准
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents
中文标题数字万神殿:与LLM代理模拟和审计联盟组建
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning
中文标题AlphaWiSE:Adaptive Weight Interpolation 面向 Continual Multimodal Representation Learning
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Introspective Attention Modulation for Safe Text-to-Image Generation
中文标题用于安全生成文本图像的内省注意力调制
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。