增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力
今天主要跟进:增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-08-31 论文源抓取并去重 477 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
增强多模态模型理解图表和文档的能力
中文标题不完全多模态情绪识别的模态分解学习:原始记忆蒸馏视角
信号显示多模态情绪识别( MER )系统在现实场景中经常会缺失模态
关键词inferencecodemultimodalmemory
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题超越负载:用户调用如何影响编码代理对存储库中毒的脆弱性
信号显示编码代理越来越多地用于软件工程任务,包括来自第三方存储库的引导项目,其完整性无法假定
关键词agentevaluationbenchmarkeval
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题SIR:Self-improving Red-teaming 面向 Compute Use Agents
信号显示计算机使用代理( CUA )是一种视觉语言模型,可通过鼠标、键盘和终端感知屏幕并在真实操作系统上执行操作,并且越来越多地用于自动化日常数字任务
关键词agentsafetybenchmarkvision-language
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题OCR-MetaReasoning 基准 :评估MLLM在富文本图像理解中的元推理能力
信号显示文本丰富的图像理解需要多模态大语言模型( MLLM )跨单词、布局、字段、图表和视觉对应关系组织OCR (光学字符识别)基础证据
关键词inferenceevaluationbenchmarkcode
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题重新激活用于解决平面几何问题的测试时间缩放
信号显示平面几何问题( PGP )求解已成为多模态推理的关键基准,因为它需要精确的视觉感知和精确的多步符号演绎
关键词inferencebenchmarkcodemultimodal
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题偏好形状相关性:个性化生成检索的跨组件层次语义对齐
信号显示通过将查询直接映射到具有候选项强大表示功能的语义ID ( SID ) ,生成检索( GR )已成为一种有希望的范例
关键词retrievalinferencelatencyalignment
代码/数据需查看原文确认
其他值得关注
中文标题超越令牌级指导:通过跨家族代表指导实现专业LLM的推理时间一致性
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题Pretrained,Curriculum-Tuned,与 Ensembled:A Tracer-Aware Interactive Segmentation Pipeline 面向 AutoPET V
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
UTILMEM: Benchmarking Evidence Utilization in Long-Term Conversational Memory
中文标题UTILMEM:基准ing Evidence Utilization in Long-Term Conversational Memory
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents
中文标题无知还是无能?为LLM代理构建知识门限、可验证的任务
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题超越已知:多标签课堂增量学习的强化知识规范
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection
中文标题DICS:Exploring Data Intrinsic Consistency 面向 Visual Instruction Selection
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
A Simple Transformer Pipeline for Full-Key Side-Channel Attacks on Uncropped Datasets
中文标题一种Simple Transformer Pipeline 面向 Full-Key Side-Channel Attacks on Uncropped Datasets
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题Stress-Testing Efficient Responsible-AI 评测:When Compute Savings Change 基准 Conclusions
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
中文标题将大型推理模型扩展到人类监督之外:通往超级智能的道路
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Multimodal Shared Latent Representation of Narration,Microscope 与 iOCT Images 面向 Phase Recognition in Vitreoretinal Surgery
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Responsible Integration of AI in Cancer Genomics:Barriers,Risks,与 Pathways to Trustworthy Clinical Translation
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Low-Resource Preference Adaptation of LLMs via Activation-Based Label Propagation
中文标题通过基于激活的标签传播对LLM进行低资源偏好适应
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
You Shouldn't Have Asked: A Pragmatics-Inspired Taxonomy for Evaluating LLM Refusals
中文标题您不应该问:评估LLM拒绝的语用启发式分类法
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
The Fragility of Jailbreak Robustness Across Operational States
中文标题越狱稳健性在整个运营状态下的脆弱性
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题SingProbe技术报告
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Failure or Drift? Evaluating Monocular SLAM under Synthetic and Real-World Corruptions
中文标题Failure or Drift? Evaluating Monocular SLAM under Synthetic 与 Real-World Corruptions
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
AdaPath: Query-Adaptive Path-Finding via Path-Bank for Multi-Hop Implicit Biomedical KGQA
中文标题AdaPath :通过路径库进行多跳隐式生物医学KGQA的查询自适应路径查找
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives
中文标题ALTSTEER:Selective Safety Steering 面向 Moving Beyond Hard Refusals to Constructive Alternatives
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
VeriCam: A Verification Baseline for the Classification of Unknown Data
中文标题VeriCam :未知数据分类的验证基线
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
BLOOM-WILT: Logit Tilting for Behaviour Elicitation in Automated LLM Auditing
中文标题BLOOM-WILT:Logit Tilting 面向 Behaviour Elicitation in Automated LLM Auditing
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。