增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-06-22 论文源抓取并去重 457 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
增强多模态模型理解图表和文档的能力
中文标题无重播连续多模态LLM的注意力频谱正则化
信号显示多模态大语言模型( MLLM )越来越需要适应视觉领域、问题类型和用户指令的非平稳流,但持续的微调往往会严重忘记以前获得的多模态技能
关键词servingbenchmarkcodemultimodal
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题IPO Finance Agent:评测 of LLM Financial Analysts beyond Finance Agent v2,with Automated Rubric Generation -- the Case of the SpaceX (SPCX) IPO
信号显示财务代理v2 (由Vals AI开发)已成为评估财务任务中Anthropic Claude和OpenAI ChatGPT前沿语言模型的参考基准
关键词agentretrievaldeploymentevaluation
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题AIR :使用MLLM中的代码进行自适应交错推理
信号显示在OpenAI o3发起的范式转变之后,交错推理与代码以增强多模态大语言模型( MLLM )已成为一个关键的研究前沿
关键词ragevaluationbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题自我压缩语言模型代理
信号显示由思想链和工具调用组成的长代理跟踪积累了锚定后代的陈旧内容,并最终超出了上下文窗口
关键词agentinferencebenchmarkfine-tuning
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题教授LLM字符串匹配、回溯和错误恢复,以推导组合爆炸位操作拼图的基础和真值表
信号显示本文介绍了我们针对NVIDIA Nemotron模型推理挑战赛的算法创新,重点介绍了位操作难题
关键词ragcodereasoningsearch
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题NGPS :通过邻居引导补丁采样进行结构保留自监督去噪
信号显示相邻切片自监督去噪对于体积医学成像具有吸引力,但切片间错位会破坏解剖学对应关系,并且当相邻切片被天真地用作目标时,通常会产生重影和边缘模糊
关键词retrievalservingalignmentcode
代码/数据需查看原文确认
其他值得关注
TriggerBench: Investigating Prospective Memory for Large Language Models
中文标题TriggerBench:Investigating Prospective Memory 面向 Large Language Models
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
From Text Metrics to Model Internals: A Study of Whisper ASR Hallucination Detection
中文标题来自 Text Metrics to Model Internals:A Study of Whisper ASR Hallucination Detection
关注理由涉及语音与音频中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Boosting Neural Video Codec via Scale-Driven Online Flow Refinement
中文标题通过规模驱动的在线流细化提升神经视频编解码器
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
PG-MAP: Joint MAP Optimization for Inference-Time Alignment of Diffusion and Flow-Matching Models
中文标题PG-MAP:Joint MAP Optimization 面向 Inference-Time Alignment of Diffusion 与 Flow-Matching Models
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning
中文标题SingGuard :具有动态推理的政策自适应多模式LLM护栏
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Motion Generation
中文标题文字指示,音乐装饰:基于能量的关注可编辑的舞蹈动作生成
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
UI-LIC: A Unified Framework for Evaluating Learned Image Compression Models
中文标题UI-LIC:A Unified 框架 面向 Evaluating Learned Image Compression Models
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题TTFT-Aware Graph Chain-of-Thought:Distance-Indexed Neural A* 面向 Low-Hallucination Multi-Hop Medical Reasoning
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models
中文标题攻击可信的想象力:对Imagine-then-ACT世界模型的Oracle级诚信攻击
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Neural Operator Processes for Probabilistic Operator Learning under Partial Observations
中文标题局部观测下概率算子学习的神经算子过程
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
KaLM-Reranker-V1: Fast but Not Late Interaction for Compressed Document Reranking
中文标题KaLM-Reranker-V1:Fast but Not Late Interaction 面向 Compressed Document Reranking
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题HAKARI-Bench:A Lightweight 基准 面向 Comparing Retrieval Architectures 与 Efficiency Settings under Unified Conditions
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
On the Limits of Prompt-Conditioned Language Models as General-Purpose Learners
中文标题作为通用学习者的即时条件语言模型的局限性
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions
中文标题EnterpriseClawBench:基准ing Agents 来自 Real Workplace Sessions
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
TailorMind: Towards Preference-Aligned Multimodal Content Generation
中文标题TAIlorMind :朝着偏好一致的多模式内容生成迈进
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Pose Anything Anywhere:Model-free Object Poses from Arbitrary References
中文标题在任何地方摆出任何姿势:从任意引用中摆出无模型的对象姿势
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MORL-A2C: Multi-Objective Reinforcement Learning Reranker for Optimizing Healthiness in MOPI-HFRS
中文标题MORL-A2C:Multi-Objective Reinforcement Learning Reranker 面向 Optimizing Healthiness in MOPI-HFRS
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery
中文标题机器人辅助手术中的实时多模式活动感知错误检测
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Evaluation Awareness Is Not One Capability: Evidence from Open Language Models
中文标题评估意识不是一种能力:来自开放语言模型的证据
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
LangMAP: A Language-Adaptive Approach to Tokenization
中文标题LangMAP :一种语言自适应的令牌化方法
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。