提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-07-24 论文源抓取并去重 240 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1提升光谱:测量到空间的自适应性如何塑造无图像单像素传感中的稳健性🔗
- 2AgentHOI:通过隐式表示对齐进行人-对象-交互视频生成的多Agent推理🔗
- 3TRaM-VSR:Importance-Aware Token Routing 与 Merging 面向 One-Step Diffusion Video Super-Resolution🔗
- 4推进前的填充:场景专用遥感传销的能力差距驱动后期训练🔗
- 5Comm与LM:Data driven behavior level descriptor 面向 ego vehicles🔗
- 6EVL-MCoT:Enhanced Vision-Language Multi-CoT 面向 Harmful Meme Detection🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升模型推理、规划和验证能力
中文标题提升光谱:测量到空间的自适应性如何塑造无图像单像素传感中的稳健性
信号显示单像素传感将场景编码为编码测量的短序列,无图像方法直接从该序列推断任务
关键词retrievalinferencecodefine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题AgentHOI :通过隐式表示对齐进行人-对象-交互视频生成的多Agent推理
信号显示视频扩散模型的最新进展激发了人们对人物交互( HOI )视频生成的兴趣,这需要对单主体动画以外的交互逻辑进行精细控制
关键词agentinferencealignmentcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题TRaM-VSR:Importance-Aware Token Routing 与 Merging 面向 One-Step Diffusion Video Super-Resolution
信号显示使用大规模扩散变压器( DiT )先验的视频超分辨率( VSR )实现了卓越的感知质量,但由于处理密集时空令牌序列的二次计算成本,通常是不切实际的
关键词raginferenceservingcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题推进前的填充:场景专用遥感传销的能力差距驱动后期训练
信号显示遥感多模态大语言模型( RS-MLLMs )提高了对一般航拍图像的理解
关键词ragalignmentbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题CommandLM:Data driven behavior level descriptor 面向 ego vehicles
信号显示随着自动驾驶系统向现实世界部署迈进,可解释的行为级决策对于安全、信任和监管至关重要
关键词deploymentalignmentsafetyevaluation
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题EVL-MCoT:Enhanced Vision-Language Multi-CoT 面向 Harmful Meme Detection
信号显示MEME在互联网上广泛使用,通常带有强烈的讽刺或讽刺元素
关键词alignmentcodevision-languagecoding
代码/数据需查看原文确认
其他值得关注
Rethinking Layer-Wise Information Allocation for Vision Foundation Model Adaptation
中文标题重新思考视觉基础模型适应的分层信息分配
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Dynamic Capability Scoping 面向 Enterprise AI Agents:A Synthetic Dataset 与 Three-Source Permission Architecture
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning
中文标题教授LLM自我进化:通过强化学习培养核心元技能
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
SIREN (Luring LLMs onto the Rocks): PAIR-Driven Preference Manipulation in Web-RAG Recommenders
中文标题SIREN (将LLM吸引到岩石上) : Web-RAG推荐中的PAIR驱动的偏好操纵
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
中文标题技能自我发挥:通过共同进化技能推动LLM能力的前沿
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题CausalForge:A Formally Grounded,Self-Improving Agentic 框架 面向 Automated Research in Causal Inference
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
PRIMS: Physics-guided Representation for Fluid Identification in Multimodal Sensing
中文标题PRIMS:Physics-guided Representation 面向 Fluid Identification in Multimodal Sensing
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation
中文标题IDEAgent:Agentic Quality-Diversity Search 面向 Research Idea Generation
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Integrated Order Dispatching and Routing for Last-Mile Pickup via Deep Reinforcement Learning
中文标题通过深度强化学习集成最后一英里自取订单派单和路线
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding
中文标题RadSight :朝着感知可靠的多模式放射学图像理解迈进
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Autoregressive EHR Foundation Models with Multimodal Inputs
中文标题具有多模态输入的自回归EHR基础模型
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
From Isolated Tasks to Structured Capabilities: A Multilayer Taxonomy for Large Language Models
中文标题从孤立任务到结构化能力:大型语言模型的多层分类
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents
中文标题DBA-Bench:A Production-Fidelity 基准 面向 基于 LLM 的 Database Operations Agents
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Spectral Prior for Reducing Exposure Bias in Diffusion Models
中文标题Spectral Prior 面向 Reducing Exposure Bias in Diffusion Models
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Mode
中文标题Nanbeige4.2-3B :在紧凑模式下解锁代理能力
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
LAMAR: An Open Language-Aware Multilingual Alignment Reranker
中文标题LAMAR :开放式语言感知多语言校准Reranker
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Agent Security Needs Redefinition through a Holistic Framework
中文标题Agent Security Needs Redefinition through a Holistic 框架
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents
中文标题空中传销代理零拍摄任务级别评估
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning
中文标题用于多模态思维链推理的视觉显著性转向蒸馏
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
TextSLIP: Text Self-Supervised CLIP for Medical Report Generation
中文标题TextSLIP:Text Self-Supervised CLIP 面向 Medical Report Generation
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。