增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力
今天主要跟进:增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力。
本期从 2026-07-20 论文源抓取并去重 329 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
增强多模态模型理解图表和文档的能力
中文标题何时使用额外上下文:基于证据的术语适应同步语音翻译
信号显示额外的上下文对于技术讲座的同步语音翻译很有价值,但将整个文档上下文注入每个流段往往过于粗糙
关键词latencyalignmentevaluationcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题jina-reranker-v3.5 :具有混合注意力和自我蒸馏的高效Listwise Reranker
信号显示列表式重排序器是代理检索管道的判别核心,但生产部署同时需要半结构化数据的效率、域鲁棒性和流畅性
关键词agentretrievalinferencedeployment
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题Differentiable Logic Gate Networks 面向 Low-Latency EEG Classification on Edge Devices
信号显示边缘设备上的实时脑电分类受到传统神经网络浮点算法的瓶颈
关键词inferencedeploymentlatencycode
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题SciForma :科学图表的结构忠实生成
信号显示结构保真度对于科学方法图至关重要
关键词inferenceevaluationcodefine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题使用编码代理进行自动搜索:古兰经背诵数据的泛化器和度量最大化器
信号显示现在可以让编码代理独自改进软件的分数
关键词agentalignmentevaluationcode
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题AlphaOracle :通过受人类工作流程启发的深度学习进行Oracle骨骼脚本解密
信号显示由于零碎的铭文和稀疏的证据, 4500个甲骨文( OBS )字符中约有3000个字符仍未解密
关键词workflowragretrievalalignment
代码/数据需查看原文确认
其他值得关注
Predictive Training with Latent Imagination for Visual Quadruped Navigation
中文标题使用潜在想象力进行视觉四足导航的预测训练
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Stress Testing Concept Erasure with Large Language Model Agents
中文标题使用大型语言模型代理进行压力测试概念擦除
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models
中文标题动态防御分析使文本到图像模型的认知越狱成为可能
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Time-Frequency Consistency Learning for Robust Speech Deepfake Detection
中文标题Time-Frequency Consistency Learning 面向 Robust Speech Deepfake Detection
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题RAMP :通过掩蔽和校准路径在有限的个性化功能可用性下提供强大的广告推荐
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
DA-MergeLoRA: Hypernetwork-Based LoRA Merging for Few-Shot Test-Time Domain Adaptation
中文标题DA-MergeLoRA:Hypernetwork-Based LoRA Merging 面向 Few-Shot Test-Time Domain Adaptation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs
中文标题现代VLM中强像素级图像篡改检测的简单域泛化
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Unveiling Invariant and Transferable Latent Factors Across Heterogeneous Environments via ATLAS
中文标题通过ATLAS揭示跨异构环境的不变和可转移潜伏因素
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications
中文标题FlashRT:Agent Harness 面向 Guiding Agents to Deploy Real-Time Multimodal Applications
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Pancasila-Dilemmas :评估基于Pancasila的印度尼西亚人的价值困境的大型语言模型
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Benchmarking NACTI Species Recognition in Long-Tailed Regimes
中文标题基准ing NACTI Species Recognition in Long-Tailed Regimes
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
FlashPDE: A Drop-in Fused Triton Operator Library for Neural PDE Solvers
中文标题FlashPDE:A Drop-in Fused Triton Operator Library 面向 Neural PDE Solvers
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Harness Engineering for LLM-Driven GPU Kernel Generation
中文标题LLM驱动GPU内核生成的线束工程
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Does Robust VIO Need More Learning? Geometry-Verified Visual Measurements under Distribution Shift
中文标题Robust VIO是否需要更多学习?分布位移下的几何验证视觉测量
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
A Hardware-oriented Approach for Efficient Bayesian Inference Computation and Deployment
中文标题一种面向硬件的高效贝叶斯推理计算和部署方法
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
CommitLLM: A Fine-Tuned Pipeline for Git Commit Message Generation
中文标题CommitLLM:A Fine-Tuned Pipeline 面向 Git Commit Message Generation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration
中文标题Oracle差距和信号保真度:用于测试时协作的固定池诊断
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Retrieval-Augmented Interpretable Learning: Towards Task-Specific Zero-Shot Models in Healthcare
中文标题检索-增强可解释学习:迈向医疗保健领域的任务特定零拍摄模型
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark
中文标题SpEmoC:A Balanced Speaker-Segment Multimodal Emotion 基准
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题FinSAgent:Corpus-Aligned Multi-Agent RAG 框架 面向 Evidence-Grounded SEC Filing Question Answering
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。