提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-06-23 论文源抓取并去重 364 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1UniDrive:A Unified Vision-Language 与 落地 框架 面向 Interpretable Risk Underst与ing in Autonomous Driving🔗
- 2AdversaBench:具有多法官确认和跨模型可转移性的自动LLM红队🔗
- 3UniTranslator:A Unified Multi-modal 框架 面向 End-to-end In-Image Machine Translation🔗
- 4Trans面向mer-Based Language Models Across Domain Verticals:Architectures,Applications 与 Critical 评估🔗
- 5C与LE:Character-level Arabic Noise Deduplication 使用 Lightweight Encoder🔗
- 6ASALT:Adaptive State Alignment 面向 Lateral Transfer in Multi-Agent Rein面向cement Learning🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升模型推理、规划和验证能力
中文标题UniDrive:A Unified Vision-Language 与 落地 框架 面向 Interpretable Risk Understanding in Autonomous Driving
信号显示最近的多模态大语言模型( MLLM )在自动驾驶场景理解方面显示出强大的潜力,但现有方法仍面临着时间推理和空间精度之间的根本权衡
关键词safetybenchmarkcodemultimodal
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题AdversaBench :具有多法官确认和跨模型可转移性的自动LLM红队
信号显示扩展大语言模型的对抗性评估既需要一种生成硬输入的方法,也需要一种可靠的方法来确认由此产生的失败是真实的
关键词tool useragevaluationcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题UniTranslator:A Unified Multi-modal 框架 面向 End-to-end In-Image Machine Translation
信号显示图像内机器翻译( IIMT )旨在翻译图像中的场景文本,并将翻译后的文本渲染回原始区域,同时保持整体视觉外观
关键词ragservingalignmentbenchmark
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Transformer-Based Language Models Across Domain Verticals:Architectures,Applications 与 Critical 评估
信号显示基于Transformer的语言模型已成为自然语言处理的默认基础,新版本的速度使得从业者很难将持久的想法与增量公告的噪音分开
关键词retrievaldeploymentalignmentbenchmark
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题CANDLE:Character-level Arabic Noise Deduplication 使用 Lightweight Encoder
信号显示处理文本中的重复字符可能很棘手,因为它们可以代表单词的正确拼写或社交媒体帖子中常见的非正式字符扩展
关键词inferencealignmentbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题ASALT:Adaptive State Alignment 面向 Lateral Transfer in Multi-agent Reinforcement Learning
信号显示多代理强化学习(MARL)解决了培训多个代理以实现协作、竞争或混合目标的问题
关键词agentalignmentbenchmarkagents
代码/数据需查看原文确认
其他值得关注
Are We Ready For An Agent-Native Memory System?
中文标题Are We Ready 面向 An Agent-Native Memory System?
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations
中文标题使用概念注释评估稀疏自动编码器的可解释性
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题通过多代理语义重写保护隐私的RAG :在不损害上下文保真度的情况下实现机密性
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation
中文标题通过几何感知蒸馏提升文本驱动的视频分割
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
REDI-Match: Rotation-Equivariant Distillation for Efficient and Robust Dense Matching
中文标题REDI-Match:Rotation-Equivariant Distillation 面向 Efficient 与 Robust Dense Matching
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Probing the Misaligned Thinking Process of Language Models
中文标题探究语言模型的不一致思维过程
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题通过自适应准高斯采样实现对多模态大型语言模型的快速有效的长视频理解
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
DramaDirector: Geometry-Guided Short Drama Generation
中文标题DramaDireCTor :几何指导短剧生成
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Progressive Pixel-Neighborhood Deformable Cross-Attention for Multispectral Object Detection
中文标题用于多光谱目标检测的渐进像素邻域可变形交叉注意
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation
中文标题FLUX3D :具有扩散对准稀疏表示的高保真3D高斯生成
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming
中文标题BioMedVR:Confusion-Aware Mixture-of-Prompt Experts 面向 Biomedical Visual Reprogramming
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Jolia: Concept-Level Vision-Language Alignment for 3D CT Contrastive Learning
中文标题Jolia:Concept-Level Vision-Language Alignment 面向 3D CT Contrastive Learning
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题UOL@IDEM at BEA 2026 Shared Task 1:Neural Fusion 与 Feature-Rich Modeling 面向 L1-Aware Vocabulary Difficulty Prediction
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection
中文标题VistaRef:Boosting Visual Spatial Orientation Awareness 面向 Pointing-to-Object Detection
关注理由涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods
中文标题推进面向艺术的场景文本识别:数据集和方法
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
TrOCR for Medieval HTR: A Systematic Ablation Study with Cross-Dataset Validation
中文标题中世纪HTR的TrOCR :一项具有交叉数据集验证的系统消融研究
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
ActiveScope: Actively Seeking and Correcting Perception for MLLMs
中文标题ActiveScope:Actively Seeking 与 Correcting Perception 面向 MLLMs
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Navigating User Behavior toward Personalized Multimodal Generation
中文标题引导用户行为转向个性化多模式生成
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Zero-Shot Test-Time Canonicalization using Out-of-Distribution Scoring
中文标题使用分布外评分进行零拍测试时间规范化
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement
中文标题通过基于扩散的解缠结实现双分支交叉投影去偏
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。