提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-06-25 论文源抓取并去重 386 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1从幻觉到接地:通过CRISP诊断视觉空间智能🔗
- 2Empirical Software Engineering TerraProbe:A Layered-Oracle 框架 面向 Detecting Deceptive Fixes in LLM-Assisted Terra面向m🔗
- 3Retrieval-Warmed Energy-Based Reasoning:A Five-Arm Ablation Methodology 面向 Diffusion-as-Inference on Structured Reasoning Tasks🔗
- 4大型语言模型自动简历筛选中的快速注射:单次和多次注射设置🔗
- 5Do Safety Guardrails Need to Reason? LeanGuard:A Fast 与 Light Approach 面向 Robust Moderation🔗
- 6\textsc{DiARC}:Distinguishing Positive 与 Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升模型推理、规划和验证能力
中文标题从幻觉到接地:通过CRISP诊断视觉空间智能
信号显示当前的VLM评估通常将语言先验与真正的空间推理混为一谈
关键词ragalignmentevaluationcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Empirical Software Engineering TerraProbe:A Layered-Oracle 框架 面向 Detecting Deceptive Fixes in LLM-Assisted Terraform
信号显示Terraform基础架构即代码中的安全配置错误是云部署中日益增长的风险,大语言模型越来越多地被用作自动修复代理
关键词agentdeploymentevaluationcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Retrieval-Warmed Energy-Based Reasoning:A Five-Arm Ablation Methodology 面向 Diffusion-as-Inference on Structured Reasoning Tasks
信号显示热启动的扩散采样器加速迭代推断,但很少清楚流水线的哪一部分承载增益
关键词ragretrievalinferencealignment
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题大型语言模型自动简历筛选中的快速注射:单次和多次注射设置
信号显示大语言模型( LLM )越来越多地用于筛选求职者并对其进行排名,从而激励求职者战略性地操纵算法招聘系统
关键词ragevaluationcodeapi
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题Do Safety Guardrails Need to Reason? LeanGuard:A Fast 与 Light Approach 面向 Robust Moderation
信号显示为了筛选提示或回复,最近的护栏方法在发布判决之前生成思维链( CoT )
关键词raginferencesafetybenchmark
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题\textsc{DiARC}:Distinguishing Positive 与 Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models
信号显示抽象和推理语料库(ARC; ~\ citealp {chollet2019measure})包含的任务需要从有限的网格样本中总结模式并预测输出网格
关键词alignmentbenchmarkcodefine-tuning
代码/数据需查看原文确认
其他值得关注
FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision
中文标题FlameVQA :具有辐射热监控的物理接地无人机野火VQA基准
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation
中文标题UNISON :通过协同理解和生成对统一多模式模型进行基准测试
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Geometric Gradient Rectification for Safe Open-Set Semi-Supervised Learning
中文标题用于安全开放式半监督学习的几何梯度校正
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems
中文标题AgentX :走向工业推荐系统的代理驱动自我迭代
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题LCAI :使用大数据融合和检索增强生成辅助解释的生命周期评估
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP
中文标题ReasonCLIP-58M:Visually Grounded Commonsense Reasoning Supervision 面向 CLIP
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题Adversarial Diffusion Across Modalities:A Fusion Survey of Attacks,Defenses,与 评测 面向 Text,Vision,与 Vision-Language Models
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
OctoSense: Self-Supervised Learning for Multimodal Robot Perception
中文标题OctoSense:Self-Supervised Learning 面向 Multimodal Robot Perception
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Automating Potential-based Reward Shaping with Vision Language Model Guidance
中文标题通过视觉语言模型指导实现基于潜力的奖励塑造自动化
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Cascaded Multi-Granularity Pruning for On-Device LLM Inference in Industrial IoT
中文标题工业物联网中用于设备上LLM推理的级联多粒度修剪
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
The Capability Frontier: Benchmarks Miss 82% of Model Performance
中文标题能力前沿:基准错过了82%的模型性能
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
中文标题OPID:On-Policy Skill Distillation 面向 Agentic Reinforcement Learning
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题用于任意医学切片超分辨率的混合样条双前导空空间学习
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
MLFFM-SegDiff: A Multi-Level Feature Fusion Diffusion Model for Skin Lesion Segmentation
中文标题MLFFM-SegDiff:A Multi-Level Feature Fusion Diffusion Model 面向 Skin Lesion Segmentation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Autoregressive Boltzmann Generators
中文标题自回归玻尔兹曼发生器
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题通过自主体验探索和任务规划的后见之明体验利用来增强GUI代理的能力
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
See & Sniff: Learning Visuo-Olfactory Representations
中文标题观看和嗅探:学习视觉嗅觉表征
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题历史意大利语对语言模型有多令人惊讶?代币化税、理解税和简单的减免
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题SatSplatDiff:Geometry-preserving generative refinement 面向 high-fidelity satellite Gaussian Splatting
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题用真实意图铺平道路:意图感知培训改善了各种培训制度下的法学硕士安全分类
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。