改进图像生成、视觉理解和可控渲染、识别并缓解模型安全、越狱和对齐风险、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:改进图像生成、视觉理解和可控渲染、识别并缓解模型安全、越狱和对齐风险、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-07-16 论文源抓取并去重 326 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:改进图像生成、视觉理解和可控渲染、识别并缓解模型安全、越狱和对齐风险、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
改进图像生成、视觉理解和可控渲染
中文标题无真实人脸的人脸识别基准测试
信号显示合成人脸数据集已经变得足够有效,可以训练人脸识别模型,其精度可与在真实照片上训练的模型相媲美
关键词servingevaluationbenchmarksynthetic data
代码/数据需查看原文确认
识别并缓解模型安全、越狱和对齐风险
中文标题无害的种子数据,潜在的意识形态:微调法学硕士的意识形态概括
信号显示在小型精选数据集上微调语言模型是使它们适应特定政策或领域的标准做法
关键词servingsafetyevaluationbenchmark
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题SEED:Self-Evolving On-Policy Distillation 面向 Agentic Reinforcement Learning
信号显示大语言模型越来越多地被训练为涉及多回合交互、工具使用和环境反馈的长期任务的交互代理
关键词agenttool useworkflowcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题人工智能与人类专家推理:基于街景图像评估构建类型学预测的协议
信号显示本研究调查了视觉语言模型(VLM)从谷歌街景(GSV)图像推断建筑类型的潜力:建筑、当前使用和楼层
关键词raginferencevision-languagevlm
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题面向可穿戴设备的节能低功耗心律失常检测
信号显示心血管疾病是全球死亡的主要原因,心律失常等疾病通常需要长期监测才能有效检测和诊断
关键词servingdeploymentdatabasesystems
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题停止思考,开始寻找:通过无推理对齐进行多式联运文档问答的高效培训后
信号显示高效的多模式文档问答,具有明确的视觉基础,定位支持每个答案的精确文档区域仍然是一个开放的挑战
关键词inferencealignmentbenchmarkmultimodal
代码/数据需查看原文确认
其他值得关注
GeoDetect: Geometric Adversarial Detection for VLPs
中文标题GeoDetect:Geometric Adversarial Detection 面向 VLPs
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题使用病理学幻灯片基础模型的多教师蒸馏预训练多实例学习网络
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring
中文标题InCarEmo:A Multimodal Dataset 面向 In-Cabin Emotion Recognition 与 Driver State Monitoring
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications
中文标题Project Kaleidoscope:Contextual,Human-Aligned 评测 面向 Real-World AI Applications
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
SmartRAG: Native Graph-Based RAG for Mobile Device
中文标题SmartRAG:Native Graph-Based RAG 面向 Mobile Device
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题VIABench:A Comprehensive Video 基准 Collected 来自 Blind Individuals 面向 Visual Impairment Assistance
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
TopoAgent: A Self-Evolving Topological Agent for Multimodal Scientific Reasoning
中文标题TopoAgent:A Self-Evolving Topological Agent 面向 Multimodal Scientific Reasoning
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents
中文标题MemPoison:Uncovering Persistent Memory Threats 与 Structural Blind Spots in LLM Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Knowing You at First Glance: Inferring Apparent Personality from Faces
中文标题乍一看认识你:从面孔推断出明显的个性
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题路由天花板与域无关:代码安全漏洞检测中的结构优先注入
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题角高斯监督对比学习用于长尾心电图心律失常诊断
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Accelerating A/B-Tests with Counterfactual Estimation: Reducing Variance through Policy Overlap
中文标题使用反事实估计加速A/B测试:通过政策重叠减少差异
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Qubes OS Security in the Public Record
中文标题公共记录中的Qubes OS安全性
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
MARS: Multi-hop Adaptive Retrieval and SPARQL Generation for KGQA
中文标题MARS:Multi-hop Adaptive Retrieval 与 SPARQL Generation 面向 KGQA
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
3D Geometric Tooth Alignment Planning via Deep Reinforcement Learning
中文标题通过深度强化学习进行三维几何牙齿对中规划
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题SafeRelBench : VLM驱动的嵌入式Agent过程级安全性的空间相关感知基准
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation
中文标题VTM-Nav:Hierarchical Visual-Topological Memory 面向 Cross-Episode Object-Goal Navigation
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence
中文标题VLT:A Vision-Language-Time Series Multimodal Foundation Model 面向 Industrial Intelligence
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
LLM Evaluators are Biased across Languages
中文标题LLM评估者在语言方面存在偏见
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
SceneBind: Binding What and Where Across Vision, Audio and Language
中文标题SceneBind:Binding What 与 Where Across Vision,Audio 与 Language
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。