提升代码生成、执行反馈和自动修复能力、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升代码生成、执行反馈和自动修复能力、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-08-05 论文源抓取并去重 479 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1VQ-VAD:Vector-quantized Motion Representation Learning 面向 Human-centric Video Anomaly Detection🔗
- 2Unified Planning-Learning 框架 面向 Robust UUV Navigation Under Partial Observability🔗
- 3Guideline-as-Oracle:Zero-Annotation Training of an Ophthalmic Telephone Triage Agent🔗
- 4将适应性体验重播和在线不确定性估计集成到安全的演员-批评者最佳控制中🔗
- 5RepoProbe:使用清单对架构感知存储库进行基准测试🔗
- 6稀疏直接飞行时间传感器的密集度量深度完成🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题VQ-VAD:Vector-quantized Motion Representation Learning 面向 Human-centric Video Anomaly Detection
信号显示视频异常检测( VAD )本质上具有挑战性,因为异常很少,监控镜头具有很大的视觉可变性,包括光线、视角和人体外观的变化
关键词evaluationbenchmarkcodeeval
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题Unified Planning-Learning 框架 面向 Robust UUV Navigation Under Partial Observability
信号显示本文提出了动态水下环境中无人水下航行器( UUV )导航的纯观测自主框架,该框架集成了持续占用映射、全球清理感知规划和风险感知本地控制
关键词safetyevaluationbenchmarktraining
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Guideline-as-Oracle:Zero-Annotation Training of an Ophthalmic Telephone Triage Agent
信号显示由于专家对话注释成本高昂且临床对话受隐私限制,因此很难对多轮医疗代理进行规模化监督
关键词agentinferenceservingsafety
代码/数据需查看原文确认
识别并缓解模型安全、越狱和对齐风险
中文标题将适应性体验重播和在线不确定性估计集成到安全的演员-批评者最佳控制中
信号显示安全的行为者-批评者控制通常将屏障过滤、不确定性估计和体验重放视为单独的模块,即使每个模块都会更改用于学习和控制的数据
关键词safetyevaluationbenchmarkpost-training
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题RepoProbe :使用清单对架构感知存储库进行基准测试
信号显示将大语言模型( LLM )集成到软件工程中,已将重点从函数级生成转移到存储库规模的辅助
关键词alignmentevaluationbenchmarkcode
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题稀疏直接飞行时间传感器的密集度量深度完成
信号显示直接飞行时间( dToF )传感器提供高度精确的度量深度,并且在具有挑战性的实际条件下比间接ToF系统更坚固
关键词coderoboticssynthetic dataopen-source
代码/数据需查看原文确认
其他值得关注
Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
中文标题迈向技能本土LLM :用于基准测试和培训长远推理的技能熵
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings
中文标题在隐性影响设置中,思维链监控可能不可靠
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
A GitOps-Driven Annotation Catalog for Fully Automatic Railway Operations
中文标题一种GitOps-Driven Annotation Catalog 面向 Fully Automatic Railway Operations
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion
中文标题CSGen :基于分层多模态扩散的多域曲线结构生成模型
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation
中文标题DAC-Pose:Dual-Agent Collaborative 框架 面向 Pose-Guided Human Generation
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents
中文标题当记忆说谎时: VLM代理中空间记忆失效的实证研究
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles
中文标题并非所有冗余令牌都是一样的:通过令牌角色分析可视化令牌修剪
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
MCHA: A Memory-Centric Hierarchical Architecture for Parallel-Sequential Computing
中文标题MCHA:A Memory-Centric Hierarchical Architecture 面向 Parallel-Sequential Computing
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题一种Foundational EDM2-Based Generative Model 面向 High-Resolution Synthetic Fetal Ultrasound Imaging 来自 Open Datasets
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Robust Context-Aware Detection of Malicious Instructions in Text
中文标题强大的上下文感知检测功能,可检测文本中的恶意指令
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Teaching Nemotron Greek:Mining a Corpus,Adapting Retrieval,与 落地 Generation 面向 Modern Greek across Specialist Domains
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
RepairFormer: Automated Repair of Structured Inputs Using Transformers
中文标题RepairFormer:Automated Repair of Structured Inputs 使用 Transformers
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning
中文标题梯度免疫:无效空间抵抗恶意微调
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题欧盟-人工智能法案要求下的安全关键环境短期负荷预测:德国输电网总负荷41天实时挑战的结果
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题用于铁路入侵检测和碰撞预测的6G集成感知和通信框架
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering
中文标题EgoVis 2026的首个EgoCross挑战:跨领域以自我为中心的视频问答
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs
中文标题GUARD:落地 Uncertainty 与 Ablation-Based Risk Detection 面向 Diffusion-Based VLAs
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Architectural Implications of Agentic AI Workflows
中文标题Agentic AI工作流程的架构影响
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题OmniRouting:A Semantic-Coupled Multimodal 基准 面向 Constraint-Aware Spatial Reasoning in PCB Routing
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes
中文标题预测,然后检索:从视频前缀进行跨实例未来状态检索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。