评测视频生成的时间一致性和运动真实感、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力
今天主要跟进:评测视频生成的时间一致性和运动真实感、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。
本期从 2026-09-03 论文源抓取并去重 405 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:评测视频生成的时间一致性和运动真实感、让 Agent 更可靠地调用工具和复用技能、提升模型推理、规划和验证能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
评测视频生成的时间一致性和运动真实感
中文标题RobustSeiz:An Open-Source 框架 面向 基准ing the Robustness of EEG Seizure Detection Models
信号显示尽管在保留的脑电图( EEG )数据上表现强劲,但在真实世界的采集变异性、伪影和对抗性输入下,癫痫发作检测器可能会失效
关键词deploymentevaluationbenchmarkopen-source
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题PatchBench:Evaluating AI Agents 面向 Vulnerability Patching
信号显示人工智能代理最近在自动化漏洞修补方面表现出色
关键词agentragevaluationbenchmark
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题超越浅层对齐:培训后方法如何确定拒绝电路和转向鲁棒性
信号显示用于训练语言模型以拒绝有害请求的方法如何影响拒绝在模型内的实际工作方式?
关键词ragalignmentsafetycode
代码/数据需查看原文确认
评测视频生成的时间一致性和运动真实感
中文标题IndicSafeEval :多语言有说服力的越狱攻击下大型语言模型的安全鲁棒性
信号显示大语言模型( LLM )越来越多地用于多语言环境,但其安全性仍然主要用英语进行评估
关键词alignmentsafetyevaluationbenchmark
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题通过回归定向累积量进行联合因果发现
信号显示在本文中,我们研究了在联邦环境中使用的线性非高斯非循环模型( LiNGAM )
关键词deploymentcodeCode Intelligence
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题EraseSAE :通过稀疏自动编码器实现文本到视频扩散模型中的手术概念擦除
信号显示文本到视频( T2V )扩散模型的最新进展已经证明了显着的生成能力,但它们对松散策划的培训数据的依赖引起了紧迫的安全和版权问题
关键词raginferenceservingsafety
代码/数据需查看原文确认
其他值得关注
中文标题在医疗生成模型中审核患者隐私:使用DeepSSIM + +进行可扩展的记忆检测
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
HypRQ-VAE: Hyperbolic Item Indexing for Long-Tail-Aware Generative Recommender Systems
中文标题HypRQ-VAE:Hyperbolic Item Indexing 面向 Long-Tail-Aware Generative Recommender Systems
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题基于GPU加速树的遗传编程实现符号回归的有效恒定优化
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
SciLENS: RL-Driven Autonomous Agents for Scientific Localized Evidence Navigation and Synthesis
中文标题SciLENS:RL-Driven Autonomous Agents 面向 Scientific Localized Evidence Navigation 与 Synthesis
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents
中文标题SWE-Gate:Passing Functional Tests Is Not Enough 面向 Software Engineering Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving
中文标题来自离散思维的持续行动:端到端自动驾驶的潜在一致性规划
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Interface-Induced Trajectory Censoring
中文标题界面诱导轨迹删失
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
CROCODIL: Cross-Model Code Editing with LLMs
中文标题CROCODIL :使用LLM进行跨模型代码编辑
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Semantic-Aware Subgraph State Space Model for WSI Classification in Histopathology
中文标题Semantic-Aware Subgraph State Space Model 面向 WSI Classification in Histopathology
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题通过自然语言描述图像子集之间的差异来了解自动驾驶数据集
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
SV-WAM: An Efficient Surround-View World-Action Model for End-to-End Autonomous Driving
中文标题SV-WAM:An Efficient Surround-View World-Action Model 面向 End-to-End Autonomous Driving
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
LevelSyn: Physical-Aware Logic Synthesis via Level-Asynchronous Graph Neural Networks
中文标题LevelSyn :通过水平异步图神经网络进行物理感知逻辑合成
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
中文标题随机注意:重新思考KV缓存驱逐以进行有效推理
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
中文标题Gradients Know What Outcomes Don't:Unlocking Reinforcement Learning 面向 LLM Reasoning with Gradient-Aligned Rewards
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题从语义学中解耦轮换:基于有限状态机全双工对话的解耦数据方法
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
DSAQuant: Denoising-Stage-Aligned Quantization-Aware Training for Video Generation
中文标题DSAQuant:Denoising-Stage-Aligned Quantization-Aware Training 面向 Video Generation
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Representational alignment yields generalizable safety in language models
中文标题表征对齐在语言模型中产生可推广的安全性
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis
中文标题用于语音配音和全双工对话合成的无对齐文本音频框
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Barnacle: Adaptive Multi-Leader Scheduling for DAG-Based Consensus
中文标题Barnacle:Adaptive Multi-Leader Scheduling 面向 DAG-Based Consensus
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Beyond Majority Vote: Multi-Perspective Adjudication for Medical Hallucination Detection
中文标题超越多数投票:医学幻觉检测的多视角裁定
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。