提升代码生成、执行反馈和自动修复能力、识别并缓解模型安全、越狱和对齐风险
今天主要跟进:提升代码生成、执行反馈和自动修复能力、提升代码生成、执行反馈和自动修复能力、识别并缓解模型安全、越狱和对齐风险。
本期从 2026-08-06 论文源抓取并去重 388 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、提升代码生成、执行反馈和自动修复能力、识别并缓解模型安全、越狱和对齐风险。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题What Current AI 基准s Leave Unmeasured:Modality,Search,Citations,与 Implications (面向 Safety 评测s)
信号显示大语言模型( LLM )基准评估通常用于支持有关模型安全性、可靠性和部署就绪性的声明
关键词deploymentsafetyevaluationbenchmark
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题Does Latent Context Help? A Controlled 评测 of Inverse Reinforcement Learning in Arctic Shipping
信号显示人工智能( AI )辅助导航可以帮助北极航运适应快速变化的海冰条件,但可靠的部署需要可解释且对不断变化的环境强大的奖励模型
关键词deploymentsafetyevaluationcode
代码/数据需查看原文确认
识别并缓解模型安全、越狱和对齐风险
中文标题不确定性的统一风险观点:解脱和超越代理评估的后验风险
信号显示可靠的不确定性估计在安全敏感应用中至关重要,在这些应用中,了解预测不确定性的来源至关重要
关键词alignmentsafetyevaluationbenchmark
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题异构注意力内存的运行时可观察性
信号显示现代模型不再保留纯KV缓存:潜在缓存、学习稀疏选择器和循环状态都以不同的形式承载模型的内存,并且在压缩下每个都以不同的方式失败
关键词inferenceservingcompressionmemory
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题具有显式规划和反应分解的轨迹预测统一框架
信号显示轨迹预测已转向具有明确社会建模的结构化配方
关键词agentservingbenchmarkcode
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题SCI-CLIP :以段为中心的推理与参考记忆,用于无需培训的开放式词汇段
信号显示无需培训的开放式词汇分割仍然受到缺少推理抽象的限制
关键词retrievalinferencealignmentbenchmark
代码/数据需查看原文确认
其他值得关注
CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits
中文标题CircuitSteer :通过稀疏自动编码器电路实现几何对齐的多层转向
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Align-RAG: Alignment Is All You Need for TSFM In-Context Learning
中文标题Align-RAG:Alignment Is All You Need 面向 TSFM In-Context Learning
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
PromptShield Home: Ambient Multimodal Prompt Injection Defense for Smart-Home Agents
中文标题PromptShield Home:Ambient Multimodal Prompt Injection Defense 面向 Smart-Home Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories
中文标题历史谎言:评估和改进误导性多圈历史下的工具使用
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Causal Episodic Memory for Feedback-Driven Agent Repair
中文标题Causal Episodic Memory 面向 Feedback-Driven Agent Repair
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Cautious Context Steering for Language Model Personalization
中文标题用于语言模型个性化的谨慎上下文引导
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replay
中文标题Activity Frames:Deterministic Screen-Activity Compilation 面向 Agent Memory 与 Replay
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding
中文标题循证驱动的动态视觉选择器,实现高效的长视频理解
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on
中文标题UniVVT:A Unified End-to-End 框架 面向 High-Fidelity Video Virtual Try-on
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries
中文标题SkillZip:Contract-Preserving Graph Compression 面向 可扩展 Agent Skill Libraries
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents
中文标题EcoAgent-Bench :评估预算有限的LLM代理商的经济决策
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer
中文标题RP-OPSD:Reasoning-Pivot-Guided On-Policy Self-Distillation 面向 Multilingual Reasoning Transfer
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents
中文标题为国家标准文件的规则密集型审查制定基准并加强LLM
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题生存期-IPTB :使用生存期数据估计个体治疗获益概率的基于注意力的模型
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
中文标题视觉工具使用的错觉:图像思维的因果审计
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints
中文标题在效用约束下提高合成临床基准的现实性
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
A Six-Dimensional Taxonomy of Post-Training Adaptation Techniques with Applications in AI Governance
中文标题训练后适应技术的六维分类及其在人工智能治理中的应用
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
EmoWorld: A Decoupled Affective Field for Controllable Emotional Video Generation
中文标题EmoWorld:A Decoupled Affective Field 面向 Controllable Emotional Video Generation
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
中文标题EnvACE :通过代理强化学习世界排练内化环境动态
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题使用预训练功能、数据增强和新SheetSage-A2S数据集的音频到分数转录
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。