让 Agent 更可靠地调用工具和复用技能、评测视频生成的时间一致性和运动真实感、提升代码生成、执行反馈和自动修复能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、评测视频生成的时间一致性和运动真实感、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-08-27 论文源抓取并去重 399 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、评测视频生成的时间一致性和运动真实感、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题BekchiAI:Measuring,Observing,与 Controlling LLM Agents in One Click
信号显示大语言模型代理在许多步骤中进行推理、调用工具和自主行动,但他们的代理技能(正确排序工具、在依赖关系下进行规划、判断不受信任的输入以及为生成的参数提供基础)很难准确衡量
关键词agentservinglatencyevaluation
代码/数据需查看原文确认
评测视频生成的时间一致性和运动真实感
中文标题通过元学习和预训练建立健壮的神经刺激反应模型
信号显示目标:基于模型的闭环神经刺激有望用于从帕金森病到感觉恢复的治疗应用,但部署受到两个障碍的限制: 1 )预测模型,用于预测
关键词deploymentevaldatasettest
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题INTENT-AS-A-TOOL使其易于跟踪代理错位
信号显示随着大语言模型(LLM)被部署为自主代理,安全故障越来越多地涉及后续行动
关键词agentalignmentsafetycode
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题TempJAIl :针对图像到视频生成模型的临时越狱攻击
信号显示近年来,图像到视频( I2V )生成模型在主题一致性和时间一致性方面取得了显着进展,实现了高质量的视频合成
关键词inferenceservingsafetyevaluation
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题教学质量很重要:为有效的偏好学习完善教学
信号显示偏好学习使用响应对优化模型,但这些对的信息性从根本上取决于生成它们的指令
关键词alignmentbenchmarkcodedata
代码/数据需查看原文确认
评测视频生成的时间一致性和运动真实感
中文标题当隐私损害可合并性时:差异隐私下的几何感知模型合并
信号显示模型合并承诺从独立微调的任务模型构建单个多任务模型,无需访问原始任务数据
关键词servingalignmentfine-tuningrl
代码/数据需查看原文确认
其他值得关注
RuleWeaver: Benchmarking Rule-Centered Scenario Reasoning for Large Language Models
中文标题RuleWeaver:基准ing Rule-Centered Scenario Reasoning 面向 Large Language Models
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Your Voice Cloning System is Secretly a Voice Anonymizer
中文标题您的语音克隆系统是秘密的语音匿名器
关注理由涉及语音与音频中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
MedFG-VQA: Low-Frequency Memory and Graph Attention for Lightweight Medical VQA
中文标题MedFG-VQA:Low-Frequency Memory 与 Graph Attention 面向 Lightweight Medical VQA
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Multi-Image Visual Token Pruning in Large Visual Language Models
中文标题大型视觉语言模型中的多图像视觉令牌修剪
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Beyond Execution: Auditing Experimental Fidelity in LLM-Driven Scientific Research
中文标题超越执行:在LLM驱动的科学研究中审计实验保真度
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
A Unified Descriptive-Complexity Framework for Model Selection under Correlated Designs
中文标题关联设计下模型选择的统一描述复杂性框架
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题SPEAR :通过强化学习中的顺序符号对齐提取领域自适应推理骨架
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题HUG-VIS:A Multimodal 基准 面向 Human-centered Understanding 与 Generation in Visual Intelligence
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
From Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bench
中文标题从静态到动态:使用MCR-Bench对真实世界的代码审查进行基准测试
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution
中文标题RedEvoAgent :经验驱动技能进化的自动红色团队代理
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Reconstructing Humans and Objects in Interaction using Large Reconstruction Models
中文标题使用大型重建模型重建交互中的人类和物体
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题BTS-AgentBench:A Deterministic,Replayable Pipeline 来自 Read-Only Telemetry Logs to Agent 基准s
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification
中文标题更智能地验证,进一步发展:通过行为感知验证实现高效的线束演进
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题孟加拉国农村医院药物不良反应的处方安全性检查系统:可行性研究
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference
中文标题PACE:A Unified Condense-与-Extract Paradigm 面向 Fast VLM Inference
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Unsupervised Adaptation of 3D CT Foundation Models for 3D CBCT Segmentation
中文标题Unsupervised Adaptation of 3D CT Foundation Models 面向 3D CBCT Segmentation
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
SSMB: Self-Supervised Local Feature Detection under Motion Blur
中文标题SSMB :运动模糊下的自监督局部特征检测
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Parameter-Efficient pretrained-CT-to-MRI Transfer 面向 Rectal Cancer Segmentation:Performance-Calibration Trade-offs
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题Ancient-Bench:A Comprehensive Multi-millennial,Multi-medium,与 Multi-script 基准 面向 Ancient Chinese Artifact Text Recognition
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
ANTShapes Benchmarking Datasets for Event-Based Neuromorphic Object Classification
中文标题ANTShapes 基准ing Datasets 面向 Event-Based Neuromorphic Object Classification
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。