评测视频生成的时间一致性和运动真实感、让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力
今天主要跟进:评测视频生成的时间一致性和运动真实感、让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力。
本期从 2026-08-28 论文源抓取并去重 330 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1CultureConverse:A Multilingual Multi-turn Simulation Harness 面向 Culturally Grounded Assistance in East 与 Southeast Asia🔗
- 2Agent-O:A Semantic Agent Card 框架 面向 Interoperable 与 Governed Healthcare AI Agents🔗
- 3ZipMVS:具有压缩成本音量的多视图立体声🔗
- 4FedEHR-Agents:Federated Agentic Optimization 面向 Automated EHR Modeling🔗
- 5MaCoPlanner: LLM辅助手动编译任务规划,具有机器人工业面板操作的主动安全验证🔗
- 6Synth-JDoc:合成具有不同布局和嵌入图像的OCR日文文档图像数据集🔗
今天最值得跟进的方向
今天的高分论文主要指向:评测视频生成的时间一致性和运动真实感、让 Agent 更可靠地调用工具和复用技能、提升代码生成、执行反馈和自动修复能力。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
评测视频生成的时间一致性和运动真实感
中文标题CultureConverse:A Multilingual Multi-turn Simulation Harness 面向 Culturally Grounded Assistance in East 与 Southeast Asia
信号显示当前对大语言模型( LLM )的文化评估通常会通过MCQ将文化减少到一次性的事实回忆,未能捕捉到一个常见的用例:用户在基于文化的场景中多次寻求实际帮助
关键词safetyevaluationbenchmarkfine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题AGENT-O:A Semantic Agent Card 框架 面向 Interoperable 与 Governed Healthcare AI Agents
信号显示AGENT-O是一个模块化本体框架,定义了用于表示面向健康的AI代理系统的语义代理卡,并支持科学出版物中报告完整性的评估
关键词agentworkflowdeploymentalignment
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题ZipMVS :具有压缩成本音量的多视图立体声
信号显示多视角立体声(MVS)方法通常可从多个配准的RGB图像中提供高度精确的3D重建,这要归功于它们之间高度信息化的几何约束
关键词servingdeploymentcompressioncode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题FedEHR-Agents:Federated Agentic Optimization 面向 Automated EHR Modeling
信号显示大语言模型的最新进展使自主临床代理能够执行日益复杂的电子健康记录( EHR )建模工作流程
关键词agentworkflowservingevaluation
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题MaCoPlanner : LLM辅助手动编译任务规划,具有机器人工业面板操作的主动安全验证
信号显示机器人工业面板操作不仅需要精确的控制定位,还需要遵守分布在异构手册中的操作规程、安全规则和设备状态约束
关键词deploymentsafetyevaluationexecution
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题Synth-JDoc :合成具有不同布局和嵌入图像的OCR日文文档图像数据集
信号显示大视觉语言模型( LVLM )读取文档图像中的文本的能力至关重要,因为它支持各种应用程序,如文档视觉问答
关键词ragevaluationcodesynthetic data
代码/数据需查看原文确认
其他值得关注
中文标题具有原型锚定校准的双流语义引导,用于视觉语言模型的完全无源适应
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题属性令牌算法:可视化自回归模型的解缠和连续语义控制
关注理由涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
QUORUM: QUality-Optimized Routing Using Multiple annotators
中文标题QUORUM:QUality-Optimized Routing 使用 Multiple annotators
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Information-Guided Selective Modality-Interest Alignment for Multimodal Recommendation
中文标题多式联运建议的信息引导选择性模式-利益一致性
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Cross-Session Decomposition Attacks: Scaling Risk and Intent-Aligned Retrieval Defense
中文标题跨会话分解攻击:扩展风险和意图一致的检索防御
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题基于深度学习的涡扇发动机剩余使用寿命预测堆栈集成框架
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
ITER: Interaction-Aware Retrieval for Agentic Search
中文标题ITER:Interaction-Aware Retrieval 面向 Agentic Search
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题使用自监督语音表示进行强制校准评估的音素和单词级别指标
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
COVER: Identifiable Evaluation of Coalition Routing
中文标题封面:联盟路线的可识别评估
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ARC-CT: Anatomy-Routed Contrastive Vision-Language Learning for 3D Chest CT
中文标题ARC-CT:Anatomy-Routed Contrastive Vision-Language Learning 面向 3D Chest CT
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Fidelity Is Not Enough: Dispatch-Level Instrumentation for Agentic Datasheet Extraction
中文标题保真度不够:用于代理数据表提取的派遣级仪器
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
GeoFF3D: Coordinate-Anchored Feed-Forward Reconstruction for Large-Scale UAV Mapping
中文标题GeoFF3D:Coordinate-Anchored Feed-Forward Reconstruction 面向 Large-Scale UAV Mapping
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Beyond Global Scalars:Synergizing Token-Level Statistics 与 Deep Semantics 面向 Adversarial AIGC Text Detection
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Anchored Scenario Coverage for Failure-Aware First-Hit Batch Inverse Design
中文标题故障感知首次命中批次反向设计的锚定场景覆盖率
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
From Perspective to Fisheye Depth Estimation and Open-Vocabulary Segmentation
中文标题从视角到鱼眼深度估计和开放式词汇分割
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
LLM-Based Agents for Software and Systems Security: Approaches, Applications, and Assessment
中文标题基于LLM的软件和系统安全代理:方法、应用和评估
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge
中文标题盲人和大象:探究长尾分歧知识下LLM的认知近视
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL
中文标题ContextPilot :通过细粒度RL进行前瞻性情境管理的教学代理
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Prompt-Guided Interactive Segmentation of Interstitial Lung Disease in Thoracic CT
中文标题胸部CT中间质性肺病的快速引导交互式分割
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
LongPIBench: A Long-Context Benchmark for Prompt Injection
中文标题LongPIBench:A Long-Context 基准 面向 Prompt Injection
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。