评测视频生成的时间一致性和运动真实感、提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:评测视频生成的时间一致性和运动真实感、提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-09-10 论文源抓取并去重 100 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:评测视频生成的时间一致性和运动真实感、提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
评测视频生成的时间一致性和运动真实感
中文标题Biology-in-the-loop : CRISPR筛选中的摊销自适应命中发现
信号显示许多生物学发现问题需要在有限的预算下按顺序选择实验
关键词evaluationbenchmarkpost-trainingeval
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题Last AI Built by Humans:面向 Genuine Recursive Self-Improvement
信号显示递归自我改进( RSI )使人工智能系统能够将经验和反馈转化为持续的变化,从而提高其能力和未来改进的过程
关键词searchindexragRetrieval and RAG
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题基于学习Agent的整体车辆性能模型预测控制
信号显示基于代理的模型预测控制( AMPC )最近被提出为与所有代理协作以实现最佳整体性能的分布式方案
关键词agentragsafetyagents
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题截断噪声最佳响应算法:向具有安全保障的游戏理论学习迈进
信号显示我们考虑博弈论方法来解决具有子模块化最大化目标的多智能体协调问题
关键词agentsafetyagentsAgents and Tool Use
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题为什么训练后量化有效?
信号显示训练后量化通过以降低的精度存储其权重来压缩大语言模型( LLM ) ,并且每个量化权重将误差引入隐藏状态
关键词post-trainingtrainingTraining and Post-training
代码/数据需查看原文确认
跟进其他中的高分研究线索
中文标题基于分布式核的鲁棒梯度下降算法的泛化分析
信号显示在本文中,我们研究了分布式梯度下降算法在鲁棒损失函数$ l_σ $下的再现核希尔伯特空间中的泛化性能
关键词other
代码/数据需查看原文确认
其他值得关注
中文标题Beyond Word Error Rate:A Switch Aware 评测 of ASR 与 Audio Language Models on English Yoruba Code-Switched Speech
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Structured Transforms for Low-Overhead Quantization of Language Models
中文标题语言模型低开销量化的结构化变换
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Multimodal Taxonomic Conditioning for Generative Plankton Imagery
中文标题生成浮游生物图像的多模态分类调节
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Learnware and AI Model Management System
中文标题Learnware 与 AI Model Management System
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Self-Supervised Cardiac Phase Detection via Single-Parameter Latent Orbits
中文标题通过单参数潜伏轨道进行自我监督的心脏相位检测
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
ZipCodec: Ultra-Low-Frame-Rate Streaming Speech Coding
中文标题ZipCodec :超低帧率流式语音编码
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题GPU-CFR :通过将游戏编译为静态数据流和CUDA图重放,将反事实遗憾最小化80倍
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
CausalArena: Benchmarking Causal Discovery in the Foundation Model Era
中文标题CausalArena :基础模型时代的因果发现基准
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Nuha-Speech: Building General-Purpose Arabic Speech-LLMs
中文标题Nuha-Speech :构建通用阿拉伯语语音LLM
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
CoRA-NAS: Coarse Ranking and Anchor-Residual Refinement for Neural Architecture Search
中文标题CoRA-NAS:Coarse Ranking 与 Anchor-Residual Refinement 面向 Neural Architecture Search
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
On the Regularization Landscape for the Linear Recommendation Models
中文标题关于线性推荐模型的正则化景观
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Evaluating Time-Series Foundation Models and Multimodal Dietary Context for CGM Forecasting
中文标题Evaluating Time-Series Foundation Models 与 Multimodal Dietary Context 面向 CGM Forecasting
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Augustinian BabyLM: What Ostensive Definition Can and Cannot Teach a Small Language Model
中文标题Augustinian BabyLM:What Ostensive Definition Can 与 Cannot Teach a Small Language Model
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Epistemic orientation predicts legislative effectiveness among members of the US Congress
中文标题认知取向预测美国国会议员的立法有效性
关注理由涉及语音与音频中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
IndicTriMix: Developing Language Identification Datasets and Models for Tri-Language Code-Mixing
中文标题IndicTriMix:Developing Language Identification Datasets 与 Models 面向 Tri-Language Code-Mixing
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题循环流思考
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题基于低语的语音转录来自跨多种语言的视频,以促进跨文化理解
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
The widening evaluation gap in medical large language model research 2023 to 2026
中文标题2023年至2026年医学大型语言模型研究中不断扩大的评估差距
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Sparsity Regularized and Robust Mean Variance Portfolio Selection Under Ellipsoidal Uncertainty
中文标题椭球不确定性下的稀疏正则化和稳健均值方差投资组合选择
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
ORCH: Organizational Principles Enable Collective Intelligence in Embodied AI
中文标题ORCH :组织原则在具体的人工智能中实现集体智能
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。