提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升模型推理、规划和验证能力、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-08-25 论文源抓取并去重 385 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1PhysMLLMs:Spatial Priors 面向 Unified Referring Segmentation 与 Grounded Reasoning of Images 与 Videos🔗
- 2为AI生成的图像质量评估搭建对抗和协作学习的桥梁🔗
- 3用于长地平线Agent线束的递归体验式工作记忆进化🔗
- 4TurboT2VA:通过分数正则化稠度蒸馏快速生成大规模文本到视频音频🔗
- 5SeisMamba:Low-Latency Single-Station Seismic Magnitude Estimation 面向 Spatially Distributed Earthquake Early Warning🔗
- 6SA-Bench:Evaluating Semantic Alignment in 基于 LLM 的 Paper Reproduction🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升模型推理、规划和验证能力、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升模型推理、规划和验证能力
中文标题PhysMLLMs:Spatial Priors 面向 Unified Referring Segmentation 与 Grounded Reasoning of Images 与 Videos
信号显示视频多模态大语言模型支持语言引导视频分割,但它们通常显示时空不一致,例如抖动、漂移和身份切换
关键词raginferenceservingalignment
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题为AI生成的图像质量评估搭建对抗和协作学习的桥梁
信号显示AI生成的图像质量评估( AIGIQA )需要对感知保真度和及时对齐进行联合推理,这两个质量维度在现有的AIGIQA模型中通常被视为独立的
关键词inferencealignmentbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题用于长地平线Agent线束的递归体验式工作记忆进化
信号显示递归自我提升( RSI )在长期任务中仍然很难实现,在这些任务中,不断增长的历史记录掩盖了任务状态和技能调用不一致
关键词agentbenchmarkcodememory
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题TurboT2VA :通过分数正则化稠度蒸馏快速生成大规模文本到视频音频
信号显示联合文本到视频-音频生成产生同步的视觉和声音内容,但大型模型的长采样轨迹和异构多模态计算使推理成本过高
关键词inferenceservingdeploymentlatency
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题SeisMamba:Low-Latency Single-Station Seismic Magnitude Estimation 面向 Spatially Distributed Earthquake Early Warning
信号显示快速地震震级估计是地震预警的核心,但许多操作系统依赖于密集的区域地震网络和区域特定的校准
关键词ragdeploymentlatencybenchmark
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题SA-Bench:Evaluating Semantic Alignment in 基于 LLM 的 Paper Reproduction
信号显示LLM代理可以生成纸质复制代码,但通常会生成科学上不忠实的实施
关键词agentragalignmentevaluation
代码/数据需查看原文确认
其他值得关注
RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges
中文标题RecurSE:Bounded Recursive Self-评测 面向 LLM Rubric Judges
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Curved Inference II: Sleeper Agent Geometry - Extending Interpretability Beyond Probes
中文标题曲线推理II :睡眠剂几何形状-将可解释性扩展到探针之外
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
GlanceWAM: Sparse Test-Time Imagination for World-Action Models
中文标题GlanceWAM:Sparse Test-Time Imagination 面向 World-Action Models
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Meta$^n$: Recursive Self-Improvement through Emergent Depth
中文标题Meta $ ^ n $ :通过紧急深度递归自我提升
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Parameter-Efficient Self-Supervised Adaptation for EEG-FM under Fixed Computational Budgets
中文标题Parameter-Efficient Self-Supervised Adaptation 面向 EEG-FM under Fixed Computational Budgets
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题“翻译中的GhAIb”又名“看不见的伤害” :在LLM仇恨言论检测中测量与“漏入乌尔都语”分数的交叉脚本安全性不一致性
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Rethinking Pre-Training and Augmentation for Zero-Shot Cross-City Object Detection
中文标题重新思考零拍摄跨城市目标检测的预训练和增强
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report
中文标题WeMM-嵌入:微信多模态嵌入技术报告
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Rules Before Oracles: Auditable, User-Configurable Argument Selection for Deliberative Polling
中文标题预言机之前的规则:可审计、用户可配置的故意轮询参数选择
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Bellman Calibration for Marginalized Importance Weighting in Offline Reinforcement Learning
中文标题Bellman Calibration 面向 Marginalized Importance Weighting in Offline Reinforcement Learning
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Strictly Causal Streaming Video Anomaly Detection with a Theoretically-Grounded State-Space Core
中文标题基于理论基础的状态空间核的严格因果流视频异常检测
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training
中文标题Game2World引擎:为世界模特训练解锁野外游戏视频
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Expectation,Backlash,Recovery,与 Excitement:How Model Releases Shape Reddit Perceptions of Conversational AI Systems
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Hierarchical Prototype-Memory Adaptation of SAM for Surgical Instrument Segmentation
中文标题用于手术器械分段的SAM的层次原型-内存适配
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题数据集稀缺性限制了多语言嵌入模型的稳健评估:斯拉夫语案例研究
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation
中文标题自我进化UI到代码生成的可视化修复上下文评分细则表
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
SQLite is Enough. Lexical, Semantic, and Hybrid Search with scrydb
中文标题SQLite就够了。使用scrydb进行词汇、语义和混合搜索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Safety-aware Model Predictive Path Integral Control with Signal Temporal Logic
中文标题具有信号时序逻辑的安全感知模型预测路径积分控制
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
RefineRank: Joint Box Refinement and Ranking for Surgical Spatio-Temporal Grounding
中文标题RefineRank:Joint Box Refinement 与 Ranking 面向 Surgical Spatio-Temporal 落地
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题机器人世界模型真的遵循行动吗?诊断和调整政策学习的行动条件生成
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。