提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-09-24 论文源抓取并去重 497 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升模型推理、规划和验证能力
中文标题SciWalker :综合运算符图和执行反馈的科学编码问题
信号显示提高大语言模型( LLM )的科学编码能力需要高质量的培训数据
关键词workflowbenchmarkcodecoding
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题用于跨供应商和版本测量模型行为的低成本测定
信号显示语言模型为人们提供建议,陪伴他们,并在他们睡觉时编写软件
关键词agentcodeopen-sourcecoding
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题不同的几何形状,冷冻重量:通过因果专家集合进行强大的异构治疗效果估计
信号显示从观察数据估计异质性治疗效果是困难的,因为最合适的诱导偏差随重叠、治疗不平衡、预后结构和样本量而变化
关键词ragevaluationbenchmarkeval
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题超越空间基准:从空间推理到导航
信号显示空间推理基准的进展是否会转化为更好的导航?
关键词inferencebenchmarkcodedataset
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题BeyondRetarget:Learning Executable Humanoid Motions Directly 来自 Monocular Video
信号显示从人类视频中学习可执行动作为仿人机器人提供了一种可扩展的解决方案,以获取演示动作
关键词raglatencyvideotemporal
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题OREO :通过动态渲染-编辑优化实现3D生成中的保真度对齐
信号显示尽管最近在3D生成方面取得了进展,但模型往往难以生成具有高视觉保真度的资产
关键词ragservingalignmentdiffusion
代码/数据需查看原文确认
其他值得关注
Industrial Anomaly Detection via Defect-Grounded Reasoning in Visual Latent Space
中文标题通过视觉潜伏空间中的缺陷接地推理进行工业异常检测
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题在嘈杂分数下的隐私和稳定性石板推荐中的解耦学习和选择
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题SPADE-DFL :通过无衍生线性化ADMM实现高效通信的去中心化联合学习
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
When Misalignment Becomes Supervision: Structured Label Noise in Supervised Synthetic CT Generation
中文标题当错位成为监督时:监督合成CT生成中的结构化标签噪声
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
WST-Graph: Topology-Preserving Wavelet Scattering Front-End for Speech Deepfake Detection
中文标题WST-Graph:Topology-Preserving Wavelet Scattering Front-End 面向 Speech Deepfake Detection
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
ArGuard Shared Task: Harmful Content Detection in Arabic Memes and LLM Prompts
中文标题ArGuard Shared Task:Harmful Content Detection in Arabic Memes 与 LLM Prompts
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Off-manifold robustness in synthesizer inversion with joint distribution flow matching
中文标题联合分布流量匹配合成器反演中的离散流形鲁棒性
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Baszta: Data-Centric Fine-Tuning of a Polish Multi-Label Safety Classifier
中文标题Baszta :波兰多标签安全分类器以数据为中心的微调
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题FounRef :具有稀疏锚点的冷冻单眼基础先验的稳健、结构保持和快速度量细化
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题通过人眼和机器眼:了解视频透视扩展现实中的视图不匹配
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Edge AI on Constrained Devices for Binary Sleep-Wake Classification in Dynamic Environments
中文标题用于动态环境中二进制睡眠唤醒分类的受约束设备上的边缘AI
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题一种Particle-Swarm-Assisted Gradient Meta-Learning Algorithm 面向 Joint Transmit Precoding 与 STAR-RIS Coefficient Optimization
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Tag-Aware Structured Text Translation: Towards a Systematic Understanding
中文标题标签感知结构化文本翻译:迈向系统化理解
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL
中文标题SLCA-GRPO :解决工具调用RL中的跨部门信用归因错误
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
FluidRain: Incompressible Rain Flow as an Attention Bias for Loop-in-Loop Video Deraining
中文标题FluidRain:Incompressible Rain Flow as an Attention Bias 面向 Loop-in-Loop Video Deraining
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Beneath the Scores: Rethinking Hallucination Evaluation for Video Understanding Models
中文标题得分下方:重新思考视频理解模型的幻觉评估
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题回到定义:通过轨迹图估计代理强化学习的步骤级优势
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题从静态个人价值观到情境化个性化: LLM的贝叶斯个性化价值观一致性
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
HelloWorld: Towards Practical Applications of Generative Driving World Models
中文标题HelloWorld:Towards Practical Applications of Generative Driving 世界模型
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
When Fancy Eviction Fails: Rethinking Cache Replacement For LLM Prefix Reuse
中文标题When Fancy Eviction Fails:Rethinking Cache Replacement 面向 LLM Prefix Reuse
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。