提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、评测视频生成的时间一致性和运动真实感
今天主要跟进:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、评测视频生成的时间一致性和运动真实感。
本期从 2026-08-13 论文源抓取并去重 363 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、评测视频生成的时间一致性和运动真实感。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题Edit2TikZ :使用TikZ进行科学图形编辑的全面且具有挑战性的基准
信号显示虽然多模态大语言模型( MLLM )在视觉理解和图形代码生成方面显示出巨大的潜力,但通过代码编辑科学图形带来了更大的挑战:模型必须共同恢复视觉结构,
关键词ragevaluationbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Heterogeneity-Aware Belief Synchronization 面向 Semantic Communication in AI-Native 6G Networks
信号显示6G网络将不仅仅用作通信基础设施;相反,它们有望发展成为智能系统,其中数千个自主人工智能( AI )代理相互连接
关键词agentservingalignmentcode
代码/数据需查看原文确认
评测视频生成的时间一致性和运动真实感
中文标题情境匹配蒸馏:自回归视频蒸馏的教师因果关系
信号显示交互式自回归视频生成需要低延迟推出和精确的在线控制
关键词inferenceservinglatencyalignment
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题AmalthAI:An Open-Source Computer Vision 平台 面向 Cultural Heritage
信号显示计算机视觉( CV )和机器学习( ML )为文化遗产( CH )工件分析提供了新的工具,但CH领域专家仍然无法访问CV/ML管道,他们缺乏配置、训练或评估模型的背景
关键词inferencedeploymentcodevision-language
代码/数据需查看原文确认
评测视频生成的时间一致性和运动真实感
中文标题用于动态环境中安全机器人机械手远程操作的预测相对速度转向
信号显示远程操作的最新进展使机器人机械手能够执行灵巧的、类似人臂的动作
关键词servinglatencysafetymotion
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题从反事实估计中选择顺序干预策略的机会受限
信号显示许多运营决策是在累积资源限制下的一系列干预措施,例如在乘务员小时预算内的维护计划
关键词safetycodetrainingTraining and Post-training
代码/数据需查看原文确认
其他值得关注
中文标题超越本地准确性:受控LLM推理评估的方案级可识别性审核
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题StateBridge : LLM多Agent系统中用于潜在通信的无培训隐藏状态对齐
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Into the ORBIT for Time Series: Training Regimes for Foundation Models
中文标题进入时间序列的轨道:基础模型的训练制度
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport
中文标题CoverPrune :通过最佳传输为3D VLM进行覆盖率驱动的令牌修剪
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
LigBench: A Unified and Human-Aligned Benchmark for LLM-based Research Idea Generation
中文标题LigBench:A Unified 与 Human-Aligned 基准 面向 基于 LLM 的 Research Idea Generation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题UniTraffic-Agent :针对2026年AI城市挑战的统一交通视频推理轨道3 ,包含两项域外评估
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Incremental Evaluation and Training in Relational Deep Learning
中文标题关系深度学习中的增量评估和培训
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题RAGSieve:Self-Referenced Local Contrast 面向 Knowledge-Poison Detection in Retrieval-Augmented Generation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation
中文标题LycheeMemory V2 :通过语义段级整合为LLM代理提供高效的长期内存
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Reconcile Once,Write Anytime:A Trust-Tiered Librarian 与 a Multi-Agent Writer 面向 Drift-Free,Point-in-Time Research
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题DiCoR:Decoupled Referent Disambiguation 与 Contour Recalibration 面向 Efficient Referring Remote Sensing Image Segmentation
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Bias Mitigation in Face Recognition via Demographic-based Supervised Contrastive Learning
中文标题通过基于人口统计的监督对比学习来缓解人脸识别中的偏见
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题了解垂直联合学习中的后门漏洞:研究与实践之间的差距
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
EGRL: Edge generation-guided relation-aware learning for RNA-protein interaction prediction
中文标题EGRL:Edge generation-guided relation-aware learning 面向 RNA-protein interaction prediction
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Adaptive $k$ Nearest Neighbors Classifier via Granular Ball Computing
中文标题通过粒度球计算的自适应$ k $最近邻分类器
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Labels Are Not Endpoints: Treatment Leakage and Construct Validity in MCP Agent Security Evaluation
中文标题Labels Are Not Endpoints:Treatment Leakage 与 Construct Validity in MCP Agent Security 评测
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
The Embedder's Dilemma: LLMs Are Better, but at What Cost?
中文标题嵌入者的困境: LLM更好,但代价是什么?
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题异构视觉-语言集成,具有分歧感知排序,用于基于文本的人员异常检索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Semantic Steering 面向 Controllable Generation:Tuning-Free Concept Erasure in Multimodal Diffusion Transformers
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
PIPES: Securing Agent Perception with Provenance and Priors
中文标题PIPES:Securing Agent Perception with Provenance 与 Priors
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。