让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性、提升模型推理、规划和验证能力
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-08-17 论文源抓取并去重 402 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1GEO-Flag:Detecting 与 Measuring GEO-Optimized Web Content🔗
- 2轨道规划师:建立在轨避障卫星代理的潜在世界模型🔗
- 3SIGMA-Lane:Scale-pyramId Gated MAmba 面向 Temporally Consistent Video Lane Detection🔗
- 4回答前查看:视觉语言模型的无培训视觉层分析🔗
- 5PixRestore:通过像素扩散变压器进行统一图像恢复🔗
- 6Think Inside the Chunk:RegulaRAG 面向 Regulation-Compliant Scenario Generation 使用 LLMs:A Case Study of UN Regulation No. 152🔗
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题GEO-Flag:Detecting 与 Measuring GEO-Optimized Web Content
信号显示生成引擎优化( GEO )修改网络内容,以增加其被生成搜索引擎选择和引用的可能性
关键词agentretrievalevaluationbenchmark
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题轨道规划师:建立在轨避障卫星代理的潜在世界模型
信号显示用于在轨导航任务的卫星代理需要使用有限的机载观测来预测碰撞风险
关键词agentcodeagentsAgents and Tool Use
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题SIGMA-Lane:Scale-pyramId Gated MAmba 面向 Temporally Consistent Video Lane Detection
信号显示视频车道检测需要跨帧保持稳定的预测,但严重的车辆堵塞可能会破坏时间线索
关键词retrievalalignmentmemoryvideo
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题回答前查看:视觉语言模型的无培训视觉层分析
信号显示LLaVA风格的视觉语言模型( VLM )将视觉令牌从视觉骨干的固定后层(通常是倒数第二层)传递到语言模型
关键词raginferencealignmentbenchmark
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题PixRestore :通过像素扩散变压器进行统一图像恢复
信号显示统一图像恢复( UIR )旨在使用单个模型从具有不同降解的低质量( LQ )图像中恢复高质量( HQ )内容
关键词raginferenceservingbenchmark
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题Think Inside the Chunk:RegulaRAG 面向 Regulation-Compliant Scenario Generation 使用 LLMs:A Case Study of UN Regulation No. 152
信号显示生成符合法规的测试场景对于验证安全关键型汽车系统至关重要,但大语言模型( LLM )很难在冗长的分层标准中实现输出
关键词ragretrievalsafetysearch
代码/数据需查看原文确认
其他值得关注
Toward Better Assessment of LLMs' Performance in Clinical Error Detection
中文标题更好地评估LLM在临床错误检测方面的表现
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题CACSurv :使用大型语言模型进行癌症生存预测的协调对齐比较学习
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization
中文标题倾听、原因和细分:将LALM与媒体章节化的编辑判断相结合
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills
中文标题JAIlbreakSkill :利用可重复使用和不断发展的技能扩展自动红色团队
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Beyond Similarity Matching: Structured Reasoning for Open-Vocabulary Referring Segmentation in 3DGS
中文标题Beyond Similarity Matching:Structured Reasoning 面向 Open-Vocabulary Referring Segmentation in 3DGS
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Bridging the Gap between Labeled and Unlabeled Data via Unified Flow with Feature Memory Bank
中文标题通过使用功能存储库的统一流程弥合已标记和未标记数据之间的差距
关注理由涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题HarmTrace:Anchor-Calibrated Decoupled Optimization 面向 Fine-Grained Target Identification in Harmful Memes
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
MLLM-Guided Semantic Correction for Text-to-Video Generation
中文标题MLLM-Guided Semantic Correction 面向 Text-to-Video Generation
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Towards Risk-free AI Agent Deployment
中文标题迈向无风险的人工智能代理部署
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
What Does Context Compression Cost an Agent? Interaction Costs Unrevealed by Task-Completion Metrics
中文标题上下文压缩会给代理带来什么成本?任务完成指标未显示的交互成本
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Unlocking Motion in Expressions: Temporal Calibration for Referring Video Object Segmentation
中文标题解锁表达式中的运动:引用视频对象分割的时间校准
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis
中文标题基于LLM的多模态情绪分析的多粒度情绪集成
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Picking the Right Image to Classify: Reliable-Input Selection in Teledermatology
中文标题挑选合适的图像进行分类:远程皮肤科中的可靠输入选择
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
LENS: In-Context Search via Latent Evidence Exploration over Dynamic Raw Documents
中文标题LENS :通过动态原始文档的潜在证据探索进行上下文搜索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
KeyID: Decoupled Drafting and Keyframe Editing for Identity-Preserving Video Generation
中文标题KeyID:Decoupled Drafting 与 Keyframe Editing 面向 Identity-Preserving Video Generation
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Spatial Temporal Synergy: Balancing Change and Invariance in Text Driven 3D Human Motion Editing
中文标题时空协同:平衡文本驱动的三维人体运动编辑的变化和不变性
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Non-Crossing Deep Quantile Regression for Distributional Survival Prediction
中文标题用于分布生存预测的非交叉深分位回归
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题HAF :通过分层动作流和光谱潜伏RL使多面手VLA适应人形全身位置操作
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题UniDot:A Unified Network 面向 Sequence Modeling 与 Feature Interaction in Large-scale Recommendation
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Revisiting Classifier-Free Guidance Methods in Latent Diffusion Models
中文标题重新审视潜在扩散模型中的无分类器引导方法
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。