提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性
今天主要跟进:提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-08-03 论文源抓取并去重 511 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1从无人机图像评估结合先进深度学习技术进行灾后建筑物损坏评估的好处🔗
- 2使用代理线束构建荟萃分析合成的可执行分析知识表示🔗
- 3DyFrDet:通过动态频率抑制和标签消歧来实现精确的小物体检测🔗
- 4EchoCache:Energy-Guided Cross-Modal Caching 面向 Efficient Audio-Driven Video Generation🔗
- 5Antares:Foundation Models 面向 Agentic Vulnerability Localization🔗
- 6Does Explainability Transfer? A Controlled 基准 of Attribution Methods on Vision Trans面向mers 与 CNNs🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升模型推理、规划和验证能力
中文标题从无人机图像评估结合先进深度学习技术进行灾后建筑物损坏评估的好处
信号显示快速准确的灾后建筑物损坏评估至关重要,但仍是一项具有挑战性的任务
关键词benchmarkcodevision-languagefine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题使用代理线束构建荟萃分析合成的可执行分析知识表示
信号显示荟萃分析综合强调了基于知识的科学分析中的一个基本挑战:结构化证据本身并不代表可执行计算所需的分析知识
关键词agentworkflowalignmentcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题DyFrDet :通过动态频率抑制和标签消歧来实现精确的小物体检测
信号显示尽管在过去几十年中取得了显着进展,但由于视觉线索不足,准确识别小物体仍然具有挑战性
关键词ragbenchmarkcodevisual
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题EchoCache:Energy-Guided Cross-Modal Caching 面向 Efficient Audio-Driven Video Generation
信号显示音频驱动视频生成( A2V )在合成时间相干和视听对齐的视频方面取得了令人鼓舞的进展,但由于扩散模型的迭代去噪过程,其推断仍然昂贵
关键词raginferenceservinglatency
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Antares:Foundation Models 面向 Agentic Vulnerability Localization
信号显示漏洞本地化是软件安全的基本步骤,要求模型对大型代码库进行推理,并迭代识别易受攻击的实现
关键词agentinferenceevaluationcode
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题Does Explainability Transfer? A Controlled 基准 of Attribution Methods on Vision Transformers 与 CNNs
信号显示大多数关于可解释人工智能( XAI )归因方法有效性的证据都是在卷积神经网络( CNN )上建立的,对这些结论是否推广到多样化的视觉转换的研究有限
关键词evaluationbenchmarkcodeopen-source
代码/数据需查看原文确认
其他值得关注
Gecko: Fast Private Inference via Secure Public Encoder Offloading
中文标题Gecko :通过安全的公共编码器卸载进行快速私人推断
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
HarMoE: Multi-Source Chest Radiograph Pretraining with Dataset-Disentangled Experts
中文标题HarMoE :与数据集解缠专家进行多源胸片预训练
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题用于自动调制分类中初级保留认知决策校正的交叉拟合剩余效用
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Invisible Ink Threats: Adversarial Goals Behind Legitimate Tasks in Computer-Use Agents
中文标题隐形墨水威胁:计算机代理合法任务背后的对抗性目标
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Rewriting or Reweighting? A Geometric Account in Language Models
中文标题重写或重新加权?语言模型中的几何帐户
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
MemSIF: From Structured Interactions to Dual-Track Fact Memory for LLM Agents
中文标题MemSIF:来自 Structured Interactions to Dual-Track Fact Memory 面向 LLM Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Bridging Artificial Intelligence and Power Systems Education Using a Hands-On Executable Framework
中文标题使用动手可执行框架桥接人工智能和电力系统教育
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Z-PEFT :通过规范光谱特征进行参数高效微调中的零点后门检测
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Disentangled Contrastive Learning for Zero-Shot Multilingual Dense Retrieval
中文标题解开对比学习,实现零拍多语言密集检索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题SPIRIT:Spatio-temporal Pairwise Relational Modeling of Instrument-Tissue Interactions 面向 Surgical Action Triplet Recognition
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
VulnGym: Benchmarking Coding Agents for Repository-Level Vulnerability Detection
中文标题VulnGym:基准ing Coding Agents 面向 Repository-Level Vulnerability Detection
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Grounding and Explaining Visual Evidence for AI-Generated Image Detection in Human-Centric Scenes
中文标题落地 与 Explaining Visual Evidence 面向 AI-Generated Image Detection in Human-Centric Scenes
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
No One Wins in Nuclear War: A Social Simulation of Military Decision-making
中文标题没有人在核战争中获胜:军事决策的社会模拟
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题Comparative Validation of GPT-4o-mini 与 Teacher Mean Scores 面向 Automated Scoring of Music Analysis Responses:Single-Pass Deployment,Repeatability,与 Strategy-Specific Bias
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题FAIrForensics :通过视觉语言建模查看表达式和解析人口统计学,实现可泛化的公平Deepfake检测
关注理由涉及视觉与图像生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Meganeura: Portable GPU Training and Inference through Vulkan and Metal
中文标题Meganeura:Portable GPU Training 与 Inference through Vulkan 与 Metal
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning
中文标题GradCuit:Credit-Assigned Gradient Flow Enables Robust 与 Interpretable Test-Time Latent Reasoning
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题RoMeRL:Balancing Feedback Coverage 与 the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
SWE-Touch: Benchmarking Coding Agents When Users Touch the Code
中文标题SWE-Touch :用户触摸代码时对编码代理进行基准测试
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Long-term Measurements: Towards a Longitudinal Understanding of Human-AI Interactions
中文标题长期测量:对人工智能相互作用的纵向理解
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。