让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性、改进图像生成、视觉理解和可控渲染
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-07-09 论文源抓取并去重 291 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1ProjAgent:Procedural Similarity Retrieval 面向 Repository-Level Code Generation🔗
- 2SolarChain-Eval:A Physics-Constrained 基准 面向 Trustworthy Economic Agents in Decentralized Energy Markets🔗
- 3当结构化稀疏自动编码器跨模态学习一致的概念时🔗
- 4超越轮椅和眼罩:使用INCLUDE-BENCH调查T2I模型中的残疾刻板印象🔗
- 5WCog-VLA:A Dual-Level World-Cognitive Vision-Language-Action Model 面向 End-to-End Autonomous Driving🔗
- 6FedOPAL:通过分析视觉提示调整的一次性联合学习🔗
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题ProjAgent:Procedural Similarity Retrieval 面向 Repository-Level Code Generation
信号显示存储库级代码生成需要实现目标函数,同时考虑复杂的跨文件依赖关系和项目特定约定
关键词agentworkflowretrievalcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题SolarChain-Eval:A Physics-Constrained 基准 面向 Trustworthy Economic Agents in Decentralized Energy Markets
信号显示随着代理人工智能系统越来越多地应用于网络物理环境,其评估需要对任务绩效和可信度进行评估
关键词agentsafetyevaluationbenchmark
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题当结构化稀疏自动编码器跨模态学习一致的概念时
信号显示稀疏自编码器( SAE )通过学习大型模型中的一组稀疏潜在特征,成为机械可解释性的一种有前途的技术,每个模型都编码一个独特的概念
关键词ragalignmentcodemultimodal
代码/数据需查看原文确认
改进图像生成、视觉理解和可控渲染
中文标题超越轮椅和眼罩:使用INCLUDE-BENCH调查T2I模型中的残疾刻板印象
信号显示文本到图像( T2I )模型已被证明表现出社会偏见
关键词alignmentevaluationbenchmarkopen-source
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题WCog-VLA:A Dual-Level World-Cognitive Vision-Language-Action Model 面向 End-to-End Autonomous Driving
信号显示Vision-Language-Action (VLA)车型拥有先进的端到端自动驾驶技术
关键词agentraginferencealignment
代码/数据需查看原文确认
改进图像生成、视觉理解和可控渲染
中文标题FedOPAL :通过分析视觉提示调整的一次性联合学习
信号显示随着基础模型在边缘智能中的广泛部署,通信带宽已成为制约联合学习可扩展性的核心瓶颈
关键词deploymentalignmentbenchmarkfine-tuning
代码/数据需查看原文确认
其他值得关注
CT-CLIP Representations for Multimodal Lung Cancer Survival Prediction
中文标题CT-CLIP Representations 面向 Multimodal Lung Cancer Survival Prediction
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models
中文标题DeltaV :统一大型多模式模型中的视觉状态更新思维
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice
中文标题OmniFood-Bench:Evaluating VLMs 面向 Nutrient Reasoning 与 Personalized Health Advice
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation
中文标题开放式词汇表内窥镜组合物引用分段的属性检索
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Token-Flow Firewall: Semantic Runtime Auditing for Persistent AI Agents
中文标题令牌流防火墙:持久性AI代理的语义运行时审核
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation
中文标题FSD-VLN:Fast-Slow Dual-System Modeling 面向 Aerial Long-Horizon Vision-Language Navigation
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
XALPHA: A Memory-Driven AI Quant Researcher for Hypothesis-to-Code Alpha Discovery
中文标题XALPHA:A Memory-Driven AI Quant Researcher 面向 Hypothesis-to-Code Alpha Discovery
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Understanding Axes of Difficulty For Long Context Tasks Via PredicateLongBench
中文标题通过PredicateLongBench了解长上下文任务的难度轴
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题用于与语言模型交互中敏感数据隐私保护的多代理防火墙架构
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery
中文标题UniRef-UAV:A Multimodal 基准 面向 Universal Referring in UAV Imagery
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
MentalHospital: A Virtual Environment for Evaluating Psychiatric Clinical Encounters
中文标题精神病院:评估精神病临床遭遇的虚拟环境
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Dive Into the Implicit Biases of Low-rank Vision-language Alignment
中文标题深入了解低级别视觉-语言对齐的隐含偏见
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action
中文标题LEEVLA:Seeing What Matters in Latent Environment Evolution 面向 Vision-Language-Action
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions
中文标题计算机视觉中的持续测试时间适应:方法、基准和未来方向
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题工作负载-通过最大熵校准为因果推断保留差分私有合成数据
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
CausalDS: Benchmarking Causal Reasoning in Data-Science Agents
中文标题CausalDS:基准ing Causal Reasoning in Data-Science Agents
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
MASTE: A Multi-Agent Pipeline for Zero-Shot Aspect Sentiment Triplet Extraction
中文标题MASTE:A Multi-Agent Pipeline 面向 Zero-Shot Aspect Sentiment Triplet 抽取
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Post-Training in End-to-End Autonomous Driving
中文标题端到端自动驾驶培训后
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring
中文标题说服攻击会降低CoT监测的有效性
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Reinforcing the Generation Order of Multimodal Masked Diffusion Models
中文标题加强多模态掩蔽扩散模型的生成顺序
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。