让 Agent 更可靠地调用工具和复用技能、评测视频生成的时间一致性和运动真实感、提升 RAG 检索和知识库问答可靠性
今天主要跟进:让 Agent 更可靠地调用工具和复用技能、评测视频生成的时间一致性和运动真实感、提升 RAG 检索和知识库问答可靠性。
本期从 2026-07-22 论文源抓取并去重 292 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1PerfAgent:Profiler-Guided Iterative Refinement 面向 Repository-Level Code Optimization🔗
- 2LKValues:使大型语言模型与斯里兰卡社会价值观保持一致🔗
- 3并非所有补丁都是相同的:可见红外预训练的采样问题🔗
- 4小巧、免费、高效:协调开放式小语言模型,在恶意软件分析方面优于单一LLM🔗
- 5Development of an automated,reliable,与 clinically meaningful artificial intelligence (AI) tool 面向 diagnosing cardiac disease 来自 conventional cardiovascular magnetic resonance (CMR) images🔗
- 6PyroDash:具有成本效益的令牌级小型大型语言模型协作推理🔗
今天最值得跟进的方向
今天的高分论文主要指向:让 Agent 更可靠地调用工具和复用技能、评测视频生成的时间一致性和运动真实感、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
让 Agent 更可靠地调用工具和复用技能
中文标题PerfAgent:Profiler-Guided Iterative Refinement 面向 Repository-Level Code Optimization
信号显示大语言模型( LLM )代理现在在面向正确性的存储库级任务上表现良好,包括SWE-Bench问题解决和实际代码库中的功能实现
关键词agentworkflowservingbenchmark
代码/数据需查看原文确认
评测视频生成的时间一致性和运动真实感
中文标题LKValues :使大型语言模型与斯里兰卡社会价值观保持一致
信号显示大语言模型( LLM )的价值观一致性已被证明在文化上偏向于西方规范
关键词alignmentevaluationbenchmarkfine-tuning
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题并非所有补丁都是相同的:可见红外预训练的采样问题
信号显示可见红外( VIS-IR )对准是强大的多传感器感知的关键预训练任务
关键词retrievalalignmentbenchmarkcode
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题小巧、免费、高效:协调开放式小语言模型,在恶意软件分析方面优于单一LLM
信号显示恶意软件分析需要快速解读跨越文件系统、网络和流程行为的复杂引爆报告
关键词agentdeploymentbenchmarkeval
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题Development of an automated,reliable,与 clinically meaningful artificial intelligence (AI) tool 面向 diagnosing cardiac disease 来自 conventional cardiovascular magnetic resonance (CMR) images
信号显示目的:心血管磁共振( CMR )成像能够对心肌结构、功能和病理进行非侵入性评估,但需要在人工智能( AI )支持的CMR图像的解释方面拥有丰富的经验-
关键词inferencecodemultimodalopen-source
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题PyroDash :具有成本效益的令牌级小型大型语言模型协作推理
信号显示大语言模型( LLM )提供强大的推理能力,但大规模服务成本高昂,而小型语言模型( SLM )更便宜,但对困难问题的可靠性较低
关键词raginferenceservingalignment
代码/数据需查看原文确认
其他值得关注
D2VBench: Benchmarking Large Language Models with Value Dilemmas in Daily Scenarios
中文标题D2VBench :在日常场景中对具有价值困境的大型语言模型进行基准测试
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Lean-SAM2: Target-Anchored Memory and Encoder Acceleration for SAM2
中文标题精益SAM2 : SAM2的目标锚定存储器和编码器加速
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Evolving Cache Schedules for Fast Diffusion Policy Inference
中文标题Evolving Cache Schedules 面向 Fast Diffusion Policy Inference
关注理由涉及推理成本、延迟、吞吐和部署约束,可补充系统优化方向。
Interpretable Fuzzy Rule-Based Regression Extension for Ex-Fuzzy Library
中文标题Interpretable Fuzzy Rule-Based Regression Extension 面向 Ex-Fuzzy Library
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Adaptive Bayesian Online Learning via Expert Aggregation
中文标题通过专家聚合进行自适应贝叶斯在线学习
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
RIM: A Retrieval-In-Matching Framework for Cross-Domain Global Visual Localization of UAVs
中文标题RIM:A Retrieval-In-Matching 框架 面向 Cross-Domain Global Visual Localization of UAVs
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Cumsum-Composable Phase Transport for Low-Cost Streaming Keyword Spotting
中文标题用于低成本流式关键词识别的累积可组合相位传输
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
A Framework of User Experience Principles for Human-AI Agent Interaction in the Workplace
中文标题工作场所人工智能座席互动的用户体验原则框架
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Harnessing Disagreement: Detecting Correlated Agreement Blindness in Multi-Agent Triage
中文标题驾驭分歧:在多代理分类中检测相关的协议盲目性
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Efficient Clustering with Provable Guardrails for LLM Inference at Scale
中文标题使用可证明的护栏进行大规模LLM推理的高效聚类
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Edge Intelligence in Civil Aviation: Paradigms, Techniques, and Applications
中文标题民航边缘智能:范式、技术和应用
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题FMRP-LEAN:A HIPAA-Compliant AI-Augmented LIMS Architecture 面向 End-to-End Clinical Assay Workflow Optimization
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题缩小实验室到商店的差距:面向零售类人机的数据高效后期培训和体验驱动学习VLA框架
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills
中文标题OpenSkillRisk:基准ing Agent Safety When 使用 Real-World Risky Third-Party Skills
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题从受污染的检索结果中采用大型语言模型选择性证据的强化学习
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
中文标题PRO-LONG :程序化内存实现长视野推理
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training
中文标题通过冲突感知不相交参数培训进行统一预测和规划
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题当托运人成为算法时:候选人曝光、信息设计和LLM介导的货运市场的集中
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题知识蒸馏何时会造成伤害?用于低资源语言总结的可靠性感知蒸馏
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection
中文标题G-MAD:A Game-Based Data Generation 框架 面向 Multi-View RGB-T Aerial Object Detection
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。