提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。
本期从 2026-06-17 论文源抓取并去重 481 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
- 1Toten:Knowledge-Based Ontological Tokenization Of Physical Quantities 与 Technical Notation In Brazilian Portuguese🔗
- 2StaminaBench:超过100个交互回合的压力测试编码代理🔗
- 3LEAP:Layer-skipping Efficiency via Adaptive Progression 面向 Vision Trans面向mer Distillation🔗
- 4一种Multi-Domain 基准 面向 Detecting AI-Generated Text-Rich Images 来自 GPT-Image-2🔗
- 5一种Technical Taxonomy of LLM Agent Communication Protocols🔗
- 6REVES:REvision 与 VErification--Augmented Training 面向 Test-Time Scaling🔗
今天最值得跟进的方向
今天的高分论文主要指向:提升 RAG 检索和知识库问答可靠性、让 Agent 更可靠地调用工具和复用技能、提升 RAG 检索和知识库问答可靠性。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升 RAG 检索和知识库问答可靠性
中文标题Toten:Knowledge-Based Ontological Tokenization Of Physical Quantities 与 Technical Notation In Brazilian Portuguese
信号显示字节对编码标记化在词汇压缩方面具有统计效率,但在语义上对结构化技术实体视而不见,将物理量、数字、单位和符号表达式分割成词汇任意子词
关键词ragcompressionevaluationbenchmark
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题StaminaBench :超过100个交互回合的压力测试编码代理
信号显示我们引入了StaminaBench ,这是一个衡量编码代理耐力的基准:他们在失败之前可以处理多少次连续交互(更改请求)
关键词agentbenchmarkcodeopen-source
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题LEAP:Layer-skipping Efficiency via Adaptive Progression 面向 Vision Transformer Distillation
信号显示具有视觉变换器( ViT )骨干的视觉基础模型( VFM ) ,如DINOv2 ,已成为对象识别和语义分割等下游任务必不可少的
关键词retrievalinferencedeploymentcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题一种Multi-Domain 基准 面向 Detecting AI-Generated Text-Rich Images 来自 GPT-Image-2
信号显示文字丰富的图片通常包含隐私敏感、交易或与决策相关的信息
关键词ragcompressionevaluationbenchmark
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题一种Technical Taxonomy of LLM Agent Communication Protocols
信号显示随着大语言模型( LLM )的进步和多智能体系统旨在克服独立智能体的局限性,强大的通信协议正成为分布式智能体网络的必不可少的基础设施
关键词agentragopen-sourceagents
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题REVES:REvision 与 VErification--Augmented Training 面向 Test-Time Scaling
信号显示通过顺序修订进行测试时间缩放已成为增强大语言模型( LLM )推理的强大范例
关键词inferencealignmentcodepost-training
代码/数据需查看原文确认
其他值得关注
Language Models as Interfaces, Not Oracles: A Hybrid LLM-ML System for Pediatric Appendicitis
中文标题Language Models as Interfaces,Not Oracles:A Hybrid LLM-ML System 面向 Pediatric Appendicitis
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
FloatDoor: Platform-Triggered Backdoors in LLMs
中文标题FloatDoor:平台-Triggered Backdoors in LLMs
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题OpenAnt:LLM-Powered Vulnerability Discovery Through Code Decomposition,Adversarial Verification,与 Dynamic Testing
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Adaptive Speech-to-Spike Encoding for Spiking Neural Networks
中文标题用于尖峰神经网络的自适应语音到尖峰编码
关注理由涉及代码智能中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Morpheus: A Morphology-Aware Neural Tokenizer and Word Embedder for Turkish
中文标题Morpheus:A Morphology-Aware Neural Tokenizer 与 Word Embedder 面向 Turkish
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
IHBench: Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows
中文标题IHBench :使用结构化工作流评估语音代理中的中断后恢复
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
DeXposure-Claw: An Agentic System for DeFi Risk Supervision
中文标题DeXposure-Claw:An Agentic System 面向 DeFi Risk Supervision
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
TurboServe: Serving Streaming Video Generation Efficiently and Economically
中文标题TurboServe:Serving Streaming Video Generation Efficiently 与 Economically
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题评分后端比池化更重要:域移位下无训练异常声音检测的系统研究
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Physics-IQ已验证
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Scaling Learning-based AEB with Massive Unlabeled Data
中文标题使用大量未标记数据扩展基于学习的AEB
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
中文标题重新思考空地协作:渐进的跨任务基准和社会化学习框架
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Skill-MAS: Evolving Meta-Skill for Automatic Multi-Agent Systems
中文标题Skill-MAS :不断发展的自动多Agent系统元技能
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Formal Verification of Learned Multi-Agent Communication Policies via Decision Tree Distillation
中文标题通过决策树蒸馏对已学习的多Agent通信策略进行正式验证
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Predicting Mergeability of Parameter-Efficient Fine-Tuning Updates
中文标题预测参数高效微调更新的可合并性
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
中文标题衡量主题覆盖、能力和认知深度方面的课程一致性:应用于CS2013和CS2023的纵向框架
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Deontic Policies for Runtime Governance of Agentic AI Systems
中文标题Deontic Policies 面向 Runtime Governance of Agentic AI Systems
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors
中文标题Reference-Driven Multi-Speaker Audio Scene Generation 来自 In-the-Wild Priors
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Confidence is Not Reliability: Rethinking MC Dropout in Brain Tumour Segmentation
中文标题信心不是可靠性:重新思考脑肿瘤分割中的MC辍学
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
DreamReasoner-8B: Block-Size Curriculum Learning for Diffusion Reasoning Models
中文标题DreamReasoner-8B:Block-Size Curriculum Learning 面向 Diffusion Reasoning Models
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。