提升代码生成、执行反馈和自动修复能力、增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升代码生成、执行反馈和自动修复能力、增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-06-29 论文源抓取并去重 466 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、增强多模态模型理解图表和文档的能力、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题Curvature-Guided Sheaf Diffusion 面向 Unsupervised Community Detection on Heterophilic Graphs
信号显示在嗜异性图中检测社区-其中连接的节点通常属于不同的类别-对于无监督方法来说很难:经典的模块化和光谱方法是特征不可知的,而深度图聚类方法依赖于对比
关键词evaluationbenchmarkcodeopen-source
代码/数据需查看原文确认
增强多模态模型理解图表和文档的能力
中文标题RiverONE :通过模拟量子机器生成知识密集型VLM
信号显示量子计算为通过叠加、纠缠和测量引起的非线性特征来表示和转换高维信息提供了强大的范例
关键词inferencecompressioncodevision-language
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题LLM-as-a-Judge能否可靠地验证Agent场景中的评分细则表?
信号显示基于评分的评分已成为模型评估中广泛使用的范例,通常使用LLM-as-a-Judge ( LaaJ )进行评分
关键词agentevaluationbenchmarkcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题论参数级防御对模型合并的脆弱性
信号显示通过模型合并对专家模型进行无需培训的集成暴露了重大的安全风险,使搭便车的人能够在未经授权的情况下组合专业模型
关键词ragevaluationcodefine-tuning
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题内部状态探查阅读情况,而不是行动:行动前错位监测的三个负面结果
信号显示如果代理系统在生成这些操作之前识别出有害文本或工具操作,则对模型内部的探测可以帮助监控代理系统
关键词agentalignmentcodetool
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题来自野外视频的共享规范对象帧的出现
信号显示比较不同实例之间的对象方向和位置要求它们的姿势在共享的规范框架中表达
关键词alignmentbenchmarkcodevideo
代码/数据需查看原文确认
其他值得关注
BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language
中文标题BrainJanus:A Unified Model 面向 Understanding 与 Generation across Brain,Vision,与 Language
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
LETT-NeXt: A Lightweight RECIST-Guided Model for 3D CT Lesion Segmentation
中文标题LETT-NeXt:A Lightweight RECIST-Guided Model 面向 3D CT Lesion Segmentation
关注理由涉及多模态模型中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
IHDec: Divergence-Steered Contrastive Decoding for Securing Multi-Turn Instruction Hierarchies
中文标题IHDec:Divergence-Steered Contrastive Decoding 面向 Securing Multi-Turn Instruction Hierarchies
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Redefining Maritime Anomaly Detection via Equation-Grounded Synthetic Anomalies
中文标题通过基于方程的合成异常重新定义海事异常检测
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题利用规划器在环反馈,实现大型语言模型安全可靠的PDDL形式化
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
SA-Homo: Scale Adaptive Homography Estimation for Scale Variation Scenarios
中文标题SA-Homo:Scale Adaptive Homography Estimation 面向 Scale Variation Scenarios
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning
中文标题DAIN:Dynamic Agent-Based Interaction Network 面向 Efficient 与 Collaborative Multimodal Reasoning
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Diagnosing and Mitigating Retrieval Bottlenecks in LLM-Based Cold-Start Recommendation
中文标题诊断和缓解基于LLM的冷启动建议中的检索瓶颈
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Timesteps of Mamba Align with Human Reading Times
中文标题曼巴舞的时间步伐与人类阅读时间保持一致
关注理由涉及数据工程中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Experience Graphs: The Data Foundation for Self-Improving Agents
中文标题体验图表:自我完善代理的数据基础
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题UrbanCDNet:Appearance-Robust 与 Boundary-Aware Bitemporal Change Detection 面向 Korean Urban Building Monitoring
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
AerialMetric: Benchmarking and Adapting UAV Monocular Metric Depth Estimation in the Real World
中文标题AerialMetric :在现实世界中对无人机单目测深估计进行基准测试和自适应
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
中文标题LeVo 2 :通过分层表示建模和渐进式后训练生成稳定而悦耳的歌曲
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
中文标题扩展视野,而不是参数:使用35B代理实现万亿参数性能
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
中文标题C $ ^ {2} $ R :跨样本一致性正则化减轻了稀疏自动编码器中的特征分裂和吸收
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
MESA: Prioritizing Vulnerable Communication Channels for Securing Multi-Agent Systems
中文标题MESA :优先考虑易受攻击的通信渠道,以确保多Agent系统的安全
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
The Human Creativity Benchmark
中文标题人类创造力基准
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
TraceLab: Characterizing Coding Agent Workloads for LLM Serving
中文标题TraceLab:Characterizing Coding Agent Workloads 面向 LLM Serving
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing
中文标题语言防火墙:几何作为多Agent系统路由中的防御
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision
中文标题通过密集的体验式思维链监督训练视觉-语言-行动模型
关注理由涉及推理与规划中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。