提升代码生成、执行反馈和自动修复能力、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能
今天主要跟进:提升代码生成、执行反馈和自动修复能力、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。
本期从 2026-09-02 论文源抓取并去重 355 篇候选论文,筛选 6 篇重点论文与 20 篇补充关注。
本期重点
今天最值得跟进的方向
今天的高分论文主要指向:提升代码生成、执行反馈和自动修复能力、提升模型推理、规划和验证能力、让 Agent 更可靠地调用工具和复用技能。下面按核心问题、方法线索、主要论点和关键词整理,便于快速判断后续跟进价值。
重点论文:核心问题、方法线索与关键词
提升代码生成、执行反馈和自动修复能力
中文标题从多鱼眼感知到全景感知:超低空无人机的视差感知机载平台
信号显示超低空无人机( UAV )需要在建筑物、植被和其他障碍物附近进行环绕视觉
关键词alignmentevaluationopen-sourceeval
代码/数据需查看原文确认
提升模型推理、规划和验证能力
中文标题H3DNAS :硬件感知ONNX原生3D点云模型压缩
信号显示在NVIDIA Jetson Orin Nano等边缘硬件上部署3D点云模型受到计算和内存预算的严重制约
关键词inferencecompressioncodememory
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题利用推理时间计算和部署支架提高评估真实性
信号显示对齐评估的一个核心障碍是评估意识:有能力的模型可以告诉他们何时正在测试而不是部署,从而削弱了安全评估可以支持的结论
关键词agentinferencedeploymentalignment
代码/数据需查看原文确认
让 Agent 更可靠地调用工具和复用技能
中文标题双层协调反思:多Agent LLM系统的博弈论方法
信号显示多代理LLM系统通常使用编排器来分解工作团队的任务,然后通过文本反思进行改进
关键词agentevaluationcodememory
代码/数据需查看原文确认
提升代码生成、执行反馈和自动修复能力
中文标题消除言语,保持活动:辅助生活中声音传感的隐私防火墙
信号显示声学传感为监控老年人的日常活动提供了一种有前途的非侵入式方法,但语音隐私问题仍然是现实世界部署的关键障碍
关键词servingdeploymentevaluationcode
代码/数据需查看原文确认
提升 RAG 检索和知识库问答可靠性
中文标题YesTrack :通过基于MLLM的Yes/No验证引用多对象跟踪
信号显示引用多对象跟踪( RMOT )旨在跟踪视频中与给定语言表达式匹配的每个实例
关键词raglatencyalignmentcode
代码/数据需查看原文确认
其他值得关注
中文标题If It Moves,Radar Knows:A Physics-Aware Radar Transformer 面向 Class-Agnostic Moving-Object Detection
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails
中文标题LLM-as-a-Judge不是神谕:为什么自我完善的代理人需要确定性的护栏
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
TAME: Temporal-Aware Mixture-of-Experts for Text-Video Retrieval
中文标题TAME:Temporal-Aware Mixture-of-Experts 面向 Text-Video Retrieval
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题Beyond Modality Harmony:Orthogonal Purification 与 Topology-Guided MoE 面向 Conflict-Aware Multimodal Recommendation
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models
中文标题多式联运大型语言模型中跨模式安全漂移的转移安全意识
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
Benchmarking RAW and RGB Restoration in Image Signal Processors
中文标题基准ing RAW 与 RGB Restoration in Image Signal Processors
关注理由涉及任务设置、指标和失效案例,可补充模型评测与回归测试。
SPADE: SPaT Attack Detection from the Connected Vehicle's Perspective
中文标题SPADE :从联网车辆的角度进行SPaT攻击检测
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Rethinking the Teacher-Student Framework for Test-Time Adaptation
中文标题重新思考教师-学生的考试时间适应框架
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题SCX路由器:使用解码器-KV分类器和真实任务本体进行流式零拍摄模型选择
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Signal or Noise? Auditing Rotation-Induced Saliency Drift in Medical and Aerial Imaging
中文标题信号或噪声?审核医疗和航空成像中的旋转诱导的显著性漂移
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题DynG-Diff:A State-Aware Dynamic Guidance Diffusion 框架 面向 Probabilistic Time Series Forecasting
关注理由涉及训练与后训练中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
Train What You Deploy: Closing the MLP Reachability Gap in Low-Rank Clone Distillation
中文标题培训您部署的内容:缩小低排名克隆蒸馏中的MLP可达性差距
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
GRADSOLVE: fast exact gradients for ODE ensembles on GPUs
中文标题GRADSOLVE:fast exact gradients 面向 ODE ensembles on GPUs
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment
中文标题SafeEvolve:Harness-Policy Co-Evolution 来自 Agent Experience 面向 Safety Alignment
关注理由涉及模型安全、护栏路由、风险分类或治理评测,可作为安全评测与治理工具链的补充线索。
ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding
中文标题ShallowStream:Index Shallow then Answer Deep 面向 Streaming Video Understanding
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
Video-Based Palm-Vein Authentication under Challenging Conditions
中文标题挑战条件下基于视频的Palm-Vein身份验证
关注理由涉及视频生成中的新任务、数据或系统线索,可作为后续跟进清单的一部分。
CodePoisonRAG: Knowledge Poisoning Attacks on Retrieval-Augmented Code Generation
中文标题CodePoisonRAG :检索增强代码生成中的知识中毒攻击
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
中文标题RVSD:Retrieval Vision Sparse Decoding 面向 Mitigating Visual Hallucinations in Large Vision-Language Models
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
CORAL: An LLM-Native Harness for Production Recommender Systems
中文标题CORAL:An LLM-Native Harness 面向 Production Recommender Systems
关注理由涉及工具调用、执行反馈和可复用能力,可作为 Agent 工作流可靠性的补充线索。
Query Rewriting for Complex Object Segmentation in 4D Gaussian Representations
中文标题四维高斯表示中复杂对象分割的查询重写
关注理由涉及检索、知识库问答与证据可靠性,可作为 RAG 评测和企业知识系统的补充线索。
阅读边界
- 自动排序会偏向有社区信号、代码信号和工程关键词的论文。
- 简报默认基于标题、摘要和公开元数据,不替代全文精读。
- 外部 API 限流或不可用时,相关信号会降级为空并在内部记录中保留说明。