方法
这个站点采用一条可验证、可复盘的轻量信息流水线:按日期从 arXiv 采集 AI 相关论文,经过去重、规则评分和模板渲染,生成每日中英双语简报。
采集范围
默认采集 arXiv 的 cs.AI、cs.CL、cs.LG、cs.CV、cs.MA、cs.IR、cs.RO、cs.SD、cs.MM、cs.HC、cs.SE、cs.DC、stat.ML、eess.AS 等 AI 相关分类。生产流程按发布日期前两天作为论文源日期,避免不同日期的数据串用。
排序信号
- 标题与摘要中的机构、会议、代码、部署、推理、Agent、RAG、安全、评测等关键词。
- arXiv 分类权重与主题分类,用于提高核心 AI 方向的可见性。
- 候选池去重与最近主题重复惩罚,降低同一论文或同质主题反复出现。
- 安全、伦理、治理相关关键词会获得额外可见性,便于跟进模型风险与治理方向。
发布节奏
GitHub Actions 按北京时间/台北时间自动运行。默认公开日期为当天,论文源日期为公开日期前两天;正式流程不静默回退到旧数据,目标日期无可用论文时应明确失败或不发布。
透明性
前端只展示轻量简报;机器可读明细、运行报告和 QA 结果保留在数据目录,便于排查抓取规模、分页、去重、日期绑定和生成状态。
局限
简报默认基于标题、摘要和公开元数据生成,不替代全文精读;arXiv 预印本不得被写成已验证结论或顶会接收事实。