Post

arXiv 论文分诊方法论:如何用 6 个维度 30 秒筛出一篇值得精读的论文

arXiv 论文分诊方法论:如何用 6 个维度 30 秒筛出一篇值得精读的论文

如果你在 LLM 算法/系统方向做研究,arXiv 每天新论文的数量已经多到不可能全读。但现有的筛选方式都存在问题:只看引用数对太新的论文无效,只看标题摘要会漏掉真正有工程价值的贡献,而精读一篇不相关的论文要浪费 2-3 小时。

我整理了一套适合 LLM 算法/工程方向的论文分诊(triage)方法论,核心思路是 “减法优先,加权打分”

为什么要造一套自己的方法论?

现有的论文筛选工具和指标,在 LLM 领域有两个致命问题:

  1. 引用数不是好信号。LLM 领域的论文太新了,一篇 2025 年的论文可能很有影响力但只有个位数引用。更糟的是,引用数可以被”引文农场”人为拉高。
  2. 可复现性极低。一项针对 18 篇带仓库的 LLM 论文的复现研究发现,只有 5 篇能跑起来,0 篇完全复现。这意味着只看论文本身是不够的,必须评估代码和数据质量。

所以这套方法论不依赖绝对引用数,而是用一组你在 30 秒内就能检查的代理信号来做判断。

第一步:硬门禁(减法优先)

在看到具体的打分维度之前,先做三个减法。任何一个不通过,直接跳过,不浪费打分时间:

  1. 真相关? 关键词命中不等于相关。一篇 LLM 论文可能讲的是算法、系统、评测、应用——先确认它匹配你当前的问题,而不是泛泛的”跟 LLM 沾边”。
  2. 贡献还是报告? “我们试了 GPT-4 做 X” 是报告型论文,”我们提出了一种新方法 Y” 才是贡献型。除非 X 恰好是你的应用领域,否则报告型论文直接跳过。
  3. 可证伪? 有实验吗?有基线吗?如果是一篇立场文章(position paper),没有实验支撑,那么对于工程导向的精读来说,跳过。

第二步:加权评分卡(100 分制,≥65 值得精读)

六个维度,每个给 0 / 0.5 / 1 分,不用太精确,取整就行。

#维度权重满分信号
1机构/作者15顶校或子领域知名作者
2代码/数据可用性20完整仓库 + 权重/数据 + 可复现文档
3影响力速度15<6 个月,已有工作真正 build on it (Highly Influential Citations)
4结果可信度20有消融 + 承认负面结果
5新颖性/杠杆15引入可复用机制/抽象,不是”+0.3 个点”
6呈现质量15高信息量架构图,自说明的图表

代码可用性(20 分)和结果可信度(20 分)权重最高。 代码权重高是因为 LLM 领域的复现危机——没有代码,你读到的方法论大概率是幻觉。结果可信度权重高是因为一篇报告了”我们尝试了 10 种配置,只有 2 种有效”的论文,比一篇只报告最好结果的论文有价值得多。

第三步:LLM 领域特色奖惩

强加分信号:

  • 标注了精确的模型版本号(gpt-4o-2024-05-13 而非 “GPT-4”),报告了 temperature 和完整 prompt → 作者认真对待可复现性
  • 报告了负面结果/失效边界 → 比只报赢的论文可信得多
  • 官方仓库被下游项目真实引用(真实 import,不只是 star)

强扣分信号:

  • 闭源模型 + 无提示词 + 无版本号 → 结果大概率不可复现
  • 刷榜:只有 SOTA 数字,没有机制,没有消融
  • “我们发现 LLM 可以做 X” 无控制实验,无量化 → 报告型,跳过

完整打分示例:DeepSeek-R1

#维度证据得分
1机构/作者DeepSeek,此前 V2/V3 已建立影响力15/15
2代码/数据开源 GRPO 算法 + 权重,训练数据未全量公开15/20
3影响力速度1 个月内已有 High Influential Citations15/15
4结果可信度AIME/GSM8K 基线 + pass@k 消融 + 冷启动消融18/20
5新颖性/杠杆GRPO 是 group-based RL 的实用变体,可迁移15/15
6呈现质量有训练流程架构图,但缺模型内部机制可视化12/15

小计 90/100,加上版本号标注 +5、负面结果报告 +5、开源仓库 +5,总分 105 → 值得精读

这套方法论的设计原则

满分不等于”完美”。 满分意味着在该维度上有明确证据,不是论文本身完美无缺。代码仓库有 README 就算 20 分满分,不需要它像 PyTorch 一样完善。

0 分不等于”不好”。 0 分意味着你无法在 30 秒内做出判断。比如你在摘要里找不到 GitHub 链接,那就是 0 分,不代表论文没有代码。

权重分布反映领域痛点。 代码可用性 20 分,影响力速度 15 分——这个分配不是随机的,它直接反映了 LLM 领域”可复现性差、论文太新”的现状。

30 秒原则。 每个维度的检查都可以在 30 秒内完成。机构看 affiliation 和通讯作者,代码看 abstract 和第一页的 GitHub 链接,影响力看 Semantic Scholar 的 Highly Influential Citations。如果超过 30 秒还判断不了,就给 0 分。

配合 paper-post 使用

这套方法论的输出是排序后的短名单,然后自动交给 paper-post 做精读——自动提取论文中的 1-3 张关键插图(架构图、核心机制、主要结果),验证图片链接,然后写一篇紧扣插图的高信息密度博文。

两个工具配合使用,完整的流程是:

arXiv 关键词搜索 → paper-triage 筛选 → paper-post 精读

局限性

这套方法论是为 LLM 算法/系统方向优化的。其他领域(比如 CV、NLP 应用、理论)的权重分布可能需要调整。另外,评分卡的”30 秒原则”意味着它会有 false negative——一篇真正好的论文可能因为代码仓库没公开、或者影响力还没传播开而被低估。这是效率取舍,不是 bug。

参考

This post is licensed under CC BY 4.0 by the author.