Original Note

How to Read Papers(整理版) - Read

How to Read Papers(整理版)

原始资料: How to Read Papers原始教程 整理说明: 本版本结合原始笔记和可读取的原始教程重排、补全和翻译,保留常用英文术语。原文件保持不变。

内容简要概括

这篇笔记总结了一套阅读 AI research papers 的流程:先 Read Wide,用少量阅读快速建立领域 mental model;再 Read Deep,对关键论文做第一轮深入理解。核心方法是从 SOTA、survey paper、dataset paper 和 related work 入手,逐步收集问题、方法、结果和待补背景知识。阅读第一遍时不追求完全理解,先抓住论文解决的问题、解决路径和实验主结果,再把不懂的概念放入 To Understand List 集中补齐。

Read WideRead DeepSOTAAbstractSurvey PaperRelated WorkIntroductionExperimentConclusionTo Understand ListPapers with CodeGoogle ScholarmPLUGmental model

目录


1. 总体思路

读一个新领域的 AI 论文时,不要一开始就试图把单篇论文读透。更有效的顺序是先宽读,再深读:

  • Read Wide:快速浏览多个相关材料,建立对问题、数据集、代表方法、评价指标和研究趋势的初步 mental model。
  • Read Deep:挑选关键论文做第一轮深入阅读,重点理解它提出的问题、解决路径、核心实验和结论。
  • To Understand List:遇到不懂的术语、方法、指标或背景论文时先记下来,最后集中补背景知识。

第一遍读论文大概只能理解 10% 是正常的。目标不是一次读懂所有细节,而是让下一轮阅读更有方向。

2. Read Wide:先建立领域地图

Read Wide 的目标是用较低成本了解一个领域的大致轮廓:当前有哪些 benchmark、哪些方法是 SOTA、常见 dataset 是什么、survey paper 如何归纳领域,以及最新论文的 related work 如何描述研究脉络。

2.1 找 SOTA,读 abstract 并总结

可以先从 Papers with Code 或类似 leaderboard 入手,找到当前任务下较新的 SOTA 方法。读对应论文的 abstract 时,不需要马上理解每个 technical term,而是先抽取四类信息:

  • 模型的简单介绍:这是什么模型,面向什么任务或能力。
  • 解决了什么问题:它认为旧方法的主要瓶颈是什么。
  • 用了什么办法解决问题:它提出了什么结构、训练策略或关键机制。
  • 达成的最终效果:它在什么 benchmark、dataset 或任务上取得了什么结果。

以原始教程中的 mPLUG 为例,abstract summary 可以写成下面这种结构:

How To Read Papers Mplug Abstract Example

这里的重点不是把 abstract 翻译一遍,而是把摘要压缩成“模型是什么、问题是什么、方法是什么、效果是什么”。如果读到不懂的词,例如 cross-modal alignmentBLEU-4CIDErMETEORSPICE,先放进 To Understand List

2.2 读 dataset paper 的 abstract

理解 SOTA 方法之后,也要理解它们使用的 dataset。原始教程以 image captioning 为例,先看 nocapsCOCO captions

  • dataset 解决什么评测或数据覆盖问题。
  • 数据来自哪里,规模大概是什么。
  • 任务如何定义输入、输出和评估指标。
  • 这个 dataset 为什么会被当前方法反复使用。

dataset abstract 通常比方法论文更容易读,因为很多信息是自然语言描述。读 dataset paper 可以帮助判断某个 SOTA 结果到底是在什么问题设定下取得的。

![](/assets/Pasted image 20260627092451.png)

2.3 找 survey paper,读结构和未来方向

Google Scholar 上搜索领域关键词和 survey,优先找较新的 survey paper。对于一篇较长的 survey,不必从头读到尾,可以先读:

  • Figure 1:通常给出领域结构、方法分类或任务关系。
  • Contributions:看作者认为这篇 survey 的组织方式和新增价值是什么。
  • Conclusions and Future Directions:快速了解开放问题和未来趋势。

原始笔记中的 survey paper 示例总结了 image captioning 领域的结构、训练策略、评测问题和开放挑战:

![](/assets/Pasted image 20260510154536.png)

survey paper 的价值在于帮你把零散术语组织成一个领域地图,但它可能不够新,也未必完全覆盖最新 SOTA。因此 survey 适合用来建立背景,不适合直接替代近期论文。

完成 SOTA abstract 和 survey paper 之后,再回到第 1 步找到的近期论文,读它们的 related work。related work 常常会说明:

  • 领域中传统方法如何分类。
  • 旧方法各自解决了什么问题,又留下了什么限制。
  • 新方法与已有方法相比,真正的变化在哪里。
  • 哪些经典论文应该进入下一轮阅读列表。

下面这张 mPLUG 示例图混合了 abstract 总结和 related work 扩展笔记。整理时可以把前半部分当作第 2.1 节的 abstract summary,把后半部分当作 related work 的研究脉络笔记:

How To Read Papers Mplug Example 1

读 related work 时不必查清每一篇引用论文,但要记录反复出现的模型、概念和分类方式。它们通常就是后续补背景知识的入口。

3. Between Wide and Deep:形成自己的问题感

宽读之后,每个人的 notes 都会开始分化。即使读的是同一批材料,不同读者也会对不同术语、问题或方法产生兴趣。这个分化是有价值的,因为它说明你开始建立自己的 mental model。

在进入深读之前,可以先写一段领域总结:

  • 这个任务想解决什么问题。
  • 当前代表 dataset 和 benchmark 是什么。
  • 近期 SOTA 方法大概沿着什么方向改进。
  • survey paper 提到的主要挑战和 future directions 是什么。
  • 哪些概念或论文仍然不理解,需要放入 To Understand List

如果某类 SOTA 方法反复出现,例如原始教程中提到的 vision-language pre-training,可以把它标记成下一轮深读的重点。

4. Read Deep:对关键论文做第一轮深入理解

Read Deep 的目标不是一次读懂 100%,而是在已有 mental model 的基础上,逐步理解单篇关键论文的主线。第一轮阅读可以围绕 introduction、figure、experiment 和 conclusion 展开。

4.1 读 introduction,提取 problem-solution chain

先读 introduction,因为它通常比 methods 更面向一般读者。阅读时重点标出:

  • 论文要解决的核心问题。
  • 过去方案如何解决这个问题。
  • 过去方案的限制是什么。
  • 本文提出的新方案如何回应这些限制。
  • 本文声称的主要 contributions。

原始教程中用 mPLUG 的 introduction 展示了一个 problem-solution chain:论文先描述更一般的问题,再逐层收窄到本文真正解决的问题。

How To Read Papers Mplug Example 2

一个好用的做法是给不同信息使用不同 highlight 颜色,例如:

  • 黄色:problem/challenge。
  • 粉色:solution。
  • 橙色:main contribution 或与自己任务最相关的实验信息。

4.2 看 Figure 1 和关键图表

如果论文有 Figure 1 或 architecture overview,优先看它。好的图能帮助你理解:

  • 方法的输入输出是什么。
  • pipeline 或 model architecture 如何分块。
  • 本文方法与 baseline 的主要差异在哪里。
  • abstract 和 introduction 中的关键术语分别对应图中的哪一部分。

遇到 methods 部分读不懂时,不必硬啃所有公式和细节。可以先借助 figure、algorithm pseudocode 和 section headings 建立粗略结构。

4.3 选择性读 methods 和 experiments

methods 部分通常需要大量背景知识,第一轮可以只读对当前问题最有帮助的部分。读 experiments 时,优先看:

  • data setup:用了哪些 dataset,训练/测试如何划分。
  • main table of results:主要 benchmark 上比了哪些 baseline,提升在哪里。
  • 与自己问题相关的 task section。
  • 特别新颖或异常的 experiment design。

如果只关心 image captioning,就可以暂时跳过与该任务无关的结果。阅读论文时信息量很大,选择性关注是必要的。

4.4 读 conclusion,回看 abstract 和 introduction

最后读 conclusion。它往往和 abstract、introduction 有相似内容,但读到这里时,你已经对术语和方法有了更多上下文,因此会比一开始更容易理解。

完成第一轮后,可以把论文重新压缩成几句话:

  • 本文解决了什么问题。
  • 为什么这个问题重要。
  • 它相比已有方法改了什么。
  • 实验是否支持作者的主张。
  • 还有哪些概念或引用论文需要补。

5. To Understand List:集中补背景知识

阅读过程中遇到不懂的名称、指标、论文或技术细节,不要立刻打断主线。先统一加入 To Understand List,读完一轮后再集中处理。

原始笔记中的 mPLUG 示例把不懂的概念和相关引用放在一起,方便后续逐个补背景:

How To Read Papers Mplug Example 3

To Understand List 可以包含:

  • 术语:例如 self-attentioncross-attentionlayer normalization
  • 训练目标:例如 Image-Text ContrastivePrefix Language Modeling
  • 评价指标:例如 BLEUCIDErSPICE
  • 相关论文:例如 related work 中反复出现的经典方法。
  • 自己还说不清的图表、公式或实验设置。

整理这个列表时,可以把最影响理解主线的概念排在前面。不是所有背景都要马上补,先补那些会影响你复述论文核心贡献的内容。

6. Presentation Reference:讲论文时的结构提醒

下面两张图来自“论文怎么看/怎么讲”相关参考,适合作为 presentation 时的结构提醒,不属于 Read WideRead Deep 的主流程。

讲论文时,最核心的是让听众明白论文解决了什么问题,其次才是方法技术和实现细节。大领域背景和实验结果可以讲,但不要让它们淹没主线。

![](/assets/Pasted image 20260510133218.png)

如果要做 PPT,可以多用论文自带的概念图、pipeline overview 或作者综述中的结构图。讲方法时要说明输入输出、整体流程和每一步操作,而不是只堆公式或术语。

![](/assets/Pasted image 20260510133630.png)

7. 可复用模板汇总

7.1 Abstract Summary Template

读 SOTA paper 的 abstract 时,可以按这个模板做最小总结:

### <Paper / Model Name>

- Paper: <link>
- Model: <用 1 句话说明模型是什么。>
- Problem: <它要解决什么问题,旧方法的瓶颈是什么。>
- Method: <它提出什么结构、训练目标、数据策略或关键机制。>
- Result: <它在什么 dataset / benchmark / task 上达到什么效果。>
- To Understand:
  - <不懂的术语、指标、引用论文或技术细节。>

7.2 First-Pass Reading Template

对单篇论文做第一轮深读时,可以按这个顺序记录:

## <Paper Title>

### Problem-Solution Chain

- Problem 1:
- Existing Solution 1:
- Limitation:
- Proposed Solution:

### Key Figure / Pipeline

- Input:
- Output:
- Main modules:
- Difference from prior methods:

### Experiments

- Dataset:
- Baselines:
- Main result:
- Metrics to understand:

### Conclusion

- Main takeaway:
- Remaining questions:

### To Understand List

- <concept / paper / metric>