跳到正文

翻译 / 整理 · 2026-06-15

如何成为优秀的研究者:
研究能力栈

没人真正教你研究。给你一张桌子、一个别人挑好的问题、一句模糊的指令——做出点新东西。于是大多数人只能从他们能看到的东西(论文、推文、发布通告)里反向工程这份工作,结果他们真正学会的,是怎么“看起来像个研究者”,而不是怎么成为研究者。

研究不是一种身份,而是一组可以训练的小技能。

原帖:@itsreallyvivek · 2026-06-10 8 章节完整翻译 11 张资料卡 7 个交互组件
开始看能力栈 ↓

Skill Stack Map · 能力栈地图

8 层能力,从下读到上是一个完整周期

点击任一层跳到对应章节。

  1. 01 自选问题 Pick your own problems
  2. 02 输入升级 Upgrade your inputs
  3. 03 研究品味 Taste
  4. 04 写作校准 Writing
  5. 05 实验循环 Tighten the loop
  6. 06 输出观察 Stare at outputs
  7. 07 跨领域游荡 Wander on purpose
  8. 08 研究共同体 Find your people

颜色 ≠ 排序;每层都同等重要。它们之间不是金字塔,更像乐高:换序、缺一块都会塌。

Full Translation · 完整中文译文

8 个章节,一字未删

保留原帖段落结构与节奏。专有名词保留英文以便溯源。

CHAPTER 01

选择你自己的问题

在贝尔实验室,Richard Hamming 有一个习惯让他在午餐时不受欢迎——他会问坐在他旁边的人:“你这个领域最重要的问题是什么?”然后再问:“你为什么不在做它?”人们于是换桌子。这个问题刺人,是因为我们大多数人都没有好答案。我们并不挑选问题,我们只是吸收它们——从导师那里,从某个大实验室上个季度宣布的方向,从这周所有人都在引用的那篇论文。

一个“被吸收来的问题”麻烦在于:你拿到了结论,却没拿到论证过程。你知道某著名实验室在意某个方向,却不知道为什么,他们预期会找到什么,又会因为什么而放弃它。当他们转向时,你一年后才后知后觉。而在已经时髦的问题上,你是在和一千个比你起步更早、算力更多的人赛跑。

John Schulman 的《机器学习研究指南》把研究分成两种模式:一种是你读文献然后寻找可以改进的地方;另一种是你选一个你真心想让它存在的目标,然后倒推回去设计实验。他主张后者,而其中沉默的理由是——后者会“制造”原创性。一个你真正在意的目标,会把你拖进任何综述论文都覆盖不到的领域。

至于“品味”,人们常把它讨论成一种天赋。它其实更像一块肌肉:在跑实验之前先预测结果;把论文结果部分盖住,只看方法猜数字;标记本月发布的成果里哪些两年后还重要,然后过一段时间核对你的命中率。一个预测加一次修正,重复几百次——这正是每一个优秀模型被训练出来的方式,包括你脑子里那一个。

CHAPTER 02

升级你的输入

共享的阅读清单会生产共享的想法。如果你的信息食谱只有 arxiv 的 trending 页,加上群聊筛选后剩下来的东西,你必然会与所有人同时得出相同的结论——而这也让这些结论差不多一文不值。

旧材料的估值低得离谱。这个领域在不断重复自己的过去:Mixture of Experts 可以追溯到 1991 年,LSTM 追溯到 1997 年,反向传播在 1986 年就已主流化。Rich Sutton 在 2019 年只用大约一千字写出《苦涩的教训》,它对这个领域未来形态的预测比十倍长度的综述还准。Claude Shannon 在 1952 年做了一场关于创造性思维的演讲,开场动作是:把问题缩小到近乎 trivial,搞定这个最小版本,再把难度一点点加回去。仅这一招,比任何现代生产力建议都能带你穿过更多墙壁。

广度与深度同样重要。可解释性神经科学上是毫不客气地借用过来的;评测设计是披着白大褂的机制设计;懂一点 GPU 到底怎么搬内存,能让你在基准跑出来之前就看出哪些架构论文注定失败。而诚实的统计学,可能是机器学习里最稀缺的技能——这里很多“严谨”是带误差棒的氛围。

还有一件事:去读论文本身,而不是读别人总结它的推文。附录才是埋尸体的位置,而 Limitations 那一节通常是一篇论文里最诚实的一段。

CHAPTER 03

把所有东西写下来

Paul Graham 指出:一个想法在落到字面上之前,常常感觉已经完全成形。纸面会找到你脑子里糊过去的空隙:你从未检验的假设、其实不成立的那一步、悄悄互相矛盾的两条断言。

Feynman 的法则是:第一个你不能骗的人是你自己,因为你是最容易的靶子。写作是迄今最便宜的防御。Darwin 把它做成流程化:任何与他的理论相左的事实,必须当场记下来——因为他已经发现自己的记忆会删除不方便的证据,速度远快于删除方便的证据。你的记忆对你的失败实验也是这么干的。保持一份日志:假设、设置、预期、结果、修正后的判断。一个月后重读自己写的东西,那种谦卑,是任何审稿人都给不了的。

然后把其中一部分放到公开处。Olah 和 Carter 的《研究债》论文主张:领域会噎在没被消化的想法上,而清晰的解释本身是真正的贡献,不是什么服务性工作。今天很多在做可解释性的人,是通过可读的博客进入这个领域的,不是会议论文。一批公开写作也是你能拿出来的最强凭证——因为它是一份不可伪造的、你思维方式的小样。

CHAPTER 04

收紧反馈循环

关于 Alec Radford 的故事,几乎没有哪一段涉及一次灵感爆发——它们都关乎量。更多的运行/天、更多的错误想法被丢掉/周,一个比任何人都更新得更快的现实模型。这才是真正的比赛。研究速度,主要是你发现自己是错的速度。

这也让工具成为一等公民的研究活动。启动一次实验应该是一条命令;画图应该再一条;每个实验都要能从它的 config 复现;比较两次实验应该是几秒钟的事,不是半天的考古学。Karpathy 的《训练神经网络的菜谱》里有一步,性价比高到可以回本一百次:在上规模训练前,先在单 batch 上过拟合。三十秒,半数 bug 消失。把所有东西缩小到便宜,把它们做对,再去花算力。

也请放弃“工程是研究里 junior partner”的念头。在前沿,这两个工种已经融合。能搭架子、能写 eval、能拉数据管线的那个研究者,他的假设才真的被测了。其他人都在排队等。

CHAPTER 05

凝视输出

一条下降的 loss 曲线不是分析,而是安慰。你的实验扔出来的信息远多于你实际消费的:转录文本、失败案例、分布那条奇怪的尾巴。它们中的大部分在 logs 目录里默默死去。

Karpathy 的菜谱在任何训练代码被写出来之前就启动——花几小时手抠原始数据。多数机器学习的 bug 活在数据里,且静默失败。什么也不崩,你只是得到一个平庸的模型,再配上一个关于“为什么”的错误理论。

Andrew Ng 十几年来反复教的是同一招不性感的动作:拉出一百个失败样本,全读一遍,分类成几堆,攻击最大的那一堆。它对模型有效,对 eval 也一样——一个你从未读过它转录文本的 benchmark,是一个你其实并不理解的 benchmark。一段真正奇怪行为的转录,教给你的比下一个小数点后的精度更多。

CHAPTER 06

有目的地游荡

你的第一个子领域是时机的偶然,所以把它当偶然对待。在可解释性、评测、强化学习、系统里都真待一段时间,再决定你住哪里。在这个领域的某个角落,你那份具体的“怪”会是一种不公平的优势,而定位它的唯一方法,是先去几个地方交学费。没人会免你的学费。

先跑每个想法的“一次性”版本,让它们大多数年轻时就死掉。把你的基线调到痛,因为机器学习的坟场里,充满了对调好的基线就蒸发了的“提升”,而审稿人是你最不该从那里学到这一点的人。消融到你知道是哪个组件在扛结果——通常是一个,而且通常不是标题里那一个。

广度也是保险。子领域都会饱和,全部,通常就在它们在 Twitter 上达峰之后。那些在过渡期里还在持续产出的,正是早就在邻近区域里认路的人。

CHAPTER 07

找到你的人

Hamming 注意到了一个模式:谁最终做出了重要工作。关着办公室门的同事,某一年产出更多;开着门的同事,做的工作更重要——因为打扰里带的信息,是关于世界真正需要什么。你的“开着门”很可能就是一个收件箱,保持那样。

慷慨在研究里的复利无与伦比。复现一个结果,把你发现的发表出来。把为自用而写的工具放出来。用平实的语言解释很难的东西。回报是侧向到达的,几个月后,变成你无法申请的那次合作、那篇引用、或那个角色。把你半成形的想法也浮到公开处,因为在时间线上错,比在印刷品里错便宜得多。那个会告诉你“想法是烂的”的合作者,值超过一卡时算力——这种关系买不到,只能挣。

CHAPTER 08

长期游戏

Pasteur 说机遇偏爱有准备的头脑;Hamming 在这之上建了整套职业哲学:知识与生产力按利息复利。每天的边缘单独看都很琐碎——你读什么、记什么、循环多快、和谁争论——给它们几年,它们会产出从外面看像运气的职业生涯。比感觉必要的更早开始复利。未来的你,已经知道这是当时最便宜的部分。

Background Cards · 背景资料卡

文中 11 个人物 / 作品 / 方法

每张卡都点出该来源对哪一层“研究能力”有直接贡献,并标注来源核查状态。

    Richard Hamming
    已核

    贝尔实验室 / 数字通信先驱 / 图灵奖 1968

    《You and Your Research》 · 1986 演讲(贝尔实验室内部);1995 录像由 IEEE 整理发布

    核心在午餐时问同事:你这个领域最重要的问题是什么?为什么你不在做?做重要工作的能力 = 品味 + 勇气 + 努力,且会随工作环境的开放性(开门/关门办公室)而拉开差距。

    研究能力Hamming 的“重要问题”问题是文中第一节“选择你自己的问题”的直接源头;他的“开门办公室”观察是第七节“找到你的人”的源头。

    来源:https://www.cs.virginia.edu/~robins/YouAndYourResearch.html

    备注:演讲全文与录像公开可得,标题与年份可核。

    John Schulman
    需进一步核实

    OpenAI 联合创始人 / RLHF 核心作者之一

    《An Opinionated Guide to ML Research》 · 约 2023(草稿在 Schulman 个人网站流传;具体版本需进一步核实)

    核心把研究分两种模式:(1) 文献驱动,读论文找可改进点;(2) 目标驱动,先选一个你希望存在的产物,倒推实验设计。他主张后者,因为后者会“制造”原创性,把你带进综述覆盖不到的领域。

    研究能力直接对应文中第一节“目标驱动”段落;为“自选问题”提供操作上的两分法。

    来源:https://joschu.github.io/

    备注:草稿在 joschu.github.io 可达;具体修订时间与最终发表/未发表状态以原页面为准。

    Rich Sutton
    已核

    DeepMind 杰出研究科学家 / 强化学习经典教材作者

    《The Bitter Lesson》 · 2019

    核心七十年 AI 史反复教同一件事:把算力 + 可扩展方法(搜索 / 学习)放在人类先验知识之上,最终总是更有效。“苦涩”在于这条经验总被人类知识派的优雅短期方案暂时遮蔽。

    研究能力解释为什么“旧材料”在 ML 中被长期低估(MoE/LSTM/BP 都在几十年后复用),并提供“方法 vs 知识”的研究品味锚。

    来源:http://www.incompleteideas.net/IncIdeas/BitterLesson.html

    备注:短文,可全文核;字数约 1000,与原帖描述一致。

    Claude Shannon
    需进一步核实

    信息论创始人 / 图灵奖 1966

    《Creative Thinking》 · 1952(贝尔实验室 / 麻省理工演讲,1990s 整理稿流传)

    核心面对一个困难问题,先把它缩小到几乎 trivial 的版本,解决最小版本;然后再把难度一项一项加回去。化整为零再化零为整。

    研究能力这是文中第二节“升级你的输入”里直接引用的一招;也是现代 RL/ML 调试(先在小 toy 上跑通再扩规模)的方法论原型。

    来源:https://www.cs.virginia.edu/~robins/Shannon_Creative_Thinking.html

    备注:讲稿流通广,但权威整理/出版渠道较少;如需作为一手引用,建议进一步核实整理者与年份。

    Paul Graham
    已核

    Y Combinator 创始人 / 程序员与作家

    《Putting Ideas into Words》/《How to Do Great Work》 · Putting Ideas into Words 约 2012;How to Do Great Work 2023

    核心把想法落到纸上的过程会暴露你脑子里糊过去的空隙:未经检验的假设、不成立的推理、悄悄矛盾的两个断言。写作是“看清自己想法”最便宜的工具。

    研究能力对应文中第三节“把所有东西写下来”的开头段;把“写下来”从习惯升级为研究方法。

    来源:http://www.paulgraham.com/words.html

    备注:原文公开可得;与 How to Do Great Work 的写作章节相互呼应。

    Richard Feynman
    已核

    诺贝尔物理学奖 1965 / 加州理工

    《Cargo Cult Science》演讲(加州的 1974 毕业典礼) · 1974 演讲;Caltech Engineering and Science 杂志同期发表

    核心科学的完整诚实包含一种特殊的美——你必须不欺骗自己,因为你比任何人都更容易被自己骗。

    研究能力对应文中第三节 Feynman 的规则,是“把失败实验也写下来”的精神源头。

    来源:https://calteches.library.caltech.edu/51/2/CargoCult.pdf

    备注:Caltech Library 公开 PDF;演讲时间/场合与原帖描述一致。

    Charles Darwin
    二手资料

    《物种起源》作者

    达尔文笔记(私人笔记本 / Notebooks on Transmutation of Species) · 约 1836-1844

    核心凡与现有理论相左的事实,必须当场记下来——以对抗记忆对“便利证据”的偏好。

    研究能力对应文中第三节“把失败实验也记下来”的反证程序。

    来源:https://www.darwinproject.ac.uk/

    备注:原帖的“达尔文记反证”广为流传但常以二手形式引用;此处标 secondary,建议以 Darwin Correspondence Project / Cambridge 数字版笔记本为后续核实入口。

    Chris Olah & Shan Carter
    已核

    Anthropic 可解释性 / 早期 Google Brain

    《Research Debt》 · 约 2020(Distill.pub 刊出)

    核心领域会“欠”一种债:未被消化的想法。清晰的解释本身就是研究贡献,不是服务性工作。

    研究能力对应文中第三节“把一部分写公开”的论证;强调解释/可视化与实验同样是一等贡献。

    来源:https://distill.pub/2020/research-debt/

    备注:Distill 文章公开。

    Andrej Karpathy
    已核

    前 Tesla AI 总监 / 前 OpenAI 研究员 / Eureka Labs

    《A Recipe for Training Neural Networks》 · 2019 博客

    核心训练神经网络要先看数据,再训练;具体步骤包括 (a) 熟悉数据,(b) 设置端到端训练/评测/tensorboard 闭环,(c) 过拟合一个 batch,(d) 找强于随机的正则化,(e) 调参。

    研究能力对应文中第四节“过拟合一个 batch”的金科玉律;也是第五节“先看数据”的方法论。

    来源:https://karpathy.github.io/2019/04/25/recipe/

    备注:博客公开,2019 04 发布。

    Andrew Ng
    需进一步核实

    Stanford 教授 / DeepLearning.AI 创始人 / Landing AI

    《Machine Learning Yearning》/ DeepLearning.AI 错误分析材料 · 2016-2018 草稿系列(MLY)/ DeepLearning.AI 课程系列持续更新

    核心在追求提升精度前,先手动检查 100 个错例,分堆,针对最大的堆下手。这套错误分析(error analysis)程序比盲目调参更有效。

    研究能力对应文中第五节“凝视输出”的核心动作:手动分桶 → 攻击最大堆。

    来源:https://www.deeplearning.ai/resources/

    备注:MLY 草稿 PDF 多处流通;具体页码引用以最新公开版本为准。

    Alec Radford
    未核实轶事

    OpenAI 研究员(GPT-2/3、CLIP、DALL·E 论文作者之一)

    (原帖为对个人研究风格的转述,非引用具体论文) · 不适用

    核心所谓研究速度,主要是你发现自己是错的速度——更多运行/天,更多错误想法被快速丢弃/周。

    研究能力对应文中第四节“收紧反馈循环”的叙事。

    备注:原帖的 Radford 轶事广为流传但很难独立核实;本卡只用作研究速度观的代表人物,不引用具体数字或言论。需进一步核实。

Research Log · 实验日志模板

五段式记录 · 把“研究品味”练成肌肉

Darwin 程序:任何与现有理论相左的事实,必须当场记下来。下面这套模板源自文中第三节。

日志只在本机浏览器保存(localStorage),不会上传。

Taste Training · 品味训练小组件

预测 → 记录 → 复盘 → 校正

每一个研究中的好品味,都是被这套循环训出来的:

  1. 1. Predict · 预测

    实验前写下:我预期会发生什么。读论文时盖住 Results 段,猜数字。

  2. 2. Record · 记录

    把预测和结果都写下来——比记忆可靠得多(参见 Darwin)。

  3. 3. Review · 复盘

    过一段时间批量回看:哪类预测一直准?哪类系统性偏?

  4. 4. Calibrate · 校正

    把系统性的偏差写进自己的判断模型,下一次预测前先调权。

Error Bucket Demo · 错误桶示例

Andrew Ng 的核心动作:分桶 → 攻击最大堆

Andrew Ng 的核心动作:拉 100 个失败样本,全读,分类,攻击最大堆。下面是一个虚构的文本分类失败案例分桶(点击桶可高亮)。

  • 人工标注 100 条里就有 38 条与多数人不一致——你的“失败”部分是标签噪声。

  • 测试集出现训练集未覆盖的俚语、缩写、跨语言混合。

  • 少数类被多数类淹没;模型对它们学得慢。

  • 结构化抽取时 JSON 字段类型不一致;模型猜了一个相近类型。

  • 模型学到了“句子里有句号 → 正例”这种捷径。

合计 100 个失败样本 · 建议动作:先攻击占比最大的桶(这里:标签噪声),而不是一上来就调超参。

7-Day Practice Plan · 7 天研究训练计划

每天 60-90 分钟 · 7 天跑完一个最小循环

面向个人 AI / 论文 / agent 项目。每条任务 ≈ 60-90 分钟,可拆分。

Day 1

自选问题

  • 列出 3 个你目前能跑得动的问题。
  • 对每个问题写一句:它为什么重要?没有你它会缺什么?
  • 从 3 个里挑 1 个;这个选择要写下来。
Day 2

输入升级

  • 读一篇 1990 年前的经典(任意子领域)。
  • 读一篇 2020 年后的代表性论文。
  • 在两者之间用一句话建立“复用 / 重新发现”联系。
Day 3

研究品味

  • 选一篇本月 arxiv 热门,预测它的方法能否 scale。
  • 把预测写下来。
  • 两周后回看。
Day 4

写作校准

  • 把昨天那个预测用 200 字写清楚。
  • 请一位不熟该领域的朋友读,挑出 1-2 个“不成立”的地方。
  • 改。
Day 5

实验循环

  • 给当前项目写一个 1 命令启动 + 1 命令画图的脚本。
  • 把已有 config 整理成可复现的 hash 化日志。
  • 在单 batch 上做一次过拟合,验证骨架。
Day 6

输出观察

  • 拉 50 个错例,全读。
  • 用上方的错误桶 demo 给自己写一个分桶表。
  • 选定最大桶,写下明天的攻击方案。
Day 7

跨领域 + 共同体

  • 去一个不熟悉的方向读 1 篇综述。
  • 找 1 位做相关工作的人,发一条具体的、能引发讨论的反馈。
  • 公开记录本周进展(半成形也可)。

0 / 7 天已完成

Personal Takeaways · 自己的启发

把研究能力栈接到 AI 编程 / Agent 工作流

把这篇文章翻译并做成页面的同时,我自己得到的最大启发是:把研究能力栈当作 agent 项目的设计原则,而不是“研究方法论”。下面 5 条是我会马上在 agent / AI 编程项目里应用的。

  1. 每个阶段形成 design rationale

    在 agent 项目的每个阶段报告里,除了“做了什么”,还要写“为什么这样做”。研究品味离不开理由记录——下一次你/agent 决策时,理由文件就是 ground truth。

  2. 记录 why,而不只是 what

    agent 的代码改动、prompt 改动、eval 改动,默认要被记下来。失败改动尤其要记——它们是研究品味训练的语料。

  3. 让 agent 输出 modified-impact analysis

    每次要求 agent 改一段代码 / 一段文档 / 一段配置,要求它顺手输出:影响范围 / 风险点 / 验证方式。这等于把 Ng 的错误桶前置到改动阶段。

  4. 代码、文档、测试一起服务于“项目理论”

    agent 项目容易陷入“功能越来越花,理论越来越乱”。Olah-Carter 提醒:清晰解释本身是研究贡献。代码 + 文档 + 测试,应该一起让“项目是什么 / 不是什么”显形。

  5. 阶段收口时用人话复述

    每个 phase 收口时写一段 200 字的 STATE OF THE SYSTEM(用人话)——这呼应 Hamming 的“开门办公室”:把当前现实摆出来,对打扰(rebuttal)开放。

Further Reading · 资料与来源

想再深一点

  • 原帖: @itsreallyvivek, how to be good at research, 2026-06-10 — 原文为 X (Twitter) 长帖;本页面为非官方翻译/整理,仅作个人学习用,版权归原作者。
  • Richard Hamming, You and Your Research, 贝尔实验室内部演讲 (1986);录像与整理稿见 IEEE / Virginia CS 镜像。
  • John Schulman, An Opinionated Guide to ML Research, 草稿 (2023 前后, 需进一步核实具体版本)。
  • Rich Sutton, The Bitter Lesson, 2019, incompleteideas.net。
  • Claude Shannon, Creative Thinking, 1952 演讲;整理稿见 cs.virginia.edu (需进一步核实整理者与年份)。
  • Paul Graham, Putting Ideas into Words + How to Do Great Work。
  • Richard Feynman, Cargo Cult Science, 加州理工 1974 毕业典礼演讲。
  • Darwin 笔记, 二手资料为主;可从 Darwin Correspondence Project 进一步核实。
  • Chris Olah & Shan Carter, Research Debt, Distill.pub 2020。
  • Andrej Karpathy, A Recipe for Training Neural Networks, 2019 博客。
  • Andrew Ng, Machine Learning Yearning (2016-2018 草稿) + DeepLearning.AI 错误分析材料。

对未独立核实的人物/年份/具体言论,本页面已尽量标注为“需进一步核实 / secondary / 未核实轶事”;读者引用时建议二次核查。