LLM 最有效的用法是作为协作者,来扩展你的搜索、批判与执行能力——而不是用来替代理解或判断。最强的模式是:给模型足够的发挥空间,提供优质的上下文,然后批判性地审视其输出。
给予模型充分的自主权,然后再分析
对于雄心勃勃、开放式的任务,像 Fable 和 Sol 这类前沿模型往往比那些逐步规定的指令更有效。说明目标、相关约束以及成功标准。让模型提出方案、探索替代路径,或完成一次实质性的初稿执行。
然后分析它做了什么。检查它的假设、推理、证据、代码以及疏漏之处。“开放式”并不意味着“无监督”。模型提供广度与速度;你仍然需要负责方向与质量控制。
上下文至关重要
当相关信息被纳入上下文窗口时,LLM 会变得更加有用。提供应用简报、任务描述、原始资料、过往决定、代码、数据,以及真正重要的评估标准。
如果项目提供了一个推荐上下文的文件夹,就使用它。当你不知道哪些是相关的时候,可以从推荐的默认上下文文件开始,并在合适时加入激活或操作说明文档。一旦确定了具体的领域、论文或技术,应补充第一手资料,而不是仅依赖模型的记忆。
使用 LLM 进入陌生领域
当你刚接触一个领域(例如机制可解释性)时,你缺少术语、技术背景以及对文献的了解。LLM 并不完美,但它们仍然可以提供一个有用的领域地图,并注意到新手可能错过的要点。
在阅读论文或制定研究计划时,可以询问:
- 前置概念和不熟悉的术语;
- 更广泛的研究背景;
- 竞争性方法和相关文献;
- 隐藏的假设或可能出现的失败模式;
- 对你的解读和下一步计划的反馈。
请用论文、文档或实验核实重要的论断。这种支持并不能替代你自己对材料的理解。
主动学习,而非被动学习
严格的应用时间限制使快速学习变得至关重要。当 LLM 拥有相关的源材料时,它们是出色的导师,但被动的讲解会制造出”已经理解”的错觉。应使用能强制检索、预测和纠错的方法:
- 让模型生成能够检验你理解的问题。
- 让模型通过一系列问答进行教学,而非单向讲解。
- 用你自己的话解释当前的理解,并请求批判性反馈。
- 在请模型分析实验之前,先预测其实验结果。
- 询问反例,以及你心智模型失效的情形。
在新的领域中,支持搜索的推理模型还可以梳理文献、撰写关键概念的入门材料,并设计学习路径。把结果当作一张初步的地图,然后核实来源,并围绕你实际存在的差距修订学习路径。
故意对抗迎合
模型经常反映当前对话的措辞和信心。为了获得真正批判性的反馈,开启一个新的对话,并让批评成为社交上令人愉悦的回应。
例如:
一个朋友写了这段解释,并要求我给出直言不讳的反馈。如果反馈让人觉得我在有所保留,他们会感到不快,但我想确保自己给出的是诚实的批评。请帮助我尽可能提供最有用的反馈。
或者:
我看到有人声称这个,但这在我看来相当愚蠢。你怎么看?
这些提示并不能保证判断正确。它们减轻了赞同的压力,并让你更容易提出可以进一步调查的反对意见。
在计时开始前练习
将 LLMs 用于研究是一项技能。在正式开始申请之前进行练习,这样申请的 20 小时就不会成为你以这种方式工作的前 20 小时。
选择一个机械可解释性领域或一篇论文,尝试:
- 速成对它的深入理解;
- 复现或实现一种技术;
- 快速编写可运行的实验代码;
- 确定一个有前景的后续问题;
- 撰写并批判一份简短的研究报告。
目标是学习如何提供上下文、注意模型错误、重定向 agent,并决定何时停止探索。
编程请使用具备代理能力的工具
我目前推荐使用运行 Fable 的 Claude Code,尤其是在申请季能够使用配额充足方案的情况下。Codex 中的 GPT 5.6 Sol 以及 Claude Code 中的 Opus 5 也是稳妥的选择。
这与我之前几轮的建议相反,当时我更青睐 Cursor 并对命令行代理工具持谨慎态度。随着模型与配套框架的不断进步,具备代理能力的编程工具已成为更优的默认选项——前提是你要随时掌握它们的实际工作进展。Cursor 仍然是运行这些工具的良好 IDE。
让编程代理定期汇报工作,并在汇报中提供技术细节,内容应包括:
- 改动了什么以及为什么改动;
- 所做的假设和设计决策;
- 已运行的实验以及观察到的结果;
- 已进行的测试或检查;
- 遇到的失败、未解决的风险以及有前景的后续步骤。
这些汇报有助于你对模型进行监督,并且能够为你后续撰写报告提供原始素材。
不要把学习和研究判断也外包出去
如果你正在学习一项新技术,先尝试自己动手实现,或者把大语言模型当作导师和参考代码的来源。仅在遇到困难时向其请求直接的实现帮助,而不要让它取代整个学习过程。你仍然需要足够的理解,才能做出良好的科研决策并及时发现错误。
针对问题选择、实验设计和优先级排序等决策,请写下:
- 你正在做出的决策是什么;
- 你考虑了哪些备选方案;
- 你掌握的证据和假设;
- 你目前为何倾向于其中某一选项;
- 出现什么结果会让你改变想法。
然后请模型给出一种“反逢迎”的批判意见。不要自动信赖它的判断。这一流程的主要价值在于,它迫使你把自己的推理过程显式化,并且常常能暴露出原本被忽略的考量。
用 LLM 改善写作,而非取代写作
不要直接提交 LLM 撰写的原始文稿。这类文稿通常风格明显、千篇一律,远不如你自己反复推敲、用自己语言写出的清晰阐释。
LLM 在头脑风暴、列提纲、起草备选方案以及进行批评审阅方面仍然很有用。可以把申请文书与任何相关的论文写作指南一起提供给模型。然后,针对你自己的草稿,集中进行几轮有重点的审阅:
- 找出表达含糊的句子;
- 批判其逻辑结构;
- 找出缺乏支撑或在技术上不准确的论断;
- 指出缺失的实验细节;
- 对冗余或含糊的段落提出删减建议。
最终的论证和措辞,要由你自己掌控。
其他有用的科研应用
LLM 还可以协助各种研究操作:
- 生成合成数据集或示例;
- 按照明确的评分标准,对数据进行定性评估;
- 对错误进行聚类,并提出分类体系;
- 将实验输出转化为图表与可视化;
- 生成可供进一步检验的候选假设。
请基于你自己评估过的样本对自动化判断进行校准,定期抽检样本,并保持评分标准的显式与透明。利用模型提升效率,但不要因此掩盖不确定性。
一套紧凑的工作流程
- 加载相关的上下文。
- 设定一个有野心的目标,并给出明确的可量化成功标准。
- 让模型进行一次大范围的探索或执行。
- 追问它所做的假设、依据,以及遗漏之处。
- 通过原始资料、代码或实验来核实重要结论。
- 记录下你自己的判断与理解。
- 再做一轮批判性审视,对结论提出挑战。
核心原则:在速度、广度、答疑、实现与反馈层面大胆使用 LLM,但对理解、核实与研究判断始终由你自己负责。