This page collects my long-form notes on mechanistic interpretability, deep learning theory, optimization, and scaling laws. If you are new here, start from the latest posts below. Most posts are written in Chinese; English translations are collected on the English blog page.
-
如何搭建一个科学的 Scaling Ladder
按执行顺序整理 Scaling Ladder 的设计与搭建:决策目标与验收、测量口径、dense 与 MoE 的缩放规则、实验矩阵与预算、超参搜索、数据配比与数据受限训练、Loss Scaling Law 拟合、下游预测、外推验证与交付流程,综合 Chinchilla、DeepSeek、StepFun、Cerebras、Llama 3、Delphi 等公开文献与工程实践。
-
当代知识分子是否仍有责任参与公共治理
从古希腊城邦到中国士大夫传统,再到后现代对宏大叙事的解构,追问知识分子介入公共治理的授权究竟从何而来。本文记录我推翻自己最初预设的过程,并尝试在没有形而上学地基的前提下,给出一种承认偶然性却依然选择承担的介入姿态。
-
pretrain 和 scaling 作为一种方法论和科学观
从 GEN-1.5 的长期预训练出发,讨论通用学习框架、training-time 与 test-time scaling,以及效率、训练稳定性和可预测性如何影响研究选择。
-
Hyperball、effective lr 与峰值加衰减的形状
探讨预训练学习率调度的两个核心问题:优化器实际调节的有效学习率由权重范数动态决定,Hyperball 通过约束权重范数消除该隐式调度;峰值加衰减形状对应偏差与方差权衡的最优解,满足该平衡的形状构成一个集合,不限于特定的解析形式。
-
本科两年,我最深的感悟:认知复利
很多人习惯用当下的有限认知做长远的线性规划,容易陷入短期付出看不到回报的焦虑。本文结合我本科两年的经历,聊聊关于「认知复利」的思考:保持公开输出、融入高密度环境、高频迭代认知,如何在长期带来非线性的成长反馈。