4 月 27 日,上海财经大学 “长江学者” 特聘教授、计算机与人工智能学院创始院长陆品燕受邀出席中关村 Xᴬᴵ智汇讲坛,以《大模型机理初探》为题,从研究视角、效率优化、理论机理到研究范式,系统分析了对大模型底层逻辑的深度思考。
陆品燕教授首先指出,当前大模型研究主要围绕四大方向展开:能力更强、应用更广、效率更高、基础更牢。这四大方向对应不同研究视角:能力更强偏向 AI 工程,应用更广将大模型视为工具,效率更高把大模型当作新型计算负载,基础更牢则将大模型作为科学研究对象。
01 大模型高效计算:宏观并行与微观优化
在 “效率更高” 这一方向,陆教授团队从宏观与微观两个层面进行了探索。
宏观层面:大模型训练涉及数千台设备,传统方法常将模型层数均匀切分到各计算节点。但由于前向与反向计算的时间依赖,均匀切分会产生闲置空隙。陆教授团队将此建模为混合整数规划问题,在内存约束下求解非均匀切分方案以最小化完成时间,在实际场景中获得 10% 以上的吞吐量提升。
.webp)
微观层面:模型量化虽能加速矩阵乘法,但 Softmax 中的指数运算仍需高精度,且求最大值的步骤导致数据在矩阵与向量处理器间反复搬运。团队发现,用上一次的最大值替代当前值在数学上等价,仅需在值大幅波动时回退。这使得大部分计算可以低精度合并完成,显著减少搬运,在 8 比特量化下效率大幅提升且精度损失极小。
02 大模型机理研究:四维方法论图谱
围绕 “基础更牢” 这一方向,陆教授提炼出一套方法论谱系,将大模型机理研究分为四个层次:数学、物理学、生物学、心理学。每个层次有各自的研究范式、适用场景和局限性,且相互之间可以转化与印证。
1. 大模型数学:理想化假设、定理证明与边界确定
数学方法追求严格的定义、定理与证明,但必须在高度简化的模型上进行。陆教授举例说明 Transformer 的表达能力与思维链(CoT)的关系:若不使用 CoT,Transformer 的计算复杂度类为 TC⁰(并行电路),难以处理串行推理任务;引入 CoT 后,其能力跃升至图灵完备,理论上可以表达更复杂的推理过程。
他同时分享了团队在优化器方面的工作:在一个线性关联记忆模型上,Muon 优化器相较于梯度下降在无噪声场景下具有指数级加速,并推导出其在有噪场景下的规模定律。Muon 通过对梯度进行矩阵正交化,强制模型以均匀的步调学习不同特征频率,从而更高效地捕捉数据中的长尾知识。
由此得知,大模型在数学上可以被视为函数逼近器、概率采样机、信息压缩器与通用图灵机的四位一体。未来需要提出一个能同时捕捉多个侧面的理想化模型。
2. 大模型的物理学:受控实验、统计规律与唯象定律
物理学方法不追求严格证明,而是通过大量可控、可重复的实验总结统计规律。最典型的例子是 Scaling Law(规模定律)—— 模型的性能与数据量、参数量、计算量之间的经验关系。此外还有 Double decent(双重下降)、Grokking(顿悟)等现象。
陆教授团队在模加运算等算术任务上进行了带噪实验。他们发现:模型在训练中表现出 Double decent 和 Grokking 现象;即使模型未能完全学会任务,其内部神经元已经自发形成了频域数值表征:数字被编码在圆环上的角度,加法对应角度叠加;此外,模型对噪音的记忆要早于对正确结果的记忆。陆教授强调,形式语言与合成数据是大模型数学和物理学研究的理想试验场,可以方便地做控制变量实验。
3. 大模型的生物学:结构解剖、神经回路与功能定位
生物学方法不再局限于小模型,而是直接对开源大模型进行 “解剖”:观察其内部参数、激活状态与神经元连接模式。陆教授重点介绍了机制可解释性领域的前沿工作,特别是稀疏自动编码器(SAE)和电路分析(CLT)。
.webp)
SAE 通过将中间层激活升维至高维稀疏空间,试图将叠加在一起的语义特征分离开来。已有研究成功识别出可解释的特征,甚至通过人为激活该特征可以改变模型的输出行为。然而,线性表达是否足够?可解释性是否等同于稀疏性?陆教授指出,SAE 并非唯一的机制可解释性方法,国内学者应积极探索更多元的方法论。
4. 大模型的心理学:黑盒测试、行为诱导与认知边界
心理学方法不打开模型内部,仅通过输入输出交互来推断其行为规律。陆教授指出,Prompt Engineering(提示词工程)、In Context Learning(上下文学习)、Chain-of-Thought(思维链)等我们今天耳熟能详的概念,最初都是在使用过程中通过黑盒测试发现的。
他分享了一个实验:在文本的每个字母后插入不可见字符,扰乱单词完整性。直觉上模型应完全失效,但实际测试发现,大模型仍能保持较高的理解准确率,且模型规模越大、鲁棒性越强。这一现象引发耐人寻味的问题:大模型是被人类发明的,还是被发现的?我们创造了它,却并不完全理解它,在使用中不断加深理解,这种张力正是机理研究的魅力所在。
03 方法论的交响:从分散到统一的认知图谱
陆教授强调,这四种方法论并非彼此割裂,而是构成一个连续的谱系,彼此之间可以相互转化与促进:
- 数学 ↔ 物理学:定理证明后需在更现实的设定下验证;当实验中发现了一个定律,科学家们会试图从数学上去证明它,从而理解其成立的原因与边界。
- 物理学 ↔ 生物学:在小模型上发现的定律,需在真实大模型中观察验证;真实大模型中的现象,可在受控小模型上重现以获得更好归因。
- 生物学 ↔ 心理学:内部参数的观察可通过控制信号来检验外部表现;外部行为模式可通过解剖内部参数来分析其机理。
陆教授分享之后,学院学生现场积极提问。有学生询问 “大模型未来架构的演进方向”,陆教授坦言,目前虽无法直接给出准确预测,但建议师生们保持多路径探索,通过机理研究明确不同架构的优劣边界,而非简单预测最终形态。
另一位同学询问:“看起来理论永远落后于实践,这一困境应该如何解决?” 陆教授从科学哲学的角度回应:还原论式的 “牛顿定律” 式解释在复杂系统中本就难以实现,生物学等领域同样如此。但这并不意味着理论研究失去意义;恰恰相反,正是这种滞后与不完备,驱动着方法论的持续迭代。
关于脑科学与人工智能的相互启发,有同学提问:当前神经网络架构最初受脑科学启发,但如今研究 AI 可解释性的人与脑科学研究者交集甚少,这种现状是否需要改变?陆教授认为,仿生学不必严格拘泥于原型,更重要的是,目前人类对脑科学本身的认知还非常有限。相比之下,大模型 “可解剖、可控制” 的特性,使其成为研究智能原理的独特平台,其结论甚至可能反过来为脑科学研究提供启发。他倡导二者应双向启发,而非强求一致。
本期讲坛兼具理论高度与方法论价值,陆品燕教授以跨学科视角重构大模型机理研究框架,既回应了产业关心的效率问题,也指明了基础研究的核心方向,更展示了如何用跨学科的方法去研究一个复杂问题 —— 提出问题、设计实验、提炼规律、反思边界。
中关村 Xᴬᴵ智汇讲坛将持续聚焦 AI 前沿基础理论,邀请更多领域顶尖学者来北京中关村学院进行深度分享,为师生在交叉学科的研究中提供切实的思路与启发。
一起下楼趣运动!中关村两院第二届趣味运动会圆满收官
具身智能进入高中课堂!北京中关村学院 AI 教育研究所携手十一学校、深度机智共建教育创新实验室



