矩阵乘法 | AI 学习笔记

为什么 LLM 要用 GPU？从游戏显卡到 AI 引擎

训练 ChatGPT 用的不是什么神秘的 AI 芯片，而是打游戏用的显卡。一块为了让游戏画面更流畅而设计的芯片，为什么成了 AI 革命的引擎？因为游戏画面和语言理解在底层共享了同一个数学本质——矩阵乘法。

GPT 的本质就是矩阵乘法。但矩阵乘法到底在干什么？9 张动图，把 GPT 里最核心的数学拍给你看。维度变了，几何没变——看懂 2D，就看懂了 GPT。

从矩阵乘法到 Attention 完整公式：softmax(QK^T/√d)×V。把四篇数学基础组装成 Transformer 的核心引擎。零基础线性代数系列完结篇。

不做证明，只建直觉。从矩阵乘法的三种视角出发，一步步搭建理解 Transformer 的完整数学框架：QKV 投影、多头注意力、残差连接、MLP，以及它们如何协作生成下一个 token。

用纯 Python 和 NumPy 从零搭了一个 10 个神经元的神经网络，识别手写数字，然后把它拆开——看清了模板匹配、投票矩阵和每一步计算。从这个最小的网络出发，聊聊 FNN、CNN、RNN、Transformer 的演进，以及可解释性的边界。

~5 = -6？从这个小困惑出发，我们穿越 7 层抽象，看见逻辑门如何一步步堆叠成 ChatGPT。这是一篇写给所有人的计算机底层原理科普。