飞天闪客内容总结.excalidraw

模块 01 | 语言建模本质与超大规模分类任务破解黑盒玄学:大语言模型绝非神秘直觉,其底层极其纯粹 —— 给定前面所有输入,在词表中做多分类预测下一个 Token!自回归语言模型生成全链路与多分类机制① 输入离散文本序列 (Tokens: t=1..4):今 天天 气序列张量 X ∈ ℝ^(4 × 768)深层神经网络万能函数 f(X; Θ)• 堆叠数十层 Transformer Blocks(自注意力与非线性变换)• 数十亿/数千亿可训练参数(权重矩阵 W 与偏置 b)• 通用近似定理:将离散字符映射到高维连续语义流形空间末位隐藏状态 h_t ∈ ℝ^768Linear 线性投影层 (d_model=768 → Vocab_Size=50257)未归一化对数得分 Logits ∈ ℝ^50257Softmax 归一化概率分布与下一词多分类采样:极了 ⭐82%8%4%...2%挖掘机0.001%香蕉0.0001%分类问题与生成任务• 图像二分类:输出 2 个神经元 (猫 vs 狗)• 图像千分类:输出 1000 个神经元• GPT 语言模型生成:本质也是分类任务! 唯一的区别是候选类别多达 50,257 个!• 所谓文字生成,就是不断做 50,257 选 1 的多选题, 选出一个 Token 拼回输入末尾,生生不息!• 自监督训练的优雅:互联网海量文本天然就是 (输入前缀, 下一个词) 的训练样本对,无需昂贵标注!交叉熵损失函数使得模型在海量语料上不断逼近真实人类语言的条件概率分布,涌现出理解与推理能力!张量维度全生命周期契约首先抓牢每一层输入/输出张量维度契约:① 输入序列: [Batch, Seq_Len=4]② 词嵌入层: [Batch, 4, d_model=768]③ 变换主干: [Batch, 4, 768] (保真)④ 线性投影: [Batch, 4, Vocab=50257]⑤ 概率采样: 取末位 [1, 50257] 抽样输入输出维度相同使得 Transformer Block 可以像积木一样无限纵向堆叠数十层甚至上百层,形成极强的深度表征!模块 02 | 词向量 Embedding 与语义空间几何直觉:一维不可分,升维则切分开!One-Hot 缺陷与稠密语义空间中的向量运算法则。一维线性不可分 ➔ 二维线性可分:升维 1. 一维数轴上的红蓝样本点:交错分布红 (x=1)蓝 (x=2)蓝 (x=3)红 (x=4)切线1切线2❌ 无论在哪里切一刀,都无法用一个阈值将红蓝球分开!(一维线性不可分)升维映射:引入特征维度 y = (x - 2.5)²2. 升入二维空间:抛物线拉伸,一条直线轻松切分!xy✔ 线性超平面(分界直线 y = C)完美切分!为什么 Transformer 需要 768 / 4096 维词向量?• 自然语言中蕴含着极其繁复的语义关联、时态、情感与逻辑关系;• 一维标量根本无法容纳如此复杂的分类界限;• 神经网络升维(Embedding)赋予了模型极其充裕的『自由度空间』, 让复杂的语言关系在超高维空间中变得处处线性可分• 词向量矩阵 Embedding 随整个模型端到端反向传播微调, 无需任何人工特征工程,自发演化出高度结构化的语义流形One-Hot 正交缺陷 vs 稠密语义向量空间方案 A:One-Hot 独热编码苹果 = [1, 0, 0, 0, ..., 0] ∈ ℝ^50257香蕉 = [0, 1, 0, 0, ..., 0] ∈ ℝ^50257挖掘机 = [0, 0, 1, 0, ..., 0] ∈ ℝ^50257❌ 维度灾难(5万维全为0),且任意两词点积均为0,完全丢失语义相似度方案 B:可学习稠密词向量 (Dense Embedding) 与几何语义苹果 (v_apple)香蕉 (v_banana)挖掘机 (v_excavator)θ 极小相似度 ≈ 0.96【语义可加性】向量空间中的平行四边形运算法则:通过端到端反向传播,词向量自发学到了抽象的概念方向(如性别轴、皇室权力轴、词性时态轴)几何距离代表语义亲疏,方向位移代表概念转换模块 03 | FFN 前馈神经网络与空间折痕纯线性堆叠等于单层!激活函数像折纸一样弯折高维空间,FFN 4倍膨胀充当大模型的事实记忆键值库。为什么只用矩阵乘法没有用?纯线性矩阵乘法:无论你堆叠 10 层还是 10,000 层全连接网络,如果不加非线性激活函数,多个矩阵连乘在数学上完全等价于单层扁平矩阵!无法拟合任何非线性曲面。【几何本质】激活函数 = 在高维空间制造「折痕」拐点/折痕 (Bending Point)ReLU(x) = max(0, x)【折纸几何比喻(Folding Space)】• 想象一张平整白纸,你只用直尺画线,永远无法切分复杂的交错圆环;• 激活函数的非线性拐点,就像把纸沿着折痕弯折一下;• 每一个神经元都在空间中折一道印子,数千个神经元共同协作, 就能折出极其精密的多维流形曲面,包裹住任意复杂的概念边界!FFN 4倍膨胀架构与事实记忆键值库 (Key-Value Memory)三层拓扑:先升维膨胀 4 倍,再降维还原输入层d = 768膨胀隐藏层4d = 3072输出层d = 768W1 矩阵 (上采样)W2 矩阵 (下采样)FFN 是大模型的事实知识记忆库(Key-Value Memory)大模型中约 2/3 的参数量都聚集在 FFN 层。最新机理研究证实:1. 第一层权重 W1 充当「Key(键匹配器)」: 每个神经元检测特定的语义模式(例如检测到「法国 + 首都」)。2. GELU 激活函数充当「非线性门控过滤」: 压制绝大多数无关神经元,只点亮被触发的概念神经元!3. 第二层权重 W2 充当「Value(值存储器)」: 被点亮的神经元通过 W2 读出事实知识(输出「巴黎」!)。结论:Attention 负责在序列中『搬运与交流信息』,FFN 负责在神经元深处『检索与回忆知识』!模块 04 | Self-Attention 动态上下文融合机制解决静态词向量歧义痛点:Q/K/V 三重角色分工,点积相似度打分,除以根号dk防止方差爆炸,Softmax加权动态融合!Query (Q / 查询向量)「我是谁?我现在急需什么上下文信息?」每个词拿着放大镜去探索其他词。由输入 X 乘以权重矩阵 W_Q 投影生成。Key (K / 键向量)「我是谁?我身上有什么关键线索可供匹配?」每个词举起的对外索引标签。由输入 X 乘以权重矩阵 W_K 投影生成。Value (V / 值向量)「若被选中,我将贡献什么实质语义精髓?」每个词内藏的真正语义内容抽屉。由输入 X 乘以权重矩阵 W_V 投影生成。【全流程矩阵推演】因果自注意力流水线 (以序列「今天 天气 真」为例)1. 查询 Q (3×d_k)q_今天 [ . . . ]q_天气 [ . . . ]q_真 [ . . . ]×2. 转置 K^T (d_k×3)k_今 k_天 k_真[ . . . ][ . . . ]3. 打分矩阵 S = Q·K^T今: [ 12.4, 4.2, 1.1 ]天: [ 3.8, 14.1, 2.0 ]真: [ 2.1, 5.8, 15.6 ]÷ √d_k+ MaskSoftmax4. 因果掩码注意力权重 A (下三角)今: [ 1.00, 0.00, 0.00 ]天: [ 0.25, 0.75, 0.00 ]真: [ 0.15, 0.25, 0.60 ]★ 右上角为0:因果掩码杜绝偷看未来Token!×5. 内容 Vv_今天v_天气v_真6. 上下文重塑 Zz_今天'z_天气'z_真'【为什么必须除以 √d_k 缩放因子?】若 q 与 k 均值约为 0、方差为 1,则其内积 q·k 是 d_k 个独立随机变量之和。内积结果的期望为 0,而方差却会放大到 d_k!当 d_k = 64 时,标准差达到 8。如果不除以 √d_k = 8,点积数值会达到数十,经过 Softmax 之后会导致极端指数放大(变成 0.9999 与 0.0001),使得梯度处处趋近于 0,反向传播严重饱和!除以 √d_k 完美将方差重新锚定回 1从「死词」到「活词」的蜕变过程• 初始词嵌入(Embedding)是静态的:字典里的「苹果」向量无论放在哪个句子里都长得一模一样;• 在「苹果发布会」中,通过 Attention,它吸收了「发布会」的 Key 标签,将高权重赋予科技语义;• 在「红富士苹果」中,它吸收了「红富士」的 Key 标签,将高权重赋予水果语义;• Attention 的本质不是算算术,而是让原本僵死的符号在上下文洪流中动态变形,精准表达当下的确切意图!模块 05 | Transformer Block 流水线位置编码打破置换不变性,残差直通高速公路彻底根除梯度消失,LayerNorm 稳定特征方差,自回归循环生生不息!现代 Pre-LN Transformer Block 单层架构输入 Tokens: ["今天", "天气", "真", "好"]+词嵌入 (Embedding)shape: [4, 768]位置编码 (Positional Encoding)shape: [4, 768] (注入语序)LayerNorm (层归一化 1)Multi-Head Attention• 8 个独立注意力头并行计算• 每个头特征维度 d_k = 64• 拼接后经 W_O 投影还原残差直通公路 1(Residual Highway)无损保留浅层特征+LayerNorm (层归一化 2)Feed-Forward Network• 升维:768 ➔ 3072• 非线性激活:GELU• 降维:3072 ➔ 768残差直通公路 2(Residual Highway)提供梯度反向直通+重复堆叠 × N 层(如 GPT-2 堆叠 12 层,GPT-3 堆叠 96 层)Final LN + Linear 头【核心组件 1】残差连接 (Residual Connection)为什么没有残差连接就根本无法训练深层大模型?反向传播梯度流:• 在数十层的深层网络中,导数连乘极易衰减到接近 0 (∂F/∂x ≈ 0);• 但因为残差连接在括号里加了一个常数「单位矩阵 I」, 使得误差梯度可以直接顺着直通公路以 100% 强度无损回传到底层!• 彻底终结了深度学习中阻碍模型做大的梯度消失顽疾!★ Pre-LN 现代改进:原始 Transformer 采用 Post-LN(在 Add 之后做归一化),容易造成深层数值不稳定。现代大模型统一迁移至 Pre-LN,让主残差干线保持无障碍纯线性贯通,训练极为平滑!【核心组件 2】层归一化 (LayerNorm) 与位置编码1. 为什么用 LayerNorm 而不用 CV 领域的 BatchNorm?• BatchNorm 是跨样本沿 Batch 维度求均值方差, 严重依赖 Batch 大小,且无法应对推理时的变长文本;• LayerNorm 独立在单个 Token 内部的 768 维特征轴归一化, 与 Batch 大小完全解耦,计算高度稳定!2. 为什么必须引入位置编码 (Positional Encoding)?• Self-Attention 是置换不变的(无语序概念): 打乱句子顺序「猫抓老鼠」和「老鼠抓猫」,点积算力完全一样!• 必须显式将位置信息编码为高维向量相加,赋予模型感知语序的能力。模块 06 | 现代大模型演进 现代 LLM 对原始 Transformer 零件的全面换装改造:RoPE、SwiGLU、RMSNorm、GQA,与从提示词到智能体工具调用。现代开源大模型 (Llama/DeepSeek) 核心零件改造1. 位置编码:绝对正弦 PE ➔ RoPE 旋转位置编码• 核心几何直觉:在二维复数平面上将向量旋转 m·θ 角度;• 内积自然带出相对位置差 (m - n)·θ,让模型天然具备长文本相对距离感知与超长上下文外推能力!2. 前馈激活:普通 FFN ➔ SwiGLU 门控前馈网络• 引入双分支门控(Gating)机制,一条分支做非线性激活,另一条分支线性调制;• 显著提高参数表达效率与训练收敛速度,成为 Llama、Mistral 标配!3. 归一化加速:LayerNorm ➔ RMSNorm• 实验证实:LayerNorm 的减去均值操作对训练稳定性贡献微乎其微;• RMSNorm 彻底舍弃减均值计算,只做均方根缩放,计算速度提升 20%~50%!4. 注意力显存优化:MHA ➔ GQA (分组查询注意力) & MLA• 推理瓶颈在显存吞吐(KV Cache 暴涨);• GQA 让多组 Query 头共享同一组 Key 和 Value 头,显存直接立省 75%!• DeepSeek MLA:更进一步采用低秩压缩潜变量,显存立省 90%!大模型到 Agent1. 用户复杂任务输入 (User Task Prompt)例:「请帮我分析 2026 年最新财报,绘制营收对比图并发送邮件」2. LLM 大脑认知规划(思维链 CoT + 格式约束)• 迫使模型输出「Let us think step by step」,拆解长链逻辑;• 遇到自身知识盲区或需要现实交互时,模型不再胡编乱造, 而是自主决定输出结构化工具调用协议指令 (Tool Call JSON)!Action: {"tool": "query_database", "args": {"year": 2026, "target": "revenue"}}3. 外部执行环境与工具网关 (MCP / Shell / API)• 模型本身无法联网、无法运行代码、无法操作文件;• 外部系统捕获 JSON 指令,调用真正的 Python 沙箱、SQL 数据库、浏览器或 MCP 服务;• 收集真实环境返回的 Observation 数据:Observation: {"revenue_q1": "$42.5B", "growth_yoy": "+18.4%"}环境真实反馈灌回模型上下文(Observation)自主循环Thought (思考拆解) ➔ Action (调用工具)➔ Observation (观察反馈) ➔ 再次 Thought大模型化身为能够:1. 借助 MCP 协议调用海量现实工具;2. 自主纠错、自主拆解长线目标;3. 驱动多 Agent 协同作业