Transformer 原始论文为什么N=6层(Encoder6层、Decoder6层)

业务通俗比喻 把每一层Block想象成一道加工工序: - 第1‑2层:看懂字面、词语、局部语法(看懂相邻词语关系) - 第3‑4层:理解句子句法、短语关系 - 第5‑6层:提炼全局深层语义、长距离逻辑(跨很远的词的指代、逻辑) 句子(张量)一层层流过每道工序,逐层把原始输入打磨成高级语义特征。 👉

2026-08-05 · 3 min · 1063 words · Xin

Transformer 注意力整套完整流程梳理

从向量到QKV到点积到缩放到Softmax到加权融合,完整的Transformer注意力流程,全程业务语言,供应链案例贯穿。

2026-07-31 · 4 min · 1669 words · Xin

什么是交叉注意力机制(Cross-Attention)

用业务语言讲清楚 Cross-Attention:两组相互对应的信息,用A做查询方去检索匹配B里的内容。

2026-07-31 · 3 min · 1176 words · Xin

什么是自注意力机制(Self-Attention)

用供应链业务案例讲透Self-Attention:一份数据内部互相查找关联,Q/K/V全部来自同一数据源,是理解Transformer的第一块基石。

2026-07-31 · 3 min · 1073 words · Xin

多头注意力机制(Multi-Headed Self-Attention)

多头注意力赋予注意力多种子表达方式,8组独立QKV矩阵并行分析,同时捕捉因果、时序、实体、动作等多种关系。

2026-07-31 · 3 min · 1235 words · Xin

点积与余弦相似度

通过Q-K点积自动算出任意两条业务信息之间关联程度,详解Thing、query-vector、key-vec等概念,区分点积与余弦相似度的本质差异。

2026-07-31 · 3 min · 1057 words · Xin

点积业务场景与计算逻辑

点积是一套快速计算公式,用来衡量两组向量大方向是否一致,输出一个数字代表匹配程度,是注意力机制计算关联程度的基础运算。

2026-07-31 · 3 min · 1039 words · Xin
黑ICP备15000859号-1 | 黑公网安备23000002000105号