1、什么是张量
不要被数学吓到:张量就是装数据的多维盒子,AI模型的统一数据容器。 - 0维张量 = 单个数字:85,一个数值,比如某一天销量 - 1维张量 = 一维数组(向量):[12,45,33],好比一张表格的一行,3个SKU的销量 - 2维张量 = 矩阵:表格,行=样本,列=特征。比如100条历史销售记录,
不要被数学吓到:张量就是装数据的多维盒子,AI模型的统一数据容器。 - 0维张量 = 单个数字:85,一个数值,比如某一天销量 - 1维张量 = 一维数组(向量):[12,45,33],好比一张表格的一行,3个SKU的销量 - 2维张量 = 矩阵:表格,行=样本,列=特征。比如100条历史销售记录,
业务通俗比喻 把每一层Block想象成一道加工工序: - 第1‑2层:看懂字面、词语、局部语法(看懂相邻词语关系) - 第3‑4层:理解句子句法、短语关系 - 第5‑6层:提炼全局深层语义、长距离逻辑(跨很远的词的指代、逻辑) 句子(张量)一层层流过每道工序,逐层把原始输入打磨成高级语义特征。 👉
翻译 交叉熵;在Transformer训练场景完整叫法:交叉熵损失函数 一、一句话业务通俗定义 对比两组概率分布: 一组=模型预测出来的概率(Softmax输出) 一组=标准答案(真实单词的One-Hot向量) 交叉熵算出两者之间的差距,差距越大=损失越高,用来指导模型自我修正。 供应链生活化例子(
中文标准名称:贪心解码 / 贪心搜索 一句话核心定义 大模型逐字生成文本时,每一步只挑选当前概率最高的词(argmax),选定之后不再回头、不保留其他备选方案,一条路走到结束。 简单数字例子(完整链路串联) 上文:零部件库存不足 模型输出Logits → Softmax算出候选词概率: 缺货:0.6
中文标准叫法:独热编码 一、一句话通俗定义 先建立词汇表,给每个词语分配唯一编号(index索引); 把词语转换成一串数字向量:只有自己索引位置写1,剩下全部填0。 直观小例子 词汇表:【汽车配件,零部件,缺货,物流】一共4个词 - 汽车配件(索引0) → [1, 0, 0, 0] - 零部件(索引
一句话定义 文本生成时,不单单只保留一条句子,同步维持 K 条最优候选句子(K叫束宽 beam size)。每一步新词预测后,筛选总分最高的K条继续推演,直到生成结束,最后选出综合得分最高的句子作为结果。 生活化类比 你想爬山找最佳观景路线。 - 贪心解码:每次岔路口只选当下看起来最好走的一条路,一
从向量到QKV到点积到缩放到Softmax到加权融合,完整的Transformer注意力流程,全程业务语言,供应链案例贯穿。
用业务语言讲清楚 Cross-Attention:两组相互对应的信息,用A做查询方去检索匹配B里的内容。
余弦相似度是衡量两段文本语义相似程度的打分方法,只对比方向不看长短,是文本语义匹配的首选方案。
用纯业务语言解释向量的概念:向量就是把文字翻译成一串标准化数字,让计算机能理解和对比。