纯业务人话:余弦相似度(完全抛开三角函数、几何知识)
先锁定场景:我们有两段文本,各自变成一长串数字(向量)。 余弦相似度,就是一套统一打分规则,用来评判两句话含义像不像。
核心比喻(最好理解)
把每一段文本的向量想象成从同一个原点伸出去的一根箭头。
- 两根箭头指向几乎同一个方向 → 夹角很小 → 分数接近 1 → 语义高度相似
- 两根箭头完全垂直,互不搭边 → 分数≈0 → 两者毫无关联
- 两根箭头朝着相反方向 → 分数靠近 -1 → 含义大概率相反
重点:它只关心箭头朝向,不在乎箭头长短。 放到业务里翻译: 只对比表达的意思方向,不在乎句子长短。 短句【缺配件】和长句【车辆零部件当前库存不足】依然可以高分匹配。
用你的供应链案例直观感受
句子A:汽车配件缺货 句子B:零部件库存不足 两根箭头方向大体一致 → 相似度 0.94
句子C:汽车配件库存充足 箭头朝向反过来了 → 和A相似度极低
句子D:客户要求推迟装车 箭头完全是另一个方向 → 和A分数接近0
分数标尺(业务直接记住这套标准即可)
区间:-1 ~ 1 ✅ 0.8~1.0:高度同义,可以当成同一类问题 ✅ 0.5~0.8:含义相关,业务场景有交集 ⚠️ 0~0.5:微弱相关,基本不能归为一类 ❌ <0:语义冲突、大概率正反意思
区分一个极易踩坑的知识点(业务非常关键)
还有一种算法叫「欧氏距离」,它看箭头端点相隔有多远(长短+方向一起算)。 余弦相似度只看方向,忽略长短。
举个业务场景体现差异: 文本1:配件缺货 文本2:售后汽车零部件大量库存不足,急需补货 句子2更长,向量“箭头更长”。
- 余弦相似度:依然很高(方向一致,推荐匹配)
- 欧式距离:会因为长短差距,判定两者差距很大
👉 所以文本语义匹配、工单模糊检索,行业统一优先用余弦相似度。
极简PPT一句话版本
余弦相似度是衡量两段文本语义相似程度的打分方法,只对比信息表达的核心方向,不受句子长短影响;分值越靠近1,代表业务含义越接近。
串联整条链路复盘(方便你完整梳理逻辑)
原始文字 → 转为向量(一串数字)→ 使用余弦相似度计算两组向量的方向重合度 → 得到分数 → 系统根据阈值判断:两句话是不是同一个业务问题。
黑公网安备23000002000105号