推文
@Zen_with_AI · 2026-10-09 23:49
第7期ML面试问题 Q:K-Means 聚类有哪几个步骤?K 值怎么定? A: 迭代三步 K-Means algorithm 先随机挑 K 个点当初始中心;然后每个样本分给最近的中心;最后每个簇重新算中心(取均值);重复"分、算"两步直到中心不再动。比如给用户按消费金额和下单次数分成 5 群,先随机定 5 个中心,迭代几次后中心自己挪到了五类人群的中间。 选 K 肘部法 elbow method 把 K 从 1 往上试,画簇内平方误差 SSE 随 K 下降的曲线,像手肘一样拐弯的地方就是性价比最高的 K。比如 SSE 在 K=5 之后下降明显变缓,就定 5 簇,再多分也没啥收益。 两大坑 pitfalls 一是对初始中心敏感,随机不好会掉进局部最优,实战用 k-means++ 挑起点(离已有中心越远的点越容易被选中);二是对异常值和量纲敏感,用欧氏距离算远近,所以特征要先标准化 standardize,不然"年薪"一栏的数值能压住所有别的特征。 (一句话记住:先分堆、再算心、迭代到不动;选 K 找肘弯。) 追问加分:K-Means 为什么要求特征先标准化?(欧氏距离对量纲敏感,量级大的特征会主导距离。) 更深度问题:K-Means 只能"硬分堆",GMM 用 EM 是怎么做到
曝光 180 · 评论 1 · 点赞 3 · 书签 1