
从入门到避坑机器学习异常检测算法选型用CS229速查表一次讲透【免费下载链接】stanford-cs-229-machine-learningVIP cheatsheets for Stanfords CS 229 Machine Learning项目地址: https://gitcode.com/GitHub_Trending/st/stanford-cs-229-machine-learning当服务器日志里混进格式怪异的请求、交易流水里冒出几笔明显不对劲的记录而你手里一条标注数据都没有传统分类模型基本失灵。斯坦福CS229课程的机器学习速查表把无监督学习里的异常检测思路整理成了可落地的方法清单配合无监督学习速查表选型时能少走不少弯路。先搞清楚异常检测到底解决什么问题异常检测面对的是一个很现实的局面绝大多数样本正常少数样本明显偏离而且你拿不到标签。所以思路不是分类而是先给正常数据建模再看新样本偏离这个模型有多远偏离越大越可疑。五种方法的分歧基本都落在怎么衡量偏离这一点上。高维大数据下怎么选默认隔离森林如果特征上千维、数据量几十万起步先看隔离森林。隔离森林Isolation Forest一句话原理用随机划分反复切数据异常点少而偏往往没切几刀就被单独隔离了。什么时候用维度高、数据量大、又不想调太多参数时它是性价比最高的默认选项。要注意什么它对量纲敏感先做标准化或分位数变换输出的异常分数是相对值阈值要结合业务能接受的误报率来定。密度不均、异常藏在局部时看密度而不是看距离数据各区域疏密差别很大时全局距离就不够用了下面两个方法各管一段。局部异常因子 LOF一句话原理比较每个点与其邻居的密度密度比周围低很多的就是局部异常。什么时候用异常只是局部偏离时某类用户行为异常、其余都正常它比全局阈值准得多。要注意什么邻居数 k 是个隐性旋钮选小了不稳定选大了会把真正的局部异常稀释掉。K-均值聚类一句话原理先把数据聚成几团离所有团中心都远的点标记为可疑。什么时候用分布接近球形、想快速出一版基线时。要注意什么它假设簇是凸的密度差异大的数据上容易误判适合当起点别当最终方案。分布复杂、没有清晰边界时让概率说话密度方法回答了哪里偏离但还有一种更棘手的情况正常数据本身就是多峰混合。高斯混合模型 GMM一句话原理用多个高斯分布加权拟合整体数据落在低概率区域的点就是异常。什么时候用正常数据天然分好几套模式比如不同机器、不同渠道各有一套分布。要注意什么分量个数 G 要试几个值再定EM 算法对初值敏感最好多次初始化取最优解。小样本场景的替代方案One-Class SVM反过来如果正常样本只有几百到几千条但边界相对画得出来就换个思路。一类支持向量机One-Class SVM一句话原理在特征空间学一个边界把正常数据尽量圈进来圈外的判为异常。什么时候用小样本、且异常定义接近越界比如设备参数超出安全包络。要注意什么训练成本随样本量上升明显数据量大时不如隔离森林划算核参数和 C 值需要交叉验证。异常检测选型速查表什么场景推荐方法关键注意事项高维、数据量大隔离森林先做量纲处理阈值结合误报率密度不均、局部异常LOF邻居数 k 要调选大易漏报分布规则、要快速基线K-均值只适合球形簇别当最终方案多峰复杂分布GMM分量数多试几个多次初始化小样本、边界清晰One-Class SVM训练慢调参靠交叉验证学习路径按这个顺序读建议先用概率与统计复习和代数与微积分复习补齐前置知识重点看高斯分布、期望与协方差——GMM 和简单高斯检测都建立在这上面。然后精读无监督学习速查表的异常检测部分用机器学习技巧速查表处理调参与验证环节。无监督这块顺了之后再翻监督学习速查表看有监督的异常检测做法把异常当分类问题来做最后用机器学习综合速查表整体回顾一遍。实操前必看的三个提醒异常检测对预处理非常敏感量纲不统一、缺失值没处理时异常分数基本不可信先清洗再建模。异常的定义因业务而异风控里漏报代价大宁可阈值调低多抓一些再走人工复核。别指望单模型通吃隔离森林和 LOF 各跑一版做个对比往往比死磕一个参数更有价值 五种方法基本覆盖了常见场景最务实的路线是先用隔离森林跑通一版再对照速查表逐个替换对比边跑边调。【免费下载链接】stanford-cs-229-machine-learningVIP cheatsheets for Stanfords CS 229 Machine Learning项目地址: https://gitcode.com/GitHub_Trending/st/stanford-cs-229-machine-learning创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考