博主头像

StatQuest:随机森林第二部分:缺失值与聚类

外来客 • 2026-08-13 12:50:09

分享
𝕏 f
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:StatQuest: Random Forests Part 2: Missing data and clustering)

🌲 核心观点

随机森林(Random Forest)不仅能处理分类和回归问题,还能有效应对数据缺失及样本聚类挑战。其核心逻辑在于利用“邻近度矩阵”(Proximity Matrix)量化样本间的相似性:若两个样本在树中落入同一叶节点,则视为相似。通过迭代优化填补训练集中的缺失值,并利用多数投票机制处理新样本的缺失分类变量,从而提升模型鲁棒性。

📊 关键事实与论据

  • 训练集缺失数据处理(迭代法):
  • 初始猜测: 对于分类变量(如“血管阻塞”),取同类别中最常见值;对于数值型变量(如“体重”),取中位数。例如,无心脏病患者中“否”最常见,体重中位数为 167.5。
  • 计算邻近度: 构建随机森林后,将所有数据穿过所有树。若样本落入同一叶节点,在邻近度矩阵对应位置加 1。最终将计数除以树的总数(如 10 棵)得到平均邻近度。
  • 迭代优化: 利用邻近度重新估算缺失值。分类变量比较“是”与“否”的平均邻近度,选高者;数值型变量计算加权平均值(权重基于邻近度)。重复此过程 6-7 次直至收敛。
  • 新样本缺失数据处理(投票法):
  • 当对新样本进行分类但存在缺失特征时,创建该特征的多个副本(如“有阻塞”和“无阻塞”两个版本)。
  • 将这两个副本分别穿过森林中的树,统计哪个版本被正确分类的次数更多。例如,“是”在 3 棵树中均被正确标记,而“否”仅在 1 棵中被正确标记,则选择“是”。
  • 样本聚类应用:
  • 邻近度矩阵可转化为距离矩阵(距离 = 1 - 邻近度)。
  • 基于此距离矩阵,无论数据类型如何(排名、多选、数值等),均可绘制热图(Heat Map)或多维尺度分析图(MDS Plot),直观展示样本间的关联结构。

🎯 结论

随机森林通过构建邻近度矩阵,实现了从“猜测”到“精确估算”的缺失值填补闭环。对于训练数据,采用迭代收敛策略;对于新预测数据,采用基于分类准确率的投票策略。此外,该方法天然支持对任意类型数据进行样本聚类可视化,极大地扩展了随机森林在探索性数据分析中的应用价值。

0 条评论

发表评论

请先 登录 后参与讨论。