ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

层次聚类算法解析:AGNES与DIANA实战对比

层次聚类算法解析:AGNES与DIANA实战对比 1. 层次聚类基础概念解析层次聚类(Hierarchical Clustering)是一种通过构建树状结构来展示数据层次关系的聚类方法。与K-means等划分式聚类不同它不需要预先指定聚类数量而是通过计算样本间的相似度逐步合并或分裂簇。在实际项目中我经常用层次聚类处理那些不清楚具体类别数量的数据集。比如分析用户行为特征时我们可能不知道用户应该分成几类这时层次聚类就能自动展示数据的分层结构。层次聚类主要有两种实现方式自底向上的聚合方法(AGNES)自顶向下的分裂方法(DIANA)重要提示选择哪种方法取决于数据特征和需求。当预期聚类数量较少时AGNES更高效而DIANA更适合发现数据中的异常点。2. AGNES算法深度剖析2.1 AGNES工作原理AGNES(Agglomerative Nesting)是典型的聚合式层次聚类算法。我常用它来处理中小规模数据集(样本量10,000)。它的核心步骤如下初始化将每个样本视为一个簇计算所有簇间距离矩阵合并距离最近的两个簇更新距离矩阵重复步骤3-4直到所有样本聚为一类在Python中我们可以用scipy库快速实现from scipy.cluster.hierarchy import linkage, dendrogram import matplotlib.pyplot as plt # 生成示例数据 data [[i] for i in [2,8,0,4,1,9,9,0]] # 计算层次聚类 Z linkage(data, single) # 使用单链接方法 # 绘制树状图 plt.figure(figsize(10,5)) dendrogram(Z) plt.show()2.2 关键参数解析AGNES的核心在于距离度量方法的选择常见的有单链接(Single Linkage)取两个簇中最近样本的距离全链接(Complete Linkage)取两个簇中最远样本的距离平均链接(Average Linkage)取两个簇所有样本间的平均距离沃德方法(Wards Method)最小化合并后的簇内方差在我的实践中发现这些方法各有优劣单链接容易形成链条效应全链接对噪声敏感但聚类更紧凑沃德方法通常能产生最平衡的聚类结果3. DIANA算法详解3.1 DIANA工作原理DIANA(Divisive Analysis)是自上而下的分裂算法与AGNES相反。它特别适合发现数据中的异常值我在金融风控领域经常使用。算法流程将所有样本视为一个簇找出当前簇中与其他点平均距离最大的样本作为分裂点形成两个新簇分裂点簇和剩余点簇递归地对每个新簇执行分裂直到满足停止条件(如簇数量或直径阈值)3.2 DIANA实现要点Python中没有DIANA的直接实现但可以基于以下逻辑自定义import numpy as np from scipy.spatial.distance import pdist, squareform def diana_cluster(data, max_clusters): clusters [data] while len(clusters) max_clusters: # 找出最大直径的簇 diameters [np.max(pdist(c)) for c in clusters] target_idx np.argmax(diameters) target clusters.pop(target_idx) # 找出分裂点 dist_matrix squareform(pdist(target)) avg_distances np.mean(dist_matrix, axis1) split_point np.argmax(avg_distances) # 分裂簇 new_cluster [target[split_point]] remaining np.delete(target, split_point, axis0) clusters.extend([new_cluster, remaining]) return clusters4. AGNES与DIANA对比分析4.1 算法特性对比特性AGNESDIANA方向自底向上自顶向下时间复杂度O(n³)O(2ⁿ)适用场景中小数据集异常值检测内存消耗中等较高聚类形状适应各种形状偏好球形簇4.2 实战选择建议根据我的项目经验选择建议如下当数据量1万且需要完整层次结构时优先选AGNES当重点关注异常检测或数据有明显层级时考虑DIANA大数据集考虑先用AGNES的优化版本(如BIRCH)实用技巧可以先用AGNES快速分析再用DIANA深入检查可疑簇。5. Python实现进阶技巧5.1 可视化优化树状图是理解层次聚类的关键。我常用的优化方法def enhanced_dendrogram(Z, labelsNone): plt.figure(figsize(12,6)) dendrogram(Z, labelslabels, leaf_rotation90, leaf_font_size8, show_contractedTrue) plt.title(Enhanced Dendrogram) plt.xlabel(Sample index) plt.ylabel(Distance) plt.grid(True, linestyle--, alpha0.5) plt.tight_layout() plt.show()5.2 聚类结果提取从linkage矩阵中提取扁平聚类from scipy.cluster.hierarchy import fcluster # 按距离阈值提取 clusters fcluster(Z, t1.5, criteriondistance) # 按聚类数量提取 clusters fcluster(Z, t3, criterionmaxclust)6. 常见问题与解决方案6.1 内存不足问题处理大数据集时的优化策略使用稀疏矩阵表示距离矩阵采用采样方法先处理子集使用Mini-Batch或BIRCH等优化算法6.2 距离计算选择不同数据类型的最佳距离度量连续数值欧式距离分类数据汉明距离文本数据余弦相似度混合数据Gower距离6.3 聚类效果评估我常用的评估方法组合轮廓系数(Silhouette Score)戴维森堡丁指数(Davies-Bouldin Index)可视化检查(降维后观察)from sklearn.metrics import silhouette_score # 计算轮廓系数 score silhouette_score(X, clusters) print(fSilhouette Score: {score:.3f})7. 实战案例客户细分分析以电商用户行为分析为例import pandas as pd from sklearn.preprocessing import StandardScaler # 加载数据 data pd.read_csv(user_behavior.csv) # 特征工程 features [purchase_freq, avg_order_value, browse_duration] X data[features] # 标准化 scaler StandardScaler() X_scaled scaler.fit_transform(X) # 层次聚类 Z linkage(X_scaled, methodward) # 提取5个簇 data[cluster] fcluster(Z, t5, criterionmaxclust) # 分析聚类特征 cluster_profile data.groupby(cluster)[features].mean() print(cluster_profile)这个案例中我们发现了5类典型用户高频高价值用户低频高价值用户中等活跃度用户浏览型非购买用户流失风险用户8. 性能优化与扩展8.1 加速计算技巧使用快速实现如fastcluster库并行计算距离矩阵近似算法如HDBSCANimport fastcluster # 更快的linkage计算 Z fastcluster.linkage(X, methodward)8.2 与其他算法结合我常将层次聚类作为其他算法的预处理步骤先用层次聚类确定K-means的K值结合PCA降维提高可视化效果作为深度学习的特征工程步骤9. 最新进展与趋势近年来层次聚类的改进方向增量式层次聚类处理流数据基于GPU的加速实现与深度学习的结合可解释性增强方法我在实际项目中测试过一些新算法发现基于局部敏感哈希(LSH)的近似方法能显著提升大数据集的处理速度。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进