AIUnlimited
🌳

AI基础

🌱
AI 种子

从零开始

🌿
AI 萌芽

打好基础

🌳
AI 枝干

付诸实践

🏕️
AI 树冠

深入探索

🌲
AI 森林

精通AI

🔨

AI精通

✏️
AI 草图

从零开始

🪨
AI 雕刻

打好基础

⚒️
AI 匠心

付诸实践

💎
AI 打磨

深入探索

🏆
AI 杰作

精通AI

📘

AI实战

📖
理解开源模型

开源模型的基础知识和资源

🎯
问题到模型任务

将业务问题转化为模型任务

⚡
跑通第一个模型

30分钟快速看到第一个结果

🔧
微调与评测

微调模型并评估性能

🚀
应用系统

构建实际AI应用系统

🎨
生成式AI

探索AIGC的开源模型

🤖
Agent智能体

学习Agent框架和MCP工具

📐
基础补充

LLM基础知识和评测

🎓

Claude 学院

🤖
Claude 101 入门

用 Claude 学习 AI 基础知识

💻
Claude Code 101 入门

让 Claude 成为你的结对编程伙伴

🤝
Claude Cowork 入门

与 Claude 协作完成复杂项目

⚙️
Claude 平台 101

使用 Claude API 构建应用

实验室

已加载 7 个实验
🧬神经网络沙盒🤖AI 还是人类?🥋提示工程道场🏁算法竞速🧠AI 知识挑战🏗️系统设计画布
🎯模拟面试进入实验室→
🚀

职业发展

🚀
面试发射台

开启你的旅程

🌟
行为面试精通

掌握软技能

💻
技术面试

通过编程轮次

🤖
AI与ML面试

ML面试精通

🏆
Offer与未来

拿下最好的Offer

立即开始
AIUnlimited

AI 教育平台

沪ICP备18025655号-11

学习

  • AI基础
  • AI实战
  • Claude学院
  • 实验室
  • 职业发展

社区

  • 关于
  • 常见问题

支持

  • 服务条款
  • 隐私政策
  • 联系我们
AI & 工程学习计划›🌿 AI 萌芽›课程›聚类:AI如何在没有标签的情况下发现规律
🔵
AI 萌芽 • 中级⏱️ 25 分钟阅读

聚类:AI如何在没有标签的情况下发现规律

聚类:人工智能如何找到没有标签的模式 🔵

到目前为止,您学习的每个算法都受到监督:您向其提供带标签的示例,它会学习预测新标签。但是,当您拥有大量数据并且根本没有标签时会发生什么?

这就是无监督学习的用武之地——而集群是其最强大的工具之一。


🔍 什么是聚类?

聚类是将数据点分组在一起的任务,以便同一组(簇)中的点比其他组中的点更“相似”。

至关重要的是,没有人告诉算法有多少组或它们代表什么。它自己找到结构。

可以将其想象为闭上眼睛对一堆混合糖果进行分类,只需使用触摸即可。你可以根据形状对它们进行分组——圆形的放在一起,长的放在一起,耐嚼的和硬的分开——没有人提前定义类别。

🤯

天文学家使用聚类根据形状和组成对星系进行分组,遗传学家使用聚类来识别疾病亚型,Spotify 则使用聚类来生成个性化播放列表 - 所有这些都无需任何人手动标记数据。


📍 K-Means:最著名的聚类算法

K-Means 简单、快速且功能强大。这是简单英语的完整算法:

  1. 选择 K — 提前决定您想要多少个集群。
  2. 随机放置 K 个质心 — 在数据空间中随机散布 K 个点。质心只是簇的“中心”。
  3. 将每个数据点分配给最近的质心 - 每个点都属于它最接近的质心。
  4. 重新计算每个质心 — 将每个质心移动到分配给它的所有点的平均位置。
  5. 重复步骤 3 和 4 — 不断重新分配和重新计算,直到分配停止变化。
K-Means 的三次迭代:随机质心、第一次分配、以不同颜色显示的最终聚合簇
K-Means 在将点分配给质心和重新计算质心位置之间进行迭代,直到簇稳定。

打个比方:想象一下将 K 块磁铁放在客户地址地图上。每个顾客都会被最近的磁铁所吸引。然后你将每个磁铁移动到其客户的中心。重复直到磁铁停止移动。

🤔
Think about it:

K 均值取决于质心的初始随机放置。对相同数据的两次运行可能会产生不同的簇。您如何决定哪个结果更好?你甚至会测量什么?


🔢 选择 K:肘部法

一个实际问题:如何选择K?如果你将 K 设置为数据点的数量,那么每个点都是它自己的簇——完美但无用。如果 K = 1,一切都是一大团——同样毫无用处。

elbow 方法 有助于:对 K = 1, 2, 3, … N 运行 K 均值,并绘制随着 K 增加“误差”(簇内方差)减少的程度。更多的簇总是会减少误差,但通常在 K 处,改进开始急剧放缓——曲线中的“肘部”。这是正确 K 的良好候选者。

这不是一条硬性规则,但它为您提供了一个原则性的起点。


🌿 层次聚类

K-Means 要求您预先修复 K。 层次聚类没有。

相反,它通过以下任一方式构建聚类树(称为树状图):

  • 聚合(自下而上):从每个点作为自己的簇开始。反复合并两个最相似的簇,直到一切都成为一个大簇。
  • 分裂(自上而下):从一个集群中的所有内容开始。反复分割最不相似的簇,直到每个点都是自己的簇。

生成的树状图允许您在任何级别“切割”以获得任意数量的簇,这是非常灵活的。缺点:层次聚类在大型数据集上的计算成本很高。


🌍 实际应用

聚类无处不在:

|应用 |什么被聚集| |---|---| |客户细分|按购买行为对客户进行分组 | |图像压缩 |像素颜色缩减为 K 个代表颜色 | |文件组织|按主题分组的文章没有手动标签 | |异常检测|不适合任何聚类的异常值 = 可疑 | |遗传学 |按疾病亚型分组的基因表达模式| |社交网络|通过连接模式识别的社区 |


⚠️ 聚类的局限性

集群很强大,但也有真正的局限性:

  • 解释集群很困难 - 算法对数据进行分组,但您仍然必须弄清楚每个组。
第 16 课,共 16 课已完成 0%
←决策树:可以在纸上画出的算法

讨论

登录 参与讨论

意味着什么
  • K-Means 假设大致为球形簇 - 它难以处理细长、不规则或嵌套的簇形状。
  • 对比例敏感 - 具有大数值范围的特征主导距离计算;始终在聚类之前对特征进行归一化。
  • 没有事实真相 - 没有标签,评估质量是主观的。两位分析师可能会从同一聚类中得出不同的结论。
  • 🤯

    K-Means 最初由 Stuart Lloyd 于 1957 年提出(作为贝尔实验室内部技术说明),并于 1965 年由 Forgy 独立重新描述。尽管它已经存在了很长时间,但它仍然是数据科学中使用最广泛的算法之一。