在上一课中,我们了解到人工智能是从经验中学习的软件。但这实际上是如何运作的呢?机器如何从一无所知到识别你的脸或推荐你下一首最喜欢的歌曲?
让我们探索智能软件背后的秘密。
每个机器学习系统都遵循相同的基本周期:
把它想象成学习做饭。您遵循食谱(数据),注意什么有效(模式),尝试自己的变化(预测),品尝结果(反馈),并在下次调整调味料(改进)。
Google 用于检测垃圾邮件的人工智能每分钟处理超过 1000 万条可疑邮件。每次用户将某些内容标记为“垃圾邮件”或“非垃圾邮件”时,系统都会学习并更新其模式 - 每次点击都会变得更加智能。
最常见的机器学习类型称为“监督学习”。它的工作原理就像跟着老师学习一样,老师会给你答案。
它的工作原理如下:
想象一下您向机器显示 100,000 封电子邮件。每个邮件都被人类标记为 “垃圾邮件” 或 “非垃圾邮件”。
机器注意到模式:
在研究了足够多的示例后,它可以查看从未见过的全新电子邮件并预测它是否是垃圾邮件 - 无需任何人编写特定规则。
监督学习依赖于标记数据——有人必须提供正确的答案供机器学习。您认为谁给所有这些数据贴上标签?在许多情况下,需要成千上万的工作人员仔细标记图像、文本和音频。人工智能的“智能”往往始于人类的大量努力。
机器学习中的”监督学习”是什么意思?
如果您没有答案怎么办?如果您只有大量数据并且希望机器自己找到有趣的模式怎么办?
这就是无监督学习。没有老师,没有标签,没有正确答案。机器探索数据并将相似的事物分组在一起。
想象一下,一家超市拥有数百万顾客的购买数据,但没有标签。人工智能分析数据并发现自然群体:
登录 参与讨论
没有人告诉机器这些团体的存在。它通过发现购物数据中的模式自行找到它们。超市现在可以向每个群体发送相关报价。
无监督学习与监督学习有何不同?
第三种是强化学习,它的工作原理很像训练狗。
当狗按照命令坐下时,你就给它零食(奖励)。当它咬你的鞋子时,你说“不”(惩罚)。随着时间的推移,狗会知道哪些行为会带来奖励,哪些行为会带来麻烦。
强化学习的工作原理相同:
1.人工智能在环境中采取行动 2.它收到奖励(正)或惩罚(负) 3.随着时间的推移,它会调整策略以最大化奖励 4.它尝试数百万种不同的方法,直到找到最好的一种
谷歌的 AlphaGo 通过与自己玩数百万局来学会玩古老的棋盘游戏围棋。每一次胜利都是一种奖励;每一次失败都是一种惩罚。它尝试了疯狂的策略,从失败中吸取教训,并最终比历史上任何人类玩家都更好。
同样的方法还用于训练机器人行走、教自动驾驶汽车导航以及优化数据中心的能源使用。
AlphaGo 在训练期间与自己进行了超过 3000 万场比赛。一个人每天玩一款游戏大约需要 82,000 年才能玩那么多游戏。人工智能将所有这些经验压缩到短短几周内。
|类型 |有标签吗? |类比|示例| |------|------------|---------|---------| | 监督 |是的 |带着答案学习 |垃圾邮件过滤器、医疗诊断| | 无人监督 |没有 |整理凌乱的抽屉|客户分组、异常检测 | | 强化 |否(使用奖励)|用零食训练狗 |游戏人工智能、机器人、自动驾驶汽车 |
想想你是如何学会骑自行车的。是有人监督(有人确切地告诉你该怎么做)、无人监督(你自己找到平衡)还是强化(你跌倒、调整并再次尝试)?大多数人类学习实际上是这三者的混合。人工智能学习风格的灵感来自于我们如何自我学习。
哪种类型的机器学习最像用零食和命令训练宠物?
不需要成为数学家或程序员才能理解机器学习。从本质上讲,它是关于从经验中学习——每个人从出生那天起就自然而然地做的事情。人工智能只是用数据而不是生活经验来做到这一点。
现在您已经了解了机器如何学习,下一课将向您展示已经装在您口袋里的人工智能。您的智能手机充满了智能功能 - 让我们来揭开它们的面纱。