人工智能系统正在做出影响人们生活的决策。谁获得贷款。谁获得工作面试机会。医学扫描是否看起来可疑。某人的脸部是否与犯罪数据库匹配。
这些不是抽象的可能性。他们现在正在发生——但有时他们会犯严重错误。
当人工智能系统产生的结果对某些人群系统性地不公平时,人工智能偏见就会发生。
重要的词是系统地。我们不是在谈论随机错误,而是在谈论对女性、有色人种、来自某些地区的人或其他群体产生不成比例影响的错误模式。
这是一个令人不安的事实:人工智能系统从我们身上学习了他们的偏见。
2019 年的一项研究发现,美国广泛使用的医疗保健算法对黑人患者存在偏见——为他们分配的风险评分低于同等病情的白人患者,这意味着他们获得的医疗护理较少。该算法没有直接接受过种族训练;它使用医疗保健成本作为替代指标,反映了医疗保健获取方面现有的不平等。
人工智能中的偏差几乎总是始于训练数据。以下是它的渗透方式:
如果人工智能接受过有关历史招聘决策的培训,并且这些决策历来有利于男性担任技术职位,那么人工智能就会学会复制这种模式。它不理解歧视——它只是看到“男性申请人往往会被雇用”并采取相应的行动。
众所周知,亚马逊建立了一种降低女性简历评级的招聘算法。它接受了 10 年成功招聘的培训——在这段时期,科技招聘主要以男性为主。当发现偏差时,该算法被悄悄废弃。
如果您的训练数据不包含多样化的示例,则人工智能在代表性不足的群体中表现不佳。
面部识别技术就是一个鲜明的例子。几个广泛使用的系统经过测试并发现:
原因是什么?训练数据集严重偏向浅肤色面孔。该系统在部署前并未针对不同人群进行测试。
如果你以有偏见的方式衡量成功,你的人工智能就会学会针对有偏见的结果进行优化。使用“顶尖大学毕业”作为智力指标对那些从未有机会进入顶尖大学的人不利——不是因为他们的智力,而是因为他们的社会经济背景。
这不是学术的。人工智能偏见会造成真正的伤害:
刑事司法 — COMPAS(替代制裁的惩教罪犯管理分析)是美国法院用来预测再犯可能性的工具。 ProPublica 2016 年的一项调查发现,即使在控制犯罪历史的情况下,它将黑人被告标记为“高风险”的比例几乎是白人被告的两倍。
医疗保健 - 上述医疗保健算法对黑人患者的预防性护理较少,因为黑人患者的病情与接受更多资源的白人患者一样。
贷款——多项研究发现,算法贷款工具批准白人申请人贷款的利率高于同样信誉良好的黑人或西班牙裔申请人。
就业——人工智能简历筛选工具被发现会惩罚诸如“女性”(如“女子象棋俱乐部”)之类的词,或者过滤掉历史上黑人大学的毕业生。
如果算法每天做出数千个决策,那么很小的百分比错误就会导致大量的真实人员受到影响。处理 10,000 份贷款申请的系统的错误率为 5%,这意味着每天有 500 人得到了他们不应该得到的结果。规模是否会改变您对“可接受”错误率的看法?
您可能会想:“我们不能检查偏见并消除它吗?”要是这么简单就好了。
代理问题:人工智能系统可以在不直接使用受保护特征的情况下进行区分。由于历史隔离,邮政编码与种族相关。购物习惯与收入相关。语音模式与口音和地区相关。您可以从数据中删除“种族”,但算法仍然可以学会区分。
公平指标之间的权衡:在数学上有不同的方法来定义“公平”。跨组错误率相同的系统将产生与正率相同的系统不同的总体结果。同时满足所有定义在数学上通常是不可能的。
反馈循环:如果人工智能决定谁受到更严厉的监管,这些社区将有更多记录的犯罪,这会训练下一个人工智能对他们进行更严厉的监管——这是一个自我强化的循环。
在偏见造成伤害之前发现偏见的最有效方法之一是让多元化的团队构建人工智能系统。
同质化的团队存在盲点。当房间里的每个人都有相似的背景、生活经历和假设时,他们就不太可能问:“但这会对那些看起来不像我们的人产生什么影响呢?”
多元化的团队更有可能:
登录 参与讨论
麦肯锡的研究发现,拥有多元化执行团队的公司在盈利能力方面表现出色的可能性要高出 36%,特别是在人工智能产品公司中,多元化团队更擅长构建适合不同用户的产品。
人工智能研究社区正在积极研究解决方案:
算法审核 - 在部署之前和之后系统地测试不同人口群体的人工智能系统,以发现差异。
多样化且具有代表性的数据集 — 刻意构建包含代表性不足群体的训练数据集,并记录哪些人包含在内,哪些人不包含在内。
可解释性工具 - 帮助人类理解人工智能为何做出特定决定的技术,从而更容易发现不公平的模式。
监管和问责 - 欧盟人工智能法案和类似立法正在为某些高风险人工智能系统制定法律要求,以进行偏见审计。
参与式设计——让受人工智能系统影响最大的社区参与设计和测试该系统。
您无需成为机器学习工程师即可为道德人工智能做出贡献:
人工智能是一种工具。与所有工具一样,它可以用得好,也可以用坏。它是否符合道德使用的问题不是一个技术问题——而是一个人性问题。