我之前的创业公司是做纠正AI算法偏见的软件,我做算法开发也有十年了,聊聊算法偏见在我们生活里有多常见,从求职到医疗,少数群体如何被数据边缘化。
举个简单例子,你刷到一个很有争议的视频,评论区几千条留言,然后你一翻,高赞回答全都是和你想法一样的,你可能会觉得,果然这世界还是正常的,大家都跟我想的一样。其实并不是,在很多平台,每个人看到的评论区都是不一样,你会看到平台认为你会互动的。而且越有争议的帖子越容易被推流,所以算法是非常支持且助长网暴的。
有段时间那个粘土动画很火,也暴露出了AI的一些问题,比如给AI一张女生在海边冲浪的照片,AI会自动给你变成男人。还有很多扫地机器人都只有女性声线。都是科技在强化社会的性别规训。
这些可能都是小事,但是这些算法偏见进入到更重要的系统里,比如保险公司和银行用算法决定理赔评估或者贷款评估,你的名字可能就决定了你过不过审,或者现在网上投出去的简历,一般都不会被活人看到,都是AI筛选,Amazon以前练过一个AI resume scanner,之后发现简历上出现“女性”等字样就会被降级,比如在Hobby一栏写了大学曾经是women’s volleyball team就被刷掉了,防不胜防。
所以这些偏见是怎么进入算法里的?最直观的就是训练数据。
AI还不能创造出自己从未见过的东西,garbage in garbage out。Microsoft早几年出过一个chatbot,叫Tay,放在Twitter上和人对话学习,早上起来还在说“hello beautiful people”,晚上就开始说“Hail Hitler”(侧面说明Twitter就是互联网垃圾场)。现在的LLM很多也用了这些数据。
不管是图像模型还是语言模型,大模型们都不是独立存在的,AI要解读一张图像,必要的环节就是feature extraction,把一张图像从纹理、色彩、形状和出现的物体都提取出来,AI要解读一段话,也要把这段话中词都情境化,所有词汇其实是一张网,在现有的数据网络里,女性这个词就是离宇航员、CEO或者拳击手比男性远,在图像训练数据里,提取出冲浪板的图像里女性出现频率就低于出现口红或灶台的图像。
但是制造AI的人也很重要,举个例子哦,被Luigi枪杀的CEO所属的公司,旗下之前有个产品叫Optum AI,他们的AI就是帮助医院决定在有限的医疗资源下,谁该优先被治疗,之后Nature发了篇论文指出他们这AI有种族歧视嫌疑,白人被获准进入ICU的几率是黑人的好几倍,所以他们是故意的吗?也不是。因为他们的AI团队在设计这个AI的时候想,我们要如何决定谁更需要治疗?在治疗上花了很多钱的人肯定更需要治疗呀!所以他们的AI根本不是在预测谁更需要治疗,而是谁会花更多的钱去治疗。
这听起来好像是个显而易见的事情,医院也是要赚钱的嘛,但是你给一个AI套上了公平公正的帽子,其实明明就是在给有钱人开路,那那些已经处于劣势的群体怎么办?上哪里申诉?
现在AI在全世界范围内的立法都是很注重数据隐私的,尤其像金融或者是医疗数据,所有的PIP都会被隐藏。然后各国政府鼓鼓掌,说你看GDPR或者PIPEDA,我们尽力了。
但是你给AI一张x光片,它根本不需要知道这些隐私信息就能准确的判断出这个患者的年龄段、种族、性别,然后AI还会用它以前学习过的关于这些年龄段、种族和性别的知识例子做判断。
这听起来没什么问题,哇,AI好厉害呀,但是问题是,大量的历史数据都表明,高龄/女性/少数民族患者在各种高危疾病中都是极其容易被误判和忽视的。把这个偏见不加改变的代入了AI,广泛应用,比一个庸医杀死的人要多很多,这是不可估量的,也没有人在统计这些数字。我参与了很多欧盟AI道德立法的working group,结论就是现在的立法远远追不上AI发展的速度。
开发算法的过程中有很多技巧可以规避这些风险,就不展开讲了,但如果你不是一个AI从业者,可以做什么?
你的文字和影像都会被喂给AI, period. Privacy is dead. 二十年前的数据里可能一个senior engineer的职位99%都是白男人,家里申请贷款的也都是男人,但是如果你做着与传统规范有出入的事,你被看见,那你的存在就是一个世界没见过的数据,AI本身只反映这个世界已有的偏见,如果AI见多了男人做饭,就会知道厨房并不是女人专属的地方,所以归根结底是指出和纠正现实中的偏见。
这话我之前说过很多次了,但是我还是要再说一遍:我们的每一个行为都是在为自己想要的世界投票,榜样的力量是无穷的,这些榜样可以不完美,但是不能不存在。
发布于 西班牙
