抖音的安全与信任中心公开了抖音的推荐算法,而且公开的方式非常好玩,他们写了一篇非常科普的文章,名字叫《从零开始了解推荐系统》,我认真看了一下,写得非常好,深入浅出,很涨知识。
现代社区中算法推荐是非常关键的一环,但是随着算法的发展,大社区或者内容平台的“推荐算法”已经越来越不可捉摸了,大家开始觉得“算法”这个东西非常神秘,因为神秘又显得有点儿邪恶——因为我们并不完全了解它是“怎么算的”,我们不明白它的原理,只是一定程度上接受它给出的结果,这就会让人觉得被操控了。
所以抖音这次就是尽量说明白它的推荐算法设计的思路和原理——非常不错的做法,而且我非常喜欢这种“把用户当成一个具备正常理解力、判断力、认真详细地介绍算法原理”的风格,我觉得这代表着最基础的尊重。我看了看,文章写得非常不错,中正平和。
简单归纳一下这个科普的内容,传统的推荐算法是这样的,你在抖音上狂看猫、汽车和宇航员,在遥远的阿拉斯加有个叫约翰的哥们,在抖音上狂看汽车、宇航员和马,那么系统就会认为“喜欢汽车的用户很可能喜欢宇航员”,然后,当你看到一个新内容,比如乐高的时候,系统就会顺手认为“看过汽车和宇航员的用户很喜欢看乐高”!于是就会在约翰看了汽车内容的时候给他下一条显示“乐高”——传统的推荐算法就是这样的。找到和你兴趣相似的用户,然后把他们感兴趣的内容也推荐给你。
当然面对海量的用户,判断和计算的过程要复杂许多倍。但重点在于,这种推荐方法是不“理解”视频是什么内容的。它只是通过找到和你行为类似的用户,然后认为“他们喜欢的你也会喜欢”,再把他们喜欢的内容也推荐给你。
其实这也是大众(包括我)此前理解的“算法”,换句话说,大批人猜测的“如何制作爆款”其实是基于对这种推荐算法的想象。所以你能看到一大堆网络大师告诉你如何制造爆款短视频,获得更多的推荐机会,但实际上都是错的。
实际上新的算法自从2016年抖音上线的时候就已经开始应用了。本质上和上面的推荐算法完全不是一码事儿,抖音非常坦率地把现在的算法原理也给出来了,非常好玩,简单来说就是人工神经网络把“每一个内容”和“每一个用户(注意是每一个用户)的行为”各自转化成一串复杂的“数字集合”,然后比对两组数字集合的“相似度”,最终,算法是在一个巨大的数学高维空间中用用户行为的数字特征去匹配海量内容的数字特征——两组数据的“距离”越近,就说明这个内容可能越适合这个用户。然后现在抖音实际是先预测“用户对内容的目标行为、如点赞、分享”,然后筛选出产生这些行为概率最大的内容再推荐给相关用户——换句话说机器已经知道了你看完后有多大概率会点收藏或推荐,然后从海量内容中挑出你最可能点的内容(也代表你喜欢)给你。非常抽象!
当然这个说法还是非常简单,具体的例子在网站上( http://t.cn/A6rDjapd )都有很详细的介绍,能不能看懂我不敢保证,但至少他们是非常认真地试图给你讲明白。
其实大家对于“算法”和“推荐”的认知细想想还真是挺粗糙的。很多人其实根本没想过也不想算法是什么,我之前就看到很多人认为内容平台的算法推荐是“你喜欢猫,就给你推猫”这种超质朴的想法。再比如“数字茧房”,这个说法其实很大程度就来源于大家对于算法的认知还是“上一代推荐机制”,觉得算法把人搓堆儿,但其实现在早就不这样了。
大家不了解,就容易妖魔化,这是一方面。另一方面,很多平台其实也有意无意地神秘化和玄幻化自己的“算法推荐”——当然我理解这里面有防止有人狂出爆款、提升自己技术形象的的考虑,但这也助长了大众对于技术的不理解。
所以我最喜欢的还是抖音的态度,就是踏踏实实地把这事儿给你摆出来,尽量给你讲明白原理。不说别的,这就是一种尊重。我们只有了解一个东西的运行原理,才会信任它,相信它在服务我们,然后才能相信它会让我们的生活变得更好,以及相信它在未来也不会绑架我们。当然在未来我们还会迎来更复杂和更好的算法,对于算法,未来会带给我们什么我还不我确定,但至少我比之前更了解它是怎么运作的了。#抖音算法原理公开#
发布于 北京
