杨立昆(Yann LeCun)在推特上分享的一个免费书籍的故事,以下内容为转译:
***
让我来分享一个关于免费书籍的故事。
在1990年代中期,我在 AT&T实验室里开展了一个名为 DjVu 的项目。
我们的目标是,制定一种新型的图像压缩格式,让打印文件能够以高分辨率被扫描,然后高效地通过新兴的互联网进行分发。
这种格式于 90年代末到 00年代初开始发表,并且得到了包括互联网档案等在内的众多网站的采用。
为了有效地展示这项技术,我决定扫描并发布神经信息处理系统会议(Neural Information Processing Systems,简称NIPS)的全部论文集。
我向出版商 Morgan Kaufman 和 MIT Press 获取这样进行的权限,他们同意了,因为他们并未从过去的论文集中获得收入。
我们扫描了所有 13 卷的论文集,进行了光学字符识别(OCR)处理,对所有材料进行了索引,并在 2000 年将其发布在了一个免费的网站上:http://t.cn/A6ld9ML3。
这个开源的知识库为机器学习研究社区提供了巨大的帮助。
大约在同一时间,机器学习(ML)社区开始反抗商业期刊出版商,并创建了 JMLR(Journal of Machine Learning Research)机器学习研究期刊,这是第一个开源且全免费的期刊,这也带来了巨大的益处。
逐渐地,NIPS会议停止印刷论文集,而是开始在他们的网站上(http://t.cn/Rhbenpq)发布所有的书籍,包括我们的扫描版本。
如果你曾经想知道为什么 ML/AI 社区积极推动预印版的快速发布和开源出版物,就是这个原因。
***
有趣的背景故事:NIPS 的第 0 卷(1987)是由非赢利的出版者美国物理学会出版的。
美国物理学会已经将版权售给了非常赢利的施普林格出版公司。我们联系了施普林格美国,并请求扫描和发布会议记录的权限。 他们的回答是不行。 因此,每当用户点击第 0 卷的文章时,我们会显示一段文字: "由于施普林格的版权限制,本文不可查看。请联系施普林格的
我们在两天内收到了授权信。 他声称,之前拒绝的决定是由美国子公司中级别较低的员工做出的,他们不敢将此请求升级到他这里。
***
其实是这样的,拉里·佩奇曾在斯坦福听我讲过 DjVu,那时他还是一名博士生(大约1998年)。他在 2002 年初提出让我担任研究主管,但我拒绝了。
谷歌在 2002 年为他们的目录扫描项目获取了 DjVu 技术的授权,不过他们实际上并没有使用。后来,他们聘请了 Luc Vincent,他之前在 LizardTech 公司负责 DjVu 项目,这个公司也是从 AT&T 获取了 DjVu 的技术。
于是,Luc 开始了他在谷歌的图书扫描项目。
当时我拒绝加入谷歌的原因有很多:
1. 早在2002年的1月份(也就是 Gmail、广告等出现之前),谷歌就拥有了600名员工,不过却没有任何收入。在那个阶段,实际上是无法进行真正的研究的。我的角色可能需要处理很多公司策略、技术产品开发、以及管控等等。而我希望能再次专注于机器学习、视觉技术、机器人技术和计算神经科学等基础研究领域。
2. 我们在硅谷的薪水并不高。区别就在于,股票期权的价格可能会创造奇迹。但是我们有正读高中准备上大学的孩子,所以需要现金。毕竟,硅谷的房价比新泽西要高。
3. 我的家人也不想搬去加利福尼亚。你不能在孩子们不情愿的情况下搬家,否则他们会因此怨恨你。
4. 之前我刚从 AT&T 离职,我以为我能在普林斯顿的 NEC 研究所继续我在机器学习、视觉技术、机器人技术和神经科学方面的研究。但我却发现那个地方很快就变成了一个应用研究实验室,所以我在18个月之后就离开了,转去了纽约大学。
如果我当时接受了他们的邀请,我想,谷歌的研究文化可能就会有所不同。我可能会让它稍早一些变得更开放,更有野心。
原文:http://t.cn/A6ld9MLu
