“大宝藏!”OpenAI前首席科学家 Ilya 的顶级AI学习清单(附下载链接)

发布时间2024年10月12日

OpenAI 前首席科学家 Ilya Sutskever 近日分享了一份顶尖人工智能的研究和学习清单,包括论文博客书籍等内容。此举在学术界和技术社区引起了广泛关注,这份清单被认为涵盖了当前人工智能领域最为关键的 90% 知识,对于希望深入理解该领域的研究者和开发者来说,无疑是一份珍贵的学习资源。

让我们一睹为快!

论文和书籍PDF下载链接:

链接:https://pan.baidu.com/s/1VpUAyqjRfDOoRncIxClgwA

提取码:1234

一、论文

清单中的论文涉及多个研究方向,包括但不限于 Transformer 架构循环神经网络(RNN)计算机视觉与图像处理自然语言处理以及语音识别与合成等。

计算机视觉与图像处理

  • Deep Residual Learning for Image Recognition

微软研究院何恺明等人于2015年发表。这篇论文提出了深度残差学习(Deep Residual Learning)的概念。极大地推动了深度学习在图像识别、目标检测、语义分割等领域的应用。ResNet作为一种经典的网络结构,至今仍被广泛应用于各种任务中。

论文链接:https://aminer.cn/pub/573696026e3b12023e515eec?fr=dp


  • Multi-Scale Context Aggregation by Dilated Convolutions

文中提出的扩张卷积多尺度上下文聚合方法对后来的语义分割研究产生了深远影响。扩张卷积作为一种有效的工具,被广泛应用于各种视觉任务中,尤其是在需要保持空间分辨率的同时捕获上下文信息的场景。

论文链接:https://www.aminer.cn/pub/5c61095ada56297340b727be/?fr=mc


  • Identity Mappings in Deep Residual Networks

恒等映射的提出对深度学习领域产生了深远的影响。它不仅提高了深度残差网络的性能,而且为设计更深的神经网络提供了新的思路。

论文链接:https://www.aminer.cn/pub/5736960a6e3b12023e51d5fb?fr=imi


  • ImageNet Classification with Deep Convolutional Neural Networks

这是一篇在深度学习和计算机视觉领域具有里程碑意义的论文,由Alex Krizhevsky、Ilya Sutskever和Geoffrey Hinton于2012年发表。这篇论文介绍了名为AlexNet的深度卷积神经网络(CNN),该网络在当年的ImageNet大规模视觉识别挑战赛(ILSVRC)中取得了突破性的成绩。

论文链接:https://www.aminer.cn/pub/53e9a281b7602d9702b88a98?fr=icdc


自然语言处理

  • Attention is All You Need

Google 2017 年发表的经典论文,距今 7 年,《Attention Is All You Need》,这是 Transformer 架构的问世之作。Transformer 架构今天已经成为人工智能领域的主流基础架构,特别是它是生成式 AI 模型的核心架构。

论文链接:

https://www.aminer.cn/pub/599c7987601a182cd2648373?fr=aan


  • Neural Machine Translation by Jointly Learning to Align and Translate

这篇论文提出了一个称为注意力机制(Attention Mechanism)的新型神经机器翻译(NMT)模型,该模型在翻译任务中同时学习对齐和翻译,显著提高了翻译质量。

论文链接:

https://www.aminer.cn/pub/5550411c45ce0a409eb3897f?fr=nmt


  • A simple neural network modulefor relational reasoning

这篇论文由Relational Networks团队于2017年发表,论文提出了一种名为关系网络(Relational Network,RN)的神经网络模块。这个模块能够捕获数据中实体之间的关系,并将其用于推理任务。它不仅简化了模型结构,而且在多个基准测试中展示了优异的性能。

论文链接:https://www.aminer.cn/pub/5a260c0c17c44a4ba8a1e176?fr=asnn


  • The Annotated Transformer

由哈佛大学NLP组负责人兼谷歌研究科学家Ashish Vaswani等人于2018年发布的论文。这篇论文并不是传统意义上的研究论文,而是一篇详细解释和注释了原始Transformer模型的教程性文章,它极大地促进了社区对Transformer模型的理解和采用。

论文链接:https://www.aminer.cn/pub/5ed07c2c9e795e34136ec335?fr=tat


  • Scaling Laws for Neural Language Models

OpenAI在2020年发表,论文探讨了神经语言模型的规模(如参数数量、数据集大小和计算量)与其性能之间的关系,即“Scaling Laws”,为GPT系列的开发提供了理论基础。

论文链接:https://www.aminer.cn/pub/5e2ac03c3a55ac8999c1ad99?fr=sln


  • order-matters-sequence-to-sequence-for-set

它探讨了一种新的序列到序列(Seq2Seq)模型的变体,用于处理集合(sets)而不是传统序列(sequences)的数据。

论文链接:https://www.aminer.cn/pub/634d805290e50fcafd4dfead?fr=om


神经网络架构与计算模型

  • Variational Lossy Autoencoder

VLAe的提出为自编码器的设计提供了新的视角,它通过允许一定程度的信息损失,提高了模型在生成复杂和多样化数据方面的能力。这对于需要生成模型的应用,如图像合成风格迁移增强学习中的探索策略,具有重要的研究价值。

论文链接:https://www.aminer.cn/pub/58d82fced649053542fd7021?fr=vla


  • Relational recurrent neural network

论文提出了关系循环神经网络(Relational RNNs),这是一种新的神经网络架构,它通过在传统RNN的基础上增加一个关系模块来增强模型捕捉序列中元素间关系的能力,提高了神经网络在理解复杂序列结构方面的能力。

论文链接:https://www.aminer.cn/pub/5b67b4b117c44aac1c866888?fr=rrn


  • Recurrent Neural Network Regularization

论文提出了一些新的正则化方法,以适应RNNs的特性。这些正则化技术有助于RNNs更好地处理长序列数据,减少过拟合,并提高模型在测试数据上的表现。

论文链接:https://www.aminer.cn/pub/5550415945ce0a409eb3a847?fr=rnnr


  • Keeping Neural Networks Simple by Minimizingthe Description Length of the Weights

论文提出了一种基于最小描述长度( MDL)原理的方法来简化神经网络。这种方法是一种早期的正则化技术,它通过考虑模型参数的编码长度来直接控制模型的复杂度。它为后来的正则化方法,如L2正则化和L1正则化奠定了基础。

论文链接:https://www.aminer.cn/pub/539087be20f70186a0d5192b?fr=knn


语音识别与合成

  • Deep Speech 2: End-to-end Speech Recognition in English and Mandarin

这是一篇由百度在2015年发表的一篇论文,它提出了一种端到端的语音识别系统,该系统能够有效地处理英语和普通话两种语言的语音识别任务。

论文链接:https://www.aminer.cn/pub/64b665bd3fda6d7f069e3b83?fr=ds2


  • Neural Turing Machines

Neural Turing Machines结合了神经网络的学习能力和图灵机的存储与处理能力。它通过引入一个外部记忆矩阵,使得神经网络能够读写这个记忆,激发了后续关于记忆增强神经网络的研究,包括不同的可微分记忆模型和注意力机制。

论文链接:https://www.aminer.cn/pub/5550411945ce0a409eb38881?fr=ntm


  • Gpipe: Easy Scaling with Micro-Batch Pipeline Parallelism

一篇由Google AI的研究人员于2019年发表的论文,它提出了一种用于训练大型神经网络的新型并行计算方法。通过将输入数据分成更小的微批次,并在不同的设备上并行处理这些微批次,GPipe能够有效地利用计算资源,提高训练效率。

论文链接:https://www.aminer.cn/pub/5e8d928c9fced0a24b6120a1?fr=gpipe


跨学科人工智能研究与应用

  • Neural Message Passing for Quantum Chemistry

论文提出的神经消息传递模型是一种图神经网络(GNN),它能够处理分子结构的图表示。

论文链接:https://www.aminer.cn/pub/5c8a11324895d9cbc6121c34?fr=nmp


  • A Tutorial Introduction to the Minimum Description Length Principle

论文详细解释了如何应用MDL原理来选择模型,包括如何计算描述长度,以及如何处理实际应用中的复杂性问题。

论文链接:https://www.aminer.cn/pub/5c610678da56297340ac0ab7?fr=ati


  • Machine super intelligence

论文探讨了机器超级智能的实现及其对社会的影响,创新性地提出了一个多维度的评估框架来衡量机器智能的社会影响。

论文链接:https://www.aminer.cn/pub/56d8d112dabfae2eeea47fab?fr=msi

二、课程

  • S231n Convolutional Neural Networks for Visual Recognition

Lly推荐了斯坦福大学计算机科学课程 CS231n:用于视觉识别的卷积神经网络

课程链接:https://cs231n.github.io/

三、书籍

  • Kolmogorov Complexity and Algorithmic Randomness

在「复杂度」方面,Ilya 重点推荐了《Kolmogorov Complexity and Algorithmic Randomness》一书中讲解「算法统计」的部分。

书籍链接:https://www.lirmm.fr/~ashen/kolmbook-eng-scan.pdf

四、博客

  • The First Law of complexodynamics

文章探讨了物理系统随时间增加而复杂性先增后减的现象,与熵的单增性质形成对比。作者尝试利用柯尔莫哥洛夫复杂性理论为这一现象提供一个可能的解释,并提出了“复杂性”的计算方法,旨在更深入地理解系统在不同时间点的“有趣性”。

博客链接:https://scottaaronson.blog/?p=762


  • The Unreasonable Effectiveness of Recurrent Neural Networks

文章主要探讨了循环神经网络(Recurrent Neural Networks, RNNs)这一深度学习模型在处理序列数据任务上的强大能力与广泛应用潜力。

博客链接:https://karpathy.github.io/2015/05/21/rnn-effectiveness/


  • Understanding LSTM Networks

Ilya 推荐了 Anthropic 联合创始人、前 OpenAI 可解释性团队技术负责人 Christopher Olah 2015 年撰写的博客文章《Understanding LSTM Networks》,这篇文章全面细致地讲解了 LSTM 的基本知识,并阐明 RNN 取得的显著成果本质上是依靠 LSTM 实现的。

博客链接:https://colah.github.io/posts/2015-08-Understanding-LSTMs/

科技革命爆发的标志是新一代科技成果开始广泛应用生产生活,人工智能必定是人类历史上的第四次科技革命。