From Google’s NASv3 RL network, trained on 800 GPUs in 2016, to Meta’s Llama 3.1 405B, using 16,384 H100 GPUs in 2024, the number of processors used increased by a factor of over 20. Gemini Ultra was trained with an even larger number of TPUs, but precise details were not reported.
| Series | Model | Organization | Publication date | Training compute (FLOP) | Hardware quantity |
|---|---|---|---|---|---|
| Top 3 | KN-LM | 2007-06-22 | 7.7e+17 | 400 | |
| Top 3 | SB-LM | 2007-06-22 | 1.4e+18 | 1,500 | |
| Top 3 | High Performance CNN (NORB) | IDSIA, SUPSI | 2011-07-16 | 2.6e+16 | 4 |
| Top 3 | DistBelief NNLM | 2013-01-16 | 2.6e+18 | 180 | |
| Top 3 | NASv3 (CIFAR-10) | Google Brain | 2016-11-05 | 2.2e+21 | 800 |
| Top 3 | AlphaZero | DeepMind | 2017-12-05 | 1.1e+20 | 5,064 |
| Top 3 | RoBERTa Large | Facebook, University of Washington | 2019-07-01 | 8.5e+21 | 1,024 |
| Top 3 | OpenAI Five | OpenAI | 2019-12-13 | 6.7e+22 | 1,536 |
| Top 3 | GPT-3 175B (davinci) | OpenAI | 2020-05-28 | 3.1e+23 | 10,000 |
| Top 3 | ViT-G/14 | Google Brain, Google Research | 2021-06-08 | 5.8e+22 | 2,048 |
| Top 3 | Megatron-Turing NLG 530B | Microsoft, NVIDIA | 2021-10-11 | 8.6e+23 | 4,480 |
| Top 3 | PaLM (540B) | Google Research | 2022-04-04 | 2.5e+24 | 6,144 |
| Top 3 | GPT-4 | OpenAI | 2023-03-15 | 2.1e+25 | 25,000 |
| Top 3 | Amazon Titan | Amazon | 2023-09-28 | 4.8e+24 | 13,760 |
| Top 3 | Gemini 1.0 Ultra | Google DeepMind | 2023-12-06 | 5.0e+25 | 57,000 |
| Top 3 | Llama 3.1-405B | Meta AI | 2024-07-23 | 3.8e+25 | 16,384 |
| Top 3 | Grok 3 | xAI | 2025-02-17 | 3.5e+26 | 80,000 |
| Top 3 | Llama 4 Behemoth (preview) | Meta AI | 2025-04-05 | 5.2e+25 | 32,000 |
| Top 3 | Grok 4 | xAI | 2025-07-09 | 5.0e+26 | 200,000 |
| Other models | Theseus | Bell Laboratories | 1950-07-02 | 4.0e+1 | NA |
| Other models | SNARC | Harvard University | 1952-01-08 | NA | NA |
| Other models | Genetic algorithm | Institute for Advanced Study | 1954-07-02 | NA | NA |
| Other models | Self Organizing System | Massachusetts Institute of Technology (MIT) | 1955-03-01 | NA | NA |
| Other models | Sequence-based pattern recognition | Massachusetts Institute of Technology (MIT) | 1955-03-01 | NA | NA |
| Other models | Perceptron Mark I | Cornell Aeronautical Laboratory, Cornell University | 1957-01-01 | 6.9e+5 | NA |
| Other models | Pandemonium (morse) | Massachusetts Institute of Technology (MIT) | 1959-02-01 | 6.0e+8 | NA |
| Other models | Samuel Neural Checkers | IBM | 1959-07-01 | 4.3e+8 | NA |
| Other models | Pattern recognition and reading by machine | Sandia Corporation | 1959-12-01 | NA | NA |
| Other models | Perceptron (1960) | Cornell Aeronautical Laboratory | 1960-03-30 | 7.2e+8 | NA |
| Other models | ADALINE | Stanford University | 1960-06-30 | 6.6e+3 | NA |
| Other models | Linear Decision Functions | Bell Laboratories | 1962-06-01 | 1.6e+6 | NA |
| Other models | MADALINE I | Stanford University | 1962-07-01 | NA | NA |
| Other models | Print Recognition Logic | IBM | 1963-01-01 | 2.2e+7 | NA |
| Other models | Heuristic Reinforcement Learning | Purdue University | 1965-10-01 | 1.1e+6 | NA |
| Other models | LTE speaker verification system | IBM | 1966-11-01 | 1.1e+8 | NA |
| Other models | GLEE | University of Edinburgh | 1968-07-01 | NA | NA |
| Other models | Boxes (pole) | University of Edinburgh | 1968-07-01 | NA | NA |
| Other models | Decision tree adaline | Tokyo Medical and Dental University | 1969-05-01 | NA | NA |
| Other models | Piecewise linear model | University of Kansas | 1973-11-01 | NA | NA |
| Other models | Cognitron | Biological Cybernetics | 1975-09-01 | 5.2e+6 | NA |
| Other models | Neocognitron | NHK Broadcasting Science Research Laboratories | 1980-04-01 | 2.7e+8 | NA |
| Other models | Kohonen network | Helsinki University of Technology | 1981-07-25 | NA | NA |
| Other models | Hopfield network | California Institute of Technology | 1982-04-01 | NA | NA |
| Other models | ASE+ACE | University of Massachusetts Amherst | 1983-09-01 | 3.2e+8 | NA |
| Other models | Hierarchical Cognitron | NHK Broadcasting Science Research Laboratories | 1984-04-01 | NA | NA |
| Other models | Error Propagation | University of California San Diego, Carnegie Mellon University (CMU) | 1986-01-03 | NA | NA |
| Other models | Distributed representation NN | Carnegie Mellon University (CMU) | 1986-08-15 | 3.9e+8 | NA |
| Other models | Back-propagation | University of California San Diego, Carnegie Mellon University (CMU) | 1986-10-01 | 6.7e+8 | NA |
| Other models | Optimized Multi-Scale Edge Detection | Massachusetts Institute of Technology (MIT) | 1986-11-01 | NA | NA |
| Other models | NetTalk (transcription) | Princeton University | 1987-06-06 | 2.8e+10 | NA |
| Other models | NetTalk (dictionary) | Princeton University | 1987-06-06 | 2.8e+10 | NA |
| Other models | Translation-invariant MLP | Carnegie Mellon University (CMU) | 1987-06-15 | 1.8e+10 | NA |
| Other models | MLN-ASR | McGill University | 1988-08-01 | 3.0e+8 | NA |
| Other models | Q-learning | University of London | 1989-01-01 | NA | NA |
| Other models | MLP baggage detector | Science Applications International Corporation / SAIC | 1989-01-01 | NA | NA |
| Other models | Truck backer-upper | Stanford University | 1989-06-18 | NA | NA |
| Other models | Invariant image recognition | Complutense University of Madrid | 1989-06-18 | 2.7e+10 | NA |
| Other models | Speaker-independent vowel classification | University of Washington | 1989-11-27 | 7.5e+9 | NA |
| Other models | Handwritten Digit Recognition System | AT&T | 1989-11-27 | 1.8e+11 | NA |
| Other models | Zip CNN | AT&T, Bell Laboratories | 1989-12-01 | 1.5e+12 | NA |
| Other models | NETtalk reimplementation | Oregon State University | 1990-06-01 | 3.6e+10 | NA |
| Other models | Bankruptcy-NN | NA | 1990-06-17 | 3.1e+9 | NA |
| Other models | SexNet compression | NA | 1990-10-01 | 7.9e+10 | NA |
| Other models | SexNet classification | NA | 1990-10-01 | NA | NA |
| Other models | ISR network | Stanford University | 1990-10-01 | NA | NA |
| Other models | RAAM | NA | 1990-11-01 | NA | NA |
| Other models | Weight Decay | NA | 1991-12-02 | 7.5e+10 | NA |
| Other models | TD-Gammon | IBM | 1992-05-01 | 1.8e+13 | NA |
| Other models | Golem | Alan Turing Institute | 1992-10-01 | NA | NA |
| Other models | Cancer drug mechanism prediction | National Cancer Institute | 1992-10-16 | 5.3e+7 | NA |
| Other models | Boosting | Bell Laboratories | 1992-11-30 | NA | NA |
| Other models | IBM-5 | IBM | 1993-06-15 | NA | NA |
| Other models | Siamese-TDNN | Bell Laboratories | 1993-08-01 | 1.3e+13 | NA |
| Other models | ANN Eye Tracker | NA | 1993-11-29 | 1.8e+10 | NA |
| Other models | Ceramic-MLP | Sapienza Università di Roma | 1994-01-07 | 4.5e+9 | NA |
| Other models | GroupLens | Massachusetts Institute of Technology (MIT) | 1994-10-22 | NA | NA |
| Other models | Predictive Coding NN | Technical University of Munich | 1994-12-02 | 1.9e+13 | NA |
| Other models | NeuroChess | NA | 1994-12-02 | 8.6e+11 | NA |
| Other models | Mixture of linear models | NA | 1994-12-02 | 4.5e+11 | NA |
| Other models | JPMAX | NA | 1994-12-02 | 8.1e+7 | NA |
| Other models | Support Vector Machines | AT&T, Bell Laboratories | 1995-09-01 | NA | NA |
| Other models | LISSOM | University of Texas at Austin | 1995-11-27 | 2.0e+11 | NA |
| Other models | MUSIC perceptron | NA | 1996-06-03 | 8.8e+11 | NA |
| Other models | System 11 | Carnegie Mellon University (CMU) | 1996-06-18 | 2.6e+10 | NA |
| Other models | AdaBoost.M2 Digit Recognition | AT&T | 1996-07-03 | NA | NA |
| Other models | SOM-CNN | NA | 1997-01-31 | 3.1e+10 | NA |
| Other models | Deep Blue | IBM | 1997-05-01 | NA | NA |
| Other models | Bidirectional RNN | Advanced Telecommunications Research Institute | 1997-11-01 | NA | NA |
| Other models | LSTM | Technical University of Munich | 1997-11-15 | 3.2e+13 | NA |
| Other models | LeNet-5 | AT&T | 1998-11-01 | 2.8e+12 | NA |
| Other models | LSTM with forget gates | IDSIA | 1999-01-02 | NA | NA |
| Other models | RECONTRA-categorized | NA | 1999-06-02 | 8.0e+12 | NA |
| Other models | RECONTRA-uncategorized | NA | 1999-06-02 | 3.9e+12 | NA |
| Other models | IBM Model 4 | University of Southern California, IBM, University of Pennsylvania | 1999-07-02 | NA | NA |
| Other models | Neural LM | University of Montreal / Université de Montréal | 2000-11-28 | 6.3e+15 | NA |
| Other models | PoE MNIST | University College London (UCL) | 2000-11-28 | 5.2e+13 | NA |
| Other models | Immediate trihead | Brown University | 2001-07-06 | NA | NA |
| Other models | Gradient Boosting Machine | Stanford University | 2001-10-01 | NA | NA |
| Other models | Decision tree (classification) | Mitsubishi Electric Research Labs, Compaq CRL | 2001-12-08 | 6.3e+13 | NA |
| Other models | Thumbs Up? | Cornell University, IBM | 2002-05-28 | NA | NA |
| Other models | Statistical Shape Constellations | California Institute of Technology | 2003-01-01 | NA | NA |
| Other models | LDA | Stanford University | 2003-02-02 | NA | NA |
| Other models | NPLM (Brown) | University of Montreal / Université de Montréal | 2003-03-15 | 1.3e+14 | NA |
| Other models | NPLM (AP News) | University of Montreal / Université de Montréal | 2003-03-15 | 1.7e+15 | NA |
| Other models | Invariant CNN | New York University (NYU) | 2004-06-27 | 9.7e+11 | NA |
| Other models | LMICA | NA | 2004-12-01 | 2.8e+15 | NA |
| Other models | Hierarchical LM | NA | 2005-01-06 | 1.2e+14 | 1 |
| Other models | Histograms of Oriented Gradients | INRIA | 2005-06-25 | NA | NA |
| Other models | RankNet | Microsoft Research, Microsoft | 2005-08-07 | 3.5e+12 | NA |
| Other models | TFE SVM | Centre de Recherche en Automatique de Nancy (CRAN), CENPARMI | 2006-02-02 | NA | NA |
| Other models | FAST | University of Cambridge | 2006-05-07 | NA | NA |
| Other models | Spatial Pyramid Matching | INRIA, University of Illinois Urbana-Champaign (UIUC), Ecole Normale Supèrieure | 2006-06-17 | NA | NA |
| Other models | SVM-CNN | New York University (NYU) | 2006-06-17 | 7.5e+14 | 1 |
| Other models | Dimensionality Reduction | University of Toronto | 2006-07-18 | NA | NA |
| Other models | Deep Belief Nets | University of Toronto, National University of Singapore | 2006-07-18 | NA | NA |
| Other models | Local Binary Patterns for facial recognition | University of Oulu, IEEE | 2006-12-01 | NA | NA |
| Other models | Greedy layer-wise DNN training | University of Montreal / Université de Montréal | 2006-12-04 | NA | NA |
| Other models | λ-WASP | UT Austin | 2007-06-01 | NA | NA |
| Other models | BLSTM for handwriting (1) | University of Bern, IDSIA, Technical University of Munich | 2007-09-23 | NA | NA |
| Other models | Enhanced Neighborhood-Based Filtering | AT&T | 2007-10-28 | NA | NA |
| Other models | BLSTM for handwriting (2) | University of Bern, IDSIA, Technical University of Munich | 2007-12-03 | NA | NA |
| Other models | Deep Multitask NLP Network | NEC Laboratories | 2008-07-05 | NA | NA |
| Other models | Denoising Autoencoders | University of Montreal / Université de Montréal | 2008-07-05 | NA | NA |
| Other models | Sparse digit recognition SVM | University of Lubeck | 2008-11-19 | NA | NA |
| Other models | BigChaos 2008 | AT&T | 2008-11-25 | NA | NA |
| Other models | HLBL | University of Toronto | 2008-12-08 | NA | NA |
| Other models | GNN | University of Siena | 2008-12-09 | 1.6e+9 | 1 |
| Other models | BP-DBN | University of Toronto | 2009-01-01 | NA | 1 |
| Other models | RBM Image Classifier | University of Toronto | 2009-04-08 | NA | NA |
| Other models | GPU DBNs | Stanford University | 2009-06-15 | 1.0e+15 | NA |
| Other models | Pragmatic Theory solution (Netflix 2009) | Pragmatic Theory Inc. | 2009-08-01 | NA | NA |
| Other models | BellKor 2008 | AT&T | 2009-08-01 | NA | NA |
| Other models | BigChaos OptiBlend | AT&T | 2009-08-01 | NA | NA |
| Other models | BellKor 2009 | AT&T | 2009-08-01 | NA | NA |
| Other models | MatrixFac for Recommenders | Yahoo Research, AT&T | 2009-08-07 | NA | NA |
| Other models | Two Stage Feature Extraction (MNIST) | New York University (NYU) | 2009-09-01 | 2.1e+13 | NA |
| Other models | BellKor 2007 | AT&T | 2009-09-21 | NA | NA |
| Other models | LCNP MNIST | NA | 2009-11-22 | 4.2e+15 | NA |
| Other models | LCNP LabelMe | University of Bonn | 2009-11-22 | 3.3e+15 | NA |
| Other models | LCNP NORB | NA | 2009-11-22 | 2.5e+15 | NA |
| Other models | Super-vector coding | University of Illinois Urbana-Champaign (UIUC), NEC Laboratories, Rutgers University | 2010-01-01 | NA | NA |
| Other models | Stacked Denoising Autoencoders | University of Montreal / Université de Montréal, University of Toronto | 2010-01-03 | NA | NA |
| Other models | Feedforward NN | University of Montreal / Université de Montréal | 2010-05-13 | 3.5e+14 | NA |
| Other models | iCCCP | Massachusetts Institute of Technology (MIT) | 2010-06-13 | 1.1e+15 | 1 |
| Other models | ReLU (NORB) | University of Toronto | 2010-06-15 | NA | NA |
| Other models | ReLU (LFW) | University of Toronto | 2010-06-15 | NA | NA |
| Other models | Pooling CNN (Caltech 101) | University of Bonn | 2010-09-15 | 1.2e+15 | NA |
| Other models | Pooling CNN (NORB) | University of Bonn | 2010-09-15 | 1.5e+15 | NA |
| Other models | RNN LM | Johns Hopkins University | 2010-09-26 | 5.4e+16 | NA |
| Other models | YouTube Video Recommendation System | 2010-09-26 | NA | NA | |
| Other models | Deep rectifier networks | University of Montreal / Université de Montréal | 2011-04-13 | NA | NA |
| Other models | Deep Autoencoders | University of Toronto | 2011-04-29 | 3.7e+16 | 1 |
| Other models | Cross-Lingual POS Tagger | Carnegie Mellon University (CMU), Google Research | 2011-06-19 | NA | NA |
| Other models | Vector Space Model | Stanford University | 2011-06-19 | NA | NA |
| Other models | Recursive Neural Network | Stanford University | 2011-06-28 | NA | NA |
| Other models | CNN Committee (MNIST) | IDSIA | 2011-09-18 | 5.2e+16 | 4 |
| Other models | CNN Committee (NIST) | IDSIA | 2011-09-18 | 2.6e+16 | 4 |
| Other models | CNN committee (traffic sign) | IDSIA | 2011-10-03 | 9.9e+14 | 4 |
| Other models | Adaptive Subgrad | Technion - Israel Institute of Technology, Google, University of California (UC) Berkeley | 2011-10-03 | NA | NA |
| Other models | NLP from scratch | NEC Laboratories, Princeton University | 2011-11-08 | NA | NA |
| Other models | Dropout (CIFAR) | University of Toronto | 2012-06-03 | 4.3e+15 | NA |
| Other models | Dropout (TIMIT) | University of Toronto | 2012-06-03 | NA | NA |
| Other models | Dropout (MNIST) | University of Toronto | 2012-06-03 | 6.0e+15 | NA |
| Other models | Dropout (ImageNet) | University of Toronto | 2012-06-03 | 2.7e+17 | NA |
| Other models | Unsupervised High-level Feature Learner | 2012-07-12 | 6.0e+17 | NA | |
| Other models | Context-dependent RNN | Microsoft Research, Brno University of Technology | 2012-07-27 | NA | NA |
| Other models | LSTM LM | RWTH Aachen University | 2012-09-09 | 1.7e+16 | NA |
| Other models | AlexNet | University of Toronto | 2012-09-30 | 4.7e+17 | NA |
| Other models | RNN+LDA+KN5+cache | Microsoft, Brno University of Technology | 2012-12-01 | NA | NA |
| Other models | Bayesian automated hyperparameter tuning | University of Toronto, University of Sherbrooke, Harvard University | 2012-12-02 | NA | NA |
| Other models | DNN EM segmentation | IDSIA, SUPSI | 2012-12-03 | 4.8e+17 | 4 |
| Other models | DistBelief Vision | 2012-12-03 | NA | NA | |
| Other models | DistBelief Speech | 2012-12-03 | 3.1e+17 | NA | |
| Other models | PreTrans-3L-250H | University of Toronto | 2013-03-22 | NA | NA |
| Other models | Selective Search | University of Trento, University of Amsterdam | 2013-04-02 | NA | NA |
| Other models | Multilingual DNN | 2013-05-26 | NA | NA | |
| Other models | ReLU-Speech | Google, University of Toronto, New York University (NYU) | 2013-05-26 | 1.3e+17 | NA |
| Other models | Hierarchical Scene Labeling (Stanford Background) | New York University (NYU) | 2013-08-01 | 2.4e+17 | 1 |
| Other models | RCTM | University of Oxford | 2013-10-01 | 9.3e+15 | 3 |
| Other models | RNTN | Stanford University | 2013-10-01 | 1.4e+16 | NA |
| Other models | Word2Vec (large) | 2013-10-16 | 3.9e+16 | NA | |
| Other models | Word2Vec (small) | 2013-10-16 | NA | NA | |
| Other models | R-CNN (T-net) | University of California (UC) Berkeley | 2013-11-11 | NA | NA |
| Other models | Visualizing CNNs | New York University (NYU) | 2013-11-12 | 5.3e+17 | NA |
| Other models | DeViSE | 2013-12-05 | NA | NA | |
| Other models | TransE | Universite de Technologie de Compiègne – CNRS, Google | 2013-12-05 | 1.3e+18 | NA |
| Other models | RNN for 1B words | 2013-12-11 | NA | 24 | |
| Other models | Network in Network | National University of Singapore | 2013-12-16 | NA | NA |
| Other models | DQN | DeepMind | 2013-12-19 | 2.8e+15 | NA |
| Other models | Image generation | University of Amsterdam | 2013-12-20 | 4.8e+14 | NA |
| Other models | OverFeat | New York University (NYU) | 2013-12-21 | NA | NA |
| Other models | GloVe (32B) | Stanford University | 2014-01-01 | NA | NA |
| Other models | GloVe (6B) | Stanford University | 2014-01-01 | NA | NA |
| Other models | HyperNEAT | University of Texas at Austin | 2014-03-05 | NA | NA |
| Other models | Paragraph Vector | 2014-05-14 | NA | NA | |
| Other models | AdaRNN | Beihang University | 2014-06-01 | NA | NA |
| Other models | Dropout: SVHN | University of Toronto | 2014-06-01 | NA | NA |
| Other models | GRUs | University of Montreal / Université de Montréal, Jacobs University, University of Maine | 2014-06-03 | NA | NA |
| Other models | Two-stream ConvNets for action recognition | University of Oxford | 2014-06-09 | NA | NA |
| Other models | GANs | University of Montreal / Université de Montréal | 2014-06-10 | 5.2e+17 | NA |
| Other models | SPPNet | Microsoft, Xi’an Jiaotong University, University of Science and Technology of China (USTC) | 2014-06-18 | 3.4e+18 | NA |
| Other models | Fragment embedding | Stanford University | 2014-06-21 | NA | NA |
| Other models | RNN-WER | DeepMind, University of Toronto | 2014-06-22 | NA | NA |
| Other models | Multiresolution CNN | Google, Stanford University | 2014-06-23 | NA | NA |
| Other models | DeepFace | Tel Aviv University, Facebook | 2014-06-23 | NA | NA |
| Other models | SmooCT | University College London (UCL) | 2014-07-01 | 6.9e+16 | NA |
| Other models | ACF-WIDER | Chinese Academy of Sciences | 2014-07-15 | 7.6e+13 | 1 |
| Other models | NPD | IEEE | 2014-08-06 | NA | NA |
| Other models | RNNsearch-50* | Jacobs University Bremen, University of Montreal / Université de Montréal | 2014-09-01 | 1.6e+18 | NA |
| Other models | VGG19 | University of Oxford | 2014-09-04 | 1.1e+19 | NA |
| Other models | VGG16 | University of Oxford | 2014-09-04 | 1.2e+19 | 4 |
| Other models | Seq2Seq LSTM | 2014-09-10 | 5.6e+19 | NA | |
| Other models | SPN-4+KN5 | Singapore University of Technology & Design, DSO National Laboratories | 2014-09-14 | 4.4e+16 | 1 |
| Other models | GoogLeNet / InceptionV1 | Google, University of Michigan, University of North Carolina | 2014-09-17 | 1.5e+18 | NA |
| Other models | Deeply-supervised nets | Microsoft Research | 2014-09-18 | NA | NA |
| Other models | Spatially-Sparse CNN | University of Warwick | 2014-09-23 | NA | NA |
| Other models | LRCN | UT Austin, University of Massachusetts Lowell, University of California (UC) Berkeley | 2014-11-07 | NA | NA |
| Other models | SC-NLM | University of Toronto | 2014-11-10 | NA | NA |
| Other models | Fully Convolutional Networks | University of California (UC) Berkeley | 2014-11-14 | NA | NA |
| Other models | Cascaded LNet-ANet | Chinese University of Hong Kong (CUHK) | 2014-11-28 | NA | NA |
| Other models | TA-CNN | Chinese University of Hong Kong (CUHK) | 2014-11-29 | 1.1e+16 | 1 |
| Other models | SNM-skip | 2014-12-03 | 3.0e+20 | NA | |
| Other models | Fractional Max-Pooling | University of Warwick | 2014-12-18 | 1.0e+17 | NA |
| Other models | ADAM (CIFAR-10) | University of Amsterdam, OpenAI, University of Toronto | 2014-12-22 | 6.2e+14 | NA |
| Other models | VGG-Face | University of Oxford | 2015-01-01 | NA | 4 |
| Other models | MSRA (C, PReLU) | Microsoft Research | 2015-02-06 | 2.4e+19 | NA |
| Other models | TRPO | University of California (UC) Berkeley | 2015-02-19 | NA | NA |
| Other models | DQN-2015 | 2015-02-25 | NA | NA | |
| Other models | genCNN + dyn eval | Chinese Academy of Sciences, Huawei Noah's Ark Lab, Dublin City University | 2015-03-17 | 3.4e+16 | NA |
| Other models | TC-DNN-BLSTM-DNN | Carnegie Mellon University (CMU) | 2015-04-06 | 1.9e+17 | 1 |
| Other models | Fast R-CNN | Microsoft Research | 2015-04-30 | NA | NA |
| Other models | U-Net | University of Freiburg | 2015-05-18 | 5.1e+16 | 1 |
| Other models | Faster R-CNN | Microsoft Research | 2015-06-04 | NA | NA |
| Other models | CFSS | SenseTime, Chinese University of Hong Kong (CUHK), Shenzhen Institute of Advanced Technology | 2015-06-07 | NA | 1 |
| Other models | YOLO | University of Washington, Allen Institute for AI, Facebook AI Research | 2015-06-08 | NA | NA |
| Other models | BatchNorm | 2015-06-15 | NA | NA | |
| Other models | CompACT-Deep | University of California San Diego | 2015-07-19 | NA | 1 |
| Other models | Deep CNN + COTS | IEEE | 2015-07-26 | NA | 1 |
| Other models | DCNN | University of Maryland, Rutgers University | 2015-08-07 | 4.8e+17 | 1 |
| Other models | BPE | University of Edinburgh | 2015-08-31 | NA | NA |
| Other models | Deep Deterministic Policy Gradients | Google DeepMind | 2015-09-09 | NA | NA |
| Other models | AlphaGo Fan | DeepMind | 2015-10-01 | 3.8e+20 | NA |
| Other models | SAF R-CNN | Beijing Institute of Technology, Sun Yat-sen University, Panasonic R&D, National University of... | 2015-10-28 | 1.2e+19 | 1 |
| Other models | 3DDFA | Chinese Academy of Sciences, Michigan State University | 2015-11-23 | NA | NA |
| Other models | Multi-scale Dilated CNN | Princeton University, Intel Labs | 2015-11-23 | NA | NA |
| Other models | Netflix Recommender System | Netflix | 2015-12-01 | NA | NA |
| Other models | Inception v3 | Google, University College London (UCL) | 2015-12-02 | 1.0e+20 | NA |
| Other models | SSD | NA | 2015-12-08 | NA | NA |
| Other models | ResNet-110 (CIFAR-10) | Microsoft | 2015-12-10 | NA | NA |
| Other models | ResNet-152 (ImageNet) | Microsoft | 2015-12-10 | 1.0e+19 | NA |
| Other models | ResNet-101 (ImageNet) | Microsoft | 2015-12-10 | 7.0e+18 | NA |
| Other models | Advantage Learning | Google DeepMind | 2015-12-15 | NA | NA |
| Other models | Variational (untied weights, MC) LSTM (Large) | University of Cambridge | 2015-12-16 | 5.9e+15 | NA |
| Other models | AlphaGo Lee | DeepMind | 2016-01-27 | 1.9e+21 | NA |
| Other models | A3C FF hs | Google, University of Montreal / Université de Montréal | 2016-02-04 | NA | NA |
| Other models | Inception-ResNet-V2 | 2016-02-23 | NA | NA | |
| Other models | Inceptionv4 | 2016-02-23 | NA | NA | |
| Other models | SqueezeNet | DeepScale, University of California (UC) Berkeley, Stanford University | 2016-02-24 | NA | NA |
| Other models | Double DQN | Google DeepMind | 2016-03-02 | NA | NA |
| Other models | Named Entity Recognition model | Carnegie Mellon University (CMU) | 2016-03-04 | 9.7e+16 | 1 |
| Other models | Template Adaptation | University of Oxford | 2016-03-12 | NA | NA |
| Other models | Dueling DQN | Google DeepMind | 2016-04-05 | NA | NA |
| Other models | Gated HORNN (3rd order) | York University | 2016-04-30 | NA | NA |
| Other models | LRR-4X | UC Irvine | 2016-05-08 | NA | 1 |
| Other models | PixelCNN | Google DeepMind | 2016-06-16 | NA | 32 |
| Other models | CMS-RCNN | IEEE | 2016-06-17 | NA | NA |
| Other models | Segmental RNN | University of Edinburgh, Carnegie Mellon University (CMU), University of Washington | 2016-06-20 | NA | NA |
| Other models | R-FCN | Tsinghua University, Microsoft Research | 2016-06-21 | 7.2e+17 | NA |
| Other models | CCL | SenseTime, Chinese University of Hong Kong (CUHK), Chinese Academy of Sciences | 2016-06-27 | NA | NA |
| Other models | Character-enriched word2vec | Facebook AI Research | 2016-07-15 | NA | NA |
| Other models | SimpleNet | Sensifai, Islamic Azad University, Technicolor R&I, Institute for Research in Fundamental Sciences... | 2016-08-22 | NA | NA |
| Other models | DenseNet-264 | Tsinghua University, Facebook AI Research, Cornell University | 2016-08-25 | NA | NA |
| Other models | LF-MMI | Johns Hopkins University, Cornell University | 2016-09-08 | NA | NA |
| Other models | MS-ensemble-speech-recognition | Microsoft | 2016-09-12 | NA | NA |
| Other models | WaveNet | Google DeepMind | 2016-09-12 | NA | NA |
| Other models | Youtube recommendation model | 2016-09-15 | NA | NA | |
| Other models | ResNet-200 | Microsoft Research Asia | 2016-09-17 | 3.0e+19 | NA |
| Other models | ResNet-1001 | Microsoft | 2016-09-17 | NA | NA |
| Other models | Wide Residual Network | Université Paris-Est | 2016-09-19 | NA | NA |
| Other models | GNMT | 2016-09-26 | 6.6e+21 | NA | |
| Other models | Pointer Sentinel-LSTM (medium) | MetaMind Inc, Salesforce | 2016-09-26 | 7.5e+15 | NA |
| Other models | Xception | 2016-10-07 | 4.4e+20 | 60 | |
| Other models | GAWWN | University of Michigan, Max Planck Institute for Informatics | 2016-10-08 | NA | NA |
| Other models | SPIDER2 | Griffith University, University of Iowa, Dezhou University | 2016-10-28 | 1.8e+16 | NA |
| Other models | VD-LSTM+REAL Large | Salesforce Research, Stanford University | 2016-11-04 | 2.1e+16 | NA |
| Other models | BIDAF | University of Washington, Allen Institute for AI | 2016-11-05 | 3.5e+18 | 8 |
| Other models | NAS with base 8 and shared embeddings | Google Brain | 2016-11-05 | 1.0e+16 | NA |
| Other models | DLDL (PASCAL) | University of Oxford | 2016-11-06 | NA | 1 |
| Other models | DTN (Domain Transfer Network) | Facebook AI Research | 2016-11-07 | NA | NA |
| Other models | DAC-CSR | Jiangnan University, University of Surrey | 2016-11-16 | NA | NA |
| Other models | ResNeXt-50 | University of California San Diego, Facebook | 2016-11-16 | NA | NA |
| Other models | PolyNet | Chinese University of Hong Kong (CUHK) | 2016-11-17 | 6.4e+19 | 32 |
| Other models | Image-to-image cGAN | University of California (UC) Berkeley | 2016-11-21 | NA | NA |
| Other models | PointNet | Stanford University | 2016-12-02 | NA | NA |
| Other models | Elastic weight consolidation | DeepMind | 2016-12-02 | NA | NA |
| Other models | GAN-Advancer | OpenAI | 2016-12-05 | NA | NA |
| Other models | HR-ResNet101 | Carnegie Mellon University (CMU) | 2016-12-13 | 7.1e+18 | NA |
| Other models | 3DMM-CNN | University of Southern California | 2016-12-15 | NA | 1 |
| Other models | EnhanceNet | Max Planck Institute for Intelligent Systems | 2016-12-23 | 1.3e+17 | 1 |
| Other models | YOLOv2 | University of Washington, Allen Institute for AI | 2016-12-25 | NA | NA |
| Other models | DeepStack | University of Alberta, Charles University, Czech Technical University | 2017-01-06 | 1.4e+19 | 20 |
| Other models | OR-WideResNet | Duke University, University of Chinese Academy of Sciences | 2017-01-07 | NA | NA |
| Other models | MoE-Multi | Jagiellonian University, Google Brain | 2017-01-23 | 9.4e+19 | 64 |
| Other models | DnCNN | Harbin Institute of Technology, Hong Kong Polytechnic University, ULSee Inc., Xi’an Jiaotong... | 2017-02-01 | NA | NA |
| Other models | Prototypical networks | University of Toronto, Twitter | 2017-03-15 | NA | NA |
| Other models | Mask R-CNN | Facebook AI Research | 2017-03-30 | NA | NA |
| Other models | WGAN-GP | Courant Institute of Mathematical Sciences, Mila - Quebec AI (originally Montreal Institute for... | 2017-03-31 | NA | NA |
| Other models | MobileNet | 2017-04-17 | NA | NA | |
| Other models | DeepLab (2017) | Johns Hopkins University, Google, University College London (UCL) | 2017-04-27 | NA | NA |
| Other models | Mnemonic Reader | Fudan University, Microsoft Research | 2017-05-08 | NA | NA |
| Other models | SRGAN | 2017-05-25 | NA | NA | |
| Other models | Inflated 3D ConvNet | DeepMind, University of Oxford | 2017-06-01 | NA | NA |
| Other models | PointNet++ | Stanford University | 2017-06-07 | NA | NA |
| Other models | Reading Twice for NLU | DeepMind | 2017-06-08 | NA | NA |
| Other models | EDSR | Seoul National University | 2017-06-10 | NA | NA |
| Other models | Transformer | Google Research, Google Brain | 2017-06-12 | 7.4e+18 | 8 |
| Other models | HRA | Maluuba, Microsoft | 2017-06-13 | NA | NA |
| Other models | DeepLabV3 | 2017-06-17 | NA | NA | |
| Other models | NoisyNet-Dueling | DeepMind | 2017-06-30 | NA | NA |
| Other models | ShuffleNet v1 | Megvii Inc | 2017-07-03 | NA | NA |
| Other models | DeepLoc | Technical University of Denmark, University of Copenhagen | 2017-07-07 | 5.8e+17 | 1 |
| Other models | JFT | Google Research, Carnegie Mellon University (CMU) | 2017-07-10 | 8.4e+20 | 50 |
| Other models | AWD-LSTM | DeepMind, University of Oxford | 2017-07-18 | NA | NA |
| Other models | PSPNet | Chinese University of Hong Kong (CUHK) | 2017-07-21 | NA | NA |
| Other models | NASNet-A | Google Brain | 2017-07-21 | NA | NA |
| Other models | ConvS2S (ensemble of 8 models) | Meta AI | 2017-07-25 | 5.6e+19 | NA |
| Other models | GSM | Peking University, Microsoft Research | 2017-07-30 | NA | NA |
| Other models | RetinaNet-R101 | Facebook AI Research | 2017-08-07 | 2.1e+18 | 8 |
| Other models | AWD-LSTM - 3-layer LSTM (tied) + continuous cache pointer (WT2) | Salesforce Research | 2017-08-07 | 3.0e+17 | NA |
| Other models | RetinaNet-R50 | Facebook AI Research | 2017-08-07 | NA | NA |
| Other models | OpenAI TI7 DOTA 1v1 | OpenAI | 2017-08-11 | 6.0e+20 | NA |
| Other models | EI-REHN-1000D | Korea Advanced Institute of Science and Technology (KAIST) | 2017-08-14 | 1.1e+16 | NA |
| Other models | NeuMF (Pinterest) | Shandong University, Texas A&M, National University of Singapore, Columbia University | 2017-08-16 | NA | NA |
| Other models | Libratus | Carnegie Mellon University (CMU) | 2017-08-19 | 5.5e+20 | NA |
| Other models | GL-LWGC-AWD-MoS-LSTM + dynamic evaluation (WT2) | Ben-Gurion University of the Negev | 2017-08-29 | 4.6e+17 | NA |
| Other models | SENet (ImageNet) | Chinese Academy of Sciences, University of Oxford | 2017-09-05 | NA | NA |
| Other models | PyramidNet | Korea Advanced Institute of Science and Technology (KAIST) | 2017-09-06 | 2.3e+15 | NA |
| Other models | ISS | Duke University, Microsoft | 2017-09-15 | 3.4e+15 | NA |
| Other models | LSTM + dynamic eval | University of Edinburgh | 2017-09-21 | NA | NA |
| Other models | AWD-LSTM+WT+Cache+IOG (WT2) | NTT Communication Science Laboratories | 2017-09-26 | 3.2e+15 | NA |
| Other models | Rainbow DQN | DeepMind | 2017-10-06 | NA | 1 |
| Other models | AlphaGo Zero | DeepMind | 2017-10-18 | 6.5e+20 | NA |
| Other models | AlphaGo Master | DeepMind | 2017-10-19 | 3.4e+20 | NA |
| Other models | ProgressiveGAN | NVIDIA | 2017-10-27 | NA | NA |
| Other models | PhraseCond | Carnegie Mellon University (CMU), University of Pittsburgh | 2017-10-28 | NA | NA |
| Other models | S-Norm | University of Washington, Allen Institute for AI | 2017-10-29 | NA | NA |
| Other models | Fraternal dropout + AWD-LSTM 3-layer (WT2) | Jagiellonian University, Mila - Quebec AI (originally Montreal Institute for Learning Algorithms),... | 2017-10-31 | 3.1e+17 | NA |
| Other models | DCN+ | Salesforce Research | 2017-10-31 | NA | NA |
| Other models | VQ-VAE | DeepMind | 2017-11-02 | NA | NA |
| Other models | AWD-LSTM-MoS + dynamic evaluation (WT2, 2017) | Carnegie Mellon University (CMU) | 2017-11-10 | 3.4e+18 | NA |
| Other models | TriNet | Visual Computing Institute, RWTH Aachen University | 2017-11-21 | NA | NA |
| Other models | DL scaling LM | Baidu | 2017-12-01 | NA | NA |
| Other models | DL scaling speech | Baidu | 2017-12-01 | NA | NA |
| Other models | DL scaling Image | Baidu | 2017-12-01 | NA | NA |
| Other models | ELMo | University of Washington, Allen Institute for AI | 2018-02-01 | 3.3e+15 | NA |
| Other models | QRNN | Salesforce Research | 2018-02-01 | 6.9e+17 | NA |
| Other models | IMPALA | DeepMind | 2018-02-05 | 1.7e+20 | 1 |
| Other models | DeepLabV3+ | 2018-02-07 | NA | NA | |
| Other models | TCN (P-MNIST) | Carnegie Mellon University (CMU), Intel Labs | 2018-02-15 | NA | NA |
| Other models | Chinese - English translation | Microsoft | 2018-03-01 | NA | NA |
| Other models | 4 layer QRNN (h=2500) | Salesforce Research | 2018-03-22 | 5.9e+17 | 1 |
| Other models | YOLOv3 | University of Washington | 2018-04-08 | 1.3e+19 | NA |
| Other models | ResNeXt-101 32x48d | 2018-05-02 | 8.7e+21 | 336 | |
| Other models | Dropout-LSTM+Noise(Bernoulli) (WT2) | Columbia University, New York University (NYU), Princeton University | 2018-05-03 | 1.3e+17 | NA |
| Other models | aLSTM(depth-2)+RecurrentPolicy (WT2) | University of Manchester, Alan Turing Institute | 2018-05-22 | 7.3e+16 | NA |
| Other models | GPT-1 | OpenAI | 2018-06-01 | 1.8e+19 | 8 |
| Other models | Relational Memory Core | DeepMind, University College London (UCL) | 2018-06-05 | NA | NA |
| Other models | MobileNetV2 | 2018-06-18 | NA | NA | |
| Other models | FTW (For The Win) | DeepMind | 2018-07-03 | 3.5e+19 | NA |
| Other models | Big-Little Net (speech) | IBM | 2018-07-10 | 4.3e+17 | NA |
| Other models | Big-Little Net | IBM | 2018-07-10 | 2.5e+17 | NA |
| Other models | AWD-LSTM-MoS+PDR + dynamic evaluation (WT2) | IBM | 2018-08-14 | NA | NA |
| Other models | Big Transformer for Back-Translation | Facebook AI Research, Google Brain | 2018-08-28 | 4.8e+20 | 128 |
| Other models | (ensemble): AWD-LSTM-DOC (fin) × 5 (WT2) | NTT Communication Science Laboratories, Tohoku University | 2018-08-30 | 6.7e+17 | NA |
| Other models | NetSurfP-2.0 | Technical University of Denmark, University of Copenhagen, Universidad Nacional de San Martín,... | 2018-09-10 | NA | NA |
| Other models | Transformer + Simple Recurrent Unit | ASAPP, Cornell University, Google, Princeton University | 2018-09-17 | 1.1e+19 | 8 |
| Other models | AWD-LSTM-MoS + dynamic evaluation (WT2, 2018) | Peking University, Microsoft Research Asia | 2018-09-18 | NA | NA |
| Other models | LSTM+NeuralCache | KU Leuven, ESAT - PSI, Apple | 2018-09-24 | 9.8e+14 | NA |
| Other models | Transformer (Adaptive Input Embeddings) WT103 | Facebook AI Research | 2018-09-28 | 4.5e+19 | 8 |
| Other models | MetaMimic | 2018-10-11 | NA | NA | |
| Other models | BERT-Large | 2018-10-11 | 2.8e+20 | 64 | |
| Other models | TrellisNet | Carnegie Mellon University (CMU), Bosch Center for Artificial Intelligence, Intel Labs | 2018-10-15 | 2.8e+18 | NA |
| Other models | MemoReader | Samsung, Korea University | 2018-10-31 | NA | NA |
| Other models | Mesh-TensorFlow Transformer 2.9B (translation) | Google Brain | 2018-11-05 | 6.8e+19 | 64 |
| Other models | Mesh-TensorFlow Transformer 4.9B (language) | Google Brain | 2018-11-05 | 1.6e+20 | 256 |
| Other models | Fine-tuned-AWD-LSTM-DOC (fin) | Samsung R&D Institute Russia | 2018-11-12 | 5.2e+16 | NA |
| Other models | Multi-cell LSTM | University of Hyderabad | 2018-11-15 | 2.0e+15 | NA |
| Other models | GPipe (Transformer) | 2018-11-16 | NA | NA | |
| Other models | SPN (ImageNet 128) | Google Brain, DeepMind | 2018-12-04 | NA | NA |
| Other models | StyleGAN | NVIDIA | 2018-12-12 | 3.9e+16 | 8 |
| Other models | Transformer ELMo | Allen Institute for AI, University of Washington | 2019-01-01 | NA | NA |
| Other models | Transformer-XL (257M) | Carnegie Mellon University (CMU), Google Brain | 2019-01-09 | 3.8e+20 | 32 |
| Other models | MT-DNN | Microsoft | 2019-01-31 | NA | NA |
| Other models | Hanabi 4 player | DeepMind, University of Oxford, Carnegie Mellon University (CMU), Google Brain | 2019-02-01 | 4.3e+18 | NA |
| Other models | GPT-2 (1.5B) | OpenAI | 2019-02-14 | 1.9e+21 | NA |
| Other models | KataGo | Jane Street | 2019-02-27 | 2.3e+19 | NA |
| Other models | NMT Transformer 437M | Google, Bar-Ilan University | 2019-02-28 | NA | NA |
| Other models | SciBERT | Allen Institute for AI | 2019-03-26 | 8.9e+19 | 4 |
| Other models | Cross-lingual alignment | Tel Aviv University, Massachusetts Institute of Technology (MIT) | 2019-04-04 | 2.6e+18 | NA |
| Other models | True-Regularization+Finetune+Dynamic-Eval | Mobvoi, Williams College | 2019-04-08 | NA | NA |
| Other models | WeNet (Penn Treebank) | Amazon | 2019-04-08 | 7.3e+17 | 1 |
| Other models | Transformer-XL + RMS dynamic eval | University of Edinburgh | 2019-04-17 | NA | NA |
| Other models | BERT-Large-CAS (PTB+WT2+WT103) | Amazon | 2019-04-20 | 1.5e+20 | NA |
| Other models | MuseNet | OpenAI | 2019-04-25 | 2.2e+20 | NA |
| Other models | Neuro-Symbolic Concept Learner | Massachusetts Institute of Technology (MIT), Tsinghua University, MIT-IBM Watson AI Lab, DeepMind | 2019-04-26 | NA | NA |
| Other models | RaptorX-Contact | Toyota Technological Institute at Chicago | 2019-05-02 | NA | NA |
| Other models | ResNeXt-101 Billion-scale | Facebook AI | 2019-05-02 | NA | NA |
| Other models | AWD-LSTM-DRILL + dynamic evaluation† (WT2) | IDIAP | 2019-05-14 | 4.1e+17 | NA |
| Other models | CPC v2 | DeepMind, University of California (UC) Berkeley | 2019-05-22 | NA | NA |
| Other models | EfficientNet-L2 | 2019-05-28 | NA | NA | |
| Other models | DLRM-2020 | Facebook AI | 2019-05-31 | 4.0e+18 | NA |
| Other models | XLNet | Carnegie Mellon University (CMU), Google Brain | 2019-06-01 | 6.2e+21 | NA |
| Other models | XLM | 2019-06-01 | NA | NA | |
| Other models | Transformer-XL Large + Phrase Induction | Massachusetts Institute of Technology (MIT), University of Illinois Urbana-Champaign (UIUC) | 2019-06-04 | 3.8e+20 | NA |
| Other models | AWD-LSTM + MoS + Partial Shuffled | University of Texas at Austin | 2019-06-10 | 3.2e+17 | NA |
| Other models | Char-CNN-BiLSTM | Capital One | 2019-06-13 | NA | NA |
| Other models | FixRes ResNeXt-101 WSL | Facebook AI | 2019-06-14 | NA | NA |
| Other models | PG-SWGAN | ETH Zurich | 2019-06-15 | NA | NA |
| Other models | LaNet-L (CIFAR-10) | Brown University, Facebook | 2019-06-17 | NA | NA |
| Other models | Walking Minotaur robot | University of California (UC) Berkeley, Google Brain | 2019-06-19 | NA | NA |
| Other models | BigBiGAN | 2019-07-04 | NA | NA | |
| Other models | Pluribus | Facebook AI Research | 2019-07-11 | 6.6e+16 | NA |
| Other models | EN^2AS with performance reward | Beijing Institute of Technology, University of Technology Sydney, Monash University | 2019-07-22 | NA | NA |
| Other models | trRosetta | Nankai University, University of Washington, Tianjin University, Harvard University | 2019-08-22 | 3.8e+19 | 1 |
| Other models | UDSMProt | Fraunhofer Heinrich Hertz Institute | 2019-09-04 | 6.4e+17 | NA |
| Other models | Mogrifier (d2, MoS2, MC) + dynamic eval | DeepMind, University of Oxford | 2019-09-04 | NA | NA |
| Other models | Megatron-LM (1.2B) | NVIDIA | 2019-09-17 | 1.1e+22 | 1 |
| Other models | Megatron-LM (8.3B) | NVIDIA | 2019-09-17 | 9.1e+21 | 512 |
| Other models | Megatron-BERT | NVIDIA | 2019-09-17 | 2.2e+22 | 512 |
| Other models | Adaptive Inputs + LayerDrop | Facebook AI Research, LORIA | 2019-09-25 | NA | NA |
| Other models | ALBERT | Toyota Technological Institute at Chicago, Google Research | 2019-09-26 | NA | NA |
| Other models | AlphaX-1 | Facebook AI Research, Brown University | 2019-10-02 | 8.9e+17 | NA |
| Other models | DistilBERT | Hugging Face | 2019-10-02 | 1.2e+19 | NA |
| Other models | M4-50B | 2019-10-11 | NA | NA | |
| Other models | T5-11B | 2019-10-23 | 3.3e+22 | 512 | |
| Other models | T5-3B | 2019-10-23 | 9.0e+21 | NA | |
| Other models | BART-large | Facebook AI | 2019-10-29 | NA | NA |
| Other models | AlphaStar | DeepMind | 2019-10-30 | 1.1e+23 | 384 |
| Other models | Base LM + kNN LM + Continuous Cache | Stanford University, Facebook AI Research | 2019-11-01 | 3.1e+19 | NA |
| Other models | XLM-RoBERTa | Facebook AI | 2019-11-05 | 2.1e+22 | 500 |
| Other models | CamemBERT | Facebook, INRIA, Sorbonne University | 2019-11-10 | 8.3e+20 | NA |
| Other models | Sandwich Transformer | Allen Institute for AI, Facebook AI Research | 2019-11-10 | 2.4e+19 | NA |
| Other models | Noisy Student (L2) | Carnegie Mellon University (CMU), Google | 2019-11-11 | 2.6e+22 | 1,024 |
| Other models | MoCo | Facebook AI | 2019-11-13 | NA | NA |
| Other models | MuZero | DeepMind | 2019-11-19 | 4.8e+19 | NA |
| Other models | Transformer - LibriVox + Decoding/Rescoring | 2019-11-19 | NA | NA | |
| Other models | Photo-Geometric Autoencoder | University of Oxford | 2019-11-25 | NA | NA |
| Other models | Transformer-XL DeFINE (141M) | University of Washington, Allen Institute for AI | 2019-11-27 | 1.7e+18 | NA |
| Other models | StyleGAN2 | NVIDIA, Aalto University | 2019-12-03 | NA | 8 |
| Other models | StarGAN v2 | NAVER, Yonsei University, Swiss Federal Institute of Technology | 2019-12-04 | NA | NA |
| Other models | MMLSTM (PTB) | Beijing University of Posts and Telecommunications, University of West London | 2019-12-05 | 5.8e+16 | NA |
| Other models | MMLSTM (WT-2) | Beijing University of Posts and Telecommunications, University of West London | 2019-12-05 | 1.9e+17 | NA |
| Other models | OpenAI Five Rerun | OpenAI | 2019-12-13 | 1.3e+22 | 512 |
| Other models | DD-PPO | Georgia Institute of Technology, Facebook AI Research, Oregon State University, Simon Fraser... | 2019-12-19 | 7.8e+20 | 64 |
| Other models | Big Transfer (BiT-L) | Google Brain | 2019-12-24 | NA | NA |
| Other models | AlphaFold | DeepMind | 2020-01-15 | 1.0e+20 | NA |
| Other models | ContextNet + Noisy Student | 2020-01-19 | 8.2e+21 | NA | |
| Other models | Meena | Google Brain | 2020-01-28 | 1.1e+23 | 1,024 |
| Other models | Theseus 6/768 | University of California San Diego, Beihang University, Microsoft | 2020-02-07 | NA | NA |
| Other models | Perceiver IO (optical flow) | DeepMind | 2020-02-08 | NA | NA |
| Other models | TaLK Convolution | Carleton University | 2020-02-08 | 2.7e+19 | 8 |
| Other models | ALBERT-xxlarge | Toyota Technological Institute at Chicago, Google | 2020-02-09 | 2.4e+21 | 512 |
| Other models | SimCLR | Google Brain | 2020-02-13 | NA | NA |
| Other models | Turing-NLG | Microsoft | 2020-02-13 | 1.6e+22 | 256 |
| Other models | Feedback Transformer | LORIA, University of Lorraine, Facebook AI Research | 2020-02-21 | 7.7e+18 | NA |
| Other models | TCAN (WT2) | Nanjing University, Ant Group | 2020-02-28 | NA | NA |
| Other models | TransformerXL + spectrum control | University of California Los Angeles (UCLA), JD.com | 2020-03-11 | 2.6e+19 | 4 |
| Other models | Routing Transformer (WT-103) | Google Research | 2020-03-12 | NA | NA |
| Other models | Tensor-Transformer(1core)+PN (WT103) | University of California (UC) Berkeley | 2020-03-17 | 1.6e+18 | NA |
| Other models | ELECTRA | Stanford University, Google, Google Brain | 2020-03-23 | 3.1e+21 | NA |
| Other models | MetNet | 2020-03-24 | 9.5e+18 | 256 | |
| Other models | Agent57 | DeepMind | 2020-03-30 | NA | NA |
| Other models | CURL | University of California (UC) Berkeley | 2020-04-08 | NA | NA |
| Other models | Go-explore | Uber AI, OpenAI | 2020-04-27 | NA | NA |
| Other models | Once for All | MIT-IBM Watson AI Lab, Massachusetts Institute of Technology (MIT), IBM | 2020-04-29 | 6.2e+20 | NA |
| Other models | UnifiedQA | Allen Institute for AI, University of Washington | 2020-05-02 | 1.6e+19 | 8 |
| Other models | NAS+ESS (23M) | Northeastern University (China), NiuTrans Research, Kingsoft | 2020-05-06 | NA | 1 |
| Other models | ContextNet | 2020-05-07 | NA | NA | |
| Other models | Conformer | 2020-05-16 | NA | NA | |
| Other models | Retrieval-Augmented Generator | Facebook, New York University (NYU), University College London (UCL) | 2020-05-22 | NA | NA |
| Other models | DETR | 2020-05-26 | 4.0e+20 | NA | |
| Other models | GShard (dense) | 2020-06-30 | 4.8e+22 | 1,024 | |
| Other models | SemExp | Carnegie Mellon University (CMU), Facebook AI Research | 2020-07-02 | NA | NA |
| Other models | Hopfield Networks (2020) | Johannes Kepler University Linz, Institute of Advanced Research in Artificial Intelligence,... | 2020-07-16 | NA | NA |
| Other models | EfficientDet | Google Brain | 2020-07-27 | NA | NA |
| Other models | DeLighT | University of Washington, Allen Institute for AI, Facebook AI Research | 2020-08-03 | 3.8e+18 | 8 |
| Other models | ERNIE-GEN (large) | Baidu | 2020-08-06 | 2.0e+20 | NA |
| Other models | ProBERTa | University of Illinois Urbana-Champaign (UIUC), Reed College | 2020-09-01 | 9.7e+18 | 4 |
| Other models | LUKE | University of Washington, National Institute of Informatics | 2020-10-02 | 1.8e+22 | 16 |
| Other models | Conformer + Wav2vec 2.0 + Noisy Student | Google, Google Research, Google Brain | 2020-10-20 | 7.6e+21 | 256 |
| Other models | mT5-XXL | Google, Google Research | 2020-10-20 | 8.2e+22 | NA |
| Other models | German ELECTRA Large | deepset, Bayerische Staatsbibliothek Muenchen | 2020-10-21 | 1.4e+21 | 64 |
| Other models | ViT-Huge/14 | Google Brain, Google Research | 2020-10-22 | 4.3e+21 | NA |
| Other models | wave2vec 2.0 LARGE | 2020-10-22 | 3.9e+21 | NA | |
| Other models | ViT-Base/32 | Google Brain | 2020-10-22 | NA | NA |
| Other models | KEPLER | Tsinghua University, Mila - Quebec AI (originally Montreal Institute for Learning Algorithms), HEC,... | 2020-11-23 | 1.7e+21 | NA |
| Other models | AlphaFold 2 | DeepMind | 2020-11-30 | 3.0e+21 | NA |
| Other models | CPM-Large | Tsinghua University, Beijing Academy of Artificial Intelligence / BAAI | 2020-12-01 | 2.6e+20 | 64 |
| Other models | ESM1b | Facebook AI Research, New York University (NYU) | 2020-12-15 | 5.1e+21 | 128 |
| Other models | VQGAN + CLIP | Heidelberg University | 2020-12-17 | NA | NA |
| Other models | DensePhrases | Korea University, Princeton University | 2020-12-23 | 2.1e+18 | 8 |
| Other models | CT-MoS (WT2) | Google, National Tsing Hua University | 2020-12-25 | 5.4e+17 | 4 |
| Other models | ERNIE-Doc (247M) | Baidu | 2020-12-31 | 3.0e+19 | NA |
| Other models | CLIP (ViT L/14@336px) | OpenAI | 2021-01-05 | 1.0e+22 | 256 |
| Other models | CLIP (ResNet-50) | OpenAI | 2021-01-05 | NA | NA |
| Other models | DALL-E | OpenAI | 2021-01-05 | 4.7e+22 | 1,024 |
| Other models | BigSSL | Google, Apple | 2021-01-10 | NA | NA |
| Other models | Switch | 2021-01-11 | 8.2e+22 | 1,024 | |
| Other models | DeiT-B | Meta AI, Sorbonne University | 2021-01-15 | 7.9e+19 | NA |
| Other models | top-down frozen classifier | University of Edinburgh, Toshiba Cambridge Research Laboratory | 2021-02-09 | NA | NA |
| Other models | DLWP | University of Washington, Microsoft Research | 2021-02-09 | 5.7e+18 | 1 |
| Other models | MSA Transformer | Facebook AI Research, University of California (UC) Berkeley, New York University (NYU) | 2021-02-13 | 5.5e+21 | 32 |
| Other models | Rational DQN Average | TU Darmstadt | 2021-02-18 | NA | NA |
| Other models | SRU++ Large | ASAPP | 2021-02-24 | 2.1e+19 | NA |
| Other models | Meta Pseudo Labels | Google Brain, Google AI | 2021-03-01 | 4.8e+22 | 1,024 |
| Other models | M6-T | Alibaba | 2021-03-05 | 5.5e+21 | 480 |
| Other models | Generative BST | Facebook AI Research | 2021-03-05 | 1.4e+22 | NA |
| Other models | Unicorn | Allen Institute for AI | 2021-03-24 | NA | NA |
| Other models | PLUG | Alibaba | 2021-04-19 | 3.6e+22 | 128 |
| Other models | ProtBERT-BFD | Technical University of Munich, NVIDIA, Seoul National University, Google, Oak Ridge National... | 2021-05-04 | 3.9e+22 | 1,024 |
| Other models | ProtT5-XL-U50 | Technical University of Munich, Med AI Technology, NVIDIA, Oak Ridge National Laboratory, Google,... | 2021-05-04 | 1.9e+22 | 256 |
| Other models | ADM | OpenAI | 2021-05-11 | 6.2e+21 | NA |
| Other models | MedBERT | Peng Cheng Laboratory, University of Texas at Houston | 2021-05-20 | 9.5e+18 | 1 |
| Other models | Transformer local-attention (NesT-B) | Google Cloud, Google Research | 2021-05-26 | 2.4e+19 | NA |
| Other models | CogView | Tsinghua University, Alibaba DAMO Academy | 2021-05-26 | 2.7e+22 | 512 |
| Other models | ByT5-XXL | Google, Google Research | 2021-05-28 | 8.1e+22 | NA |
| Other models | CoAtNet | Google, Google Research, Google Brain | 2021-06-09 | 4.3e+22 | NA |
| Other models | EMDR | Mila - Quebec AI (originally Montreal Institute for Learning Algorithms), McGill University,... | 2021-06-09 | 1.9e+21 | NA |
| Other models | DeBERTa | Microsoft | 2021-06-10 | 2.6e+22 | 256 |
| Other models | Denoising Diffusion Probabilistic Models (LSUN Bedroom) | University of California (UC) Berkeley | 2021-06-11 | 7.8e+19 | NA |
| Other models | ALIGN | Google Research | 2021-06-11 | 2.6e+22 | 512 |
| Other models | StyleGAN3-R | NVIDIA, Aalto University | 2021-06-21 | 2.4e+21 | 8 |
| Other models | StyleGAN3-T | NVIDIA, Aalto University | 2021-06-21 | 1.7e+21 | 8 |
| Other models | EfficientNetV2-XL | Google, Google Brain | 2021-06-23 | 9.6e+19 | 16 |
| Other models | Fold2Seq | IBM, Texas A&M | 2021-06-24 | 1.4e+17 | 2 |
| Other models | Adaptive Input Transformer + RD | Microsoft Research Asia, Soochow University | 2021-06-28 | 8.6e+19 | 8 |
| Other models | ERNIE 3.0 | Baidu | 2021-07-05 | 2.2e+22 | 384 |
| Other models | Codex | OpenAI | 2021-07-07 | 7.3e+22 | NA |
| Other models | HuBERT | Facebook AI Research | 2021-07-27 | 5.5e+21 | NA |
| Other models | GOAT | DeepMind | 2021-07-27 | 2.4e+22 | NA |
| Other models | SEER | Facebook AI Research, INRIA | 2021-07-29 | 1.8e+22 | 512 |
| Other models | 6-Act Tether | Facebook AI Research, Georgia Institute of Technology | 2021-08-03 | NA | NA |
| Other models | YOLOX-X | Megvii Inc | 2021-08-06 | 6.3e+20 | 8 |
| Other models | W2v-BERT | Google Brain, Massachusetts Institute of Technology (MIT) | 2021-08-07 | NA | NA |
| Other models | Zidong Taichu | Chinese Academy of Sciences, Wuhan AI Computing Center | 2021-08-11 | 8.0e+20 | NA |
| Other models | Jurassic-1-Jumbo | AI21 Labs | 2021-08-11 | 3.7e+23 | NA |
| Other models | DNABERT | Northeastern University | 2021-08-15 | 1.1e+20 | NA |
| Other models | XLMR-XXL | Facebook AI Research | 2021-08-17 | 3.4e+22 | NA |
| Other models | FLAN 137B | Google Research | 2021-09-03 | 2.0e+24 | NA |
| Other models | MEB | Microsoft | 2021-09-04 | NA | NA |
| Other models | PermuteFormer | Peking University | 2021-09-06 | 2.8e+18 | 8 |
| Other models | HyperCLOVA 204B | NAVER | 2021-09-10 | 2.0e+23 | NA |
| Other models | PLATO-XL | Baidu | 2021-09-20 | 9.9e+21 | 256 |
| Other models | TrOCR | Beihang University, Microsoft Research Asia | 2021-09-21 | NA | 32 |
| Other models | Turing ULRv5 | Microsoft | 2021-09-28 | 2.9e+22 | 256 |
| Other models | AlphaFold-Multimer | Google DeepMind, DeepMind | 2021-10-04 | 4.4e+21 | 64 |
| Other models | Yuan 1.0 | Inspur | 2021-10-12 | 3.5e+23 | 2,128 |
| Other models | base LM+GNN+kNN | Shannon.AI, Nanjing University, Nanyang Technological University, Zhejiang University (ZJU) | 2021-10-17 | 5.3e+19 | NA |
| Other models | Eve | Harvard Medical School, University of Oxford | 2021-10-27 | NA | NA |
| Other models | EfficientZero | Tsinghua University, University of California (UC) Berkeley, Shanghai Qi Zhi institute | 2021-10-30 | NA | NA |
| Other models | S4 | Stanford University | 2021-10-31 | 7.8e+19 | 8 |
| Other models | Projected GAN | Heidelberg University | 2021-11-01 | 1.0e+19 | NA |
| Other models | CodeT5-base | Salesforce, Nanyang Technological University | 2021-11-01 | 1.6e+21 | NA |
| Other models | Masked Autoencoders ViT-H | Facebook AI Research | 2021-11-11 | 4.6e+20 | NA |
| Other models | ViT-G/14 (LiT) | Google Research | 2021-11-15 | NA | NA |
| Other models | Swin Transformer V2 (SwinV2-G) | Microsoft Research Asia | 2021-11-18 | 1.1e+21 | NA |
| Other models | BASIC-L | 2021-11-19 | 4.1e+22 | NA | |
| Other models | Florence | Microsoft | 2021-11-22 | 4.8e+22 | 512 |
| Other models | NÜWA | Microsoft Research, Peking University | 2021-11-24 | 7.2e+21 | NA |
| Other models | T-NLRv5 XXL | Microsoft | 2021-12-03 | NA | NA |
| Other models | Student of Games | DeepMind | 2021-12-06 | 3.7e+22 | NA |
| Other models | Gopher (280B) | DeepMind | 2021-12-08 | 6.3e+23 | 4,096 |
| Other models | GLaM | 2021-12-13 | 3.6e+23 | 1,024 | |
| Other models | LongT5 | Google Research | 2021-12-15 | NA | 128 |
| Other models | Contriever | Meta AI, University College London (UCL), PSL University, Université Grenoble Alpes | 2021-12-16 | 1.6e+20 | NA |
| Other models | XGLM-7.5B | Meta AI, Facebook AI Research | 2021-12-20 | 2.2e+22 | 256 |
| Other models | LDM-1.45B | Heidelberg University, Runway | 2021-12-20 | NA | NA |
| Other models | ERNIE 3.0 Titan | Baidu, Peng Cheng Laboratory | 2021-12-23 | 1.0e+24 | 1,920 |
| Other models | ERNIE-ViLG | Baidu | 2021-12-31 | NA | NA |
| Other models | Detic | Meta AI, University of Texas at Austin | 2022-01-07 | 2.3e+19 | 32 |
| Other models | data2vec (vision) | Meta AI | 2022-01-20 | NA | NA |
| Other models | data2vec (language) | Meta AI | 2022-01-20 | NA | NA |
| Other models | data2vec (speech) | Meta AI | 2022-01-20 | NA | NA |
| Other models | AbLang (heavy sequences) | University of Oxford | 2022-01-22 | NA | NA |
| Other models | OntoProtein | Zhejiang University (ZJU) | 2022-01-23 | NA | NA |
| Other models | InstructGPT 175B | OpenAI | 2022-01-27 | 3.2e+23 | NA |
| Other models | InstructGPT 1.3B | OpenAI | 2022-01-27 | NA | NA |
| Other models | InstructGPT 6B | OpenAI | 2022-01-27 | NA | NA |
| Other models | AlphaCode | DeepMind | 2022-02-02 | 2.4e+23 | 3,750 |
| Other models | RETRO-7B | DeepMind | 2022-02-07 | 1.7e+22 | NA |
| Other models | GPT-NeoX-20B | EleutherAI | 2022-02-09 | 9.3e+22 | 96 |
| Other models | ProteinBERT | Hebrew University of Jerusalem, Ben-Gurion University of the Negev, Deep Trading | 2022-02-10 | 6.5e+19 | 1 |
| Other models | LaMDA | 2022-02-10 | 3.6e+23 | 1,024 | |
| Other models | Midjourney V1 | Midjourney | 2022-02-15 | NA | NA |
| Other models | ST-MoE | Google, Google Brain, Google Research | 2022-02-17 | 2.9e+23 | NA |
| Other models | FourCastNet | NVIDIA, NERSC, Lawrence Berkeley National Laboratory, University of Michigan, Rice University,... | 2022-02-22 | 3.5e+20 | 64 |
| Other models | PolyCoder | Carnegie Mellon University (CMU) | 2022-02-26 | 1.1e+21 | NA |
| Other models | DeepNet | Microsoft Research | 2022-03-01 | NA | NA |
| Other models | Statement Curriculum Learning | OpenAI | 2022-03-02 | NA | NA |
| Other models | MegaSyn | Collaborations Pharmaceuticals | 2022-03-07 | NA | NA |
| Other models | ViT-G (model soup) | University of Washington, Columbia University, Google, Meta AI, Tel Aviv University | 2022-03-10 | 3.4e+21 | NA |
| Other models | Segatron-XL large, M=384 + HCP | Microsoft Research, University of Waterloo | 2022-03-21 | 2.6e+19 | NA |
| Other models | Make-A-Scene | Meta AI | 2022-03-24 | 6.4e+21 | NA |
| Other models | Chinchilla | DeepMind | 2022-03-29 | 5.8e+23 | NA |
| Other models | DALL·E 2 | OpenAI | 2022-04-06 | 3.4e+23 | NA |
| Other models | BERT-RBP | Waseda University | 2022-04-07 | 1.4e+20 | NA |
| Other models | Stable Diffusion (LDM-KL-8-G) | Runway, Ludwig Maximilian University of Munich, Heidelberg University | 2022-04-13 | 5.0e+22 | 256 |
| Other models | Sparse all-MLP | Meta AI | 2022-04-14 | 5.3e+20 | NA |
| Other models | XMC-GAN | Google Research | 2022-04-14 | NA | NA |
| Other models | Flamingo | DeepMind | 2022-04-29 | 2.2e+23 | 1,536 |
| Other models | OPT-175B | Meta AI | 2022-05-02 | 4.3e+23 | 1,024 |
| Other models | DeBERTaV3large + KEAR | Microsoft | 2022-05-04 | NA | NA |
| Other models | UL2 | Google Research, Google Brain | 2022-05-10 | 1.2e+23 | 512 |
| Other models | Gato | DeepMind | 2022-05-12 | 4.0e+21 | 256 |
| Other models | SimCSE | Princeton University, Tsinghua University | 2022-05-18 | NA | NA |
| Other models | Imagen | Google Brain | 2022-05-23 | 1.5e+22 | 256 |
| Other models | Tranception | University of Oxford, Harvard Medical School, Cohere | 2022-05-27 | 7.2e+21 | 64 |
| Other models | GPT-2 Medium (FlashAttention) | Stanford University, University at Buffalo | 2022-05-27 | 8.9e+20 | 8 |
| Other models | CogVideo | Tsinghua University, Beijing Academy of Artificial Intelligence / BAAI | 2022-05-29 | NA | NA |
| Other models | Diffusion-GAN | UT Austin, Microsoft | 2022-06-05 | NA | NA |
| Other models | DITTO | Tsinghua University, Apple, Westlake University, Chinese University of Hong Kong (CUHK) | 2022-06-06 | 3.3e+18 | 8 |
| Other models | MetaLM | Microsoft Research | 2022-06-13 | NA | NA |
| Other models | CoCa | Google Research | 2022-06-14 | 7.3e+22 | 2,048 |
| Other models | Parti | Google Research | 2022-06-22 | 5.1e+23 | NA |
| Other models | ProGen2-xlarge | Salesforce Research, Columbia University, Johns Hopkins University | 2022-06-27 | 1.4e+22 | NA |
| Other models | Minerva (540B) | 2022-06-29 | 2.7e+24 | 1,024 | |
| Other models | CodeT5-large | Salesforce | 2022-07-05 | 2.7e+21 | NA |
| Other models | NLLB | Meta AI | 2022-07-06 | 1.8e+22 | NA |
| Other models | BLOOM-176B | Hugging Face, BigScience | 2022-07-11 | 3.7e+23 | 384 |
| Other models | ESM2-15B | Meta AI, New York University (NYU), Stanford University, Massachusetts Institute of Technology (MIT) | 2022-07-21 | 7.4e+22 | 512 |
| Other models | OmegaPLM | Massachusetts Institute of Technology (MIT), Westlake University | 2022-07-22 | 1.0e+22 | NA |
| Other models | AlexaTM 20B | Amazon | 2022-08-02 | 2.0e+23 | 128 |
| Other models | GLM-130B | Tsinghua University | 2022-08-04 | 3.5e+23 | 768 |
| Other models | BlenderBot 3 | McGill University, Meta AI, Mila - Quebec AI (originally Montreal Institute for Learning Algorithms) | 2022-08-10 | 4.3e+23 | 128 |
| Other models | BEIT-3 | Microsoft | 2022-08-22 | 7.0e+19 | NA |
| Other models | SauTech | Saudi Data and Artificial Intelligence Authority, Saudi Company for Artificial Intelligence | 2022-09-14 | NA | 8 |
| Other models | PaLI | 2022-09-14 | 1.7e+23 | 1,024 | |
| Other models | Whisper | OpenAI | 2022-09-21 | 4.2e+21 | NA |
| Other models | Make-A-Video | Meta AI | 2022-09-29 | NA | NA |
| Other models | DiffDock | Massachusetts Institute of Technology (MIT) | 2022-10-04 | 7.2e+19 | NA |
| Other models | AlphaTensor | DeepMind | 2022-10-05 | 7.1e+20 | 64 |
| Other models | Phenaki | University College London (UCL), University of Michigan, Google Brain | 2022-10-05 | NA | NA |
| Other models | GenSLM | University of Chicago, NVIDIA, Harvard University, Cerebras Systems, Technical University of... | 2022-10-11 | 1.4e+21 | NA |
| Other models | Diplodocus | Meta AI, Massachusetts Institute of Technology (MIT) | 2022-10-11 | NA | NA |
| Other models | Flan-PaLM 540B | 2022-10-20 | 2.5e+24 | 512 | |
| Other models | LMSI-Palm | Google, University of Illinois Urbana-Champaign (UIUC) | 2022-10-20 | NA | NA |
| Other models | U-PaLM (540B) | 2022-10-20 | 2.5e+24 | 512 | |
| Other models | EnCodec | Meta AI | 2022-10-24 | NA | NA |
| Other models | eDiff-I | NVIDIA | 2022-11-02 | 5.5e+19 | NA |
| Other models | Mogrifier RLSTM (WT2) | DeepMind | 2022-11-03 | 1.4e+17 | NA |
| Other models | mT0-13B | Hugging Face, BigScience | 2022-11-03 | NA | NA |
| Other models | InternImage | Shanghai AI Lab, Tsinghua University, Nanjing University, SenseTime, Chinese University of Hong... | 2022-11-10 | 2.4e+21 | NA |
| Other models | AltCLIP_M9 | Beijing Academy of Artificial Intelligence / BAAI | 2022-11-12 | NA | NA |
| Other models | EVA-01 | Beijing Academy of Artificial Intelligence / BAAI, Huazhong University of Science and Technology,... | 2022-11-14 | 1.5e+22 | 128 |
| Other models | Galactica | Meta AI | 2022-11-16 | 3.2e+23 | 128 |
| Other models | Fusion in Encoder | Samsung | 2022-11-18 | 1.3e+20 | NA |
| Other models | AR-LDM | Alibaba, University of Waterloo, Vector Institute | 2022-11-20 | 5.1e+20 | NA |
| Other models | CICERO | Meta AI | 2022-11-22 | NA | NA |
| Other models | GPT-3.5 | OpenAI | 2022-11-28 | 2.6e+24 | NA |
| Other models | Discriminator Guidance | Korea Advanced Institute of Science and Technology (KAIST), NAVER | 2022-11-28 | 2.2e+20 | NA |
| Other models | DiT-XL/2 + Discriminator Guidance | Korea Advanced Institute of Science and Technology (KAIST), NAVER | 2022-11-28 | NA | NA |
| Other models | ALM 1.0 | Beijing Academy of Artificial Intelligence / BAAI | 2022-11-28 | NA | NA |
| Other models | GPT-3.5 Turbo | OpenAI | 2022-11-30 | NA | NA |
| Other models | DeepNash | DeepMind | 2022-12-01 | NA | NA |
| Other models | Vega v2 | Wuhan University, JD Explore Academy, Shanghai AI Lab, Nanyang Technological University, Washington... | 2022-12-04 | 7.8e+22 | 320 |
| Other models | TranceptEve | University of Oxford, Harvard Medical School | 2022-12-10 | NA | NA |
| Other models | RT-1 | 2022-12-13 | NA | NA | |
| Other models | CaLM | University of Oxford | 2022-12-19 | 2.9e+19 | 4 |
| Other models | Hybrid H3-2.7B | Stanford University, University at Buffalo | 2022-12-28 | 6.5e+21 | 8 |
| Other models | VALL-E | Microsoft | 2023-01-05 | 1.0e+19 | NA |
| Other models | DreamerV3 | DeepMind, University of Toronto | 2023-01-10 | 2.2e+20 | 16 |
| Other models | Nucleotide Transformer | NVIDIA, Technical University of Munich, InstaDeep | 2023-01-15 | 8.1e+21 | 128 |
| Other models | Ankh_large | Technical University of Munich, Columbia University | 2023-01-16 | 6.5e+21 | 64 |
| Other models | MusicLM | 2023-01-26 | NA | NA | |
| Other models | DDPM-IP (CelebA) | Utrecht University | 2023-01-27 | 3.5e+20 | NA |
| Other models | BLIP-2 (Q-Former) | Salesforce Research | 2023-01-30 | 1.2e+21 | 16 |
| Other models | Gen-1 | Runway | 2023-02-06 | NA | NA |
| Other models | ProteinDT | University of California (UC) Berkeley, California Institute of Technology, University of Toronto,... | 2023-02-09 | NA | NA |
| Other models | ViT-22B | 2023-02-10 | 1.9e+23 | 1,024 | |
| Other models | BASIC-L + Lion | Google, University of California Los Angeles (UCLA) | 2023-02-13 | NA | NA |
| Other models | LLaMA-65B | Meta AI | 2023-02-24 | 5.5e+23 | 2,048 |
| Other models | DiT-XL/2 | New York University (NYU), University of California (UC) Berkeley | 2023-03-02 | 6.0e+20 | NA |
| Other models | AudioGen | Meta AI, Hebrew University of Jerusalem | 2023-03-05 | 9.5e+21 | NA |
| Other models | PaLM-E | Google, TU Berlin | 2023-03-06 | NA | NA |
| Other models | Claude | Anthropic | 2023-03-14 | NA | NA |
| Other models | LEP-AD | King Abdullah University of Science and Technology (KAUST), Karolinska Institute | 2023-03-15 | NA | NA |
| Other models | Falcon-40B | Technology Innovation Institute | 2023-03-15 | 2.4e+23 | 384 |
| Other models | PanGu-Σ | Huawei Noah's Ark Lab | 2023-03-20 | 4.7e+23 | 512 |
| Other models | Gen-2 | Runway | 2023-03-20 | NA | NA |
| Other models | Firefly | Adobe | 2023-03-21 | NA | NA |
| Other models | SigLIP 400M | Google DeepMind | 2023-03-27 | 4.9e+21 | 32 |
| Other models | VideoMAE V2 | Nanjing University, Shenzhen Institute of Advanced Technology, Shanghai AI Lab | 2023-03-29 | 9.7e+21 | 64 |
| Other models | BloombergGPT | Bloomberg, Johns Hopkins University | 2023-03-30 | 2.4e+23 | 512 |
| Other models | Segment Anything Model | Meta AI | 2023-04-05 | 7.8e+21 | 256 |
| Other models | Incoder-6.7B | Facebook AI Research, University of Washington, University of California (UC) Berkeley, Carnegie... | 2023-04-09 | 3.0e+21 | NA |
| Other models | DINOv2 | Facebook AI Research, INRIA | 2023-04-14 | 7.4e+21 | NA |
| Other models | LLaVA | University of Wisconsin Madison, Microsoft Research, Columbia University | 2023-04-17 | 7.8e+22 | 8 |
| Other models | Agile Soccer Robot | Google DeepMind | 2023-04-26 | NA | NA |
| Other models | StarCoder | Hugging Face, ServiceNow, Northeastern University, Mila - Quebec AI (originally Montreal Institute... | 2023-05-09 | 8.5e+22 | 512 |
| Other models | ImageBind | Meta AI | 2023-05-09 | NA | NA |
| Other models | PaLM 2 | 2023-05-10 | 7.3e+24 | NA | |
| Other models | InstructBLIP | Salesforce Research, Hong Kong University of Science and Technology (HKUST), Nanyang Technological... | 2023-05-11 | 1.9e+20 | 16 |
| Other models | Med-PaLM 2 | Google Research, DeepMind | 2023-05-16 | NA | NA |
| Other models | CoEdiT-xxl | University of Minnesota, Grammarly | 2023-05-17 | NA | NA |
| Other models | ONE-PEACE | Alibaba, Huazhong University of Science and Technology | 2023-05-18 | 1.8e+20 | NA |
| Other models | CodeT5+ | Salesforce | 2023-05-20 | NA | NA |
| Other models | Goat-7B | National University of Singapore | 2023-05-23 | NA | NA |
| Other models | PaLI-X | Google Research | 2023-05-29 | 5.6e+23 | NA |
| Other models | LTM-1 | Magic | 2023-06-06 | NA | NA |
| Other models | MusicGen | Meta AI | 2023-06-08 | NA | NA |
| Other models | HyenaDNA | Stanford University, Harvard University, Mila - Quebec AI (originally Montreal Institute for... | 2023-06-27 | 1.8e+21 | 8 |
| Other models | ERNIE 3.5 | Baidu | 2023-06-27 | NA | NA |
| Other models | Stable Diffusion XL (SDXL) | Stability AI | 2023-07-04 | NA | NA |
| Other models | Pangu-Weather | Huawei | 2023-07-05 | 4.0e+22 | 192 |
| Other models | xTrimoPGLM -100B | Tsinghua University, BioMap Research | 2023-07-06 | 6.2e+23 | 768 |
| Other models | InternLM | Shanghai AI Lab, SenseTime | 2023-07-06 | 1.0e+24 | NA |
| Other models | Claude 2 | Anthropic | 2023-07-11 | 3.9e+24 | NA |
| Other models | Llama 2-7B | Meta AI | 2023-07-18 | 8.4e+22 | NA |
| Other models | GPT3-2.7B (FlashAttention-2) | Stanford University, Princeton University | 2023-07-18 | NA | 8 |
| Other models | Llama 2-70B | Meta AI | 2023-07-18 | 8.1e+23 | 1,000 |
| Other models | AudioLM | Google Research | 2023-07-26 | 3.9e+18 | NA |
| Other models | RT-2 | Google DeepMind | 2023-07-28 | NA | NA |
| Other models | GGNN | Westlake University, Tsinghua University, Toyota Technological Institute at Chicago | 2023-08-05 | 7.6e+21 | 2 |
| Other models | Qwen-VL | Alibaba | 2023-08-24 | NA | NA |
| Other models | PeptideBERT | Carnegie Mellon University (CMU) | 2023-08-28 | 4.9e+16 | 1 |
| Other models | Jais | Cerebras Systems, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), Inception G42 | 2023-08-29 | 4.9e+22 | 16 |
| Other models | Swift | Intel Labs | 2023-08-30 | 5.3e+16 | 1 |
| Other models | Falcon-180B | Technology Innovation Institute | 2023-09-06 | 3.8e+24 | 4,096 |
| Other models | Robot Parkour | Shanghai Qi Zhi institute, Stanford University, Carnegie Mellon University (CMU), Tsinghua... | 2023-09-12 | NA | NA |
| Other models | AlphaMissense | Google DeepMind | 2023-09-22 | NA | NA |
| Other models | GPT-4V | OpenAI | 2023-09-25 | NA | NA |
| Other models | Show-1 | National University of Singapore | 2023-09-27 | NA | NA |
| Other models | CTM (CIFAR-10) | Stanford University, Sony | 2023-10-01 | NA | 4 |
| Other models | FinGPT-13B | University of California Los Angeles (UCLA), Columbia University, New York University (NYU) | 2023-10-07 | 1.6e+23 | 1 |
| Other models | RoseTTAFold All-Atom (RFAA) | University of Washington, Seoul National University, University of Sheffield | 2023-10-09 | 2.1e+20 | NA |
| Other models | Ferret (13B) | Columbia University, Apple | 2023-10-11 | NA | 8 |
| Other models | RT-2-X | Google DeepMind | 2023-10-13 | NA | NA |
| Other models | ERNIE 4.0 | Baidu | 2023-10-17 | NA | NA |
| Other models | PaLI-3 | Google DeepMind, Google Research, Google Cloud | 2023-10-17 | NA | NA |
| Other models | DALL·E 3 | OpenAI | 2023-10-19 | NA | NA |
| Other models | CODEFUSION (Python) | Microsoft, Microsoft Research | 2023-10-26 | 7.9e+18 | 4 |
| Other models | DiT-XL/2 + CADS | ETH Zurich, Disney Research | 2023-10-26 | NA | NA |
| Other models | ChatGLM3-6B | Zhipu AI | 2023-10-27 | 5.0e+22 | NA |
| Other models | Skywork-13B | Kunlun Inc. | 2023-10-30 | 2.5e+23 | 512 |
| Other models | Cohere Embed | Cohere | 2023-11-02 | NA | NA |
| Other models | Yi-34B | 01.AI | 2023-11-02 | 6.1e+23 | 128 |
| Other models | RT-Trajectory | Google DeepMind, University of California San Diego, Stanford University | 2023-11-03 | NA | NA |
| Other models | BLUUMI | University of Turku, Hugging Face | 2023-11-03 | NA | NA |
| Other models | Grok-1 | xAI | 2023-11-04 | 2.9e+24 | NA |
| Other models | LLaVA 1.5 | University of Wisconsin Madison, Microsoft Research | 2023-11-05 | 7.8e+22 | 8 |
| Other models | CogVLM-17B | Tsinghua University, Zhipu AI, Beihang University | 2023-11-06 | 6.3e+22 | NA |
| Other models | GPT-4 Turbo | OpenAI | 2023-11-06 | 2.2e+25 | NA |
| Other models | OmniVec | TensorTour | 2023-11-07 | NA | NA |
| Other models | mPLUG-Owl2 | Alibaba | 2023-11-07 | NA | NA |
| Other models | MultiBand Diffusion | Meta AI, Hebrew University of Jerusalem, LORIA | 2023-11-08 | 2.6e+19 | NA |
| Other models | SPHINX (Llama 2 13B) | Shanghai AI Lab, Chinese University of Hong Kong (CUHK), ShanghaiTech University | 2023-11-13 | 3.0e+22 | 32 |
| Other models | Volcano 13B | Korea University, Korea Advanced Institute of Science and Technology (KAIST), LG | 2023-11-13 | 4.6e+22 | NA |
| Other models | GraphCast | Google DeepMind | 2023-11-14 | 2.1e+22 | NA |
| Other models | Qwen-Audio-Chat | Alibaba | 2023-11-14 | NA | NA |
| Other models | Nemotron-3-8B | NVIDIA | 2023-11-15 | 1.8e+23 | 1,024 |
| Other models | AndesGPT | Oppo Mobile Telecommunications | 2023-11-16 | NA | NA |
| Other models | Claude 2.1 | Anthropic | 2023-11-21 | NA | NA |
| Other models | Inflection-2 | Inflection AI | 2023-11-22 | 1.0e+25 | 5,000 |
| Other models | GNoME for crystal discovery | Google DeepMind | 2023-11-29 | NA | 4 |
| Other models | PPLX-70B-Online | Perplexity | 2023-11-29 | NA | NA |
| Other models | Qwen-72B | Alibaba | 2023-11-30 | 1.3e+24 | NA |
| Other models | Mamba-24M (SC09) | Carnegie Mellon University (CMU), Princeton University | 2023-12-01 | NA | NA |
| Other models | Gemini 1.0 Pro | Google DeepMind | 2023-12-06 | 1.8e+24 | NA |
| Other models | Llama Guard | Meta AI | 2023-12-07 | 1.6e+23 | NA |
| Other models | SeamlessM4T | Facebook, INRIA, University of California (UC) Berkeley | 2023-12-08 | NA | NA |
| Other models | W.A.L.T | Stanford University, Google Research, Georgia Institute of Technology | 2023-12-11 | NA | NA |
| Other models | Mixtral 8x7B | Mistral AI | 2023-12-11 | 7.7e+23 | NA |
| Other models | VILA-13B | NVIDIA, Massachusetts Institute of Technology (MIT) | 2023-12-12 | 2.3e+21 | 128 |
| Other models | FunSearch | Google DeepMind | 2023-12-14 | 3.9e+23 | NA |
| Other models | CogAgent | Tsinghua University, Zhipu AI | 2023-12-14 | 6.7e+22 | NA |
| Other models | Gemini Nano-2 | Google DeepMind | 2023-12-19 | NA | NA |
| Other models | Gemini Nano-1 | Google DeepMind | 2023-12-19 | NA | NA |
| Other models | nekomata-14b | rinna | 2023-12-21 | 2.6e+23 | 256 |
| Other models | CoRe | Tsinghua University | 2023-12-29 | NA | NA |
| Other models | Kimi Explorer | Moonshot | 2024-01-01 | NA | NA |
| Other models | Palmyra X 003 | Writer | 2024-01-01 | NA | NA |
| Other models | AlphaGeometry | Google DeepMind, New York University (NYU) | 2024-01-17 | NA | NA |
| Other models | Qwen-VL-Max | Alibaba | 2024-01-25 | NA | NA |
| Other models | Qwen1.5-72B | Alibaba | 2024-02-04 | 1.3e+24 | NA |
| Other models | Aya | Cohere for AI, Brown University, Cohere, Carnegie Mellon University (CMU), Massachusetts Institute... | 2024-02-12 | NA | 128 |
| Other models | Gemini 1.5 Pro | Google DeepMind | 2024-02-15 | 1.6e+25 | NA |
| Other models | Sora Turbo | OpenAI | 2024-02-15 | NA | NA |
| Other models | Sora | OpenAI | 2024-02-15 | NA | NA |
| Other models | Stable Diffusion 3 | Stability AI | 2024-02-22 | 5.0e+22 | NA |
| Other models | MegaScale (Production) | ByteDance, Peking University | 2024-02-23 | 3.9e+24 | 12,288 |
| Other models | Mistral Large | Mistral AI | 2024-02-26 | 1.1e+25 | NA |
| Other models | Claude 3 Sonnet | Anthropic | 2024-03-04 | NA | NA |
| Other models | Claude 3 Opus | Anthropic | 2024-03-04 | 1.6e+25 | NA |
| Other models | Aramco Metabrain AI | Saudi Aramco | 2024-03-04 | 1.0e+25 | NA |
| Other models | Inflection-2.5 | Inflection AI | 2024-03-07 | 8.0e+24 | NA |
| Other models | ManiGaussian | Tsinghua University, Nanyang Technological University, Carnegie Mellon University (CMU) | 2024-03-13 | NA | 2 |
| Other models | MM1-30B | Apple | 2024-03-14 | 4.9e+23 | NA |
| Other models | DBRX | Databricks | 2024-03-27 | 2.6e+24 | NA |
| Other models | ReALM | Apple | 2024-03-29 | NA | NA |
| Other models | Reka Core | Reka AI | 2024-04-15 | 8.4e+24 | NA |
| Other models | Llama 3-70B | Meta AI | 2024-04-18 | 7.9e+24 | NA |
| Other models | GenCast | Google DeepMind | 2024-05-01 | 8.2e+20 | 32 |
| Other models | VILA1.5-13B | NVIDIA, Massachusetts Institute of Technology (MIT) | 2024-05-03 | 2.3e+21 | 128 |
| Other models | AlphaFold 3 | Google DeepMind, Isomorphic Labs | 2024-05-08 | 4.1e+22 | 256 |
| Other models | GPT-4o | OpenAI | 2024-05-13 | 3.8e+25 | NA |
| Other models | Yi-Large | 01.AI | 2024-05-13 | 1.8e+24 | NA |
| Other models | Octo-Base | University of California (UC) Berkeley, Stanford University, Carnegie Mellon University (CMU),... | 2024-05-20 | 5.8e+20 | 128 |
| Other models | GLM-4 (0520) | Zhipu AI | 2024-05-20 | NA | NA |
| Other models | ALLaM 7B | Saudi Data and Artificial Intelligence Authority | 2024-05-21 | 9.0e+22 | NA |
| Other models | ALLaM adapted 70B | Saudi Data and Artificial Intelligence Authority | 2024-05-21 | 1.1e+24 | NA |
| Other models | Qwen2-72B | Alibaba | 2024-06-07 | 3.0e+24 | NA |
| Other models | Llama-3.1-Nemotron-70B-Instruct | NVIDIA, Meta AI | 2024-06-12 | 7.9e+24 | NA |
| Other models | OpenVLA | Stanford University, University of California (UC) Berkeley, Toyota Research Institute, Google... | 2024-06-13 | 1.1e+23 | 64 |
| Other models | Nemotron-4 340B | NVIDIA | 2024-06-14 | 1.8e+25 | 6,144 |
| Other models | DeepSeek-Coder-V2 236B | DeepSeek | 2024-06-17 | 1.3e+24 | NA |
| Other models | Claude 3.5 Sonnet | Anthropic | 2024-06-20 | 2.7e+25 | NA |
| Other models | Cambrian-1-34B | New York University (NYU) | 2024-06-24 | NA | 512 |
| Other models | ESM3 (98B) | EvolutionaryScale, University of California (UC) Berkeley | 2024-06-25 | 1.1e+24 | NA |
| Other models | Ernie 4.0 Turbo | Baidu | 2024-06-28 | NA | NA |
| Other models | SenseChat 5.5 | SenseTime | 2024-07-06 | NA | NA |
| Other models | Mathstral | Mistral AI | 2024-07-16 | NA | NA |
| Other models | DeepL LLM | DeepL | 2024-07-16 | NA | NA |
| Other models | GPT-4o mini | OpenAI | 2024-07-18 | 7.4e+24 | NA |
| Other models | Mistral Large 2 | Mistral AI | 2024-07-24 | 2.1e+25 | NA |
| Other models | AFM-server | Apple | 2024-07-29 | 4.3e+24 | 8,192 |
| Other models | AFM-on-device | Apple | 2024-07-29 | 4.5e+23 | 2,048 |
| Other models | LLaVA-OV-72B | ByteDance, Nanyang Technological University, Chinese University of Hong Kong (CUHK), Hong Kong... | 2024-08-06 | 3.0e+24 | NA |
| Other models | Table Tennis Agent | Google DeepMind | 2024-08-07 | NA | NA |
| Other models | Grok-2 | xAI | 2024-08-13 | 3.0e+25 | NA |
| Other models | Jamba 1.5-Large | AI21 Labs | 2024-08-22 | NA | NA |
| Other models | Hairuo | Inspur | 2024-08-29 | NA | NA |
| Other models | GLM-4-Plus | Zhipu AI | 2024-08-29 | 3.6e+25 | NA |
| Other models | AlphaProteo | Google DeepMind | 2024-09-05 | NA | NA |
| Other models | Hunyuan Turbo | Tencent | 2024-09-05 | NA | NA |
| Other models | DeepSeek-V2.5 | DeepSeek | 2024-09-06 | 1.8e+24 | NA |
| Other models | o1-mini | OpenAI | 2024-09-12 | NA | NA |
| Other models | o1-preview | OpenAI | 2024-09-12 | NA | NA |
| Other models | Qwen2.5-32B | Alibaba | 2024-09-17 | 3.5e+24 | NA |
| Other models | Qwen2.5 Instruct (72B) | Alibaba | 2024-09-19 | 7.9e+24 | NA |
| Other models | Qwen2.5-72B | Alibaba | 2024-09-19 | 7.8e+24 | NA |
| Other models | Oryx 34B | Tsinghua University, Tencent, Nanyang Technological University | 2024-09-19 | NA | 64 |
| Other models | Telechat2-115B | China Telecom | 2024-09-20 | 6.9e+24 | NA |
| Other models | PixelDance | ByteDance | 2024-09-24 | NA | NA |
| Other models | Llama 3.2 11B | Meta AI | 2024-09-24 | 5.8e+23 | NA |
| Other models | Movie Gen Video | Meta AI | 2024-10-04 | 1.6e+24 | 6,144 |
| Other models | GR-2 | ByteDance | 2024-10-08 | NA | NA |
| Other models | Palmyra X 004 | Writer | 2024-10-09 | NA | NA |
| Other models | RDT-1B | Tsinghua University | 2024-10-10 | 4.1e+22 | 48 |
| Other models | CHAI-1 | Chai discovery | 2024-10-15 | 7.8e+21 | 128 |
| Other models | Yi-Lightning | 01.AI | 2024-10-18 | 1.5e+24 | 2,000 |
| Other models | NVLM-D 72B | NVIDIA | 2024-10-22 | 3.0e+24 | 128 |
| Other models | NVLM-H 72B | NVIDIA | 2024-10-22 | 3.0e+24 | 128 |
| Other models | NVLM-X 72B | NVIDIA | 2024-10-22 | 3.0e+24 | 128 |
| Other models | Doubao-pro | ByteDance | 2024-10-28 | 2.5e+25 | NA |
| Other models | Hunyuan-Large | Tencent | 2024-11-06 | 3.5e+24 | NA |
| Other models | SeedEdit | ByteDance | 2024-11-11 | NA | NA |
| Other models | Gemini-Exp-1114 | Google DeepMind | 2024-11-15 | NA | NA |
| Other models | k0-math | Moonshot | 2024-11-16 | NA | NA |
| Other models | Pixtral Large | Mistral AI | 2024-11-18 | NA | NA |
| Other models | Suno v4 | Suno | 2024-11-19 | NA | NA |
| Other models | Fugatto 1 | NVIDIA | 2024-11-25 | NA | 32 |
| Other models | Amazon Nova Pro | Amazon | 2024-12-03 | 6.0e+24 | NA |
| Other models | Infinity | ByteDance | 2024-12-05 | NA | NA |
| Other models | NVILA 15B | NVIDIA, Massachusetts Institute of Technology (MIT), University of California (UC) Berkeley,... | 2024-12-05 | NA | 128 |
| Other models | o1 | OpenAI | 2024-12-05 | NA | NA |
| Other models | Llama 3.3 70B | Meta AI | 2024-12-06 | 6.9e+24 | NA |
| Other models | EXAONE 3.5 32B | LG AI Research | 2024-12-09 | 1.3e+24 | NA |
| Other models | Gemini 2.0 Pro | Google DeepMind | 2024-12-11 | NA | NA |
| Other models | Apollo 7B | Meta AI, Stanford University | 2024-12-13 | NA | 128 |
| Other models | Veo 2 | Google DeepMind | 2024-12-16 | NA | NA |
| Other models | o3 | OpenAI | 2024-12-20 | NA | NA |
| Other models | DeepSeek-V3 | DeepSeek | 2024-12-24 | 3.4e+24 | 2,048 |
| Other models | STORM-B/8 | University of Southern California, Georgia Institute of Technology, Stanford University, NVIDIA | 2024-12-31 | NA | 16 |
| Other models | Stable Point Aware 3D (SPAR3D) | Stability AI, University of Illinois Urbana-Champaign (UIUC) | 2025-01-08 | NA | NA |
| Other models | INTELLECT-MATH | Prime Intellect | 2025-01-17 | NA | NA |
| Other models | Eagle 2 | NVIDIA, Nanjing University, Tsinghua University, Hong Kong Polytechnic University, Johns Hopkins... | 2025-01-20 | 4.7e+22 | 256 |
| Other models | DeepSeek-R1 | DeepSeek | 2025-01-20 | 4.0e+24 | NA |
| Other models | Kimi k1.5 | Moonshot | 2025-01-22 | NA | NA |
| Other models | Doubao-1.5-pro | ByteDance | 2025-01-22 | NA | NA |
| Other models | Computer-Using Agent (CUA) | OpenAI | 2025-01-23 | NA | NA |
| Other models | o3-mini | OpenAI | 2025-01-31 | NA | NA |
| Other models | Eurus-2-7B-PRIME | Tsinghua University, University of Illinois Urbana-Champaign (UIUC), Shanghai AI Lab, Peking... | 2025-02-03 | NA | NA |
| Other models | Claude 3.7 Sonnet | Anthropic | 2025-02-24 | 3.3e+25 | NA |
| Other models | Mercury | Inception Labs | 2025-02-27 | NA | NA |
| Other models | GPT-4.5 | OpenAI | 2025-02-27 | 2.1e+26 | NA |
| Other models | QwQ-32B | Alibaba | 2025-03-06 | 3.5e+24 | NA |
| Other models | Mistral OCR | Mistral AI | 2025-03-06 | NA | NA |
| Other models | Hunyuan-TurboS | Tencent | 2025-03-11 | NA | NA |
| Other models | EXAONE Deep 32B | LG AI Research | 2025-03-16 | 1.3e+24 | 512 |
| Other models | ERNIE-4.5-VL-424B-A47B (文心大模型4.5) | Baidu | 2025-03-16 | NA | NA |
| Other models | Diffusion Renderer | NVIDIA, University of Toronto, Vector Institute, University of Illinois Urbana-Champaign (UIUC) | 2025-03-22 | NA | 32 |
| Other models | Gemini 2.5 Pro | Google DeepMind | 2025-03-25 | NA | NA |
| Other models | Llama 4 Maverick | Meta AI | 2025-04-05 | 2.2e+24 | NA |
| Other models | Llama 4 Scout | Meta AI | 2025-04-05 | 4.1e+24 | NA |
| Other models | Pangu Ultra | Huawei | 2025-04-10 | 1.1e+25 | 8,192 |
| Other models | gpt-image-1 | OpenAI | 2025-04-23 | NA | NA |
| Other models | Qwen3-235B-A22B | Alibaba | 2025-04-29 | 4.8e+24 | NA |
| Other models | Seed1.5-VL | ByteDance | 2025-05-11 | 1.4e+24 | NA |
| Other models | Imagen 4 | 2025-05-20 | NA | NA | |
| Other models | Veo 3 | Google DeepMind | 2025-05-21 | NA | NA |
| Other models | Claude Sonnet 4 | Anthropic | 2025-05-22 | NA | NA |
| Other models | Claude Opus 4 | Anthropic | 2025-05-22 | NA | NA |
| Other models | Qwen3 Embedding | Alibaba | 2025-06-05 | NA | NA |
| Other models | Seed-1.6-Thinking | ByteDance | 2025-06-11 | NA | NA |
| Other models | FGN | Google DeepMind | 2025-06-12 | 9.6e+21 | NA |
| Other models | Kimi K2 | Moonshot | 2025-07-11 | 3.0e+24 | NA |
| Other models | Gemini Embedding | Google DeepMind | 2025-07-14 | NA | NA |
| Other models | EXAONE 4.0 (32B) | LG AI Research | 2025-07-15 | 2.7e+24 | 512 |
| Other models | Qwen3-Coder-480B-A35B | Alibaba | 2025-07-22 | 1.6e+24 | NA |
| Other models | Gemini 2.5 Deep Think | Google, Google DeepMind | 2025-08-01 | NA | NA |
| Other models | MindLink-72B | Kunlun Inc. | 2025-08-01 | NA | NA |
| Other models | Qwen Image | Alibaba | 2025-08-04 | NA | NA |
| Other models | GLM 4.5 | Zhipu AI, Tsinghua University | 2025-08-05 | 4.4e+24 | NA |
| Other models | gpt-oss-120b | OpenAI | 2025-08-05 | 4.9e+24 | NA |
| Other models | gpt-oss-20b | OpenAI | 2025-08-05 | 5.5e+23 | NA |
| Other models | GPT-5 | OpenAI | 2025-08-07 | NA | NA |
| Other models | GPT-5 mini | OpenAI | 2025-08-07 | NA | NA |
| Other models | GPT-5 nano | OpenAI | 2025-08-07 | NA | NA |
| Other models | Qwen3-Max | Alibaba | 2025-09-05 | 1.5e+25 | NA |
Epoch's work is free to use, distribute, and reproduce provided the source and authors are credited under the Creative Commons BY license.