Bibliography (21):

  1. RoBERTa: A Robustly Optimized BERT Pretraining Approach

  2. Approximating CNNs with Bag-of-local-Features models works surprisingly well on ImageNet

  3. https://www.cell.com/cms/10.1016/j.cell.2025.02.025/asset/87e91aa6-0ba2-44a5-be3e-bc056da57180/main.assets/gr2_lrg.jpg

  4. Longformer: The Long-Document Transformer

  5. The Llama 3 Herd of Models

  6. https://arxiv.org/abs/2403.08295#google

  7. https://www.cell.com/cms/10.1016/j.cell.2025.02.025/asset/76489d37-d548-4da9-9627-228118813ae1/main.assets/figs1_lrg.jpg

  8. https://www.cell.com/cms/10.1016/j.cell.2025.02.025/attachment/5ed5c728-798e-4628-a3a8-e351609e5dab/mmc1.pdf#page=2

  9. https://www.cell.com/cms/10.1016/j.cell.2025.02.025/asset/d6e4098b-f7be-49d3-933c-a13b6420b582/main.assets/gr4_lrg.jpg