RoBERTa: A Robustly Optimized BERT Pretraining Approach
Approximating CNNs with Bag-of-local-Features models works surprisingly well on ImageNet
https://www.cell.com/cms/10.1016/j.cell.2025.02.025/asset/87e91aa6-0ba2-44a5-be3e-bc056da57180/main.assets/gr2_lrg.jpg
Longformer: The Long-Document Transformer
The Llama 3 Herd of Models
https://arxiv.org/abs/2403.08295#google
https://www.cell.com/cms/10.1016/j.cell.2025.02.025/asset/76489d37-d548-4da9-9627-228118813ae1/main.assets/figs1_lrg.jpg
https://www.cell.com/cms/10.1016/j.cell.2025.02.025/attachment/5ed5c728-798e-4628-a3a8-e351609e5dab/mmc1.pdf#page=2
https://www.cell.com/cms/10.1016/j.cell.2025.02.025/asset/d6e4098b-f7be-49d3-933c-a13b6420b582/main.assets/gr4_lrg.jpg