Low-resource language
Authors
Paolo ValentinelliAbstract
Traditional definitions of language resourcedness fail to capture the structural inequalities embedded in LLMs’ pre-training data. While historical classifications rely heavily on sociopolitical vitality, artifacts, and human resources, a language’s real-world robustness no longer guarantees equitable algorithmic representation. To address this disparity, this paper proposes a novel tripartite framework that combines four established exogenous criteria with a relative endogenous quantitative metric: a language must hold a dominant or co-dominant statistical share of an LLM’s pre-training dataset to be classified as high-resource. Under this new paradigm, languages with strong societal infrastructure but marginal AI data representation, such as Italian and German in LLMs like GPT-3, are accurately reclassified as few-resource, while those lacking both real-world and digital infrastructure remain low-resource. Despite industry trends toward data opacity, adopting this precise terminology equips researchers with the tools to expose engineered linguistic disparities, challenge the false equivalence of traditional labels, and advocate for genuinely equitable, multilingual AI systems.
References
Bidese, Ermenegildo & Padovan, Andrea & Tomaselli, Alessandra. 2020. Rethinking V2 and nominative case assignment: new insights from a Germanic variety in Northern Italy. In Woods, Rebecca & Wolfe, Sam (eds). Rethinking Verb Second, 1–23. Oxford: Oxford University Press. https://doi.org/10.1093/oso/9780198844303.001.0001 DOI: https://doi.org/10.1093/oso/9780198844303.003.0024
Bidese, Ermenegildo. 2021. Introducing Cimbrian. The main linguistic features of a German(ic) language in Italy. Energeia 46. 19–62.
Brown, Tom B. & Mann, Benjamin & Ryder, Nick & Subbiah, Melanie & Kaplan, Jared & Dhariwal, Prafulla & Neelakantan, Arvind et al. 2020. Language models are few-shot learners. arXiv.
https://doi.org/10.48550/arXiv.2005.14165
Cicero, Francesco. 2023. L’italiano delle intelligenze artificiali generative. Italiano LinguaDue 15(2). 733–761.
https://doi.org/10.54103/2037-3597/21990 DOI: https://doi.org/10.54103/2037-3597/21990
Cicero, Francesco. 2025. Esercizi di stile. La narrativa per l’infanzia delle intelligenze artificiali. AI-Linguistica. Linguistic Studies on AI-Generated Texts and Discourses 2(2). https://doi.org/10.62408/ai-ling.v2i2.19 DOI: https://doi.org/10.62408/ai-ling.v2i2.19
CommonCrawl. 2026. Statistics of Common Crawl monthly archives: Distribution of languages.
https://commoncrawl.github.io/cc-crawl-statistics/plots/languages.html (last accessed 01/03/2026).
De Cesare, Anna-Maria. 2023. Assessing the quality of ChatGPT’s generated output in light of human-written texts: A corpus study based on textual parameters. CHIMERA: Revista de Corpus de Lenguas Romances y Estudios Lingüísticos 10. 179–210. https://revistas.uam.es/chimera/article/view/17979 (last accessed on 01/03/2026).
De Cesare, Anna-Maria. 2024. Nuove dinamiche di contatto linguistico. Le “impronte digitali” dell’inglese nell’italiano generato da LLM. Lid’O. Lingua Italiana d’Oggi XXI, 67–91.
De Cesare, Anna-Maria. 2025. LLM referential chain generation: A qualitative case study based on Italian biographies produced by GPT-4. Linguistik Online 136(4). 25–52. https://doi.org/10.13092/8tppdv47 DOI: https://doi.org/10.13092/8tppdv47
Devlin, Jacob & Chang, Ming-Wei & Lee, Kenton & Toutanova, Kristina. 2018. BERT: Pre-training of deep bidirectional transformers for language understanding. arXiv. https://doi.org/10.48550/arXiv.1810.04805
Eberhard, David M. & Simons, Gary F. & Fennig, Charles D. 2025. Ethnologue: Languages of the World. 28th ed. Dallas: SIL International. https://www.ethnologue.com (last accessed on 01/03/2026).
Ferrara, Emilio. 2023. Should ChatGPT be biased? Challenges and risks of bias in Large Language Models. First Monday 28(11), 1–39. https://doi.org/10.5210/fm.v28i11.13346 DOI: https://doi.org/10.5210/fm.v28i11.13346
Grattafiori, Aaron & Dubey, Abhimanyu & Jauhri, Abhinav & Pandey, Abhinav & Kadian, Abhishek & Al-Dahle, Ahmad & Letman, Aiesha et al. 2024. The Llama 3 herd of models. arXiv. https://doi.org/10.48550/arXiv.2407.21783
Hämäläinen, Mika. 2021. Endangered languages are not low-resourced! In Hämäläinen, Mika & Partanen, Niko & Alnajjar, Khalid (eds.), Multilingual Facilitation, 1–11. University of Helsinki.
https://doi.org/10.31885/9789515150257.1 DOI: https://doi.org/10.31885/9789515150257.1
Johnson, Rebecca L. & Pistilli, Giada & Menédez-González, Natalia & Duran, Leslye Denisse Dias & Panai, Enrico & Kalpokiene, Julija & Bertulfo, Donald Jay. 2022. The ghost in the machine has an American accent: value conflict in GPT-3. arXiv. https://doi.org/10.48550/arXiv.2203.07785
Jones, Karen Sparck. 1994. Natural Language Processing: A historical review. In Zampolli, Antonio & Calzolari, Nicoletta & Palmer, Martha (eds.), Current Issues in Computational Linguistics: In Honour of Don Walker, 3–16. Dordrecht: Springer Netherlands.
https://doi.org/10.1007/978-0-585-35958-8_1 DOI: https://doi.org/10.1007/978-0-585-35958-8_1
Kaffee, Lucie-Aimée & Biswas, Russa & Keet, C. Maria & Vakaj, Edlira Kalemi & de Melo, Gerard. 2023. Multilingual knowledge graphs and low-resource languages: A review. Transactions on Graph Data and Knowledge 1(1), 10:1-10:19. https://doi.org/10.4230/TGDK.1.1.10
Laurençon, Hugo & Saulnier, Lucile & Wang, Thomas & Akiki, Christopher & Villanova del Moral, Albert & Le Scao, Teven & Von Werra, Leandro et al. 2022. The BigScience Roots corpus: A 1.6TB composite multilingual dataset. Advances in Neural Information Processing Systems 35 (NeurIPS 2022), 31809–31826. New Orleans, United States: Neural Information Processing Systems Foundation, Inc. https://openreview.net/forum?id=UoEw6KigkUn (last accessed 01/03/2026). DOI: https://doi.org/10.52202/068431-2306
Le Scao, Teven & Fan, Angela & Akiki, Christopher & Pavlick, Ellie & Ilić, Suzana & Hesslow, Daniel & Castagné Roman et al. 2023. BLOOM: A 176B-parameter open-access multilingual language model. arXiv. https://doi.org/10.48550/arXiv.2211.05100
Matthies, Jochen. 2025. Agensdemotion und wissenschaftliche Verfasserreferenz im Kontext des KI-gestützten Schreibens – Eine Pilotstudie. In Lykhnenko, Olha & Matthies, Jochen & Roelcke, Thorsten & Teufele, Lisa (eds.), Deutsch als Fremdsprache – Mehrsprachigkeit, Fachkommunikation, Digitalisierung und Kultur: Internationale Nachwuchstagung 2024 an der Technischen Universität Berlin, 91–114. Berlin, Heidelberg: Springer. https://doi.org/10.1007/978-3-662-70351-9_5 DOI: https://doi.org/10.1007/978-3-662-70351-9_5
Melgarejo, Nelsi & Zevallos, Rodolfo & Gomez, Hector & Ortega, John E. 2022. WordNet-QU: Development of a lexical database for Quechua varieties. Proceedings of the 29th International Conference on Computational Linguistics, 4429–4433. Gyeongju, Republic of Korea: International Committee on Computational Linguistics.
Nicolussi Golo, Andrea & Nicolussi, Gisella & Panieri, Luca (ed.). 2013. Zimbarbort. Börtarpuach Lusérnesch – Belesch / Belesch – Lusérnesch (Dizionario del cimbro di Luserna). Luserna: Kulturinstitut Lusérn (Istituto Cimbro di Luserna).
Nigatu, Hellina Hailu & Tonja, Atnafu Lambebo & Rosman, Benjamin & Solorio, Thamar & Choudhury, Monojit. 2024. The Zeno’s paradox of ‘low-resource’ languages. In Al-Onaizan, Yaser & Bansal, Mohit & Chen, Yun-Nung (eds.), Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 17753–17774. Miami, Florida, USA: Association for Computational Linguistics. https://doi.org/10.18653/v1/2024.emnlp-main.983 DOI: https://doi.org/10.18653/v1/2024.emnlp-main.983
Orlando, Riccardo & Moroni, Luca & Cabot, Pere-Lluís Huguet & Conia, Simone & Barba, Edoardo & Orlandini, Sergio & Fiameni, Giuseppe and Navigli, Roberto. 2024. Minerva LLMs: The first family of Large Language Models trained from scratch on Italian data. Proceedings of the Tenth Italian Conference on Computational Linguistics (CLiC-it 2024), 707–719. Pisa, Italy: CEUR Workshop Proceedings.
Radford, Alec & Narasimhan, Karthik & Salimans, Tim & Sutskever, Ilya. 2018. Improving language understanding by generative pre-training. OpenAI. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf (last accessed 01/03/2026).
Radford, Alec & Wu, Jeffrey & Child, Rewon & Luan, David & Amodei, Dario & Sutskever, Ilya. 2019. Language models are unsupervised multitask learners. OpenAI. https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf (last accessed 01/03/2026).
Salammagari, Abhi Ram Reddy & Srivastava, Gaurava. 2024. Advancing natural language understanding for low-resource languages: Current progress, applications, and challenges. International Journal of Advanced Research in Engineering and Technology (IJARET) 15(3). 244–255.
Tavosanis, Mirko. 2024. Valutare la qualità dei testi generati in lingua italiana. AI-Linguistica. Linguistic Studies on AI-Generated Texts and Discourses 1(1). https://doi.org/10.62408/ai-ling.v1i1.14 DOI: https://doi.org/10.62408/ai-ling.v1i1.14
Tavosanis, Mirko. 2025. Grammatica generata. AI-Linguistica. Linguistic Studies on AI-Generated Texts and Discourses 2(2).
https://doi:10.62408/ai-ling.v2i2.23 DOI: https://doi.org/10.62408/ai-ling.v2i2.23
Valentinelli, Paolo. 2026. Tracing English interference in AI-generated German: An analysis of word order and syntactic fronting. AI-Linguistica. Linguistic Studies on AI-Generated Texts and Discourses 5(1). https://doi.org/10.62408/ai-ling.v5i1.36 DOI: https://doi.org/10.62408/ai-ling.v5i1.36
