Alessio Miaschi et al.:What Makes My Model Perplexed? A Linguistic Investigation on Neural Language Models Perplexity. Association for Computational Linguistics, 2021, S.40–47, doi:10.18653/v1/2021.deelio-1.5 (englisch, aclweb.org[abgerufen am 17.April 2026]).
F. Jelinek et al.:Perplexity—a measure of the difficulty of speech recognition tasks. In: The Journal of the Acoustical Society of America. Band62, S1, 1.Dezember 1977, ISSN0001-4966, S.S63–S63, doi:10.1121/1.2016299 (englisch, aip.org[abgerufen am 17.April 2026]).
↑„Die gängigen Sequenztransduktionsmodelle basieren auf komplexen rekurrenten oder konvolutionellen neuronalen Netzen in einer Encoder-Decoder-Konfiguration. Die leistungsstärksten Modelle verbinden Encoder und Decoder zusätzlich über einen Aufmerksamkeitsmechanismus. Wir schlagen eine neue, einfache Netzwerkarchitektur vor, den Transformer, der ausschließlich auf Aufmerksamkeitsmechanismen basiert und vollständig auf Rekurrenz und Faltungen verzichtet.“
Yinhan Liu, Myle Ott, Naman Goyal, Jingfei Du, Mandar Joshi, Danqi Chen, Omer Levy, Mike Lewis, Luke Zettlemoyer, Veselin Stoyanov:RoBERTa: A Robustly Optimized BERT Pretraining Approach.In:Arxiv.26.Juli 2019,abgerufen am 2.April 2026(englisch).
Junnan Li, Dongxu Li, Silvio Savarese, Steven Hoi:BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. 2023, doi:10.48550/ARXIV.2301.12597, arxiv:2301.12597.
Ibomoiye Domor Mienye et al.:Large language models: an overview of foundational architectures, recent trends, and a new taxonomy. In: Discover Applied Sciences. Band7, Nr.9, 2.September 2025, ISSN3004-9261, doi:10.1007/s42452-025-07668-w (englisch, springer.com[abgerufen am 3.April 2026]).
Rishi Bommasani et al.:Considerations for governing open foundation models. In: Science. Band386, Nr.6718, 11.Oktober 2024, ISSN0036-8075, S.151–153, doi:10.1126/science.adp1848 (englisch, science.org[abgerufen am 1.April 2026]).
Partha Pratim Ray:ChatGPT: A comprehensive review on background, applications, key challenges, bias, ethics, limitations and future scope. In: Internet of Things and Cyber-Physical Systems. Band3, 2023, S.121–154, doi:10.1016/j.iotcps.2023.04.003 (englisch, elsevier.com[abgerufen am 28.April 2026]).
Guandong Feng et al.:Robust NL-to-Cypher Translation for KBQA: Harnessing Large Language Model with Chain of Prompts. In: Knowledge Graph and Semantic Computing: Knowledge Graph Empowers Artificial General Intelligence. Band1923. Springer Nature Singapore, Singapore 2023, ISBN 978-981-99-7223-4, S.317–326, doi:10.1007/978-981-99-7224-1_25 (englisch, springer.com[abgerufen am 8.November 2025]).
Yuening Jia:Attention Mechanism in Machine Translation. In: Journal of Physics: Conference Series. Band1314, Nr.1, 1.Oktober 2019, ISSN1742-6588, S.012186, doi:10.1088/1742-6596/1314/1/012186 (englisch, iop.org[abgerufen am 4.April 2026]).
Rejaul Karim Barbhuiya et al.:Fundamentals of Encoders and Decoders in Generative AI. In: Generative AI: Current Trends and Applications. Band1177. Springer Nature Singapore, Singapore 2024, ISBN 978-981-97-8459-2, S.19–33, doi:10.1007/978-981-97-8460-8_2 (englisch, springer.com[abgerufen am 2.April 2026]).
Jürgen Schmidhuber:Learning to Control Fast-Weight Memories: An Alternative to Dynamic Recurrent Networks. In: Neural Computation. Band4, Nr.1, Januar 1992, ISSN0899-7667, S.131–139, doi:10.1162/neco.1992.4.1.131 (englisch, mit.edu[abgerufen am 4.April 2026]).
Robert A. Jacobs, Michael I. Jordan, Steven J. Nowlan, Geoffrey E. Hinton:Adaptive Mixtures of Local Experts. In: Neural Computation. Band3, Nr.1, Februar 1991, ISSN0899-7667, S.79–87, doi:10.1162/neco.1991.3.1.79 (englisch, mit.edu[abgerufen am 3.April 2026]).
Philipp Dufter, Martin Schmitt, Hinrich Schütze:Position Information in Transformers: An Overview. In: Computational Linguistics. Band48, Nr.3, 1.September 2022, ISSN0891-2017, S.733–763, doi:10.1162/coli_a_00445 (englisch, mit.edu[abgerufen am 5.April 2026]).
Dhruvin Kotak, Yamini Barge, Tanvi Patel, Nitin Pandya, Rachit Adhvarvyu:Comparison of LLM Models of AI: A Comprehensive Analysis. In: ICT Analysis and Applications. Band1651. Springer Nature Switzerland, Cham 2026, ISBN 978-3-032-06687-9, S.93–101, doi:10.1007/978-3-032-06688-6_9 (springer.com[abgerufen am 18.März 2026]).
Shriyank Somvanshi et al.:From Tiny Machine Learning to Tiny Deep Learning: A Survey. In: ACM Computing Surveys. Band58, Nr.7, 24.Dezember 2025, ISSN0360-0300, S.1–33, doi:10.1145/3776588 (englisch, acm.org[abgerufen am 5.April 2026]).
Omar Ghazal et al.:TinyML: Applications, Algorithms, Co-design and Implementations. In: Smart and Connected Health: AI, IoT, and Trustworthy Technologies. Springer Nature Switzerland, Cham 2026, ISBN 978-3-032-06285-7, S.473–541, doi:10.1007/978-3-032-06286-4_6 (englisch, springer.com[abgerufen am 11.April 2026]).
Jasper A. Friedrich:Die Computerspielbranche als Innovationstreiber für technologische und gesellschaftliche Entwicklungen. In: Game-Journalismus. Springer Fachmedien Wiesbaden, Wiesbaden 2023, ISBN 978-3-658-42615-6, S.163–191, doi:10.1007/978-3-658-42616-3_12 (springer.com[abgerufen am 3.April 2026]).
Elizabeth Gibney:Not all ‘open source’ AI models are actually open: here’s a ranking. In: Nature. 19.Juni 2024, ISSN0028-0836, doi:10.1038/d41586-024-02012-5 (englisch, nature.com[abgerufen am 1.April 2026]).
Junnan Li, Dongxu Li, Silvio Savarese, Steven Hoi:BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. 2023, doi:10.48550/ARXIV.2301.12597, arxiv:2301.12597.
Stanley F Chen et al.:Evaluation Metrics For Language Models. 30.Juni 2018, doi:10.1184/R1/6605324.V1 (englisch, cmu.edu[abgerufen am 17.April 2026]).
F. Jelinek et al.:Perplexity—a measure of the difficulty of speech recognition tasks. In: The Journal of the Acoustical Society of America. Band62, S1, 1.Dezember 1977, ISSN0001-4966, S.S63–S63, doi:10.1121/1.2016299 (englisch, aip.org[abgerufen am 17.April 2026]).
Alessio Miaschi et al.:What Makes My Model Perplexed? A Linguistic Investigation on Neural Language Models Perplexity. Association for Computational Linguistics, 2021, S.40–47, doi:10.18653/v1/2021.deelio-1.5 (englisch, aclweb.org[abgerufen am 17.April 2026]).
Adib Bin Rashid et al.:Artificial Intelligence in the Military: An Overview of the Capabilities, Applications, and Challenges. In: International Journal of Intelligent Systems. Band2023, Nr.1, Januar 2023, ISSN0884-8173, doi:10.1155/2023/8676366 (englisch, wiley.com[abgerufen am 22.April 2026]).
Junchao Wu, Shu Yang, Runzhe Zhan, Yulin Yuan, Lidia Sam Chao, Derek Fai Wong:A Survey on LLM-Generated Text Detection: Necessity, Methods, and Future Directions. In: Computational Linguistics. Band51, Nr.1, 15.März 2025, ISSN0891-2017, S.275–338, doi:10.1162/coli_a_00549 (mit.edu[abgerufen am 27.Juni 2026]).
Partha Pratim Ray:ChatGPT: A comprehensive review on background, applications, key challenges, bias, ethics, limitations and future scope. In: Internet of Things and Cyber-Physical Systems. Band3, 2023, S.121–154, doi:10.1016/j.iotcps.2023.04.003 (englisch, elsevier.com[abgerufen am 28.April 2026]).
Jürgen Schmidhuber:26 March 1991: Neural nets learn to program neural nets with fast weights—the first Transformer variants. 2021-: New stuff!In:Dalle Molle Institute for Artificial Intelligence (IDSIA).SUPSI,2025,abgerufen am 5.April 2026:„Before 1991, no network learned by gradient descent to quickly compute the changes of the fast weight storage of another network or of itself. Such Fast Weight Programmers (FWPs) were published in 1991-93 [FWP0-2](Sec. 1, 2, 3, 4). They embody the principles found in certain types of what is now called attention [ATT](Sec. 4) and Transformers [TR1-6](Sec. 2, 3, 4, 5).“
Jay Alammar, Maarten Grootendorst:Hands-On Large Language Models: Language Understanding and Generation. O’Reilly Media, Sebastopol, CA 2024, ISBN 978-1-0981-5096-9 (llm-book.com[abgerufen am 3.April 2026]).
Jürgen Schmidhuber:Learning to Control Fast-Weight Memories: An Alternative to Dynamic Recurrent Networks. In: Neural Computation. Band4, Nr.1, Januar 1992, ISSN0899-7667, S.131–139, doi:10.1162/neco.1992.4.1.131 (englisch, mit.edu[abgerufen am 4.April 2026]).
Robert A. Jacobs, Michael I. Jordan, Steven J. Nowlan, Geoffrey E. Hinton:Adaptive Mixtures of Local Experts. In: Neural Computation. Band3, Nr.1, Februar 1991, ISSN0899-7667, S.79–87, doi:10.1162/neco.1991.3.1.79 (englisch, mit.edu[abgerufen am 3.April 2026]).
Philipp Dufter, Martin Schmitt, Hinrich Schütze:Position Information in Transformers: An Overview. In: Computational Linguistics. Band48, Nr.3, 1.September 2022, ISSN0891-2017, S.733–763, doi:10.1162/coli_a_00445 (englisch, mit.edu[abgerufen am 5.April 2026]).
Junchao Wu, Shu Yang, Runzhe Zhan, Yulin Yuan, Lidia Sam Chao, Derek Fai Wong:A Survey on LLM-Generated Text Detection: Necessity, Methods, and Future Directions. In: Computational Linguistics. Band51, Nr.1, 15.März 2025, ISSN0891-2017, S.275–338, doi:10.1162/coli_a_00549 (mit.edu[abgerufen am 27.Juni 2026]).
Elizabeth Gibney:Not all ‘open source’ AI models are actually open: here’s a ranking. In: Nature. 19.Juni 2024, ISSN0028-0836, doi:10.1038/d41586-024-02012-5 (englisch, nature.com[abgerufen am 1.April 2026]).
Sheera Frenkel et al.:Mutually Automated Destruction: The Escalating Global A.I. Arms Race. In: The New York Times. 12.April 2026, ISSN0362-4331 (englisch, nytimes.com[abgerufen am 22.April 2026]).
Kevin Roose:Anthropic Claims Its New A.I. Model, Mythos, Is a Cybersecurity ‘Reckoning’. In: The New York Times. 7.April 2026, ISSN0362-4331 (englisch, nytimes.com[abgerufen am 12.April 2026]).
↑The sequential nature of RNNs also makes it more difficult to fully take advantage of modern fast computing devices such as TPUs and GPUs, which excel at parallel and not sequential processing. Convolutional neural networks (CNNs) are much less sequential than RNNs, but in CNN architectures like ByteNet or ConvS2S the number of steps required to combine information from distant parts of the input still grows with increasing distance.
Rishi Bommasani et al.:Considerations for governing open foundation models. In: Science. Band386, Nr.6718, 11.Oktober 2024, ISSN0036-8075, S.151–153, doi:10.1126/science.adp1848 (englisch, science.org[abgerufen am 1.April 2026]).
Ibomoiye Domor Mienye et al.:Large language models: an overview of foundational architectures, recent trends, and a new taxonomy. In: Discover Applied Sciences. Band7, Nr.9, 2.September 2025, ISSN3004-9261, doi:10.1007/s42452-025-07668-w (englisch, springer.com[abgerufen am 3.April 2026]).
Guandong Feng et al.:Robust NL-to-Cypher Translation for KBQA: Harnessing Large Language Model with Chain of Prompts. In: Knowledge Graph and Semantic Computing: Knowledge Graph Empowers Artificial General Intelligence. Band1923. Springer Nature Singapore, Singapore 2023, ISBN 978-981-99-7223-4, S.317–326, doi:10.1007/978-981-99-7224-1_25 (englisch, springer.com[abgerufen am 8.November 2025]).
Rejaul Karim Barbhuiya et al.:Fundamentals of Encoders and Decoders in Generative AI. In: Generative AI: Current Trends and Applications. Band1177. Springer Nature Singapore, Singapore 2024, ISBN 978-981-97-8459-2, S.19–33, doi:10.1007/978-981-97-8460-8_2 (englisch, springer.com[abgerufen am 2.April 2026]).
Dhruvin Kotak, Yamini Barge, Tanvi Patel, Nitin Pandya, Rachit Adhvarvyu:Comparison of LLM Models of AI: A Comprehensive Analysis. In: ICT Analysis and Applications. Band1651. Springer Nature Switzerland, Cham 2026, ISBN 978-3-032-06687-9, S.93–101, doi:10.1007/978-3-032-06688-6_9 (springer.com[abgerufen am 18.März 2026]).
Omar Ghazal et al.:TinyML: Applications, Algorithms, Co-design and Implementations. In: Smart and Connected Health: AI, IoT, and Trustworthy Technologies. Springer Nature Switzerland, Cham 2026, ISBN 978-3-032-06285-7, S.473–541, doi:10.1007/978-3-032-06286-4_6 (englisch, springer.com[abgerufen am 11.April 2026]).
Jasper A. Friedrich:Die Computerspielbranche als Innovationstreiber für technologische und gesellschaftliche Entwicklungen. In: Game-Journalismus. Springer Fachmedien Wiesbaden, Wiesbaden 2023, ISBN 978-3-658-42615-6, S.163–191, doi:10.1007/978-3-658-42616-3_12 (springer.com[abgerufen am 3.April 2026]).
Stephen Wolfram:What Is ChatGPT Doing … and Why Does It Work? In: Stephen Wolfram Writings. 14.Februar 2023 (englisch, stephenwolfram.com[abgerufen am 11.April 2026]).
Richard Lea:Google swallows 11,000 novels to improve AI's conversation. In: The Guardian. 28.September 2016, ISSN0261-3077 (theguardian.com[abgerufen am 2.April 2026]).
Tobias Mann:How to run an LLM locally on your PC in less than 10 minutes. In: The Register. 17.März 2024 (theregister.com[abgerufen am 11.April 2026]).
Adib Bin Rashid et al.:Artificial Intelligence in the Military: An Overview of the Capabilities, Applications, and Challenges. In: International Journal of Intelligent Systems. Band2023, Nr.1, Januar 2023, ISSN0884-8173, doi:10.1155/2023/8676366 (englisch, wiley.com[abgerufen am 22.April 2026]).
Ibomoiye Domor Mienye et al.:Large language models: an overview of foundational architectures, recent trends, and a new taxonomy. In: Discover Applied Sciences. Band7, Nr.9, 2.September 2025, ISSN3004-9261, doi:10.1007/s42452-025-07668-w (englisch, springer.com[abgerufen am 3.April 2026]).
Rishi Bommasani et al.:Considerations for governing open foundation models. In: Science. Band386, Nr.6718, 11.Oktober 2024, ISSN0036-8075, S.151–153, doi:10.1126/science.adp1848 (englisch, science.org[abgerufen am 1.April 2026]).
Yuening Jia:Attention Mechanism in Machine Translation. In: Journal of Physics: Conference Series. Band1314, Nr.1, 1.Oktober 2019, ISSN1742-6588, S.012186, doi:10.1088/1742-6596/1314/1/012186 (englisch, iop.org[abgerufen am 4.April 2026]).
Jürgen Schmidhuber:Learning to Control Fast-Weight Memories: An Alternative to Dynamic Recurrent Networks. In: Neural Computation. Band4, Nr.1, Januar 1992, ISSN0899-7667, S.131–139, doi:10.1162/neco.1992.4.1.131 (englisch, mit.edu[abgerufen am 4.April 2026]).
Richard Lea:Google swallows 11,000 novels to improve AI's conversation. In: The Guardian. 28.September 2016, ISSN0261-3077 (theguardian.com[abgerufen am 2.April 2026]).
Robert A. Jacobs, Michael I. Jordan, Steven J. Nowlan, Geoffrey E. Hinton:Adaptive Mixtures of Local Experts. In: Neural Computation. Band3, Nr.1, Februar 1991, ISSN0899-7667, S.79–87, doi:10.1162/neco.1991.3.1.79 (englisch, mit.edu[abgerufen am 3.April 2026]).
Philipp Dufter, Martin Schmitt, Hinrich Schütze:Position Information in Transformers: An Overview. In: Computational Linguistics. Band48, Nr.3, 1.September 2022, ISSN0891-2017, S.733–763, doi:10.1162/coli_a_00445 (englisch, mit.edu[abgerufen am 5.April 2026]).
Shriyank Somvanshi et al.:From Tiny Machine Learning to Tiny Deep Learning: A Survey. In: ACM Computing Surveys. Band58, Nr.7, 24.Dezember 2025, ISSN0360-0300, S.1–33, doi:10.1145/3776588 (englisch, acm.org[abgerufen am 5.April 2026]).
Elizabeth Gibney:Not all ‘open source’ AI models are actually open: here’s a ranking. In: Nature. 19.Juni 2024, ISSN0028-0836, doi:10.1038/d41586-024-02012-5 (englisch, nature.com[abgerufen am 1.April 2026]).
F. Jelinek et al.:Perplexity—a measure of the difficulty of speech recognition tasks. In: The Journal of the Acoustical Society of America. Band62, S1, 1.Dezember 1977, ISSN0001-4966, S.S63–S63, doi:10.1121/1.2016299 (englisch, aip.org[abgerufen am 17.April 2026]).
Sheera Frenkel et al.:Mutually Automated Destruction: The Escalating Global A.I. Arms Race. In: The New York Times. 12.April 2026, ISSN0362-4331 (englisch, nytimes.com[abgerufen am 22.April 2026]).
Adib Bin Rashid et al.:Artificial Intelligence in the Military: An Overview of the Capabilities, Applications, and Challenges. In: International Journal of Intelligent Systems. Band2023, Nr.1, Januar 2023, ISSN0884-8173, doi:10.1155/2023/8676366 (englisch, wiley.com[abgerufen am 22.April 2026]).
Kevin Roose:Anthropic Claims Its New A.I. Model, Mythos, Is a Cybersecurity ‘Reckoning’. In: The New York Times. 7.April 2026, ISSN0362-4331 (englisch, nytimes.com[abgerufen am 12.April 2026]).
Eva Wolfangel:KI-Detektoren: Misstrauen als Geschäftsmodell. In: Die Zeit. 20.Juni 2026, ISSN0044-2070 (zeit.de[abgerufen am 27.Juni 2026]).
Junchao Wu, Shu Yang, Runzhe Zhan, Yulin Yuan, Lidia Sam Chao, Derek Fai Wong:A Survey on LLM-Generated Text Detection: Necessity, Methods, and Future Directions. In: Computational Linguistics. Band51, Nr.1, 15.März 2025, ISSN0891-2017, S.275–338, doi:10.1162/coli_a_00549 (mit.edu[abgerufen am 27.Juni 2026]).