Large Language Model Architectures Explained: Mathematics, Programs, Analogies, and Data Flow
An LLM architecture defines how a model converts language into numbers, moves information between tokens, stores short-term contextual memory, transforms representations through neural layers, predicts or generates tokens, and scales parameters and computation.
Most modern language models belong to one or more of these families:
- Recurrent architectures: RNN, LSTM, GRU and RWKV
- Encoder-only Transformers: BERT-style models
- Decoder-only Transformers: GPT, Llama and Mistral-style models
- Encoder–decoder Transformers: T5 and BART-style models
- Sparse Mixture-of-Experts models
- Local, sparse and linear-attention models
- Retention and delta-rule architectures
- State-space models such as Mamba
- Convolutional sequence models such as Hyena
- Hybrid attention–recurrent architectures
- Diffusion language models
- Multimodal language models
- Retrieval-augmented language-model systems