You ask a language model a one-line question — it processes it through 48 layers. You paste a 10,000-word document — it still processes it through 48 layers. Same depth.

Source: [Dev.to](https://dev.to/neha_maurya/what-if-a-transformer-never-had-to-forget-meet-the-recurrent-looped-transformer-rlt-43oh)

Sponsored