Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM

Привет, Хабр! Меня зовут Владимир, и это третья часть цикла статей по написании и обучению небольшой decoder-only LLM с нуля. В первой части мы обучили токенизатор и собрали pretrain-датасет, во второй части реализовали класс Трансформер-блока. В этой части будем собирать и предобучать нашу LLM.
Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.
Источник: Habr