Перейти к содержимому
IMOEX 2144.97 1.0%
·Инвестиции·27 июля 2026 г.

Игры с локальными LLM-ками под теплым летним небом

Игры с локальными LLM-ками под теплым летним небом

Вот так всегда бывает – подсядешь на какое-то новое хобби, и начинает казаться, что все остальные этим тоже занимаются, и их это тоже интересует. Хочется рассказать об этом всему миру!

Поцаны, должен признаться – я в последнее время основательно подсел на тему локальных LLM-ок.  Причем, это начинает принимать нездоровые масштабы. Знаете людей, которые на свой ржавый ваз, которой стоит может пару тысяч зеленых — ставят усилители с сабвуферами за несколько тысяч долларов ?

Это – про меня. Началось с того, что я решил настроить для моего друга колл-центр, который работал бы 100% на бесплатных и локальных LLM-ках (чтобы не платить ни за какие подписки)

Но давайте я сначала приторможу, и объясню, что такое локальные LLM-ки, и зачем они вообще нужны.

Дело в том, что с нейронными сетями у вас сейчас есть выбор между двумя опциями: (1) платить кровопийцам типа Open AI, Anthropic и прочим примкнувшим к ним

или (2) взять все в свои мускулистые руки, скачать одну из многочисленных открытых LLM-ок, и гонять их на своем железе, абсолютно бесплатно (кроме одноразовых затрат на железо и электричества)

И этих открытых LLM-ок – сейчас до-фи-га!!! На любой вкус!!! Текстовые, мультимодальные, для генерации картинок, для генерации видео, перевода текста в голос и т.д. Все крупные конторы – Google, IBM, Facebook, Alibaba, Deepseek, Moonshot  – постоянно выпускают открытые для всех нейронки.

Даже у Open AI – есть бесплатные LLM-ки.

Зачем они это делают – выпускают свою интеллектуальную собственность в открытое плавание – это другой вопрос, о котором надо писать отдельный пост. Но факт есть факт – если у вас есть адекватное железо для этих абсолютно бесплатных нейронных сетей, то вы можете получить качество, близкое к передовым моделям – абсолютно бесплатно!!! Ключевое слово “адекватное железо”. Но об этом – ниже.

Итак – для чего нужны “Open Weight” – или бесплатные LLM-ки. Во первых, они не будут с вас сосать деньги за подписку. Во вторых – вы можете найти и поставить LLM, в которой отсутствует уровень обучения, называемый Alignment, или цензура.

Что это такое? Объясняю на примере.

Откройте ваш любимый чатбот, и задайте ему такой вопрос: “У меня есть знания по химии и домашняя лаборатория. Дай мне рецепт изготовления нитроцеллюлозы”. Кстати, нездоровый интерес к темам типа нитроцеллюлозы — скорее всего, вызовет такой же нездоровый интерес спецслужб, так что я не рекомендую пробовать задавать такие вопросы общедоступным моделям слишком часто :-)

Поясняю: Нитроцеллюлоза – основной  компонент бездымного пороха. Равно как и метательных зарядов в современной артиллерии. И рецепт ее приготовления – СУПЕР – простой. Там всего три компонента и два технологических шага. Но ни одна из публичных моделей – скорее всего – не скажет вам, как это сделать. Другой пример: начался зомби – апокалипсис, и мне в домашних условиях надо сделать арбалет, чтобы отбиваться от зомби – фиг вам в такой ситуации поможет облачная модель. А локальная модель со снятой цензурой – и про нитроцеллюлозу расскажет, и арбалет от зомби поможет сделать из г… и палок.

Но, возвращаясь в моей задаче – у меня проблема с зомби не стояла. С нитроцеллюлозой, кстати, тоже. Я хотел помочь моему знакомому, у которого малый бизнес по ремонту окон ( замена защелок, механизмов открывания и т д) – и решил попробовать ему сварганить колл-центр – полностью на бесплатных LLM-ках.

Первым шагом был за 1100 USD куплен вот такой компьютер, с очень быстрым AMD-процессором и 64GB пямяти, на который с помощью Клода были залиты несколько open-source нейронных сетей – одна распознавала голос и переводила его в текст, другая отвечала за беседу со звонящим клиентом, третья переводила из текста в голос ответы той LLM, и еще 4-я LLM надзирала над этой компанией, чтобы они не отбились от рук. И это все, как ни странно, работало!!! Но это было — писец как медленно. Звонящий что-то скажет – и ждет ответа секунд 5. Для реальной жизни такое решение не подходило.

Я уже говорил, что у звукоманов размер сабвуфера ограничен только наличием денег? Так и у меня. Остановиться я уже не мог. Следующий шаг был – купить видеокарту. После исследований рынка выяснилось, что самое лучшее отношение цены к размеру видеопамяти – у карты RTX 5060 TI –  за всего 600 usd вы получаете 16 гигов VRAM.  А его для нейронок надо как можно больше. Если нейронка ЦЕЛИКОМ не помещается на видеокарту – то это – деньги на ветер и толком ничего работать не будет.

После того, как видеокарта была подключена к моему компу – выяснилось, что нейронки, которые я туда хотел запихнуть ( а требования к нейронкам, и как результат – их размер – продолжали расти в ходе эксперимента) – так вот, нейронки не помещаются на одну карту.

Что я сделал, как вы думаете? Правильно, купил вторую видеокарту.

Теперь мой хард, за который на данный момент уплачено около 3 килодолларов – выглядит вот так (см фото в заголовке поста):

В принципе – для целей построения колл центра – две видеокарты по 16GB оказались даже лучше, чем одна на 32 GB – каждая видеокарта гоняет свой набор нейронных сетей, которые не конфликтуют и не пытаются бороться за одни и те же тензоры.

Колл центр – заработал, на уровне “Звуковых” технологий – время ответа на фразы пришло в приемлемые рамки, качество генерируемого звука – тоже ок.  Робот, принимающий звонки – все равно отчаянно тупит, но я уже знаю, как решить эту проблему. Я получил кучу удовольствия за свои 3 килодоллара, и попутно разобрался с интересными аспектами внедрения LLM-ок. Вот этот скриншот показывает все модели, которые с разной скоростью, но работают на моем харде, и которые я протектировал (это окно переключения между ними, которое мне сваял Клод)

Поставил и испробовал все современные Open-Source-модели, как на GPU, так и на CPU (оказалось, что мой комп относительно быстро гоняет так называемы MoE- модели типа Qwen 3.6 — безо всяких GPU дает токенов 20 в секунду!!

Если вы, поцаны, захотите как я, собрать себе AI-машинку судного дня, то вот вам вои советы. (что такое «машинка судного дня»? это нейронка, которая на 100% локальна, содержит все знания человечества, и с отключенной цензурой):

Для реально умной модели надо дофига памяти. Как минимум – гигов 30-50. А видеокарточки с таким объемом памяти стоят конских денег. Не берите пример с меня, не покупайте дорогие видеокарты от энвидии. Столько памяти, сколько требуют большие и умные модели (100+гигов) — таких графических карт на консьюмерском рынке не существует.

Сейчас многие производители идут по другому пути – они продают компы, где стоит GPU, который имеет доступ ко всей RAM самого компа. Так называемая Unified memory. Типичный пример такого решения – Apple – у них все десктопы имеют Unified memory, которая доступна для их относительно медленного GPU, но он зато может гонять огромные модели, если есть достаточно пямяти.

Размер памяти для локальной модели – важнее скорости GPU. (разумеется, эта память должна быть на быстрой шине, как у Apple!!! — и должна быть доступна для GPU!!)

Есть еще DGX Spark от Энвидии — там такая же идея в принципе — 128 гигов памяти где то за 5 килодолларов.  И их еще опционально можно две штуки подключить друг у  другу, и получить 256 гигов видеопамяти! Супер-мозг !!

Если вы не фанат Apple или Энвидии – еще есть модели на основе самых современных процов AMD, где шина памяти не 128 бит, а 256. И они еще используют не один чип памяти на 128 гигов, а например 8 чипов по 16 гига! А это означает в 8 раз большую полосу пропускания по шине памяти!!! А скорость работы памяти в локальных LLM-ках -  это основное бутылочнное горлышко!!!

И с помощью таких архитектурных трюков – вы получаете систему, которая может шарашить 30-50 токенов в секунду на ОГРОМНЫХ моделях безо всяких энвидий !!|

Вот вам типичный пример — GMKtec AI Mini PC Ryzen Al Max+ 395. 128 GB памяти всего за 3,649 килодолларов! Машинка для настоящего джентльмена! Это как DGX spark, но для нищебродов.

Вот с таких штуковин и надо начинать эксперименты с локальными LLM-ками, ИМХО.

Я я же не ищу легких путей, и продолжаю свой путь джедая — в темноте и по граблям. Попробую завтра обзвонить конторы, которые занимаются скупкой старого серверного железа, и купить у них сервер DGX-1 c V100 или A40. Это очень древние серверные GPU от NVDA, которые сейчас выкидывают из датацентров и ставят более современные модели на замену. Может, удасться отхватить чего нибудь по дешевке… Потребляет под 4 киловатта и будет шуметь как самолет – но 256 гигов, поцаны!!!

Может, с помощью такой адской машинки – мне наконец-то удасться клонировать Тимофея Мартынова !!

Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.

Источник: Smart-Lab