Перейти к содержимому
IMOEX 2209.84 0.1%
·Инвестиции·31 июля 2026 г.

Еще про экономику локальных LLM-моделей

Еще про экономику локальных LLM-моделей

Это вдогонку к моему предыдущему посту

Вот вы тут спросите поцоны – зачем ты Гуру Хренов пишешь всякую заумь про нейронные сети – какое отношение это вообще имеет к инвестициям?

Отвечаю – самое прямое. Я пытаюсь для себя и для вас ответить на вопрос – является ли текущая волна хайпа по поводу AI и датацентров – пузырем или только началом длительного тренда.

В предыдущей серии, отчаявшись найти домашнее решение для больших и реально умных LLM-ок  — я решил позвонить чувакам, которые занимаются перепродажей старого серверного железа от Энвидии

И вот какие цены они мне выкатили (это все в канадских долларах, чтобы привести к американским – делите на 1.4)

38 тысяч за старый сервер на древнем GPU V100 на 512 GB!!! И этого все равно не хватит для передовых моделей тима KIMI!!!

Короче, поцаны, вот вам суровая правда про локальные модели:

Современные модели – супер – большие, и им нужно где-то 1500GB видеопамяти!

(справедливости ради – для Mixture-of-Experts (MoE) моделей типа Kimi – там есть читы, когда можно часть модели грузить в VRAM, а остальное оставлять в обычной памяти, потому что там только часть “Экспертов” активна в любой момент времени)

Если вы хотите реально умных ответов от современных моделей – вам надо включать там Reasoning mode. Reasoning – это то, что реально улучшает результаты ответов моделей. Но на каждый токен ответа, который такая модельвыдаст вам – она сожжет 10 токенов на reasoning. И будет думать намного медленнее!!! А еще лучше – обвесить такую модель Harness-ом (упряжью) тима Claude Code, который поверх  Reasoning Mode – еще нагонит кучу агентов, которые будут друг друга критиковать. Это второй уровень поумнения для модели, и там вообще на каждый токен кода, который выдает система-она сжигает десятки тысяч токенов!!! С ума сойти!!

С чем это оставляет всех нас, кто хочет заиметь супер-мозг у себя в квартире ??  тут все очень плохо поцаны

Консьюмерские графические карточки – не метод – мало VRAM, супер-дорогие. Оставим их гейммерам, пусть наслаждаются своим Cyberpunk -ом

Потребительские модели от Энвидии-это тоже издевательство. DGX Spark на 128 GB видеопамяти – сейчас в Штатах стоит USD 5,000 Две можно объединить NVLink-ом, будет 256GB за 10,000. Такая штука вам может выдать ну токенов 50 в секунду на каких-то относительно умных моделях, но если вы хотите реально кодить например, то см выше – на токен кода вам понадобится например 1000 агентских токенов в бэкграунде, и все будет очень очень медленно!

Есть еще NVDA DGX Station – 748 GB пямяти всего за 99,999 USD. Но  и там они мухлюют, потому что из тех 748GB – только 252Gb – это на самом GPU, все остальное – та же unified RAM с в 20 раз меньшей полосой пропускания.

Есть еще вариант купить старый GPU – сервер – про это я уже писал выше

Самый, наверное, правильный вариант для нищебродов в наше время – это компы на архитектуре Ryzen AI Max+ 395 типа GMKtec за 3,600 USD с 128GB Unified Memory

Но лучше – дождаться к осени их новой модели  Ryzen AI Max+ PRO 495, где памяти будет уже 192GB

Еще есть Интел, которая только обещает Nova Lake-AX, который вроде тоже будет основан на идее гиганской шины памяти с Unified Memory

Что мы имеем, поцаны? С одной стороны, крупным игрокам наплевать на нас, гоняющих свои ЛЛМ-ки в своих квартирах. Enterprise-рынок – гораздо более перспективен, нафиг мы консьюмеры из сдались?

С другой стороны, покопавшись в этом рынке, начинаешь понимать, како огромный спрос там на рабочие решения.

Все упирается в кучу ограничений:

Память — дорогая

Даже есть есть память, проблема с полосой пропускания шины

Проблемы с полосой пропускания шины – решается либо

Cменой архитектуры (увеличить шину как у Ryzen AI Max+ PRO 495),  или разместить супер быструю SRAM прямо на чипе как Cerebras

… или подключением нескольких GPU друг к другу через супер быстрые интерфейсы типа NVLink

Короче – я посмотрел на все это, и везде, везде – куча бутылочных горлышек, которые потребуют грандиозных инвестиций во все уровни иерархии ИИ, и где еще поле непаханное.

Поэтому – лично я, несмотря на всякие падения рынка и эпичный про… б Леопольда Ашенбреннера (как человеку с такой фамилией кто-то доверил деньги ?? Она же буквально переводится как “Сгорающий в пепел”!!) – так вот, лично я продолжаю верить во все эти AI-истории.

По-моему, это все – не пузырь, а начало очень интересной и длинной истории.

Ну как – «длинной»?

Я думаю — годика 3 мы еще протянем до восстания роботов...

Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.

Источник: Smart-Lab