Это вдогонку к моему предыдущему посту
Вот вы тут спросите поцоны – зачем ты Гуру Хренов пишешь всякую заумь про нейронные сети – какое отношение это вообще имеет к инвестициям?
Отвечаю – самое прямое. Я пытаюсь для себя и для вас ответить на вопрос – является ли текущая волна хайпа по поводу AI и датацентров – пузырем или только началом длительного тренда.
В предыдущей серии, отчаявшись найти домашнее решение для больших и реально умных LLM-ок — я решил позвонить чувакам, которые занимаются перепродажей старого серверного железа от Энвидии
И вот какие цены они мне выкатили (это все в канадских долларах, чтобы привести к американским – делите на 1.4)

38 тысяч за старый сервер на древнем GPU V100 на 512 GB!!! И этого все равно не хватит для передовых моделей тима KIMI!!!
(и это кстати 4 «блейда», для которых нужна своя серверная стойка ). И интересно не то, что они продают по таким ценам — интересно, что кто-то покупает! (Мои попытки залоу-боллить цену, когда я им написал, что готов заплатить, но только в 4 раза меньше — не нашли понимания у продавца)
Короче, поцаны, вот вам суровая правда про локальные модели:
- Современные модели – супер – большие, и им нужно где-то 1500GB видеопамяти!
(справедливости ради – для Mixture-of-Experts (MoE) моделей типа Kimi – там есть читы, когда можно часть модели грузить в VRAM, а остальное оставлять в обычной памяти, потому что там только часть “Экспертов” активна в любой момент времени) - Если вы хотите реально умных ответов от современных моделей – вам надо включать там Reasoning mode. Reasoning – это то, что сильно улучшает результаты ответов моделей. Но на каждый токен ответа, который такая модель выдаст вам – она сожжет 10 токенов на reasoning. И будет думать намного медленнее!!! А еще лучше – обвесить такую модель Harness-ом (упряжью) типа Claude Code, который поверх Reasoning Mode – еще нагонит кучу агентов, которые будут друг друга критиковать. Это второй уровень поумнения для модели, и там вообще на каждый токен кода, который выдает система-она сжигает десятки тысяч токенов!!! С ума сойти!!
С чем это оставляет всех нас, кто хочет заиметь супер-мозг у себя в квартире ?? тут все очень плохо поцаны.
- Консьюмерские графические карточки – не метод – они очень быстрые, но мало VRAM, супер-дорогие. Оставим их геймерам, пусть наслаждаются своим Cyberpunk -ом
- Потребительские решения от Энвидии — это тоже издевательство. DGX Spark на 128 GB видеопамяти – сейчас в Штатах стоит USD 5,000 Две можно объединить NVLink-ом, будет 256GB за 10,000. Такая штука вам может выдать ну токенов 50 в секунду на каких-то относительно умных моделях, но если вы хотите реально кодить например, то см выше – на токен кода вам понадобится например 1000 агентских токенов в бэкграунде, и все будет очень очень медленно!
- Есть еще NVDA DGX Station – 748 GB пямяти всего за 99,999 USD. Потребительская модель, ага. По цене BMW X5. Но и там они мухлюют, потому что из тех 748GB – только 252Gb – это на самом VRAM, все остальное – та же unified RAM с в 20 раз меньшей полосой пропускания.
- Есть еще вариант купить старый GPU – сервер – про это я уже писал выше
- Самый, наверное, правильный вариант для нищебродов в наше время – это компы на архитектуре Ryzen AI Max+ 395 типа GMKtec за 3,600 USD с 128GB Unified Memory
Но лучше – дождаться к осени их новой модели Ryzen AI Max+ PRO 495, где памяти будет уже 192GB - Еще есть Интел, которая только обещает Nova Lake-AX, который вроде тоже будет основан на идее гиганской шины памяти с Unified Memory
Что мы имеем, поцаны? С одной стороны, крупным игрокам наплевать на нас, гоняющих свои ЛЛМ-ки в своих квартирах. Enterprise-рынок – гораздо более перспективен, нафиг мы консьюмеры из сдались?
С другой стороны, покопавшись в этом рынке, начинаешь понимать, какой огромный спрос там на рабочие решения.
Потому что — консьюмерские решения, когда они становятся масштабируемые по памяти, начинают плавно конкурировать в enterprise.
НО!!! Все упирается в кучу ограничений:
- Память — дорогая
- Даже есть есть память, проблема с полосой пропускания шины
- Проблемы с полосой пропускания шины – решается либо
- Cменой архитектуры (увеличить шину как у Ryzen AI Max+ PRO 495), или разместить супер быструю SRAM прямо на чипе как Cerebras
- … или подключением нескольких GPU друг к другу через супер быстрые интерфейсы типа NVLink
Короче – я посмотрел на все это, и везде, везде – куча бутылочных горлышек, которые потребуют грандиозных инвестиций во все уровни иерархии ИИ, и где еще поле непаханное.
Поэтому – лично я, несмотря на всякие падения рынка и эпичный про… б Леопольда Ашенбреннера (как человеку с такой фамилией кто-то доверил деньги ?? Она же буквально переводится как “Сгорающий в пепел”!!) – так вот, лично я продолжаю верить во все эти AI-истории.
По-моему, это все – не пузырь, а начало очень интересной и длинной истории.
Ну как – «длинной»?
Я думаю — годика 3 мы еще протянем до восстания роботов...
Данная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
Григорий, да, можно конечно — но сервер в облаке с достаточным количеством VRAM — будет стоить например долларов 50 в час. Может и больше
По большому счету — облачные подписки — это самый дешевый способ сейчас гонять реально умные модели, но за них сейчас платите в основном не вы, а другие люди (венчурные капиталисты для американских моделей, или коммунистическая партия китая — для китайских)
Но рано или поздно — у них всех закончатся деньги или терпение, и придется платить по реальному ценнику.
Гуру Хренов, нормально пузырь надули и демпингуют? Да?
На мой взгляд есть еще куда развиваться в эту сторону. 99% загрузки ИИ просто эксперименты и баловство. Но прогресс налицо. Может чего и выйдет со временем. Лет через 10… Страшно представить. Вероятно мы увидим реальные умные ИИ способные заменить специалистов или там солдат. Но ценник будет другой...