Это вдогонку к моему предыдущему посту
Вот вы тут спросите поцоны – зачем ты Гуру Хренов пишешь всякую заумь про нейронные сети – какое отношение это вообще имеет к инвестициям?
Отвечаю – самое прямое. Я пытаюсь для себя и для вас ответить на вопрос – является ли текущая волна хайпа по поводу AI и датацентров – пузырем или только началом длительного тренда.
В предыдущей серии, отчаявшись найти домашнее решение для больших и реально умных LLM-ок — я решил позвонить чувакам, которые занимаются перепродажей старого серверного железа от Энвидии
И вот какие цены они мне выкатили (это все в канадских долларах, чтобы привести к американским – делите на 1.4)

38 тысяч за старый сервер на древнем GPU V100 на 512 GB!!! И этого все равно не хватит для передовых моделей тима KIMI!!!
(и это кстати 4 «блейда», для которых нужна своя серверная стойка ). И интересно не то, что они продают по таким ценам — интересно, что кто-то покупает! (Мои попытки залоу-боллить цену, когда я им написал, что готов заплатить, но только в 4 раза меньше — не нашли понимания у продавца)
Короче, поцаны, вот вам суровая правда про локальные модели:
- Современные модели – супер – большие, и им нужно где-то 1500GB видеопамяти!
(справедливости ради – для Mixture-of-Experts (MoE) моделей типа Kimi – там есть читы, когда можно часть модели грузить в VRAM, а остальное оставлять в обычной памяти, потому что там только часть “Экспертов” активна в любой момент времени) - Если вы хотите реально умных ответов от современных моделей – вам надо включать там Reasoning mode. Reasoning – это то, что сильно улучшает результаты ответов моделей. Но на каждый токен ответа, который такая модель выдаст вам – она сожжет 10 токенов на reasoning. И будет думать намного медленнее!!! А еще лучше – обвесить такую модель Harness-ом (упряжью) типа Claude Code, который поверх Reasoning Mode – еще нагонит кучу агентов, которые будут друг друга критиковать. Это второй уровень поумнения для модели, и там вообще на каждый токен кода, который выдает система-она сжигает десятки тысяч токенов!!! С ума сойти!!
С чем это оставляет всех нас, кто хочет заиметь супер-мозг у себя в квартире ?? тут все очень плохо поцаны.
- Консьюмерские графические карточки – не метод – они очень быстрые, но мало VRAM, супер-дорогие. Оставим их геймерам, пусть наслаждаются своим Cyberpunk -ом
- Потребительские решения от Энвидии — это тоже издевательство. DGX Spark на 128 GB видеопамяти – сейчас в Штатах стоит USD 5,000 Две можно объединить NVLink-ом, будет 256GB за 10,000. Такая штука вам может выдать ну токенов 50 в секунду на каких-то относительно умных моделях, но если вы хотите реально кодить например, то см выше – на токен кода вам понадобится например 1000 агентских токенов в бэкграунде, и все будет очень очень медленно!
- Есть еще NVDA DGX Station – 748 GB пямяти всего за 99,999 USD. Потребительская модель, ага. По цене BMW X5. Но и там они мухлюют, потому что из тех 748GB – только 252Gb – это на самом VRAM, все остальное – та же unified RAM с в 20 раз меньшей полосой пропускания.
- Есть еще вариант купить старый GPU – сервер – про это я уже писал выше
- Самый, наверное, правильный вариант для нищебродов в наше время – это компы на архитектуре Ryzen AI Max+ 395 типа GMKtec за 3,600 USD с 128GB Unified Memory
Но лучше – дождаться к осени их новой модели Ryzen AI Max+ PRO 495, где памяти будет уже 192GB - Еще есть Интел, которая только обещает Nova Lake-AX, который вроде тоже будет основан на идее гиганской шины памяти с Unified Memory
Что мы имеем, поцаны? С одной стороны, крупным игрокам наплевать на нас, гоняющих свои ЛЛМ-ки в своих квартирах. Enterprise-рынок – гораздо более перспективен, нафиг мы консьюмеры из сдались?
С другой стороны, покопавшись в этом рынке, начинаешь понимать, какой огромный спрос там на рабочие решения.
Потому что — консьюмерские решения, когда они становятся масштабируемые по памяти, начинают плавно конкурировать в enterprise.
НО!!! Все упирается в кучу ограничений:
- Память — дорогая
- Даже есть есть память, проблема с полосой пропускания шины
- Проблемы с полосой пропускания шины – решается либо
- Cменой архитектуры (увеличить шину как у Ryzen AI Max+ PRO 495), или разместить супер быструю SRAM прямо на чипе как Cerebras
- … или подключением нескольких GPU друг к другу через супер быстрые интерфейсы типа NVLink
Короче – я посмотрел на все это, и везде, везде – куча бутылочных горлышек, которые потребуют грандиозных инвестиций во все уровни иерархии ИИ, и где еще поле непаханное.
Поэтому – лично я, несмотря на всякие падения рынка и эпичный про… б Леопольда Ашенбреннера (как человеку с такой фамилией кто-то доверил деньги ?? Она же буквально переводится как “Сгорающий в пепел”!!) – так вот, лично я продолжаю верить во все эти AI-истории.
По-моему, это все – не пузырь, а начало очень интересной и длинной истории.
Ну как – «длинной»?
Я думаю — годика 3 мы еще протянем до восстания роботов...
Данная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
Григорий, да, можно конечно — но сервер в облаке с достаточным количеством VRAM — будет стоить например долларов 50 в час. Может и больше
По большому счету — облачные подписки — это самый дешевый способ сейчас гонять реально умные модели, но за них сейчас платите в основном не вы, а другие люди (венчурные капиталисты для американских моделей, или коммунистическая партия китая — для китайских)
Но рано или поздно — у них всех закончатся деньги или терпение, и придется платить по реальному ценнику.
Гуру Хренов, нормально пузырь надули и демпингуют? Да?
На мой взгляд есть еще куда развиваться в эту сторону. 99% загрузки ИИ просто эксперименты и баловство. Но прогресс налицо. Может чего и выйдет со временем. Лет через 10… Страшно представить. Вероятно мы увидим реальные умные ИИ способные заменить специалистов или там солдат. Но ценник будет другой...
В ИИ модели достаточно добавить что-то вроде фильтров, убрать ненужные и дорогие ветки интерпретаций через блоки эмпирических взаимосвязей, которые может общитывать во время простоя.
Ну например, мы все понимаем, если за окном идёт дождь и сегодня, значит большая часть людей сидит дома и 100% никто не жарит шашлык. Мы даже не думаем, как мы к этому пришли. Для нас это очевидно.
А вот ИИ сегодня просчитывает все варианты заново, без кеширования взаимосвязей.
Например, если в какой-то интерпретации мы общитали миллиард запросов с одинаковым результатом, где во время дождя намокал асфальт- это можно записать в виде аксиомы в память. Последующие запросы будут сводиться к ресёрчу базы данных, вместо расчетов всех векторов вероятностей.
И работает медленно — дашь какую нибудь задачу — он думает буквально целый день, пока не выдаст что — то. Написание колл-центра с нуля, о котором я говорил в предыдущем посте — оно требует самых продвинутых режимов, это в общем то нетривиальная задача
Проще говоря, все запросы связанные каким-то образом с РФ могут блокироваться на аппаратном уровне.
Ты смотришь на цену акций Кодак и Нокии и с пеной у рта показываешь как все дорого.
Хотя буквально пару лет назад была РОВНО такая же история с майнингом и она ВСЯ лопнула как только появились асики.
Хотя буквально сегодня выкатился новый DS Flash V4 0731, который в кодинге судя по бенчам — примерно 95% от Opus 4.8. только с нюансом, что это модель которая комфортно влезает в 192 гига оперативки и 32 гига видеопамятью.
И я повторюсь, что ты полностью игнорируешь вероятность появления узкоспециализированного решения под ИИ для домашнего пользователя.
Окей, вопрос, если у среднестатисечкого Васяна дома Опус 4.8, то на кой рожон нужны датацентры и API? Построим сейчас — будем молиться что придумаем применение. Уже эта модель к слову, трещит по швам — опенсорс начали выпускать не так охотно, потому что опенсорс откровенно конкурирует с облачными API. Тот же квен 27млрд это новая рабочая лошадь для многих людей, после GPT-OSS 122B. Сейчас, видимо, это будет новый дипсик.
Какой резон гонять Кими? Только корпораты будут этим развлекаться. Гонка ИИ здесь и сейчас это не про ИИ, а про вычислительные мощности, которые 100% можно использовать чтобы атаковать другое государство, захватив архивы, гос порталы, коммуникацию и все такое. Вот для таких «ддосов» и нужны эти датацентры. Госзаказ у этой истории «окей, как нам захватить или развалить страну Х?» и дать им время на ответ. Извините, спойлер. А делать прототипы приложений, обобщать информацию, писать код, генерить видео, музыку и картинки — датацентры на этом не выживут.
А тем временем сегодня луна подешевела на 80%, до 18\2\100 рублей, а дипсик выкатил новый флэш без изменения цен за 12\0.2\25 рублей, но поумнел до уровня опуса 4.8. Такие модели придется сильно ужать, чтобы запустить на связке V100, а если брать железо на H100 — сотни штук зелени.
История попадалась на глаза давно — чел лет 10 назад решил майнить, прибыль поперла, на нее покупал новое железо. Но сложность росла быстрее, в итоге стоимость железа обнулилась, чистый итог копейки.
Но у меня другая арифметика получается.
Модели 120b все слабенькие уже. Из современных с разумным объемом VRAM вроде получается только DeepSeek V4 Flash. Но это уже 320Gb.
V100 это шляпа на сегодня, но A100 80Gb пока еще нормуль.
В итоге надо 4 A100 + корпус на 8 A100 (возможность расширения) на плате SXM + охлад + Infiniband на оба конца (PCI-e слишком медленно для такого конфига).
У меня получается по минимуму 2,500,000 руб. на эксперимент (это я еще экономный и знаю, где покупать, продаваны хотят 5,000,000 руб. за такой конфиг).
Но это дорого. Жаба душит, блин. И прайсы в России конские в моменте.
Подумаем и подождем. Но H200, B200, и разные новые шляпы от Huawei не вариант — там итоговый прайс под 50 млн. рублей будет (((
С уважением
Сейчас самый оптимальный недорогой вариант это кластер из DGX Spark.
Чувак собирал такой из 8шт для запуска большой модели, соединяются они через свитч, можно и больше объеденить.
Спасибо за пост! Тоже очень интересна эта тема, так как на ней завязан мой бизнес.
Ситуация действительно не в пользу обычного потребителя. Я думаю так: скорее всего, простым смертным никогда не удастся развернуть на домашней системе праймовую модель. Хотя, надо признать качество моделей на каждый 1GB VRAM растёт день ото дня.
Для себя решил так: для своей личной работы использую топовые модели по подписке, а для моих бизнес задач (ИИ-боты для бизнеса) кручу локальную LLM-ку Qwen27B. И её вполне хватает и по качеству и по пропускной способности!
Для большинства бизнес-задач локальные LLM-ки уже очень качественно выполняют свою работу, хорошо работают с данными, следуют инструкциям, у них хороший русский язык, из них получается хороший ассистент общего плана.
А бабки лишние, лучше пустить на что то творческое — например купить трактор или два б/у сломаных, нанять слесаря чтоб отремонтировал и продать.