Блог им. Division_by_zero

Еще про экономику локальных LLM-моделей

Это вдогонку к моему предыдущему посту
Вот вы тут спросите поцоны – зачем ты Гуру Хренов пишешь всякую заумь про нейронные сети – какое отношение это вообще имеет к инвестициям?
Отвечаю – самое прямое. Я пытаюсь для себя и для вас ответить на вопрос – является ли текущая волна хайпа по поводу AI и датацентров – пузырем или только началом длительного тренда.

В предыдущей серии, отчаявшись найти домашнее решение для больших и реально умных LLM-ок  — я решил позвонить чувакам, которые занимаются перепродажей старого серверного железа от Энвидии

И вот какие цены они мне выкатили (это все в канадских долларах, чтобы привести к американским – делите на 1.4)

Еще про экономику локальных LLM-моделей

38 тысяч за старый сервер на древнем GPU V100 на 512 GB!!! И этого все равно не хватит для передовых моделей тима KIMI!!!
(и это кстати 4 «блейда», для которых нужна своя серверная стойка ). И интересно не то, что они продают по таким ценам — интересно, что кто-то покупает! (Мои попытки залоу-боллить цену, когда я им написал, что готов заплатить, но только в 4 раза меньше — не нашли понимания у продавца)

Короче, поцаны, вот вам суровая правда про локальные модели:

  • Современные модели – супер – большие, и им нужно где-то 1500GB видеопамяти!
    (справедливости ради – для Mixture-of-Experts (MoE) моделей типа Kimi – там есть читы, когда можно часть модели грузить в VRAM, а остальное оставлять в обычной памяти, потому что там только часть “Экспертов” активна в любой момент времени)
  • Если вы хотите реально умных ответов от современных моделей – вам надо включать там Reasoning mode. Reasoning – это то, что сильно улучшает результаты ответов моделей. Но на каждый токен ответа, который такая модель выдаст вам – она сожжет 10 токенов на reasoning. И будет думать намного медленнее!!! А еще лучше – обвесить такую модель Harness-ом (упряжью) типа Claude Code, который поверх  Reasoning Mode – еще нагонит кучу агентов, которые будут друг друга критиковать. Это второй уровень поумнения для модели, и там вообще на каждый токен кода, который выдает система-она сжигает десятки тысяч токенов!!! С ума сойти!!

С чем это оставляет всех нас, кто хочет заиметь супер-мозг у себя в квартире ??  тут все очень плохо поцаны.

  1. Консьюмерские графические карточки – не метод – они очень быстрые, но мало VRAM, супер-дорогие. Оставим их геймерам, пусть наслаждаются своим Cyberpunk -ом
  2. Потребительские решения от Энвидии — это тоже издевательство. DGX Spark на 128 GB видеопамяти – сейчас в Штатах стоит USD 5,000 Две можно объединить NVLink-ом, будет 256GB за 10,000. Такая штука вам может выдать ну токенов 50 в секунду на каких-то относительно умных моделях, но если вы хотите реально кодить например, то см выше – на токен кода вам понадобится например 1000 агентских токенов в бэкграунде, и все будет очень очень медленно!
  3. Есть еще NVDA DGX Station – 748 GB пямяти всего за 99,999 USD. Потребительская модель, ага. По цене BMW X5. Но  и там они мухлюют, потому что из тех 748GB – только 252Gb – это на самом VRAM, все остальное – та же unified RAM с в 20 раз меньшей полосой пропускания.
  4. Есть еще вариант купить старый GPU – сервер – про это я уже писал выше
  5. Самый, наверное, правильный вариант для нищебродов в наше время – это компы на архитектуре Ryzen AI Max+ 395 типа GMKtec за 3,600 USD с 128GB Unified Memory
    Но лучше – дождаться к осени их новой модели  Ryzen AI Max+ PRO 495, где памяти будет уже 192GB
  6. Еще есть Интел, которая только обещает Nova Lake-AX, который вроде тоже будет основан на идее гиганской шины памяти с Unified Memory

Что мы имеем, поцаны? С одной стороны, крупным игрокам наплевать на нас, гоняющих свои ЛЛМ-ки в своих квартирах. Enterprise-рынок – гораздо более перспективен, нафиг мы консьюмеры из сдались?

С другой стороны, покопавшись в этом рынке, начинаешь понимать, какой огромный спрос там на рабочие решения.
Потому что — консьюмерские решения, когда они становятся масштабируемые по памяти, начинают плавно конкурировать в enterprise.

НО!!! Все упирается в кучу ограничений:

  1. Память — дорогая
  2. Даже есть есть память, проблема с полосой пропускания шины
  3. Проблемы с полосой пропускания шины – решается либо
  4. Cменой архитектуры (увеличить шину как у Ryzen AI Max+ PRO 495),  или разместить супер быструю SRAM прямо на чипе как Cerebras
  5. … или подключением нескольких GPU друг к другу через супер быстрые интерфейсы типа NVLink

Короче – я посмотрел на все это, и везде, везде – куча бутылочных горлышек, которые потребуют грандиозных инвестиций во все уровни иерархии ИИ, и где еще поле непаханное.

Поэтому – лично я, несмотря на всякие падения рынка и эпичный про… б Леопольда Ашенбреннера (как человеку с такой фамилией кто-то доверил деньги ?? Она же буквально переводится как “Сгорающий в пепел”!!) – так вот, лично я продолжаю верить во все эти AI-истории.

По-моему, это все – не пузырь, а начало очень интересной и длинной истории.

Ну как – «длинной»?
Я думаю — годика 3 мы еще протянем до восстания роботов...

 

 

 

Данная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
1.8К | ★2
#23 по плюсам, #37 по комментариям
9 комментариев
можно арендовать же сервер в облаке и там развернуть локалку.
avatar

Григорий, да, можно конечно — но сервер в облаке с достаточным количеством VRAM — будет стоить например долларов 50 в час. Может и больше

По большому счету — облачные подписки — это самый дешевый способ сейчас гонять реально умные модели, но за них сейчас платите в основном не вы, а другие люди (венчурные капиталисты для американских моделей, или коммунистическая партия китая — для китайских)
Но рано или поздно — у них всех закончатся деньги или терпение, и придется платить по реальному ценнику. 

Гуру Хренов, нормально пузырь надули и демпингуют? Да?

На мой взгляд есть еще куда развиваться в эту сторону. 99% загрузки ИИ просто эксперименты и баловство. Но прогресс налицо. Может чего и выйдет со временем. Лет через 10… Страшно представить. Вероятно мы увидим реальные умные ИИ способные заменить специалистов или там солдат. Но ценник будет другой...

avatar
Когда придёт Терминатор?
avatar
ипанические цены, v100 32 на авито 50-60 косарей
avatar
trump, Это один модуль, цены, которые приведены у меня — это полностью готовые сервера
в общем можно надеяться, что продавцы лопат заработают
avatar
Я вот чего только не пойму — а зачем вам локальные LLM? Обычному юзеру подписка за $20 выше крыши, такому как я — подписка-две за $100-200, плюс, ну сожгу я пару сотен долларов в месяц по API на что то китайское типа дипсика, квена или кими. Забавно разве что поиграться с abliterated моделями, (я на своих двух 3090 проигрался), но тоже непонятно зачем. И так понятно что железо на серьезные модели сейчас стоит не подъемных денег.
avatar
В майнинг еще успел заскочить и потиранить соседей шумом на лоджии, а с ИИ в пролете, то ли старый стал, то ли мир стал более динамичным. 
avatar

Читайте на SMART-LAB:
Фото
Новые фичи ВТБ Мои Инвестиции: что действительно полезно?
Новая эпоха работы с инвестиционными инструментами уже началась. Инвесторам следует тщательно выбирать активы, обращать внимание не только на...
Фото
Июльское обновление списка устойчивых ВДО-эмитентов Иволги Капитал
__________ В наш список устойчивых попадают ВДО-эмитенты, последним организатором или со-организатором выпусков которых явилась Иволга, а...
Фото
Две акции с потенциалом среднесрочного роста в августе 2026
К началу августа в Индексе МосБиржи наметился слом среднесрочного нисходящего тренда. Рынок акций довольно резко отскочил вверх от...
Фото
ЛУКОЙЛ: отчет по РСБУ за 2-й квартал - все идет по Плану
ЛУКОЙЛ опубликовал отчет по РСБУ за 2-й квартал 2026 года Важно понимать, что отчетность по РСБУ не показывает реальные денежные...

теги блога Гуру Хренов

....все тэги



UPDONW
Новый дизайн