Гуру Хренов
Гуру Хренов личный блог
Сегодня в 15:35

Еще про экономику локальных LLM-моделей

Это вдогонку к моему предыдущему посту
Вот вы тут спросите поцоны – зачем ты Гуру Хренов пишешь всякую заумь про нейронные сети – какое отношение это вообще имеет к инвестициям?
Отвечаю – самое прямое. Я пытаюсь для себя и для вас ответить на вопрос – является ли текущая волна хайпа по поводу AI и датацентров – пузырем или только началом длительного тренда.

В предыдущей серии, отчаявшись найти домашнее решение для больших и реально умных LLM-ок  — я решил позвонить чувакам, которые занимаются перепродажей старого серверного железа от Энвидии

И вот какие цены они мне выкатили (это все в канадских долларах, чтобы привести к американским – делите на 1.4)

Еще про экономику локальных LLM-моделей

38 тысяч за старый сервер на древнем GPU V100 на 512 GB!!! И этого все равно не хватит для передовых моделей тима KIMI!!!
(и это кстати 4 «блейда», для которых нужна своя серверная стойка ). И интересно не то, что они продают по таким ценам — интересно, что кто-то покупает! (Мои попытки залоу-боллить цену, когда я им написал, что готов заплатить, но только в 4 раза меньше — не нашли понимания у продавца)

Короче, поцаны, вот вам суровая правда про локальные модели:

  • Современные модели – супер – большие, и им нужно где-то 1500GB видеопамяти!
    (справедливости ради – для Mixture-of-Experts (MoE) моделей типа Kimi – там есть читы, когда можно часть модели грузить в VRAM, а остальное оставлять в обычной памяти, потому что там только часть “Экспертов” активна в любой момент времени)
  • Если вы хотите реально умных ответов от современных моделей – вам надо включать там Reasoning mode. Reasoning – это то, что сильно улучшает результаты ответов моделей. Но на каждый токен ответа, который такая модель выдаст вам – она сожжет 10 токенов на reasoning. И будет думать намного медленнее!!! А еще лучше – обвесить такую модель Harness-ом (упряжью) типа Claude Code, который поверх  Reasoning Mode – еще нагонит кучу агентов, которые будут друг друга критиковать. Это второй уровень поумнения для модели, и там вообще на каждый токен кода, который выдает система-она сжигает десятки тысяч токенов!!! С ума сойти!!

С чем это оставляет всех нас, кто хочет заиметь супер-мозг у себя в квартире ??  тут все очень плохо поцаны.

  1. Консьюмерские графические карточки – не метод – они очень быстрые, но мало VRAM, супер-дорогие. Оставим их геймерам, пусть наслаждаются своим Cyberpunk -ом
  2. Потребительские решения от Энвидии — это тоже издевательство. DGX Spark на 128 GB видеопамяти – сейчас в Штатах стоит USD 5,000 Две можно объединить NVLink-ом, будет 256GB за 10,000. Такая штука вам может выдать ну токенов 50 в секунду на каких-то относительно умных моделях, но если вы хотите реально кодить например, то см выше – на токен кода вам понадобится например 1000 агентских токенов в бэкграунде, и все будет очень очень медленно!
  3. Есть еще NVDA DGX Station – 748 GB пямяти всего за 99,999 USD. Потребительская модель, ага. По цене BMW X5. Но  и там они мухлюют, потому что из тех 748GB – только 252Gb – это на самом VRAM, все остальное – та же unified RAM с в 20 раз меньшей полосой пропускания.
  4. Есть еще вариант купить старый GPU – сервер – про это я уже писал выше
  5. Самый, наверное, правильный вариант для нищебродов в наше время – это компы на архитектуре Ryzen AI Max+ 395 типа GMKtec за 3,600 USD с 128GB Unified Memory
    Но лучше – дождаться к осени их новой модели  Ryzen AI Max+ PRO 495, где памяти будет уже 192GB
  6. Еще есть Интел, которая только обещает Nova Lake-AX, который вроде тоже будет основан на идее гиганской шины памяти с Unified Memory

Что мы имеем, поцаны? С одной стороны, крупным игрокам наплевать на нас, гоняющих свои ЛЛМ-ки в своих квартирах. Enterprise-рынок – гораздо более перспективен, нафиг мы консьюмеры из сдались?

С другой стороны, покопавшись в этом рынке, начинаешь понимать, какой огромный спрос там на рабочие решения.
Потому что — консьюмерские решения, когда они становятся масштабируемые по памяти, начинают плавно конкурировать в enterprise.

НО!!! Все упирается в кучу ограничений:

  1. Память — дорогая
  2. Даже есть есть память, проблема с полосой пропускания шины
  3. Проблемы с полосой пропускания шины – решается либо
  4. Cменой архитектуры (увеличить шину как у Ryzen AI Max+ PRO 495),  или разместить супер быструю SRAM прямо на чипе как Cerebras
  5. … или подключением нескольких GPU друг к другу через супер быстрые интерфейсы типа NVLink

Короче – я посмотрел на все это, и везде, везде – куча бутылочных горлышек, которые потребуют грандиозных инвестиций во все уровни иерархии ИИ, и где еще поле непаханное.

Поэтому – лично я, несмотря на всякие падения рынка и эпичный про… б Леопольда Ашенбреннера (как человеку с такой фамилией кто-то доверил деньги ?? Она же буквально переводится как “Сгорающий в пепел”!!) – так вот, лично я продолжаю верить во все эти AI-истории.

По-моему, это все – не пузырь, а начало очень интересной и длинной истории.

Ну как – «длинной»?
Я думаю — годика 3 мы еще протянем до восстания роботов...

 

 

 

Данная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
20 Комментариев
  • Григорий
    Сегодня в 15:44
    можно арендовать же сервер в облаке и там развернуть локалку.
  • Toptygin11
    Сегодня в 17:11
    Когда придёт Терминатор?
  • trump
    Сегодня в 17:16
    ипанические цены, v100 32 на авито 50-60 косарей
  • MATEMATNK
    Сегодня в 18:31
    в общем можно надеяться, что продавцы лопат заработают

Активные форумы
Что сейчас обсуждают

Старый дизайн
Старый
дизайн