Блог им. Division_by_zero

Еще про экономику локальных LLM-моделей

Это вдогонку к моему предыдущему посту
Вот вы тут спросите поцоны – зачем ты Гуру Хренов пишешь всякую заумь про нейронные сети – какое отношение это вообще имеет к инвестициям?
Отвечаю – самое прямое. Я пытаюсь для себя и для вас ответить на вопрос – является ли текущая волна хайпа по поводу AI и датацентров – пузырем или только началом длительного тренда.

В предыдущей серии, отчаявшись найти домашнее решение для больших и реально умных LLM-ок  — я решил позвонить чувакам, которые занимаются перепродажей старого серверного железа от Энвидии

И вот какие цены они мне выкатили (это все в канадских долларах, чтобы привести к американским – делите на 1.4)

Еще про экономику локальных LLM-моделей

38 тысяч за старый сервер на древнем GPU V100 на 512 GB!!! И этого все равно не хватит для передовых моделей тима KIMI!!!
(и это кстати 4 «блейда», для которых нужна своя серверная стойка ). И интересно не то, что они продают по таким ценам — интересно, что кто-то покупает! (Мои попытки залоу-боллить цену, когда я им написал, что готов заплатить, но только в 4 раза меньше — не нашли понимания у продавца)

Короче, поцаны, вот вам суровая правда про локальные модели:

  • Современные модели – супер – большие, и им нужно где-то 1500GB видеопамяти!
    (справедливости ради – для Mixture-of-Experts (MoE) моделей типа Kimi – там есть читы, когда можно часть модели грузить в VRAM, а остальное оставлять в обычной памяти, потому что там только часть “Экспертов” активна в любой момент времени)
  • Если вы хотите реально умных ответов от современных моделей – вам надо включать там Reasoning mode. Reasoning – это то, что сильно улучшает результаты ответов моделей. Но на каждый токен ответа, который такая модель выдаст вам – она сожжет 10 токенов на reasoning. И будет думать намного медленнее!!! А еще лучше – обвесить такую модель Harness-ом (упряжью) типа Claude Code, который поверх  Reasoning Mode – еще нагонит кучу агентов, которые будут друг друга критиковать. Это второй уровень поумнения для модели, и там вообще на каждый токен кода, который выдает система-она сжигает десятки тысяч токенов!!! С ума сойти!!

С чем это оставляет всех нас, кто хочет заиметь супер-мозг у себя в квартире ??  тут все очень плохо поцаны.

  1. Консьюмерские графические карточки – не метод – они очень быстрые, но мало VRAM, супер-дорогие. Оставим их геймерам, пусть наслаждаются своим Cyberpunk -ом
  2. Потребительские решения от Энвидии — это тоже издевательство. DGX Spark на 128 GB видеопамяти – сейчас в Штатах стоит USD 5,000 Две можно объединить NVLink-ом, будет 256GB за 10,000. Такая штука вам может выдать ну токенов 50 в секунду на каких-то относительно умных моделях, но если вы хотите реально кодить например, то см выше – на токен кода вам понадобится например 1000 агентских токенов в бэкграунде, и все будет очень очень медленно!
  3. Есть еще NVDA DGX Station – 748 GB пямяти всего за 99,999 USD. Потребительская модель, ага. По цене BMW X5. Но  и там они мухлюют, потому что из тех 748GB – только 252Gb – это на самом VRAM, все остальное – та же unified RAM с в 20 раз меньшей полосой пропускания.
  4. Есть еще вариант купить старый GPU – сервер – про это я уже писал выше
  5. Самый, наверное, правильный вариант для нищебродов в наше время – это компы на архитектуре Ryzen AI Max+ 395 типа GMKtec за 3,600 USD с 128GB Unified Memory
    Но лучше – дождаться к осени их новой модели  Ryzen AI Max+ PRO 495, где памяти будет уже 192GB
  6. Еще есть Интел, которая только обещает Nova Lake-AX, который вроде тоже будет основан на идее гиганской шины памяти с Unified Memory

Что мы имеем, поцаны? С одной стороны, крупным игрокам наплевать на нас, гоняющих свои ЛЛМ-ки в своих квартирах. Enterprise-рынок – гораздо более перспективен, нафиг мы консьюмеры из сдались?

С другой стороны, покопавшись в этом рынке, начинаешь понимать, какой огромный спрос там на рабочие решения.
Потому что — консьюмерские решения, когда они становятся масштабируемые по памяти, начинают плавно конкурировать в enterprise.

НО!!! Все упирается в кучу ограничений:

  1. Память — дорогая
  2. Даже есть есть память, проблема с полосой пропускания шины
  3. Проблемы с полосой пропускания шины – решается либо
  4. Cменой архитектуры (увеличить шину как у Ryzen AI Max+ PRO 495),  или разместить супер быструю SRAM прямо на чипе как Cerebras
  5. … или подключением нескольких GPU друг к другу через супер быстрые интерфейсы типа NVLink

Короче – я посмотрел на все это, и везде, везде – куча бутылочных горлышек, которые потребуют грандиозных инвестиций во все уровни иерархии ИИ, и где еще поле непаханное.

Поэтому – лично я, несмотря на всякие падения рынка и эпичный про… б Леопольда Ашенбреннера (как человеку с такой фамилией кто-то доверил деньги ?? Она же буквально переводится как “Сгорающий в пепел”!!) – так вот, лично я продолжаю верить во все эти AI-истории.

По-моему, это все – не пузырь, а начало очень интересной и длинной истории.

Ну как – «длинной»?
Я думаю — годика 3 мы еще протянем до восстания роботов...

 

 

 

Данная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
5.9К | ★6
38 комментариев
можно арендовать же сервер в облаке и там развернуть локалку.
avatar

Григорий, да, можно конечно — но сервер в облаке с достаточным количеством VRAM — будет стоить например долларов 50 в час. Может и больше

По большому счету — облачные подписки — это самый дешевый способ сейчас гонять реально умные модели, но за них сейчас платите в основном не вы, а другие люди (венчурные капиталисты для американских моделей, или коммунистическая партия китая — для китайских)
Но рано или поздно — у них всех закончатся деньги или терпение, и придется платить по реальному ценнику. 

Гуру Хренов, нормально пузырь надули и демпингуют? Да?

На мой взгляд есть еще куда развиваться в эту сторону. 99% загрузки ИИ просто эксперименты и баловство. Но прогресс налицо. Может чего и выйдет со временем. Лет через 10… Страшно представить. Вероятно мы увидим реальные умные ИИ способные заменить специалистов или там солдат. Но ценник будет другой...

avatar
Гуру Хренов, а вы не думаете что к этому времени ИИ-шки станут производительнее и дешевле? Когда-то компы занимали целые помещения и стоили как особняк на рублёвке.

В ИИ модели достаточно добавить что-то вроде фильтров, убрать ненужные и дорогие ветки интерпретаций через блоки эмпирических взаимосвязей, которые может общитывать во время простоя.

Ну например, мы все понимаем, если за окном идёт дождь и сегодня, значит большая часть людей сидит дома и 100% никто не жарит шашлык. Мы даже не думаем, как мы к этому пришли. Для нас это очевидно.

А вот ИИ сегодня просчитывает все варианты заново, без кеширования взаимосвязей.

Например, если в какой-то интерпретации мы общитали миллиард запросов с одинаковым результатом, где во время дождя намокал асфальт- это можно записать в виде аксиомы в память. Последующие запросы будут сводиться к ресёрчу базы данных, вместо расчетов всех векторов вероятностей.
avatar
Гуру Хренов, кстати, я подозреваю что локальные LLM-ки этим как раз и могут заниматься. Потому как участники загружают свои индивидуальные базы знаний. Поэтому аксиомы должны быть на 100% устойчивы к смене контекста.
avatar
Гуру Хренов, в России вот так. Может, у нас выгоднее? selectel.ru/prices/
avatar
Когда придёт Терминатор?
avatar
Toptygin11, найдите шоу китайских роботов.
avatar
ипанические цены, v100 32 на авито 50-60 косарей
avatar
trump, Это один модуль, цены, которые приведены у меня — это полностью готовые сервера
в общем можно надеяться, что продавцы лопат заработают
avatar
Я вот чего только не пойму — а зачем вам локальные LLM? Обычному юзеру подписка за $20 выше крыши, такому как я — подписка-две за $100-200, плюс, ну сожгу я пару сотен долларов в месяц по API на что то китайское типа дипсика, квена или кими. Забавно разве что поиграться с abliterated моделями, (я на своих двух 3090 проигрался), но тоже непонятно зачем. И так понятно что железо на серьезные модели сейчас стоит не подъемных денег.
avatar
BeyG, а как раздеть соседку с помощью нитроглицерина используя подписку? :)
avatar
drow, тут да, без HuiHui не обойтись)
avatar
BeyG, при более-менее серьёзной работе эти подписки за 20-100-200 баксов имеют тенденцию быстро заканчиваться. И вместо того, чтобы что-то делать, приходится гулять, пока временное окно восстановления лимитов сдвинется. Ну, ещё есть такой параноидальный бред, как конфиденциальность, данные должны обрабатываться локально и всё такое.
avatar
Алексей, вторая покупается, по апи можно китайцами догнаться. А если вы и в это не помещаетесь, значит у вас такие задачи, что придется много платить))
avatar
BeyG, вторая покупается — ну, суть вы уловили :)
avatar
BeyG, я сейчас плачу 200 долл в месяц за Клод, и все равно не хватает
Гуру Хренов, мне тоже бывает не хватает $200 на кодексе, тогда подключаю лимиты жены), или по апи гоняю дипсик. Но это пара тысяч долларов в год, а оборудование для подобных моделей это сотни тысяч долларов)
avatar
BeyG, парадокс в том, что не всегда нужны «такие модели». Можно поднатаскаться, и взять оборудование под модели попроще, но которых будет всё равно хватать. И с лихвой окупит все подписки.
avatar
Гуру Хренов, а на что вы используете такой объем?
avatar
Сергей777, так, как я и писал уже — агентский кодинг потребляет десятки тысяч токенов на каждый выданный на гора, особенно — если включать самый умный режим и выбирать самую умную модель.
И работает медленно — дашь какую нибудь задачу — он думает буквально целый день, пока не выдаст что — то. Написание колл-центра с нуля, о котором я говорил в предыдущем посте — оно требует самых продвинутых режимов, это в общем то нетривиальная задача
avatar
BeyG, к тому что инет могут изолировать или заблокировать доступ по маске запросов, ассоциированной с русским языком и геопозиционным синтезом запросов.

Проще говоря, все запросы связанные каким-то образом с РФ могут блокироваться на аппаратном уровне.
avatar
Чёрный Ленин, на аппаратном нет, но пользователей, да, могут начать банить
avatar
BeyG, а на что уходят токены? Мне одной подписки на $100 хватает — но я просматриваю код который генерит модель, работа идет поэтому медленней.
avatar
Alex Craft, агенты токены как в не в себя кушают, какой код?
avatar
В майнинг еще успел заскочить и потиранить соседей шумом на лоджии, а с ИИ в пролете, то ли старый стал, то ли мир стал более динамичным. 
avatar
Дико извиняюсь, но я решил лично для себя всех добавлять в чс с комментарием, нравится кому-то или нет. Ваша информация мне совершенно не нужна никогда.
avatar
.....
Ты смотришь на цену акций Кодак и Нокии и с пеной у рта показываешь как все дорого.
Хотя буквально пару лет назад была РОВНО такая же история с майнингом и она ВСЯ лопнула как только появились асики. 

Хотя буквально сегодня выкатился новый DS Flash V4 0731, который в кодинге судя по бенчам — примерно 95% от Opus 4.8. только с нюансом, что это модель которая комфортно влезает в 192 гига оперативки и 32 гига видеопамятью.
 
И я повторюсь, что ты полностью игнорируешь вероятность появления узкоспециализированного решения под ИИ для домашнего пользователя.

Окей, вопрос, если у среднестатисечкого Васяна дома Опус 4.8, то на кой рожон нужны датацентры и API? Построим сейчас — будем молиться что придумаем применение. Уже эта модель к слову, трещит по швам — опенсорс начали выпускать не так охотно, потому что опенсорс откровенно конкурирует с облачными API. Тот же квен 27млрд это новая рабочая лошадь для многих людей, после GPT-OSS 122B. Сейчас, видимо, это будет новый дипсик. 

Какой резон гонять Кими? Только корпораты будут этим развлекаться. Гонка ИИ здесь и сейчас это не про ИИ, а про вычислительные мощности, которые 100% можно использовать чтобы атаковать другое государство, захватив архивы, гос порталы, коммуникацию и все такое. Вот для таких «ддосов» и нужны эти датацентры. Госзаказ у этой истории «окей, как нам захватить или развалить страну Х?» и дать им время на ответ. Извините, спойлер. А делать прототипы приложений, обобщать информацию, писать код, генерить видео, музыку и картинки — датацентры на этом не выживут.

А тем временем сегодня луна подешевела на 80%, до 18\2\100 рублей, а дипсик выкатил новый флэш без изменения цен за 12\0.2\25 рублей, но поумнел до уровня опуса 4.8. Такие модели придется сильно ужать, чтобы запустить на связке V100, а если брать железо на H100 — сотни штук зелени.

История попадалась на глаза давно — чел лет 10 назад решил майнить, прибыль поперла, на нее покупал новое железо. Но сложность росла быстрее, в итоге стоимость железа обнулилась, чистый итог копейки.

avatar
Тоже смотрю в сторону локалки.

Но у меня другая арифметика получается.

Модели 120b все слабенькие уже. Из современных с разумным объемом VRAM вроде получается только DeepSeek V4 Flash. Но это уже 320Gb.

V100 это шляпа на сегодня, но A100 80Gb пока еще нормуль.

В итоге надо 4 A100 + корпус на 8 A100 (возможность расширения) на плате SXM + охлад + Infiniband на оба конца (PCI-e слишком медленно для такого конфига).

У меня получается по минимуму 2,500,000 руб. на эксперимент (это я еще экономный и знаю, где покупать, продаваны хотят 5,000,000 руб. за такой конфиг).

Но это дорого. Жаба душит, блин. И прайсы в России конские в моменте.

Подумаем и подождем. Но H200, B200, и разные новые шляпы от Huawei не вариант — там итоговый прайс под 50 млн. рублей будет (((

С уважением
Мальчик buybuy, для DeepSeek V4 Flash достаточно 200Gb VRAM для полной версии при 256000 контекста.
Сейчас самый оптимальный недорогой вариант это кластер из DGX Spark.
Чувак собирал такой из 8шт для запуска большой модели, соединяются они через свитч, можно и больше объеденить.
avatar
Я пытаюсь для себя и для вас ответить на вопрос – является ли текущая волна хайпа по поводу AI и датацентров – пузырем или только началом длительного тренда.
Ежу понятно, что подписка сейчас дешевле, чем покупать себе монстра за много денег, превращать квартиру в датацентр, а самому становиться сисадмином. Если бы производители хотели, они бы выдали на рынок AI решения для физиков, однако это никому не выгодно. Ноутбучное гуано типа Ryzen AI 395 и т.п. — это просто дорогие игрушки, которые морально устареют за пару лет и никогда не окупятся. Так что с рынком все нормально, это не пузырь. Они собираются хорошо заработать на подписках, а не на дешевом железе для гиков.
avatar

Спасибо за пост! Тоже очень интересна эта тема, так как на ней завязан мой бизнес.

Ситуация действительно не в пользу обычного потребителя. Я думаю так: скорее всего, простым смертным никогда не удастся развернуть на домашней системе праймовую модель. Хотя, надо признать качество моделей на каждый 1GB VRAM растёт день ото дня. 

Для себя решил так: для своей личной работы использую топовые модели по подписке, а для моих бизнес задач (ИИ-боты для бизнеса) кручу локальную LLM-ку Qwen27B. И её вполне хватает и по качеству и по пропускной способности!
Для большинства бизнес-задач локальные LLM-ки уже очень качественно выполняют свою работу, хорошо работают с данными, следуют инструкциям, у них хороший русский язык, из них получается хороший ассистент общего плана. 

Виктор Свиридин, сейчас хайпят новый софт по имени Colibri, который позволяет конских размеров MoE модели запускать даже если они не помещаются в память (причем, даже без GPU) — работает правда довольно медленно. Можете с ней поэкспериметнировать, если места на диске хватит
avatar
Kimi 3 же moe, в видеопамяти для скорости надо держать только одного агента на 40 миллиардов параметров, там вроде ещё и квантование 4, так что 2 v100 хватит
avatar
Буба, рассуждения дилетанта не имеющего никакого опыта в этом, даже для запуска урезанного Q2 кванта нужно мин 800Gb памяти
avatar
Мне кажется, если нет понимания как превратить локальный ИИ в бабло лучше купить подписку.

А бабки лишние, лучше пустить на что то творческое — например купить трактор или два б/у сломаных, нанять слесаря чтоб отремонтировал и продать.
avatar

Читайте на SMART-LAB:
Фото
Бро, не забывай, что у нас осталось всего 2 месяца до московской конференции
Эх, как быстро летит время! Бро, не забывай, что у нас осталось всего 2 месяца до московской конференции . Чем позже берешь билет — тем...
Фото
Идеи Элвиса Марламова в ПИФ Аленка Капитал на август - пол портфеля опять пересобрано
Традиционно продолжаем следить за ПИФ Аленка Капитал от Элвиса Марламова Предыдущий пост про ПИФ Alenka Capital был месяц назад тут...
США нарастили госдолг до $40 трлн: в чем уроки для России?
Госдолг США, по данным американского Минфина, превысил $40 трлн при определенном Конгрессом потолке на уровне $41,1 трлн.  С 2017 года показатель...
Фото
Портовый срез #8: НМТП отгружает нефть, разворот в контейнерах и ставках
Порты России вместо привычной сверхмаржи и дохода для инвесторов стали мишенью для БПЛА противника. Перестали ли из-за этого они быть...

теги блога Гуру Хренов

....все тэги



UPDONW
Новый дизайн