На 3DNews / ServerNews Увидел интересную статью, которая даёт представление о стоимости развёртывания современных ИИ моделей.
Компания MWS Cloud (входит в МТС Web Services) проанализировала требования к вычислительной инфраструктуре для запуска ведущих мировых и российских больших языковых моделей.
Экспертную оценку прошли популярные открытые модели, выпущенные весной и летом соответствующего года.
Для 2025 года рассматривались Kimi K2, gpt-oss-120b, Gemma 3 27B, GLM-4.5V, Qwen3 235B и российская Cotype Pro 2.
Для 2026 года — Kimi K3, Qwen3.5 397B, DeepSeek-V4-Pro, DeepSeek-V4-Flash, GLM-5.2, Gemma 4 и Cotype Pro 3.
Исследование показало, что средняя стоимость минимального набора ускорителей NVIDIA для запуска одной модели увеличилась в 2,8 раза — с 13,7 млн руб. в 2025 году до 38,8 млн руб. в 2026 году.
2025 год

2026 год

Новые ИИ-модели становятся более мощными: они лучше справляются со сложными задачами и могут обрабатывать больше информации в одном запросе. Однако для этого им требуется больше памяти и более производительные GPU. При этом растёт и стоимость самих видеокарт, поэтому развёртывание моделей обходится дороже, пояснили в MWS Cloud результаты исследования.
Источник:
ServerNews.ruДанная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
ха-ха 2 раза, DeepSeek-V4-Pro, DeepSeek-V4-Flash в последних версиях ставятся на пару DGX Spark… если будет не 2, а 4 машины в кластере — будет айс!
если, конечно, Вы не собираетесь делать полное и быстрое обучение моделей ))) в противном случае бюджет, указанный выше надо умножать в 50-100 раз
Auximen, дядь, а дядь! речь идет про активные параметры, которые нужно держать в видеопамяти, а для остальных достаточно быстрого ССД, желательно 5.0… вот и фсё!
наслаждайтесь!
Auximen, Вы можете, конечно, замахнуться и купить 900 Гб видеопамяти, но нам, в нашей деревне, хватит и 2-х Спарков (и ещё 2 заказаны)… смесь экспертов и нужна для того, чтобы не тащить всё в видеопамять, а быстрый ССД 5.0 — для того, чтобы тусоваться туда-сюда постоянно...
все зависит от задачи… если у Вас постоянная задача, например, фигачить бульварные романы о любви, то Вам не нужны ВСЕ параметры под рукой… значит и обращение ко ВСЕМ будет нечастым… сами решите, что для Вас критично — 350 млн рублей в железе или количество токенов в минуту на выдаче?
Кстати Свитч стоит чуть дешевле одного Спарка
Напиши ему что он не прав и для MOE модели не нужно все загружать в VRAM, он извинится и напишет другой ответ
Очень содержательный ответ.
А теперь пишешь про Flash который примерно в ШЕСТЬ раз МЕНЬШЕ.
Ok
— то есть 96Gb НЕ хватит для DeepSeek4-Pro !
— Но вот 98Gb ТОЧНО хватит для DeepSeek4-Pro и все будет хорошо работать?
-----
Ну и с какой скоростью у вас будет работать на 98Gb VRAM?
Beach Bunny, конечно )) для тех, кто не умеет пользоваться межушным пространством иначе как для еды, показываю специально:
Auximen, а у ПРО всего 49В активных… для них достаточно 98 Гб видеопамяти + 30% на обработку и пр.
так что одного Спарка под ПРО недостаточно, нужно побольше — 2-3 штуки в зависимости от загрузки
Ho_Chu, угу, напиши какая у тебя будет скорость генерации при всего 96Gb VRAM для DeepSeek 4 Pro.
У меня вот DeepSeek4-Flash которая гораздо меньше, на 230Gb VRAM на RTX4090 дает 40 tok/sec генерации, для кванта Q8.
У тя же ДВА спарка и 256Gb VRAM и ты пишешь что этого больше чем достаточно для DeepSeek4-Pro.
Ну так и сколько у тебя токенов ?![]()
можно будет запустить
Qwen3.6-27B
Qwen3.6-35B
Qwen3.8-27B
в кванте Q4
лучше конечно 2 карты типа RTX3090
чтобы гонять теже модели но в лучшем качестве и большим размером контекста.
Та же DeepSeek4-Flash НЕ намного лучше этих Qwen а требования к железу у нее намного выше.
Плюс еще и нормального охлаждения нет, надо доделывать.
Так что тут лучше переплатить и взять че нит другое, типа Radeon Mi60 Mi50.
Или готовый Radeon 9700x или Intel Arc Pro B70
Да и LLM особо то ни чего не переберают, вообще нейронки не знанимаются перебором
Сильнее Qwen3.6-27B и Qwen3.8-27B
Qwen3.8-27B — самая сильная из мелких Qwen
А пока я решаю узкие задачи — говорю что где добавить или какой узкий функционал реализовать, и вот минимум что оставался это сейчас в клоде «6% left». Но тут я долго с ним работал в одной сессии.
Так что, видимо, надо исходить из тех задач, которые решаешь.
И будет 384Gb VRAM на которых можно будет запускать:
GLM-5.2 в Q4 с неплохой скоростью токенов 20-25
Kimi-Code-K2.7 в Q3
MiniMax-M3 будет быстро работать
и все что меньше по размеру в Q8 и быстро
------
Модели большего размера будут работать НЕ быстро, ну и оперативки RAM надо будет больше от 512Gb
========================
Можно и на RTX Spark собрать кластер, но какие скорости будут на Spark сказать не могу, ну и возможно на них будет невысокая скорость Prefill для больших моделей
Для комфортной работы — достаточно.
Какие нафиг 10 000 000? За 50к можно собрать.
Можено посмотреть в калькуляторе от Selectel (НЕ реклама) !
selectel.ru/services/vram-calculator/
и УЖАСНУТЬСЯ!
Потому что к примеру посмотрел скорость для GLM-5.2
на 8шт H200 квант FP8 — это типа Q8 но с плавающей запятой
ВСЕГО 20tok/sec
---------
После этого я понял, что у меня локально GLM-5.2 таки неплохо работает.
А Minimax-M3 таки вообще летает как космолет, быстрее чем у Selectel.