Блог им. Division_by_zero

Игры с локальными LLM-ками под теплым летним небом

Игры с локальными LLM-ками под теплым летним небом

Вот так всегда бывает – подсядешь на какое-то новое хобби, и начинает казаться, что все остальные этим тоже занимаются, и их это тоже интересует. Хочется рассказать об этом всему миру!

Поцаны, должен признаться – я в последнее время основательно подсел на тему локальных LLM-ок.  Причем, это начинает принимать нездоровые масштабы. Знаете людей, которые на свой ржавый ваз, которой стоит может пару тысяч зеленых — ставят усилители с сабвуферами за несколько тысяч долларов ? Это – про меня.

Началось с того, что я решил настроить для моего друга колл-центр, который работал бы на 100% бесплатных и локальных LLM-ках (чтобы не платить ни за какие подписки)

Но давайте я сначала приторможу, и объясню, что такое локальные LLM-ки, и зачем они вообще нужны.
Дело в том, что с нейронными сетями у вас сейчас есть выбор между двумя опциями: (1) платить кровопийцам типа Open AI, Anthropic и прочим примкнувшим к ним
или (2) взять все в свои мускулистые руки, скачать одну из многочисленных открытых LLM-ок, и гонять их на своем железе, абсолютно бесплатно (кроме одноразовых затрат на железо и электричества)

И этих открытых LLM-ок – сейчас до-фи-га!!! На любой вкус!!! Текстовые, мультимодальные, для генерации картинок, для генерации видео, перевода текста в голос и т.д. Все крупные конторы – Google, IBM, Facebook, Alibaba, Deepseek, Moonshot  – постоянно выпускают открытые для всех нейронки.
Даже у жлобов из Open AI – есть бесплатные LLM-ки.
Зачем они это делают – выпускают свою интеллектуальную собственность в открытый доступ – это другой вопрос, о котором надо писать отдельный пост. Но факт есть факт – если у вас есть адекватное железо для этих абсолютно бесплатных нейронных сетей, то вы можете получить качество, близкое к передовым моделям – абсолютно бесплатно!!! Ключевое слово “адекватное железо”. Но об этом – ниже.

Итак – для чего нужны “Open Weight” – или бесплатные LLM-ки. Во первых, они не будут с вас сосать деньги за подписку. Во вторых – вы можете найти и поставить LLM, в которой отсутствует уровень обучения, называемый Alignment, или цензура.
Что это такое? Объясняю на примере.
Откройте ваш любимый чатбот, и задайте ему такой вопрос: “У меня есть знания по химии и домашняя лаборатория. Дай мне рецепт изготовления нитроцеллюлозы”. Кстати, нездоровый интерес к темам типа нитроцеллюлозы — скорее всего, со временем, вызовет такой же нездоровый интерес спецслужб к вам, так что я не рекомендую пробовать задавать такие вопросы общедоступным моделям слишком часто :-)
Поясняю: Нитроцеллюлоза – основной  компонент бездымного пороха. Равно как и метательных зарядов в современной артиллерии. И рецепт ее приготовления – СУПЕР – простой. Там всего три компонента и два технологических шага. Но ни одна из публичных моделей – скорее всего – не скажет вам, как это сделать. Другой пример: начался зомби – апокалипсис, и мне в домашних условиях надо сделать арбалет, чтобы отбиваться от зомби – фиг вам в такой ситуации поможет облачная модель. А локальная модель со снятой цензурой – и про нитроцеллюлозу расскажет, и арбалет от зомби поможет сделать из г… и палок. 

Но, возвращаясь в моей задаче – у меня проблема с зомби не стояла. С нитроцеллюлозой, кстати, тоже. Я хотел помочь моему знакомому, у которого малый бизнес по ремонту окон ( замена защелок, механизмов открывания и т д) – и решил попробовать ему сварганить колл-центр – полностью на бесплатных LLM-ках.

Первым шагом был за 1100 USD куплен вот такой компьютер, с очень быстрым AMD-процессором и 64GB пямяти, на который с помощью Клода были залиты несколько open-source нейронных сетей – одна распознавала голос и переводила его в текст, другая отвечала за беседу со звонящим клиентом, третья переводила из текста в голос ответы той LLM, и еще 4-я LLM надзирала над этой компанией, чтобы они не отбились от рук. IP-телефония была от Twilio, и это был единственный коммерческий компонент проекта.  И это все, как ни странно, работало!!! Но это было — писец как медленно. Звонящий что-то скажет – и ждет ответа секунд 5. Для реальной жизни такое решение не подходило.

Я уже говорил, что у звукоманов размер сабвуфера ограничен только наличием денег? Так и у меня. Остановиться я уже не мог. Следующий шаг был – купить видеокарту, чтобы радикально ускорить мои локальные нейронки. После исследований рынка выяснилось, что самое лучшее отношение цены к размеру видеопамяти – у карты RTX 5060 TI :  за всего 600 usd вы получаете 16 гигов VRAM.  А его (VRAM то есть) — для нейронок надо как можно больше. Если нейронка ЦЕЛИКОМ не помещается в пямять видеокарты – то это – деньги на ветер и толком ничего работать не будет.
После того, как видеокарта была подключена к моему компу – выяснилось, что нейронки, которые я туда хотел запихнуть ( а требования к нейронкам, и как результат – их размер – продолжали расти в ходе эксперимента) – так вот, нейронки не помещаются на одну карту.

Что я сделал, как вы думаете? Правильно, купил вторую видеокарту.
Теперь мой хард, за который на данный момент уплачено около 3 килодолларов – выглядит вот так (см фото в заголовке поста):

В принципе – для целей построения колл центра – две видеокарты по 16GB оказались даже лучше, чем одна на 32 GB – каждая видеокарта гоняет свой набор нейронных сетей, которые не конфликтуют и не пытаются бороться за одни и те же тензоры.

Колл центр – заработал, на уровне “Звуковых” технологий – время ответа на фразы пришло в приемлемые рамки, качество генерируемого голоса– тоже ок.  Робот, принимающий звонки – все равно отчаянно тупит, но я уже знаю, как решить эту проблему. Я получил кучу удовольствия за свои 3 килодоллара, и попутно разобрался с интересными аспектами внедрения LLM-ок. Вот этот скриншот показывает все модели, которые с разной скоростью, но работают на моем харде, и которые я протестировал (это окно переключения между ними, которое мне сваял Клод)

Игры с локальными LLM-ками под теплым летним небом

Поставил и испробовал все современные Open-Source-модели, как на GPU, так и на CPU (оказалось, что мой комп относительно быстро гоняет так называемы MoE- модели типа Qwen 3.6 — безо всяких GPU дает токенов 20 в секунду!!)

Если вы, поцаны, захотите как я, собрать себе AI-машинку судного дня, то вот вам мои советы. (что такое «машинка судного дня»? это нейронка, которая на 100% локальна, содержит все знания человечества, и с отключенной цензурой):

  1. Для реально умной модели надо дофига памяти. Как минимум – гигов 30-50. А видеокарточки с таким объемом памяти стоят конских денег. Не берите пример с меня, не покупайте дорогие видеокарты от энвидии. Столько памяти, сколько требуют большие и умные модели (100+гигов) — таких графических карт на консьюмерском рынке не существует. 
  2. Сейчас многие производители идут по другому пути – они продают компы, где стоит GPU, который имеет доступ ко всей RAM самого компа. Так называемая Unified memory. Типичный пример такого решения – Apple – у них все десктопы имеют Unified memory, которая доступна для их относительно медленного GPU, но он зато может гонять огромные модели, если есть достаточно пямяти.
    Размер памяти для локальной модели – важнее скорости GPU. (разумеется, эта память должна быть на быстрой шине, как у Apple!!! — и должна быть доступна для GPU!!)
  3. Есть еще DGX Spark от Энвидии — там такая же идея в принципе — 128 гигов памяти где то за 5 килодолларов.  И их еще опционально можно две штуки подключить друг у  другу, и получить 256 гигов видеопамяти! Супер-мозг !! 
  4. Если вы не фанат Apple или Энвидии – еще есть модели на основе самых современных процов AMD, где шина памяти не 128 бит, а 256. И они еще используют не один чип памяти на 128 гигов, а например 8 чипов по 16 гига! А это означает в 8 раз большую полосу пропускания по шине памяти!!! А скорость работы памяти в локальных LLM-ках -  это основное бутылочнное горлышко!!!
    И с помощью таких архитектурных трюков – вы получаете систему, которая может шарашить 30-50 токенов в секунду на ОГРОМНЫХ моделях безо всяких энвидий !!|
    Вот вам типичный пример — GMKtec AI Mini PC Ryzen Al Max+ 395. 128 GB памяти всего за 3,649 килодолларов! Машинка для настоящего джентльмена! Это как DGX spark, но для нищебродов.
    Вот с таких штуковин и надо начинать эксперименты с локальными LLM-ками, ИМХО.
  5. Я я же не ищу легких путей, и продолжаю свой путь джедая — в темноте и по граблям. Попробую завтра обзвонить конторы, которые занимаются скупкой старого серверного железа, и купить у них сервер DGX-1 c V100 или A40. Это очень древние серверные GPU от NVDA, которые сейчас выкидывают из датацентров и ставят более современные модели на замену. Может, удасться отхватить чего нибудь по дешевке… Потребляет под 4 киловатта и будет шуметь как самолет – но 256 гигов, поцаны!!!
    Может, с помощью такой адской машинки – мне наконец-то удасться клонировать Тимофея Мартынова !!

 

 

Данная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
    | ★24
    #1 по плюсам, #1 по комментариям
    28 комментариев
    А можно было бы Маше из деревни 20к рублей в месяц платить и она бы вела беседы! 3к баксов это 300 тыс рублей, плюс цена разработки! Студентка Маша бы с кайфом отвечала и не надо нвидиям бапки засылать! А потом, она бы потратила эти деньги на что то, а они бы в конце концов пришли к производителю процессоров и видюх в РФ и мы бы увидели видюху Антон! Российского производства! 
    Мультитрендовый, забеременеет или бросит. Люди, не надёжная субстанция.
    avatar
    Alexandr Dolbnev, ну так и автор сам не робот, один раз живём
    Мультитрендовый, Российским производителям чего? У нас нет своего производства процессоров (военные не берем в расчет, это особая тема и они все еще выше 200 Нм, но там шибко нет необходимости в 4-7 Нм техпроцессе. Деньги вернутся в Китай, так как Маша накупит всякого на маркетплейсах, а основная масса товара из того самого Китая.
    по ощущениям\опыту какой «базовый минимум» по железу можно брать на базе ноутбука\миниПК  для создания RAG базы данных? Консультант на основе базы знаний законов и НПА 

    Сергей Викторович, RAG — это совсем другая история. Там тоже нужна нейронная сеть для генерации Embeddings, но их надо генерить только один раз, для конкретного запроса, если что то опрашивать в real time (Для начального наполнения векторной базы данных — эти embeddings тоже надо вызывать, и вызывать много, но это надо делать один раз, и можно подождать -  там время некритично)

    Короче — RAG — это та штука, которая, наверное, могла бы работать на обычном PC без проблем (для прототипирования — сгодится)

    Забыл упомянуть еще момент — при наполнении векторной базы данных — хорошо еще сделать правильный Chunking (разбиение на куски) — и — возможно — суммирование знаний / сжатие текстов, чтобы убрать из них всю «воду» — для этого тоже желательно использовать отдельную LLM-ку, но она не обязательно должна быть слишком умной (разбиение на куски и суммирование — не сложные задачи). Тут размер контекста важней «умности» модели.  Какая нибудь небольшая Gemma или Granite — подойдет. И тут уже надо — вместе с embedding — моделью, которая будет работать на том же железе — наверное как минимум 32 гига памяти, и чтобы проц не слишком медленный. Все это без правильных GPU будет тошнить с скоростью улитки, но заполнение векторной БД — это надо сделать всего один раз, можно и подождать.

    Блин!!! забыл упомянуть еще один момент — если база знаний в разных форматах типа pdf / word или упаси господь отсканированные документы, которые еще надо в текст перевести, или диаграммы какие нибудь — вот тут вы попали. Потому что — чтобы перевести все эти разные форматы в удобноваримые логичные chunks — тут никакой локальной модели не хватит, конечно же. Тут нужна приличная коммерческая модель, мульти-модальная, чтобы понимала все форматы. Готовьтесь платить за токены, если этот сценарий описывает Ваш случай !

    Гуру Хренов, купил на авито 2 недели назад для подобных целей rtx2060 12гб за 13к рублей.
    (чуть дороже чем по гб за 1к)

    Есть материнки куда влезают 4 таких карты.
    дунвольтишь их — чтобы ядра работали медленнее — там главное память.

    и у тебя 48гб видеопамяти на 4 видеокартах.
    (50к рублей)

    +xeon 12 ядер + 32gb + серверная материнка которая имеет 4 выхода (или переходная видеокарта)
    (30к)
    за примерно 1к usd.


    а еще есть майнинговые видеокарты.
    там ~20гб вообще за ~15к рублей.
    можно собрать 80гб видеопамяти за 1к usd в сборе...

    но тут придется с драйверами морочится.
    и подбирать чтобы слои ллм модели ложились так чтобы между видеокартами было мало обмена данными.
    так урезана шина данных.


    и да сами рабочие проекты строго платят за токены.
    — так как там главное требование маштабирование проекта у клиента.
    а этот только покупать именно токены.

    и еще один момент что твой ллм отвечает на вопрос «чей крым»
    есть проблемы с подобным пулом стоп вопросов.
    и решение этих проблем тоже стоит денежек.
    (самая дорогая часть для проектов в РФ)
    avatar
    Кайф.
    В свое время Рэй Далио захотел себя клонировать. Т.е. построить модель, которая эмулировала ответы на вопросы, в соответствии с принципами самого Далио. Нанял спецов, потратил миллионы. Но результат был слабым. Думаю, он просто не дождался эпохи AI.

    Маркиз Лафайет, почему же, раз он еще жив — значит, дождался! Буквально два дня назад слушал интервью с ним на подкасте MFM ( My first million)
    не уверен, что миру нужен еще один такой зануда

    ой, что то полезное и познавательное на SL.
    Лайк, подписка
    avatar
    Поставил и испробовал все современные Open-Source-модели, как на GPU, так и на CPU (оказалось, что мой комп относительно быстро гоняет так называемы MoE- модели типа Qwen 3.6 — безо всяких GPU дает токенов 20 в секунду!!)
    Угу я так и поверил.
    И как ты на своей доходяге запускал GLM-5.2 или Kimi-2.7 — они оперсорсные.
    Ну или хотя бы MiniMax-M3 или MiMo-V2.5 ?
    Комп у тя в общем мусорный, лучшее что на нем можно запустить это  Qwen3.6-27B или Qwen3.6-35B.
    И ФСЕ.
    Для всего остального желательно 200Gb VRAM и оперативки от 220Gb.
    Но это не для смартлабовских нищебродов.
    Комп нужен либо на EPYC либо на последних Intel Ultra типа i7 265K.
    — EPYC — можно подлключить 8 и больше видюх и памяти много и в многоканале
    — Intel Ultra — можно воткнуть 256Gb быстрой DDR5 6000 и это будет стабильно работать в отличии от AMD, но только max 256Gb — и это сейчас будет стоить $6000 — только за память. Для EPYC можно взять DDR4 намного дешевле. Ну в Intel на хорошей плате можно 7-8 видюх воткнуть через переходники.

    И видюхи нужны хорошие NVidia от 48Gb на каждой.
    Одна штука от $4400 — это минимум.


    avatar
    последних Intel Ultra типа i7 265K.

    270к plus намного быстрее, уже продаются, и недорого.

    7-8 видюх воткнуть через переходники. И видюхи нужны хорошие NVidia от 48Gb на каждой.

    тогда уж дешевле мак студию с 512гб
    Олег Иванов, дешевле всего этой шляпой не заниматься. Самое главное ниче в мире от этого не изменится
    avatar
    Балаган, онтологическая природа цифрового артефакта, будь то Mac Studio или иная кремниевая матрица, неизбежно трансцендирует материальную оболочку, обнажая глубинную диалектику желания. Эпистемологический горизонт нашего восприятия техники редуцируется до прагматической утилитарности, тогда как телеологическая направленность на апгрейд отражает экзистенциальный поиск суррогатной полноты. Аксиологическая иерархия ценностей в условиях постиндустриального капитализма подвергается семантической эрозии, поскольку феноменологический анализ любой «шляпы» раскрывает иллюзорность технологического детерминизма. Гносеологическая парадигма подсказывает, что мир не трансформируется от перераспределения терабайт, а метафизическая индифферентность космоса остаётся незыблемой перед лицом наших конфигураций. Онто-эпистемологический разрыв между виртуальным и реальным лишь кажущимся образом заполняется гигабайтами, в то время как прагматический нигилизм, скрывающийся за тезисом о неизменности бытия, заслуживает критической рефлексии. Динамика существования не подчиняется алгоритмическому императиву, но резонирует с аутентичным экзистенциальным выбором, где апофатический подход к технике обнажает пустоту, которую мы тщетно стремимся заполнить аппаратной мощностью. Диалектика потребления и аскезы выявляет онтологическую амбивалентность современного субъекта, чья космологическая масштабность не зависит от тактовой частоты процессора или объёма оперативной памяти. Эпистемическая скромность диктует признание, что ни один накопитель не станет панацеей от экзистенциальной тревоги, поскольку телеология развития смещается от аккумуляции ресурсов к рефлексивному осмыслению их онтологической цены. Феномен «незачемности» апгрейда обнажает гносеологический предел материального прогресса, тогда как онтологическая инерция реальности сопротивляется попыткам перепрограммировать её через железо. Истинная трансформация рождается не в спецификациях, а в осознанном отказе от иллюзорных гарантий контроля, ибо синкретичность бытия подтверждает: мир изменится лишь тогда, когда мы перестанем искать его в коробке.
    Успехов вам и желательно промежуточные итоги ваших достижений выкладывайте на форум. Очень интересен конечный ценник всего достойно работающего колл-центра.
    avatar
    Хорошая тема, может кого и заинтересует
    Вот уж действительно нихера не понял, но очень интересно.
    avatar
    А как удалось две видеокарты подключить к одному usb4?
    avatar
    StuffyAl, JHL7440 выдает pcie x4, наверно их можно поделить по 2 х2 
    avatar
    мне для моих задач надо ставить DeepSeek V4-Pro на локалке… а это уже от 98 Гб видеопамяти и даже DGX не тянет… и EVO-X3 395+ не тянет, но до конца года обещают EVO-X3 с 495+ — вот там будет уже 192 Гб общей, из которой под видео можно будет выделять 160 Гб — там и попробуем развернуть все свои хотелки... 
    avatar
    кстати, на ебэе встречаются карты NVidia RTX 6000 Q-Max с 96 Гб видеопамяти по 3-5Кб, но покупать там стрём, да и 96 < 98 так что надо брать 2 штуки, а это уже недешево для экспериментов… а новые так вообще по 10-13 Кб
    avatar
    лучше 3090  покупать  
    Миллиардер из Сибири, чем лучше? там можно кажется допаять памяти и работает одна связка из двух карт. Но это тоже макс 96гб vram, и 407b модели не пойдут.
    avatar
    Crogall, память. 3900 ti сейчас самая выгодная покупка. точно лучше чем 5600ti. Поймут или нет большие модели — другой вопрос. Деньги то не бесконечные. более старые проф.карты вроде v100 не поддерживают многие вещи. например bf16, fp8 да и много чего ещё.
    Миллиардер из Сибири, так суть не в скорости даже, а в больших моделях. Смысла быстро гонять модель 7b никакого нет. А на большее 25гб не хватит. Нейронные модули в процессорах задействуют оперативную память, но их не выпустили еще
    avatar

    есть несколько замечаний:
    1. вопрос: как по итогу работает кол центр, принес ли он твоему приятелю денег от таких дозвонов? или баги с задержками звука свели это на нет?

    2. Ты изучал тему распределения между vram разных видеокарт? чтобы работали параллельно?

    3. Процессоры с нейронными ядрами, которые на пк еще не выпущены, а значит использовать оперативную память для запуска моделей это только ограничения в мини пк 128гб (407b модели не влезут, а значит тупые и долго дообучать). В ноутбуках же только 96 макс (128гб и 256гб(4шт) есть но дорого и редкость.

    4. Сам ищу применения локальным моделям ии на параллельных gpu, но не могу найти.

    avatar

    Читайте на SMART-LAB:
    Не верим эмоциям, доверяем расчету
    Российский фондовый рынок продолжает переживать период повышенной волатильности . Короткие этапы роста сменяются новыми распродажами, а индекс...
    НОВАТЭК в целом успешно провел первое полугодие
    Акции НОВАТЭКа в ходе торгов 24 июля падают на 1,9%, до 982,2 руб., на более интенсивно корректирующемся рынке.НОВАТЭК представил результаты по...
    Фото
    Мнение аналитиков. Банк России снизил ставку до 14% — что делать?
    Сегодня на заседании Банк России снизил ключевую ставку до 14%. Решение стало сюрпризом для рынка — умеренно позитивно. Главное •...

    теги блога Гуру Хренов

    ....все тэги



    UPDONW
    Новый дизайн