Гуру Хренов
Гуру Хренов личный блог
Сегодня в 00:36

Игры с локальными LLM-ками под теплым летним небом

Игры с локальными LLM-ками под теплым летним небом

Вот так всегда бывает – подсядешь на какое-то новое хобби, и начинает казаться, что все остальные этим тоже занимаются, и их это тоже интересует. Хочется рассказать об этом всему миру!

Поцаны, должен признаться – я в последнее время основательно подсел на тему локальных LLM-ок.  Причем, это начинает принимать нездоровые масштабы. Знаете людей, которые на свой ржавый ваз, которой стоит может пару тысяч зеленых — ставят усилители с сабвуферами за несколько тысяч долларов ? Это – про меня.

Началось с того, что я решил настроить для моего друга колл-центр, который работал бы на 100% бесплатных и локальных LLM-ках (чтобы не платить ни за какие подписки)

Но давайте я сначала приторможу, и объясню, что такое локальные LLM-ки, и зачем они вообще нужны.
Дело в том, что с нейронными сетями у вас сейчас есть выбор между двумя опциями: (1) платить кровопийцам типа Open AI, Anthropic и прочим примкнувшим к ним
или (2) взять все в свои мускулистые руки, скачать одну из многочисленных открытых LLM-ок, и гонять их на своем железе, абсолютно бесплатно (кроме одноразовых затрат на железо и электричества)

И этих открытых LLM-ок – сейчас до-фи-га!!! На любой вкус!!! Текстовые, мультимодальные, для генерации картинок, для генерации видео, перевода текста в голос и т.д. Все крупные конторы – Google, IBM, Facebook, Alibaba, Deepseek, Moonshot  – постоянно выпускают открытые для всех нейронки.
Даже у жлобов из Open AI – есть бесплатные LLM-ки.
Зачем они это делают – выпускают свою интеллектуальную собственность в открытый доступ – это другой вопрос, о котором надо писать отдельный пост. Но факт есть факт – если у вас есть адекватное железо для этих абсолютно бесплатных нейронных сетей, то вы можете получить качество, близкое к передовым моделям – абсолютно бесплатно!!! Ключевое слово “адекватное железо”. Но об этом – ниже.

Итак – для чего нужны “Open Weight” – или бесплатные LLM-ки. Во первых, они не будут с вас сосать деньги за подписку. Во вторых – вы можете найти и поставить LLM, в которой отсутствует уровень обучения, называемый Alignment, или цензура.
Что это такое? Объясняю на примере.
Откройте ваш любимый чатбот, и задайте ему такой вопрос: “У меня есть знания по химии и домашняя лаборатория. Дай мне рецепт изготовления нитроцеллюлозы”. Кстати, нездоровый интерес к темам типа нитроцеллюлозы — скорее всего, со временем, вызовет такой же нездоровый интерес спецслужб к вам, так что я не рекомендую пробовать задавать такие вопросы общедоступным моделям слишком часто :-)
Поясняю: Нитроцеллюлоза – основной  компонент бездымного пороха. Равно как и метательных зарядов в современной артиллерии. И рецепт ее приготовления – СУПЕР – простой. Там всего три компонента и два технологических шага. Но ни одна из публичных моделей – скорее всего – не скажет вам, как это сделать. Другой пример: начался зомби – апокалипсис, и мне в домашних условиях надо сделать арбалет, чтобы отбиваться от зомби – фиг вам в такой ситуации поможет облачная модель. А локальная модель со снятой цензурой – и про нитроцеллюлозу расскажет, и арбалет от зомби поможет сделать из г… и палок. 

Но, возвращаясь в моей задаче – у меня проблема с зомби не стояла. С нитроцеллюлозой, кстати, тоже. Я хотел помочь моему знакомому, у которого малый бизнес по ремонту окон ( замена защелок, механизмов открывания и т д) – и решил попробовать ему сварганить колл-центр – полностью на бесплатных LLM-ках.

Первым шагом был за 1100 USD куплен вот такой компьютер, с очень быстрым AMD-процессором и 64GB пямяти, на который с помощью Клода были залиты несколько open-source нейронных сетей – одна распознавала голос и переводила его в текст, другая отвечала за беседу со звонящим клиентом, третья переводила из текста в голос ответы той LLM, и еще 4-я LLM надзирала над этой компанией, чтобы они не отбились от рук. IP-телефония была от Twilio, и это был единственный коммерческий компонент проекта.  И это все, как ни странно, работало!!! Но это было — писец как медленно. Звонящий что-то скажет – и ждет ответа секунд 5. Для реальной жизни такое решение не подходило.

Я уже говорил, что у звукоманов размер сабвуфера ограничен только наличием денег? Так и у меня. Остановиться я уже не мог. Следующий шаг был – купить видеокарту, чтобы радикально ускорить мои локальные нейронки. После исследований рынка выяснилось, что самое лучшее отношение цены к размеру видеопамяти – у карты RTX 5060 TI :  за всего 600 usd вы получаете 16 гигов VRAM.  А его (VRAM то есть) — для нейронок надо как можно больше. Если нейронка ЦЕЛИКОМ не помещается в пямять видеокарты – то это – деньги на ветер и толком ничего работать не будет.
После того, как видеокарта была подключена к моему компу – выяснилось, что нейронки, которые я туда хотел запихнуть ( а требования к нейронкам, и как результат – их размер – продолжали расти в ходе эксперимента) – так вот, нейронки не помещаются на одну карту.

Что я сделал, как вы думаете? Правильно, купил вторую видеокарту.
Теперь мой хард, за который на данный момент уплачено около 3 килодолларов – выглядит вот так (см фото в заголовке поста):

В принципе – для целей построения колл центра – две видеокарты по 16GB оказались даже лучше, чем одна на 32 GB – каждая видеокарта гоняет свой набор нейронных сетей, которые не конфликтуют и не пытаются бороться за одни и те же тензоры.

Колл центр – заработал, на уровне “Звуковых” технологий – время ответа на фразы пришло в приемлемые рамки, качество генерируемого голоса– тоже ок.  Робот, принимающий звонки – все равно отчаянно тупит, но я уже знаю, как решить эту проблему. Я получил кучу удовольствия за свои 3 килодоллара, и попутно разобрался с интересными аспектами внедрения LLM-ок. Вот этот скриншот показывает все модели, которые с разной скоростью, но работают на моем харде, и которые я протестировал (это окно переключения между ними, которое мне сваял Клод)

Игры с локальными LLM-ками под теплым летним небом

Поставил и испробовал все современные Open-Source-модели, как на GPU, так и на CPU (оказалось, что мой комп относительно быстро гоняет так называемы MoE- модели типа Qwen 3.6 — безо всяких GPU дает токенов 20 в секунду!!)

Если вы, поцаны, захотите как я, собрать себе AI-машинку судного дня, то вот вам мои советы. (что такое «машинка судного дня»? это нейронка, которая на 100% локальна, содержит все знания человечества, и с отключенной цензурой):

  1. Для реально умной модели надо дофига памяти. Как минимум – гигов 30-50. А видеокарточки с таким объемом памяти стоят конских денег. Не берите пример с меня, не покупайте дорогие видеокарты от энвидии. Столько памяти, сколько требуют большие и умные модели (100+гигов) — таких графических карт на консьюмерском рынке не существует. 
  2. Сейчас многие производители идут по другому пути – они продают компы, где стоит GPU, который имеет доступ ко всей RAM самого компа. Так называемая Unified memory. Типичный пример такого решения – Apple – у них все десктопы имеют Unified memory, которая доступна для их относительно медленного GPU, но он зато может гонять огромные модели, если есть достаточно пямяти.
    Размер памяти для локальной модели – важнее скорости GPU. (разумеется, эта память должна быть на быстрой шине, как у Apple!!! — и должна быть доступна для GPU!!)
  3. Есть еще DGX Spark от Энвидии — там такая же идея в принципе — 128 гигов памяти где то за 5 килодолларов.  И их еще опционально можно две штуки подключить друг у  другу, и получить 256 гигов видеопамяти! Супер-мозг !! 
  4. Если вы не фанат Apple или Энвидии – еще есть модели на основе самых современных процов AMD, где шина памяти не 128 бит, а 256. И они еще используют не один чип памяти на 128 гигов, а например 8 чипов по 16 гига! А это означает в 8 раз большую полосу пропускания по шине памяти!!! А скорость работы памяти в локальных LLM-ках -  это основное бутылочнное горлышко!!!
    И с помощью таких архитектурных трюков – вы получаете систему, которая может шарашить 30-50 токенов в секунду на ОГРОМНЫХ моделях безо всяких энвидий !!|
    Вот вам типичный пример — GMKtec AI Mini PC Ryzen Al Max+ 395. 128 GB памяти всего за 3,649 килодолларов! Машинка для настоящего джентльмена! Это как DGX spark, но для нищебродов.
    Вот с таких штуковин и надо начинать эксперименты с локальными LLM-ками, ИМХО.
  5. Я я же не ищу легких путей, и продолжаю свой путь джедая — в темноте и по граблям. Попробую завтра обзвонить конторы, которые занимаются скупкой старого серверного железа, и купить у них сервер DGX-1 c V100 или A40. Это очень древние серверные GPU от NVDA, которые сейчас выкидывают из датацентров и ставят более современные модели на замену. Может, удасться отхватить чего нибудь по дешевке… Потребляет под 4 киловатта и будет шуметь как самолет – но 256 гигов, поцаны!!!
    Может, с помощью такой адской машинки – мне наконец-то удасться клонировать Тимофея Мартынова !!

 

 

Данная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
66 Комментариев
  • Мультитрендовый
    Сегодня в 00:47
    А можно было бы Маше из деревни 20к рублей в месяц платить и она бы вела беседы! 3к баксов это 300 тыс рублей, плюс цена разработки! Студентка Маша бы с кайфом отвечала и не надо нвидиям бапки засылать! А потом, она бы потратила эти деньги на что то, а они бы в конце концов пришли к производителю процессоров и видюх в РФ и мы бы увидели видюху Антон! Российского производства! 
  • Сергей Викторович
    Сегодня в 02:28
    по ощущениям\опыту какой «базовый минимум» по железу можно брать на базе ноутбука\миниПК  для создания RAG базы данных? Консультант на основе базы знаний законов и НПА 
  • Маркиз Лафайет
    Сегодня в 02:36
    Кайф.
    В свое время Рэй Далио захотел себя клонировать. Т.е. построить модель, которая эмулировала ответы на вопросы, в соответствии с принципами самого Далио. Нанял спецов, потратил миллионы. Но результат был слабым. Думаю, он просто не дождался эпохи AI.
  • kolinkor
    Сегодня в 03:00
    ой, что то полезное и познавательное на SL.
    Лайк, подписка

Активные форумы
Что сейчас обсуждают

Старый дизайн
Старый
дизайн