Комментарии пользователя Гуру Хренов

Мои комментарии:в блогах в форуме
Ответы мне:в блогах в форуме
Все комментарии: к моим постам
BBAA, qualcom купил недавно Modular, так что у вас есть шанс дождаться, они явно двигаются в этом направлении
avatar
  • 29 июля 2026, 02:15
  • Еще
Laukar, языковые модели, если вы их имеете в виду — это очень плохая технология для трейдинга по моему
avatar
  • 29 июля 2026, 02:12
  • Еще
Ho_Chu, это так было может 2-3 года назад. Сейчас подписка на claude code — это все, что надо джентльмену
avatar
  • 29 июля 2026, 02:10
  • Еще
Миллиардер из Сибири, с этим не поспоришь! Память — главное! Это я тоже понял!
avatar
  • 29 июля 2026, 02:07
  • Еще
psydub, стопроцентов это делается дешевле и проще — существует куча фреймворков для построения колл центров, как коммерческих, так и бесплатных. Цель моего уникального проекта — сделать все на локальных и бесплатных LLM-ках
avatar
  • 29 июля 2026, 02:02
  • Еще
DrManhattan, так я и отношусь! Я для себя давно уяснил (и не только я) — что вино 10 долларов за бутылку не отличается в слепом тесте от 30 долл
avatar
  • 28 июля 2026, 15:59
  • Еще
Sispipis, в основном ходил в британский музей — охренительное место, на которое надо потратить дня 2 как минимум
avatar
  • 28 июля 2026, 15:57
  • Еще
Владимир, так 65 процентов — этож дофига! Я сам только процентов 30 понял из того, что написал
avatar
  • 28 июля 2026, 15:53
  • Еще
Обитатель матрицы, самому ничего грузить не надо. Надо говорить клоду, чтобы он это сделал !

avatar
  • 27 июля 2026, 22:06
  • Еще
Сергей Викторович, погуглите или поспрашивайте вашего Клода про chunking (разбиение базы знаний на правильные куски перед их векторизацией) — он вам распишет все подходы. Правильный, умный chunking (а еще лучше — с суммаризацией) — сильно улучшит ваш RAG
avatar
  • 27 июля 2026, 16:32
  • Еще
Andy80U, если мне будет не лень это сделать, то я клонирую голос Тимофея, и попробую настроить агента, который его голосом продавал бы подписки на мозговик :-)
avatar
  • 27 июля 2026, 16:26
  • Еще
Ho_Chu, живем в такое время, что для проверки идей у нас есть Клод Код — он решает самую сложную технически часть проблемы — программирование и интеграцию. При этом. для дизайна любой системы — все равно надо понимать предметную область и архитектуру, конечно. Но стоимость экспериментов — это снижает радикально
avatar
  • 27 июля 2026, 16:24
  • Еще
Андрей К, что никогда не окупится — это само собой! Я рассматриваю это как эксперимент, чтобы разобраться с аспектами применения (и мне это удалось — я выяснил, как работает KV-cache, как его правильно использовать, как вообще уменьшать контекст с помощью суммирования предыдущего разговора, и куча куча других вещей — например, что для того, чтобы слушать звонящего и переводить все это в текст — обязательно нужна нейронка, потому что только она сможет правильно опередить, когда человек закончил фразу, а когда он просто завис и думает, что дальше сказать. Без такой нейронки на входе система ведет себя тупо и просто перебивает звонящего при любой паузе в разговоре, потому что думает, что он закончил говорить
Еще есть так называемый barge in — когда мне AI — агент отвечает голосом, а я его перебиваю. AI- агент, точнее его TTV компонент — должен не только остановиться в середине фразы и начать меня слушать, но и пометить ту фразу, которую он пытался до меня донести — как не услышанную. Чтобы LLM-ка потом не предполагала, что я получил эту инфу, и чтобы повторила ее при удобном случае в одном из следующих turns
avatar
  • 27 июля 2026, 16:22
  • Еще
Миллиардер из Сибири, я рассматривал это как опцию, но в моих краях он стоит 1500 USD. 5060 ti — это на пару поколений лучше и быстрее вроде
avatar
  • 27 июля 2026, 14:44
  • Еще

StuffyAl, супер — хороший вопрос — после покупки второго GPU — экспериментальным путем выяснилось, что мой мини-PC имеет только один разъем USB4 — второй идентичный разьем (они оба выглядят как USB-C) — оказался обычным, не скоростным USB
Пришлось купить небольшой адаптер интерфейса Oculink, воткнуть его в свободный M2 — слот внутри, и аккуратно вывести шлейф с коннектором наружу через щель в корпусе — это на моей заглавной фотке в посте видно — черный GPU  подключен как раз через Oculink. 

avatar
  • 27 июля 2026, 15:05
  • Еще

Petr S, тут есть несколько моментов
Во-первых, у самого мини-компа, как выяснилось, есть своя собственная GPU Radeon 780M — и она может распоряжаться всей его памятью — всеми 64 GB (плюс, мне повезло, что в этом компе стоит 2 модуля по 32 — то есть скорость увеличивается вдвое). То есть, только на самом компе, безо всяких энвидий — мне удалось запустить довольно большую Gemma 4 31B c 8-мибитной квантизацией — и она выдает токенов 7-10 в секунду

Что касается  qwen 3.5-35B-A3B — там часть слоев и параметров запущена на Энвидии, часть работает на CPU — выдает 30-35 токенов в секунду.

avatar
  • 27 июля 2026, 15:03
  • Еще

Vyacheslav Ivanenkov, RAG, конечно же, в этой системе тоже предусмотрен. Как и векторная, как и обычная реляционная БД, конечно

Вообще, в процессе разработки всей этой системы — я понял, что полагаться на интеллект одной только LLM-ки в разговоре с клиентом, и ожидать, что она будет следовать своим инструкциям — это дохлый номер, особенно — с относительно небольшими LLM-ками, у которых отключен режим Reasoning (потому что — если его включать, то скорость ответа сразу падает до недопустимых задержек)

LLL-м должна еще и tool calling делать — то есть вызывать инструменты — проверка адреса клиента, тот же RAG вызвать например, вызвать код, который будет предлагать время визита и т д — если на нее еще и это навалить, то она сходит с ума. Чем длиннее системная инструкция, тем тупее нейронная сеть будет ей следовать.

Поэтому у меня сейчас основная и самая умная LLM (qwen3.5:9b-q8_0)  отвечает только за поддержание разговора с клиентом, и при каждом turn — транскрипт разговора читает другая LLM-ка (granite3.3:2b) , которая отвечает ТОЛЬКО за извлечение структурной информации (те данные, которые надо обязательно собрать — имя клиента, адрес, тип проблемы), и иногда говорит основной LLM — что спросить у клиента в следующем turn (такие инструкции впрыскиваются прямо в конец системного промпта)

Но и этого оказалось недостаточно, чтобы приструнить этих двух чуваков, и заставить их делать то, что надо. Я подсмотрел, как сделаны коммерческие системы, и понял, что надо строить еще более менее строгий алгоритмический harness, который основан на flow

И все эти системы — они основаны на Intent (намерение) звонящего. Главной целью основной LLM – является определить Intent (чего вообще звонящий хочет) – пожаловаться на проблему, вызвать мастера, спросить, делаем ли мы какой то сервис, или спросить сколько он стоит

Поэтому — мне пришлось сделать еще и редактор для этих flow. Где для каждого Intent-а – описана своя последовательность шагов – смотрите скриншот, которыя я гружу сюда – это именно мой редактор для одного из Intent
Сейчас, собственно и занимаюсь отладкой всего этого
Там еще выяснилось куча ОЧЕНЬ ОЧЕНЬ интересных моментов, я здесь описал наверное только процентов 30. Я же говорю – получил кучу удовольствия за свои деньги 😊

 

avatar
  • 27 июля 2026, 14:31
  • Еще
Выберите надежного брокера, чтобы начать зарабатывать на бирже:
....все тэги
UPDONW
Новый дизайн