Тогда тоже все «кричали», что доткомы ждет «бесконечный рост», а нейросети — наше постоянное будущее

А Баффет падал и подвергался критике.
P. S. На этой рекламе нейросетей впервые с их ПО познакомился осенью 1995-го.
Данная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
Так что ускорение печати — это принцип борьбы с кризисами 21-го века в штатах.
— В основе обучения нейросетей по-прежнему лежит классический алгоритм обратного распространения ошибки (Backpropagation) и градиентный спуск. Однако за последние годы подходы к его реализации, подготовке данных и архитектурным трюкам изменились кардинально. [1, 2]Главный сдвиг произошел в переходе от ручного контроля и жесткой разметки к полной автономности, масштабируемости и многоэтапному «рассуждению».Основные принципиальные изменения в процессах и алгоритмах обучения:1. Доминирование самообучения (Self-Supervised Learning)Раньше для качественного обучения требовались гигантские базы данных, размеченные людьми вручную (Supervised Learning). Сегодня модели обучаются на неразмеченных текстах, коде или изображениях. [1, 2]
- Как это работает: Алгоритм сам маскирует (прячет) часть слова или картинки и пытается ее предсказать, генерируя псевдометки. Это позволило использовать для обучения триллионы токенов со всего Интернета. [1, 2]
2. Смена парадигмы RLHF на DPO и ИИ-критиковОбучение с подкреплением на основе отзывов людей (RLHF), сделавшее популярным первые версии ChatGPT, требовало сложного и нестабильного алгоритма PPO (Proximal Policy Optimization) и сотен оценщиков-людей.- Что изменилось: Появился алгоритм DPO (Direct Preference Optimization), который оптимизирует модель напрямую на парах ответов «хороший/плохой» без промежуточной сети поощрения.
- Кроме того, людей-оценщиков заменили сами нейросети (RLAIF — Reinforcement Learning from AI Feedback), что удешевило и ускорило финальное «выравнивание» (alignment) моделей.
3. Алгоритмы «рассуждения» во время вывода (Compute-at-Test-Time)Раньше фокус был на том, чтобы заложить максимум знаний в веса сети на этапе обучения. Современный тренд — перенос вычислительной сложности на этап ответа.- Такие модели, как OpenAI o1, используют алгоритм MCTS (поиск в дереве Монте-Карло) и скрытую цепочку рассуждений (Chain of Thought). Модель перед выдачей ответа генерирует десятки внутренних вариантов, критикует сама себя, исправляет ошибки и выбирает лучший путь решения.
4. Экстремальная оптимизация памяти и точности (Mixed Precision & Sparsity)Обучать современные модели с миллиардами параметров в классическом формате FP32 стало экономически невозможно. [1]- Квантование и смешанная точность: Алгоритмы перешли на форматы FP16, BF16 и даже INT8/FP4. Сеть обучается или дообучается на сниженной точности без потери качества, что экономит память GPU в разы. [1]
- Разреженность (Sparsity): Применяются алгоритмы блочной разреженности и архитектуры MoE (Mixture of Experts). Вместо активации всей нейросети для каждого слова алгоритм выбирает и обучает лишь малую долю «экспертов» (подсетей), сохраняя общую колоссальную емкость модели. [1]
5. Федеративное и децентрализованное обучение (Federated Learning)Из-за законов о конфиденциальности данных алгоритмы эволюционировали в сторону распределенных вычислений. [1, 2]- Модели теперь могут обучаться на децентрализованных данных (например, на тысячах смартфонов или медицинских серверов). Устройства рассчитывают локальные градиенты и передают на центральный сервер только изменения весов, а не сами личные данные пользователей. Новейшие алгоритмы оптимизируют эту коммуникацию, чтобы преодолеть задержки сети. [1, 2]
Summary: Сравнение подходовДа рыночные цены с другими параметрами онлайн торгов на бирже и тогда можно было подать на вход нейросети для обучения хоть онлайн. Ничего не делая с датасетами.
- Было в 90-е: Использовались сигмоида (
σsigma𝜎) или гиперболический тангенс (
tanht a n h𝑡𝑎𝑛ℎ). Приводили к проблеме затухания градиентов (vanishing gradients). Из-за этого сети глубже 2–3 слоев физически не могли обучиться. - Стало сейчас: Стандартом стала функция ReLU (Rectified Linear Unit) и ее модификации. Она имеет постоянный градиент для положительных значений, что устранило проблему затухания и позволило легко обучать глубокие сети.
2. Масштабируемость и аппаратное обеспечение- Было в 90-е: Обучение происходило исключительно на CPU. Процесс занимал часы или дни даже для простых сетей с тысячами параметров.
- Стало сейчас: Обучение перенесено на GPU/TPU (массивно-параллельные вычисления). Та же сеть для распознавания цифр обучается за несколько секунд, что позволяет мгновенно экспериментировать с архитектурой.
3. Продвинутые методы оптимизации- Было в 90-е: Использовался классический градиентный спуск (SGD) с постоянным шагом обучения (learning rate). Сети часто застревали в локальных минимумах или обучались крайне медленно.
- Стало сейчас: Применяются адаптивные оптимизаторы, такие как Adam, RMSprop, Adagrad. Они динамически подстраивают шаг обучения для каждого веса индивидуально, обеспечивая кратно более быструю и стабильную сходимость.
4. Решение проблемы переобучения (Регуляризация)- Было в 90-е: Мощные сети быстро «зазубривали» обучающую выборку (overfitting) и плохо распознавали новые рукописные цифры. Методы регуляризации были примитивными (L1/L2).
- Стало сейчас: Появился Dropout (случайное отключение нейронов в процессе обучения), который заставляет сеть строить устойчивые внутренние взаимосвязи, а также Batch Normalization (нормализация данных между слоями), которая стабилизирует и ускоряет процесс.
5. Инициализация весов- Было в 90-е: Веса инициализировались случайными (часто слишком большими или малыми) числами, что приводило к моментальному взрыву или затуханию сигналов на старте.
- Стало сейчас: Используются строгие математические подходы — инициализация Xavier (Glorot) или He. Они рассчитывают начальный разброс весов на основе количества входов и выходов слоя, гарантируя, что сигнал пройдет сквозь всю сеть.
Сравнительный итог1. Объем нелинейных функций для оптимизации увеличен.
2. Скорость их поиска выросла в разы из-за роста производительности компьютеров.
Ни то, ни другое не может быть шагом вперед в исследовании нестационарных случайных величин.
Впрочем, это не отменяет вероятности краха ряда крупных компаний из этой области…
smart-lab.ru/blog/1353690.php#comment19964945
А ведь нестационарная случайность и из современной квантовой физики никуда не делась. Да и в цифровых данных финансовых рынков тоже «на месте».
То, что популярные статейки стало проще писать, я и не спорю :)
А. Г., какое это имеет отношение, к тому, что я написал? Вы в предыдущем сообщении дали комментарий, который мягко говоря не соответствует действительности. На это я Вам и указал. Про «статейки» — Вы опять передергиваете. Я говорил про достаточно сложные программные продукты, созданные с нуля автономно.
Если Ваши познания в математике, окружающие Вас люди будут называть школьной программой. Вы с этим согласитесь?
Если лично Вы не видите применения этих технологий в Вашей непосредственной деятельности, то это еще не значит, что их не ждут впечатляющие перспективы.
Что в этом не соответствует действительности? То, что функции, как результат обучения, расширили? Ну расширили, а какое это имеет отношение к задаче статистического прогноза случайности при неизвестном распределении?
если слушать только анонс, то ии обещает подготовить инженера или бухгалтера не за 15-20 лет, а за 2 часа...
а пока клепают тошнотворные ролики по истории, философии и динозавров..
Но это не значит, что если не выполнили, то нет прогресса.
Расходы на ITER сейчас около $33 млрд.
Сравним с помощью Украине.
У хуситов этого нет.
И польза слабая.
«Джанджавид» в Судане, мавританские «мехаристы», туареги в Мали и фронт «Полисарио» в Западной Сахаре преиущественно используют верблюдов.
Мало там дорожных заправок.
Хуситы, может и развились.
Но как это опровергает тезис.
Зачем тебе в горах и в пустыне машины
Тем более, если ты повстанец.
«Джанджавид» в Судане, мавританские «мехаристы», туареги в Мали и фронт «Полисарио» в Западной Сахаре»- ну давай расскажи, как ты жил в пустыне Сахара.
- ⚡ Фронт ПОЛИСАРИО (Народный фронт за освобождение Сегиет-эль-Хамра и Рио-де-Оро) ведет партизанскую войну в условиях суровой пустыни Сахары. Их военная доктрина строится на максимальной мобильности, поэтому основа их передвижения — это высокоманевренный колесный транспорт и советская бронетехника.🚗 Главное средство передвижения: «Технички» (Ган-траки)Как и большинство повстанческих движений в регионе, ПОЛИСАРИО передвигается преимущественно на гражданских внедорожниках, переоборудованных под военные нужды.
- Пикапы Toyota Land Cruiser и Hilux: Абсолютная основа мобильности фронта. Эти машины идеально приспособлены к песчаным дюнам и каменистому грунту (хамаде).
- Вооружение на колесах: На пикапы монтируются крупнокалиберные пулеметы (КПВТ, ДШК), зенитные установки (ЗУ-23-2), противотанковые ракетные комплексы (ПТРК «Малютка», «Конкурс») и блоки для запуска неуправляемых авиационных ракет (НАР). Это позволяет наносить быстрые удары по марокканской оборонительной стене («Берме») и мгновенно отходить вглубь пустыни.
🛡️ Бронетехника (поставки из Алжира)Благодаря многолетней поддержке Алжира, ПОЛИСАРИО располагает полноценным парком тяжелой техники советского производства, которая используется для поддержки пехоты:- Танки: Модификации советских танков Т-55 и Т-62.
- Боевые машины: Гусеничные БМП-1 и легкие плавающие танки ПТ-76.
- Бронетранспортеры: Колесные БТР-60 и БРДМ-2 (боевые разведывательно-дозорные машины).
🚛 Вспомогательный транспорт- Военные грузовики: Тяжелые полноприводные грузовики (в основном советские ЗИЛ-131, Урал-4320, КАМАЗ, а также старые европейские модели) используются для снабжения баз, перевозки личного состава, доставки воды и боеприпасов через пустыню.
Воздушного или морского транспорта общего назначения у фронта ПОЛИСАРИО фактически нет — вся их логистика и тактика завязаны исключительно на скрытное и быстрое перемещение по суше.Когда был Ленин маленький
С кудрявой головой,
Любил ИИшку стилусом,
А Наденьку рукой.
Но все-таки большой шаг в увеличении нелинейности моделей стационарных случайных процессов этим точно сделан.
а счас всего удвоился… более того все инновации в 99г были у компаний малой капитализации а счас инновации внутри гугла амазон теслы нвидиа и меты… т.е внутри развитых компаний умеющих делать бизнес и его масштабироватьь
вообще заслуга совреенной экономики — стартап индустрия которая которая масштабирует инновации… такого не было в 90ых
И где такое сейчас?
Уже сейчас ИИ полностью оставил без работы криптографов спецслужб, в кратчайшие сроки вскрывая сложнейшие шифры и коды.
И уже нет никакого сомнения, что в самое ближайшее время AI найдёт способ нейтрализации ракетно-ядерного оружия.
Поэтому сравнивать стартапы AI, которые работают по заданию спецслужб Китая и США на деньги из правительств и военных ведомств с пресловутыми доткомами абсолютно некорректно.
Это точно полнейшая ерунда. Читайте теорему Шеннона 1945-го года. А как построить шифратор, который не отличит от гаммирования случайным блужданием ни один комп с производительностью меньше 10^200 за секунду де-факто я уже указал в топике тут
smart-lab.ru/blog/1221314.php
У вас волосы встанут дыбом!
Но только КГБ СССР, как и АНБ, с этим столкнулись еще в 70-е годы прошлого века и эта задача там стояла, стоит и решается. А открытая криптография — это лишь о-малое реальной закрытой.
Или вы до сих пор ещё не поняли, что мы от них отстали уже недостижимо и навсегда, а в свободный доступ выкладываются нейросети лишь прошлых поколений, а не то, с чем уже сейчас работают спецслужбы и военные Китая и США?
А проблема то возникла совсем в другом. Дешифрование то еще с Энигмы — это не тотальный перебор. И поэтому ключевое — это поиск того, что выявляется при опробовании не всего, а части используемого ключа.
И как в криптографии мы могли отстать от США, если еще в 1989-м:
«Кроме того, значительным достижением 8-го ГУ КГБ в сфере дешифровки в 1989 году было раскрытие криптосистемы аналоговой аппаратуры засекречивания телефонных переговоров АНБ США «STU-II», в результате чего КГБ смог прослушивать телефонные разговоры между Белым Домом и штаб-квартирой НАТО в Брюсселе».
Скажите, что в этом всего 1%?
Э нет, тут далеко ещё до потолка. Все только начинается. Еще много открытий чудных готовит нам данный пузырь.
Еще можно пунктов набросать…
www.mathnet.ru/php/journal.phtml?jrnid=tvp&option_lang=rus
Обезъяна с ИИ сможет больше, чем молодой инженер, экономист, программер или юрист. И проникновение будет расти.
Тут огромный рынок, ибо аналог — изобретение паровой машины и начало эпохи индустриальной революции. Только теперь «паровая машина» не в области ручного труда, а интеллектуального.
Ладно, ушел с темы. Работать надо.
Аналогия — это не доказателсьтво, но где же она ломантся?
В 1999-м многие доткомы не имели ни выручки, ни прибыли, ни внятной бизнес-модели.
Сейчас у ключевых игроков ИИ есть реальные продукты, выручка и часто огромные прибыли. Nvidia, Microsoft, Google, Amazon зарабатывают на ИИ уже сейчас.
ИИ внедряется в существующие процессы, а не только создаёт новые сайты. Код, поддержка, анализ данных, дизайн, медицина, логистика — это не «сайт про котиков».
Покупатели — корпорации, а не только розничные инвесторы.
Это делает спрос более устойчивым, хотя и не бесконечным.
Технология уже работает.
В 1999-м интернет тоже работал, но монетизация была слабой.
Сейчас ИИ уже даёт измеримую производительность в ряде задач.
У лидеров есть cash flow.
Пузырь надувается не только на долгах, но и на свободных деньгах гигантов. Это оттягивает момент расплаты, но не отменяет еЁ.
Поэтому, сейчас главный вопрос - какие компании и бизнес-модели на ИИ выживут и будут зарабатывать?
Особенно учитывая что и обучение и inference все время дорожают, а конкуренция растет. Если ИИ-гиганты поднимут цены, чтобы выйти хотя бы в безубыток, все просто убегут на опенсорс.
Ну такая себе аналогия с логической нестыковкой.
А можете подсказать с какими из современных нейросетей приходилось работать/взаимодействовать и в рамках каких задач? — А-то эта ваша постоянная отсылка к перцептрону… выше кто-то в комментах писал, что еще пару лет назад нейросети не были такими capable, а вы говорите перцептрон.
А начинается всё с элементарного «как хочу, так и разговариваю (пишу)».
Кризис восьмого ждал с пятого начиная. Недозаработал, но спал спокойно.