— В основе обучения нейросетей по-прежнему лежит классический алгоритм обратного распространения ошибки (Backpropagation) и градиентный спуск. Однако за последние годы подходы к его реализации, подготовке данных и архитектурным трюкам изменились кардинально. [1, 2]Главный сдвиг произошел в переходе от ручного контроля и жесткой разметки к полной автономности, масштабируемости и многоэтапному «рассуждению».Основные принципиальные изменения в процессах и алгоритмах обучения:1. Доминирование самообучения (Self-Supervised Learning)Раньше для качественного обучения требовались гигантские базы данных, размеченные людьми вручную (Supervised Learning). Сегодня модели обучаются на неразмеченных текстах, коде или изображениях. [1, 2]
- Как это работает: Алгоритм сам маскирует (прячет) часть слова или картинки и пытается ее предсказать, генерируя псевдометки. Это позволило использовать для обучения триллионы токенов со всего Интернета. [1, 2]
- Что изменилось: Появился алгоритм DPO (Direct Preference Optimization), который оптимизирует модель напрямую на парах ответов «хороший/плохой» без промежуточной сети поощрения.
- Кроме того, людей-оценщиков заменили сами нейросети (RLAIF — Reinforcement Learning from AI Feedback), что удешевило и ускорило финальное «выравнивание» (alignment) моделей.
- Такие модели, как OpenAI o1, используют алгоритм MCTS (поиск в дереве Монте-Карло) и скрытую цепочку рассуждений (Chain of Thought). Модель перед выдачей ответа генерирует десятки внутренних вариантов, критикует сама себя, исправляет ошибки и выбирает лучший путь решения.
- Квантование и смешанная точность: Алгоритмы перешли на форматы FP16, BF16 и даже INT8/FP4. Сеть обучается или дообучается на сниженной точности без потери качества, что экономит память GPU в разы. [1]
- Разреженность (Sparsity): Применяются алгоритмы блочной разреженности и архитектуры MoE (Mixture of Experts). Вместо активации всей нейросети для каждого слова алгоритм выбирает и обучает лишь малую долю «экспертов» (подсетей), сохраняя общую колоссальную емкость модели. [1]
- Модели теперь могут обучаться на децентрализованных данных (например, на тысячах смартфонов или медицинских серверов). Устройства рассчитывают локальные градиенты и передают на центральный сервер только изменения весов, а не сами личные данные пользователей. Новейшие алгоритмы оптимизируют эту коммуникацию, чтобы преодолеть задержки сети. [1, 2]
| Критерий | Как было раньше | Как это работает сейчас |
|---|---|---|
| Подготовка данных | Тщательная разметка датасетов людьми. | Автоматическое самообучение (Masked LM, Next Token Prediction). |
| Выравнивание (Alignment) | Субъективные оценки людей через PPO. | Прямая оптимизация (DPO) и оценка силами других ИИ (RLAIF). |
| Ресурсоемкость | Полносвязные тяжелые вычисления в высокой точности. | Смешанная точность, архитектуры MoE, разреженные веса. |
| Логика работы | Моментальный интуитивный ответ (System 1). | Пошаговое планирование, самопроверка и поиск решений (System 2). |








