Блог им. AlexCosta

Турнир вместо дуэли: что происходит, когда сравниваешь 12 компаний сектора сразу, и насколько этому можно верить

В прошлой статье на этом блоге (и на DuelStocks.com) я разбирал разницу между относительной оценкой (сравнение компании с конкретным конкурентом) и абсолютной оценкой через DCF (что компания стоит сама по себе, исходя из её собственных денежных потоков). Добавил туда и третий угол зрения — индекс устойчивости баланса (FRI), который вообще не про «дорого/дёшево», а про то, не развалится ли бизнес финансово. Вывод был неприятным для любителей единого рейтинга: победитель по одному методу почти никогда не совпадает с победителем по другому.

Там же я честно указал на ограничение методики (раздел 2.4): дуэль — это сравнение только двух компаний. Классическая относительная оценка сравнивает компанию с группой аналогов, а не с одним произвольным соперником. Победитель одной дуэли против другого оппонента мог бы выглядеть совсем иначе.

Эта статья — прямая попытка закрыть этот пробел. И, что не менее важно, — измерить, насколько именно он закрывается, а не просто заявить, что закрывается.

Что мы ожидали увидеть — сформулировано заранее

Перед тем как считать, я зафиксировал три проверяемые гипотезы, чтобы результаты ниже можно было сверить с ожиданиями, а не подгонять ожидания под результат постфактум:

  • Г1 — расхождение сохранится. Если разрыв между относительной, абсолютной и устойчивой оценкой из прошлой статьи — реальное свойство данных, а не случайность конкретной пары, он должен воспроизвестись и на уровне сектора: несколько компаний должны оказаться в топе по одному критерию и в низу — по другому.
  • Г2 — устойчивость (FRI) ортогональна. FRI измеряет структурно другое (качество баланса), а не факторы роста/маржи (относительный балл) или подразумеваемую денежным потоком стоимость (DCF). Ожидали слабую, а не сильную корреляцию с двумя другими рейтингами.
  • Г3 — маленькая выборка шумит даже при «принципиальной» модели. Пилот на 2 раунда даёт каждой компании всего 2 точки данных. Ожидали, что итоговый порядок мест — какой бы математически строгой ни была модель агрегации — окажется куда менее стабильным, чем выглядит на бумаге, и заранее спланировали, как это измерить количественно, а не просто сказать «это же пилот».

Все три гипотезы подтвердились, причём третья — сильнее, чем мы рассчитывали (см. раздел 6).

Метод

Дизайн турнира

Полный круговой турнир по 12 компаниям (каждая с каждой) — это 66 дуэлей, избыточно для контент-пилота. Использовал circle method — стандартный алгоритм планирования частичных круговых турниров из теории спортивного расписания и психометрики — чтобы построить схему на 2 раунда, при которой граф «кто с кем встречался» образует один связный цикл через все 12 компаний (SWKS исключил из исходных 13 — наименьший вес в индексе среди группы, минимальное искажение от удаления).

Тур 1: NVDA–ON, AVGO–MCHP, MU–MPWR, AMD–MRVL, INTC–QCOM, TXN–ADI Тур 2: NVDA–MCHP, ON–MPWR, AVGO–MRVL, MU–QCOM, AMD–ADI, INTC–TXN

Связность графа — не формальность: оценки силы по модели Брэдли-Терри распространяются именно по графу «кто кого обыграл», и если бы граф распался на два несвязных кластера, модели было бы попросту не с чем сравнивать компанию из одного кластера с компанией из другого. Один связный цикл — это минимальная структура, при которой вообще можно ранжировать все 12 компаний друг относительно друга, даже если большинство пар никогда не встречались напрямую.

Как считали агрегированный рейтинг

Из 12 результатов посчитал два рейтинга силы по итогам дуэлей:

  • Copeland score — просто победы минус поражения. Прозрачно, но грубо: при всего 2 играх на компанию почти все попадают в одну из трёх групп (+2, 0 или −2), с большим числом ничьих по местам.
  • Рейтинг Брэдли-Терри (BT) — классическая модель парных сравнений (1952 год, математический предок рейтинга Эло). В этой модели вероятность победы i над j равна s_i / (s_i + s_j), где s_i — оценка силы i. Силы оцениваются итеративным методом максимального правдоподобия (алгоритм MM/Zermelo), который позволяет силе «распространяться» по цепочке: победа над командой, которая сама обыграла сильного соперника, весит больше, чем победа над командой без единой победы — даже если эти две компании никогда не встречались напрямую.

Два результата в этом датасете «идеальны» именно в том смысле, который критичен для BT: компания, выигравшая обе свои игры, без коррекции получает оценку силы, устремляющуюся к бесконечности; компания, проигравшая обе — к нулю. Оба случая ломают модель. Я использовал стандартную регуляризацию — небольшое число «виртуальных» игр против условного среднего по турниру соперника, добавленных каждому участнику — которая делает все оценки конечными. Это не косметическая правка, а именно то, что вообще позволяет построить рейтинг при таком малом объёме данных — и именно поэтому точный числовой разрыв между соседними местами не стоит воспринимать буквально (подробнее — в разделе 6).

Дальше добавил два рейтинга, которые считаются по собственной отчётности каждой компании, независимо от того, с кем её сравнивали:

  • Мультипликатор EV/Revenue из DCF-модели — во сколько раз DCF-движок платформы оценивает компанию к её выручке. Это отдельный вывод модели для каждой компании (проверил — число идентично в обеих дуэлях компании, значит от соперника не зависит). Выше — значит движок модели закладывает больше стоимости на доллар выручки, исходя из собственного роста, маржи и ROIC компании. Это не «апсайд к рыночной цене» — модель вообще не использует текущую цену акции — это внутренняя оценка качества денежного потока.
  • FRI (Fundamental Resilience Index) — композитный индекс устойчивости баланса, тоже привязан к конкретной компании.
Результаты

Итоги дуэлей

Дуэль Счёт Победитель
NVDA vs ON 80–20 NVDA
AVGO vs MCHP 100–0 AVGO
MU vs MPWR 27–73 MPWR
AMD vs MRVL 73–27 AMD
INTC vs QCOM 12–88 QCOM
TXN vs ADI 57–43 TXN
NVDA vs MCHP 100–0 NVDA
ON vs MPWR 12–88 MPWR
AVGO vs MRVL 100–0 AVGO
MU vs QCOM 31–69 QCOM
AMD vs ADI 34–66 ADI
INTC vs TXN 8–92 TXN

Четыре рейтинга одного сектора

Компания Счёт (W-L) Copeland Место по BT EV/Revenue (DCF) Место FRI Место
TXN 2-0 +2 1 1.90x 9 60 (умеренная) 11
QCOM 2-0 +2 2 3.54x 5 89 (высокая) 3
MPWR 2-0 +2 3 5.27x 3 98 (высокая) 2
NVDA 2-0 +2 4 19.84x 1 64 (умеренная) 10
AVGO 2-0 +2 5 16.06x 2 75 (высокая) 8
ADI 1-1 0 6 3.87x 4 87 (высокая) 6
AMD 1-1 0 7 3.12x 7 100 (высокая) 1
INTC 0-2 -2 8 н/д (EV<0) 12 32 (низкая) 12
MU 0-2 -2 9 0.64x 11 76 (высокая) 7
ON 0-2 -2 10 1.93x 8 88 (высокая) 5
MCHP 0-2 -2 11 1.71x 10 73 (высокая) 9
MRVL 0-2 -2 12 3.45x 6 89 (высокая) 3
Где три угла зрения расходятся

TXN — главный пример. Выиграл обе дуэли и держит 1-е место по BT, но по DCF-мультипликатору — только 9-е место из 12 (скромные 1,9x), а по устойчивости — 11-е, с флагом за повышенный долг (D/E около 0,9, слабое покрытие долга кэшем). Лучший результат по относительной оценке в турнире принадлежит одному из самых слабых участников по абсолютной оценке и устойчивости баланса.

MRVL — почти зеркальная история.
Последнее место по BT, но делит 3-е по устойчивости (FRI 89) и держится в середине (6-е место) по DCF-мультипликатору. Если смотреть только на относительный рейтинг, про баланс MRVL вы узнаете мало верного.

AMD — средний результат и по дуэлям (1-1), и по DCF-мультипликатору (7-е место), но лучший показатель устойчивости во всём секторе (FRI 100 — ни единого флага конфликта, максимум по всем метрикам). Этого не видно, если смотреть только на то, кого AMD обыграла.

NVDA и AVGO — единственная пара, где DCF-слой сильно совпадает с относительным рейтингом (1-е и 2-е места по обоим). А устойчивость расходится: NVDA падает до 10-го места по FRI из-за метрики «запас ликвидности», заметно ниже порога «надёжный буфер» — реальный трейд-офф между силой роста/оценки и запасом прочности баланса, а не шум в данных.

INTC — контрольный случай. Последнее или почти последнее место по всем трём критериям, и единственная компания, для которой DCF-модель выдаёт отрицательную стоимость бизнеса напрямую (отрицательный свободный денежный поток ломает модель, а не просто занижает оценку). Когда фундаментал реально слабый по всем фронтам, все три метода сходятся — и это само по себе показательно: расхождения в остальных случаях отражают действительно неоднозначную картину, а не случайный шум методов оценки.

Насколько можно доверять 1-му месту?

Прежде чем считать «TXN на 1-м месте» выводом про TXN, стоит разобраться, что именно двигает эту цифру.

Обе победы TXN — над INTC (0-2, ни одной победы во всей сети) и над ADI (1-1 — единственная заслуга ADI — победа над AMD). В модели Брэдли-Терри победа над командой, которая сама кого-то обыграла, весит больше, чем победа над командой с пустым послужным списком, потому что сила распространяется по графу транзитивно. NVDA, AVGO, QCOM и MPWR — остальные четыре команды с счётом 2-0 — каждая обыграла двух соперников с результатом 0-2 и без единой победы во всей сети. TXN — единственная команда 2-0, чья вторая победа одержана над соперником (ADI), у которого есть собственная живая победа. Именно это единственное косвенное звено отделяет 1-е место TXN по BT от четырёхкратной ничьей на вершине.

Это не баг метода — это ровно то, для чего Брэдли-Терри и придумана. Но это же ровно тот случай, когда стоит насторожиться и не читать слишком много в рейтинг, построенный на 2 играх на компанию. Чтобы не просто заявить это, а измерить, я прогнал Монте-Карло проверку: смоделировал 12 компаний со случайной «истинной» силой, прогнал тот же турнирный график по circle method и посмотрел, как часто 1-е место по Брэдли-Терри и 1-е место по простому Copeland-счёту расходятся чисто из-за случайности выборки, при разной длине турнира (4000 симуляций на каждую точку):

Раундов на компанию BT и Copeland расходятся в определении 1-го места
2 (этот пилот) 64,4%
4 34,4%
6 25,2%
11 (полный круговой турнир) 4,9%

При 2 раундах то, какой метод вы используете для определения «кто первый», — почти монетка в вопросе, совпадёт ли он с более простым методом подсчёта. То есть математическая изощрённость Брэдли-Терри при таком объёме данных ещё не даёт стабильного ответа — только по-другому нестабильный. Эта нестабильность — свойство размера выборки, а не что-то специфичное для TXN, и именно поэтому я публикую это как пилотный результат, который нужно перепроверить на большем объёме данных, а не как подтверждённый вывод о лидере сектора.

Сколько раундов реально нужно?

Раздел выше показывает, что 1-е место шатко при 2 раундах. Естественный следующий вопрос — и именно тот, на который эта статья должна дать количественный, а не качественный ответ — сколько раундов было бы достаточно, и что даёт каждый дополнительный раунд?

Я смоделировал круговые турниры того же дизайна на 12 компаний по circle method, с длиной от 1 раунда до полного кругового турнира на 11 раундов (когда каждая компания встречается с каждой ровно один раз), присваивая компаниям случайную «истинную» силу в каждой из 3000 смоделированных симуляций на строку таблицы. Затем измерил, насколько итоговый рейтинг по Брэдли-Терри совпадает с (известным в симуляции) истинным порядком силы:

Раундов на компанию Всего дуэлей (12 компаний) Ранговая корреляция с истинным порядком (Спирмен) Доля верно определённого топ-3 % компаний с «идеальным» счётом
1 6 0,32 37,0% 100%
2 (этот пилот) 12 0,47 48,5% 56,7%
3 18 0,55 51,1% 34,5%
4 24 0,60 55,9% 22,8%
5 30 0,65 59,4% 16,1%
6 36 0,68 60,6% 11,2%
8 48 0,74 64,2% 6,4%
11 (полный круговой турнир) 66 0,78 66,9% 3,1%

Выделяются два момента. Во-первых, пилотный дизайн (2 раунда) даёт ранговую корреляцию с «истинным» порядком около 0,47 — это полезно для выделения широких групп (явные лидеры/явные аутсайдеры), но ненадёжно для утверждения о конкретном 1-м месте. Во-вторых, больше половины участников (56,7%) заканчивают турнир на 2 раундах с математически «идеальным» счётом 2-0 или 0-2 — звучит убедительно, но, как показано выше, именно это и делает индивидуальный порядок мест нестабильным: идеальный счёт не содержит информации о том, насколько компания сильнее — только о том, что она выиграла все игры, которые ей выпали.

Как читать таблицу при планировании следующего турнира:

  • 1-2 раунда: дёшево и быстро, хорошо для обозначения широких групп (явные лидеры против явных аутсайдеров) в контенте, привязанном к одному пилоту или циклу публикаций. Место внутри верхней или нижней группы считать решённым не стоит.
  • 3-4 раунда: заметно лучше (корреляция ~0,55-0,60) при умеренном росте затрат (18-24 дуэли); разумный минимум, если сам рейтинг, а не только история расхождения с DCF, — цель статьи.
  • 5-6 раундов: рабочий компромисс (корреляция ~0,65-0,68) между строгостью полного турнира и стоимостью проведения десятков дуэлей.
  • 8+ раундов, вплоть до полного турнира на 66 дуэлей: отдача от каждого следующего раунда снижается, но это единственный режим, где можно защищать конкретное числовое место (а не просто группу) с реальной уверенностью.
Перестаёт ли актуальным ограничение из прошлой статьи?

Структурно — да, частично: агрегирование 12 парных дуэлей в связную сеть, где каждая компания оценивается относительно подразумеваемой силы всей группы, а не одного произвольного соперника, — это настоящее методологическое улучшение по сравнению с одной дуэлью. Именно это и требуется от классической относительной оценки — «сравнение с пир-группой», переведённое на язык статистики парных сравнений.

Эмпирически ответ более осторожный, и таблица из раздела выше — честная версия этой осторожности. Конкретный дизайн на 2 раунда снижает остроту исходной критики, но не снимает её полностью. Место компании в этом пилотном рейтинге информативнее, чем победитель одной дуэли, но, судя по разделам выше, это всё ещё ближе к грубому разбиению на группы, чем к точному, устойчивому рангу. Ограничение из прошлой статьи (раздел 2.4) сейчас правильнее формулировать так: «решено по типу метода, но не по степени точности» — метод сравнения с пир-группой существует и работает; чтобы довести объём выборки до уровня, при котором отдельным местам можно доверять, — отдельная и измеримая цена, показанная выше.

Выводы
  1. Расхождение между относительной, абсолютной оценкой и устойчивостью из прошлой статьи — не случайность выбора одной пары. Оно воспроизводится на уровне сектора: TXN (1-е место по относительной оценке, 9-е по DCF, 11-е по устойчивости) и MRVL (12-е по относительной оценке, 6-е по DCF, 3-е по устойчивости) показывают разрыв в 6-8 позиций между критериями, измеряющими действительно разные вещи.
  2. Устойчивость (FRI) — самый независимый из трёх критериев, как и предполагалось (гипотеза Г2). Лучший в секторе показатель устойчивости у AMD сочетается со средним относительным результатом и средним DCF-мультипликатором; общее 1-е/2-е место NVDA и AVGO по относительной оценке и DCF сочетается с местами 10 и 8 по устойчивости. Высокий балл по факторам роста/маржи или по DCF-мультипликатору почти ничего не говорит о запасе прочности баланса.
  3. Единственный случай без расхождений (INTC) — это и есть единственный случай явного финансового неблагополучия: последнее или почти последнее место по всем трём критериям, и единственная компания, для которой DCF-движок выдаёт вырожденный результат (отрицательную стоимость бизнеса), а не просто низкую оценку. Это подтверждает, что расхождения в остальных случаях отражают реально неоднозначную картину, а не шум самих методов оценки.
  4. Пилот на 2 раунда полезен для направления и нестабилен на уровне отдельных мест — и теперь это измерено, а не просто заявлено. Симуляция показывает ранговую корреляцию около 0,47 с «истинным» порядком при таком дизайне, 64,4%-ную вероятность, что более простой метод подсчёта (Copeland) короновал бы другого лидера чисто из-за случайности выборки, и 56,7% участников с «идеальным», малоинформативным счётом 2-0 или 0-2. 1-е место в этом пилоте (TXN) держится на одном косвенном звене в графе сравнений (его победа над ADI, чья единственная заслуга — победа над AMD) — учебный пример именно этой нестабильности, а не особенность конкретно TXN.
  5. Критика из прошлой статьи про пару vs пир-группу решена структурно, но лишь частично снята на практике. Метод агрегации множества дуэлей в рейтинг относительно группы существует и работает; чтобы доверять именно конкретным местам (а не только широким группам), по таблице выше нужно порядка 5-8 раундов (30-48 дуэлей) вместо 2 — конкретное, применимое на практике число для планирования следующего турнира, а не расплывчатый призыв «собрать больше данных».

Источник данных: отчётность SEC EDGAR (10-K/10-Q), получена через платформу DUEL (duelstocks.com). Все рейтинги, баллы и DCF-расчёты формируются раскрытыми фиксированными формулами по публичной отчётности — без субъективных корректировок аналитика. Результаты симуляций в разделах выше основаны на синтетических турнирах со случайно назначенной силой участников и используются только для характеристики статистических свойств метода планирования, а не для выводов о конкретных компаниях. Материал носит исключительно информационно-образовательный характер и не является индивидуальной инвестиционной рекомендацией. Прошлые данные не гарантируют результатов в будущем.

Данная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
109

Читайте на SMART-LAB:
Фото
EUR/USD: в шаге от падения?
Европейская валюта «завязла» в тестировании линии шеи, которую не может уверенно пробить уже не первую неделю. Сейчас сформировалась фигура...
Фото
ОФЗ на скамейке запасных. Сколько продлится пауза Минфина?
Минфин взял паузу. Размещение ОФЗ приостановлено. И пока не известно, как долго это продлится. Ведомство сослалось на необходимость...
Рынок будет волатильным до заседания ЦБ РФ
Российский фондовый рынок на торгах 21 июля с самого утра мощно и уверенно идёт вверх. Индекс Московской биржи после целой серии обвалов вырос...
Фото
Включаем "Антикризис" на полную катушку! А вдруг?
Сегодня я был снова вынужден прервать свой отвратительный отпуск, чтобы заниматься делами своего инвестиционного портфеля и даже для того, чтобы...

теги блога AlexCosta

....все тэги



UPDONW
Новый дизайн