Введение
Точечный прогноз скрывает важную часть задачи. Если регрессионная модель оценивает время доставки в 42 минуты, пользователю неизвестно, насколько устойчиво это число: реальный результат может отличаться на две минуты или на час. Вероятность класса также не всегда решает проблему. Значение 0,9, выданное классификатором, ещё не доказывает, что среди объектов с таким прогнозом нужная метка действительно встречается в 90% случаев.
Конформное прогнозирование предлагает другой порядок действий. Сначала строится любая базовая модель, затем на отдельных наблюдениях измеряется, насколько её ответы расходятся с реальностью. Ранг новой ошибки среди уже наблюдавшихся ошибок позволяет выбрать границу прогнозного множества. Метод не доказывает правильность модели и не восстанавливает неизвестное распределение. Он калибрует размер множества ответов так, чтобы при оговорённых условиях доля попаданий была не ниже заданной [1], [2].
Прогнозное множество и условие обменности
Пусть имеются пары Zi=(Xi,Yi), где X содержит признаки объекта, а Y — наблюдаемый ответ. Требуется по новому вектору Xn+1 построить множество C(Xn+1), для которого
P{Yn+1 ∈ C(Xn+1)} ≥ 1 − α.
При α=0,1 целевой уровень покрытия равен 90%. В регрессии множество обычно является интервалом, в классификации — одним или несколькими возможными классами. Вероятность в формуле берётся по совместной случайности данных, использованных для калибровки, и нового объекта. Это уточнение принципиально: стандартная гарантия относится к повторению всей процедуры, а не обещает одинаковую точность в каждой точке пространства признаков.
Основная предпосылка — обменность наблюдений. Совместное распределение последовательности не должно меняться при перестановке её элементов. Независимые одинаково распределённые наблюдения являются частным случаем обменности, но само понятие несколько шире. Для конформного доказательства существенно, чтобы новый объект не имел привилегированного положения относительно калибровочных объектов.
Следовательно, термин «распределительно-свободный» нужно понимать точно. Метод не требует выбрать нормальное, пуассоновское или иное параметрическое семейство распределений. Однако он не освобождает исследователя от проверки схемы получения данных. Временной тренд, смена измерительного прибора, зависимость соседних наблюдений или отбор тестовых объектов по иному правилу могут нарушить обменность и лишить стандартную гарантию основания.
Алгоритм split conformal prediction
Наиболее простой вариант использует разбиение исходных данных на обучающую и калибровочную части. Пусть базовый алгоритм, обученный на первой части, выдаёт регрессионный прогноз f̂(x). Для каждого из m калибровочных объектов вычисляется мера неконформности — абсолютный остаток
Si = |Yi − f̂(Xi)|.
Большое значение Si означает, что объект хуже согласуется с прогнозом модели. Для уровня ошибки α выбирается порядковая статистика с номером k=⌈(m+1)(1−α)⌉. Если обозначить её через q, то для нового объекта строится интервал
C(x)=[f̂(x)−q; f̂(x)+q].
- Случайно разделить исходную выборку на обучающую и калибровочную части до настройки модели.
- Обучить базовый предиктор только на обучающей части.
- Зафиксировать модель и вычислить оценки неконформности на калибровочных наблюдениях.
- Найти поправленный эмпирический квантиль с множителем m+1, учитывающим ещё не наблюдавшуюся тестовую ошибку.
- Для каждого нового объекта присоединить выбранную поправку к точечному прогнозу.
Например, при 99 калибровочных остатках и целевом покрытии 90% требуется элемент с номером ⌈100·0,9⌉=90 в упорядоченном ряду. Если он равен 7,4, то к прогнозу 42 добавляется симметричный коридор, и получается интервал [34,6; 49,4]. Число 7,4 извлечено не из предположения о гауссовской ошибке, а непосредственно из ошибок на отложенных наблюдениях.
Почему работает ранговое доказательство
После обучения модель считается фиксированной относительно калибровочной части. Если калибровочные пары и новая пара обменны, то обменны и значения их неконформности. Ранг тестовой оценки среди m+1 оценок равномерно распределён по возможным позициям, если совпадения рангов разбиваются случайно. Поэтому вероятность того, что новая ошибка не превысит выбранную порядковую статистику, не меньше 1−α.
Доказательство не использует точность базовой модели. Даже постоянный предиктор формально можно откалибровать. Но цена плохого прогноза проявится в больших остатках и широком, почти бесполезном интервале. Здесь разделяются два свойства: валидность означает соблюдение покрытия, а эффективность — малый размер прогнозного множества. Конформный слой защищает первое свойство, но второе зависит от модели, признаков и выбранной функции неконформности [3].
Гетероскедастичность и конформная квантильная регрессия
Интервал с абсолютным остатком имеет одинаковую полуширину q для всех объектов. Это неудачно, если шум зависит от признаков. Прогноз энергопотребления может быть устойчивым в обычный день и значительно менее точным в период резкого похолодания. Единая поправка окажется чрезмерной для первой группы и недостаточно адаптивной для второй, хотя среднее покрытие по всей совокупности сохранится.
Один из способов — нормировать остаток на предварительную оценку локального масштаба ошибки. Другой — conformalized quantile regression (CQR). Базовая модель оценивает нижнюю и верхнюю условные квантили q̂low(x) и q̂high(x), а калибровочная оценка принимает вид
Si=max{q̂low(Xi)−Yi; Yi−q̂high(Xi)}.
Квантиль этой оценки расширяет или, при отрицательной поправке, сужает исходный интервал. В результате его длина способна меняться вместе с локальной неопределённостью, а конформная калибровка сохраняет маргинальную конечновыборочную гарантию. В экспериментах авторов CQR давала более короткие интервалы на гетероскедастичных данных, чем методы со слабо меняющейся шириной [4].
Как читать 90%-ную гарантию
Конформный интервал уровня 90% не означает, что после публикации конкретного интервала неизвестное значение находится внутри него с вероятностью 0,9 при любых дополнительных условиях. Частотная гарантия описывает процедуру: при повторном получении обменных калибровочных и тестовых данных не менее 90% построенных множеств должны содержать истинный ответ.
Гарантия также не утверждает, что ошибки равномерно распределены во времени. На коротком участке возможна серия непокрытий, даже если долгосрочная частота соответствует уровню. Нельзя читать ширину интервала как доказательство причинности, надёжности исходных измерений или отсутствия систематической ошибки. Если целевая переменная записана неверно, конформная процедура будет калиброваться относительно этих неверных значений.
Маргинальное и условное покрытие
Стандартное неравенство усредняет результат по распределению X. Из него не следует, что P{Y∈C(X)|X=x}≥1−α для каждого x. Модель может перекрывать цель чаще необходимого в массовой простой группе и недопокрывать её в небольшой сложной группе, сохраняя 90% в среднем. Для медицины, кредитного анализа и других чувствительных применений такое различие имеет практическое значение.
Универсальное точное условное покрытие в конечной выборке невозможно получить одновременно с информативными интервалами без дополнительных ограничений на распределение. Поэтому применяются ослабленные цели: покрытие внутри заранее определённых групп, локальное покрытие, допуски на ошибку или асимптотические результаты. Простое разбиение калибровочных данных по группам работает лишь при достаточном числе наблюдений в каждой группе; иначе квантили становятся нестабильными, а интервалы резко расширяются.
Работа И. Гиббса, Дж. Чериана и Э. Кандеса, опубликованная в 2025 году, формулирует условную валидность через классы возможных сдвигов распределения признаков. Для конечномерных классов авторы получают точные конечновыборочные гарантии, включая одновременное покрытие для заданных, в том числе пересекающихся, групп. Для более богатых классов вместо невозможного универсального обещания оценивается величина ошибки покрытия [9]. Это не отменяет разницы между маргинальной и поточечной гарантией, а делает компромисс явным.
Сдвиг распределения и последовательные данные
При ковариатном сдвиге меняется распределение признаков P(X), но условный механизм P(Y|X) предполагается неизменным. Взвешенное конформное прогнозирование корректирует вклад калибровочных объектов отношением плотностей тестового и обучающего распределений. Теоретическая валидность возможна, если это отношение известно; на практике его оценивают по неразмеченным тестовым признакам, и ошибка оценки весов становится новым источником неопределённости [5].
Для временного ряда обычное случайное перемешивание часто неприемлемо. Будущее наблюдение может зависеть от недавнего прошлого, а режим процесса — меняться. Adaptive conformal inference обновляет рабочий уровень ошибки после каждого попадания или промаха, добиваясь целевой частоты покрытия на длинном горизонте даже при изменяющемся распределении. Эта гарантия относится к средней последовательной частоте и не тождественна исходному конечновыборочному утверждению для обменных данных [6].
Развитие метода и конформный контроль риска
Современные варианты выходят за пределы события «истинный ответ входит в множество». Conformal risk control калибрует параметр решения так, чтобы контролировать математическое ожидание заданной монотонной функции потерь. В опубликованной на ICLR 2024 работе подход применён, в частности, к доле ложноотрицательных решений, расстоянию между графами и метрике F1 на уровне токенов [8]. Это расширяет круг задач, но требует осмысленно определить loss-функцию: математическая гарантия наследует именно то понятие ошибки, которое заложил исследователь.
Конформные методы применяются к изображениям, текстам, медицинским прогнозам и структурированным ответам. Их популярность объясняется модельной агностичностью: калибровочный слой можно добавить к уже обученному предиктору. Обзор А. Ангелопулоса и С. Бейтса подчёркивает, что базовая теория даёт явные неасимптотические гарантии, но расширения для временных рядов, сдвига распределения и сложных выходов используют разные наборы предпосылок [7].
Практический протокол проверки
- Зафиксировать объект гарантии. Нужно определить, требуется ли маргинальное покрытие, покрытие по группам, контроль средней потери или последовательная частота ошибок.
- Отделить калибровку от настройки. Калибровочную часть нельзя многократно использовать для выбора признаков, score-функции и гиперпараметров без учёта возникшего смещения.
- Проверить соответствие выборок. Сравниваются периоды, источники, способы измерения, пропуски и правила включения объектов.
- Оценить валидность и эффективность. На независимом тесте измеряются покрытие, длина интервалов или размер множеств, в том числе отдельно для заранее важных групп.
- Показать базовые сравнения. Полезно сопоставить конформный результат с некалиброванным интервалом, простым постоянным диапазоном и несколькими вариантами модели.
- Документировать крайние случаи. Следует указать долю пустых или неограниченных множеств, поведение при редких признаках и чувствительность к размеру калибровочной выборки.
Ограничения
Конформное прогнозирование не создаёт информацию, которой нет в данных. При малой калибровочной выборке доступны лишь грубые уровни квантилей. При слабой модели интервалы широки. При редком классе множество меток может быть почти всегда большим. Формальная валидность совместима с низкой практической ценностью.
Обменность трудно обосновать для пациентов из новой клиники, оборудования после перенастройки, меняющегося рынка или последовательности наблюдений с памятью. Специализированные расширения ослабляют проблему, но добавляют предпосылки и параметры. Их нельзя автоматически переносить из одной схемы сдвига в другую.
Заключение
Конформное прогнозирование даёт редкое сочетание: оно совместимо с произвольной базовой моделью и при обменности обеспечивает конечновыборочное покрытие без параметрической модели ошибок. В split conformal prediction эта гарантия возникает из ранга тестовой оценки неконформности среди калибровочных оценок, а поправка m+1 предотвращает систематическое занижение квантили.
Сила утверждения имеет чёткие границы. Покрытие обычно маргинально, не характеризует каждый объект и не сохраняется автоматически при сдвиге распределения. Точность модели влияет не на формальную валидность, а на информативность интервала. Поэтому корректный отчёт должен одновременно описывать предпосылки, фактическое покрытие, размер прогнозных множеств и результаты по важным группам.