Попарный выбор проще абсолютной оценки: «какой ответ лучше?» Но модель Брэдли–Терри сжимает контекстное человеческое суждение в разность двух чисел. Чтобы reward model не научилась уверенно повторять шум, нужно изучать граф сравнений и разногласие оценщиков.

Почему сравнить легче, чем поставить 8,3

Два ответа на один вопрос лежат рядом. Эксперт выбирает более точный и полезный. Требование поставить каждому независимую оценку по десятибалльной шкале заставляет калибровать внутреннюю шкалу между днями и людьми.

В модели Брэдли–Терри у варианта ii скрытый score rir_i. Вероятность предпочесть ii варианту jj:

Pr(ij)=σ(rirj)=11+exp[(rirj)].\Pr(i\succ j) =\sigma(r_i-r_j) =\frac1{1+\exp[-(r_i-r_j)]}.

Имеет значение только разность. Добавление одной константы ко всем rir_i ничего не меняет, поэтому для идентифицируемости фиксируют iri=0\sum_i r_i=0 или один score равным нулю.

Если rirj=log3r_i-r_j=\log3, вероятность победы ii равна 0,750{,}75. Score измеряется в log-odds, а не в «баллах качества» с естественным нулём.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Логистическая кривая Bradley Terry с отмеченными разностями scores
Рис. 80.1. Разность скрытых баллов становится вероятностью

По горизонтали rirjr_i-r_j, по вертикали Pr(ij)\Pr(i\succ j). Отмечены вероятности 0,5, 0,75 и 0,9. Симметрия вокруг нуля показывает Pr(ji)=1Pr(ij)\Pr(j\succ i)=1-\Pr(i\succ j).

Likelihood попарных голосов

Для сравнения kk обозначим yk=1y_k=1, если победил первый вариант. Тогда negative log-likelihood:

L=k[yklogσ(Δrk)+(1yk)log(1σ(Δrk))].\mathcal L =-\sum_k\left[ y_k\log\sigma(\Delta r_k) +(1-y_k)\log(1-\sigma(\Delta r_k)) \right].

Это бинарная cross-entropy. Если вариант AA победил BB 7 раз из 10, модель подбирает разность, близкую к log(0,7/0,3)\log(0{,}7/0{,}3), учитывая остальные связи.

Для reward model score зависит от prompt xx и ответа yy:

rϕ(x,y)R.r_\phi(x,y)\in\mathbb R.

Loss на паре chosen/rejected:

LRM=logσ(rϕ(x,y+)rϕ(x,y)).\mathcal L_{\mathrm{RM}} =-\log\sigma\left( r_\phi(x,y^+)-r_\phi(x,y^-) \right).

Модель учится порядку внутри одного prompt. Сравнивать raw scores между совершенно разными prompt без калибровки рискованно.

Граф должен быть связан

Вершины — варианты, ребро — хотя бы одно сравнение. Если граф распался на компоненты, их score можно независимо сдвигать; относительный уровень не определяется данными.

Даже в связном графе «мост» из одного сравнения создаёт большую неопределённость. Полезный дизайн содержит циклы и повторные оценки. Активный выбор пар предпочитает варианты с близкими score или слабой связью.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Граф сравнений с двумя плотными сообществами и одним мостом, интервалы scores
Рис. 80.2. Тонкий мост делает рейтинг хрупким

Размер вершины равен числу сравнений, цвет — fitted score, полупрозрачная дуга — повторные голоса. У вершин по разные стороны единственного моста интервалы широки. После добавления трёх перекрёстных рёбер справа интервалы сужаются.

Лаборатория предпочтений

Попарные голоса, скрытый reward и разногласие

Загружается живая иллюстрация…

Создайте пять ответов и добавляйте сравнения. Сначала постройте цепочку ABCDEA\succ B\succ C\succ D\succ E, затем добавьте повторные голоса и цикл EAE\succ A. Следите за scores и неопределённостью.

Смешайте две группы оценщиков с противоположными вкусами. Одна скалярная reward model усредняет их и может предсказывать уверенность, которой нет ни у одной группы. Сравните aggregate и group-conditioned модели.

Циклы и нетранзитивность

Люди могут предпочесть краткий AA подробному BB, точный BB дружелюбному CC, а дружелюбный CC краткому AA. Bradley–Terry предполагает транзитивную одномерную шкалу и не воспроизводит устойчивый цикл.

Диагностика: fitted probability и empirical win rate для каждой пары, residual

eij=p^ijσ(r^ir^j).e_{ij}=\widehat p_{ij}-\sigma(\widehat r_i-\widehat r_j).

Систематический цикл residual указывает на missing dimension. Можно использовать векторные utilities, mixture по типам оценщиков или явно моделировать ничьи.

Связь с self-play точна: Elo и Bradley–Terry удобно сжимают турнир, но теряют циклы стратегий.

Инструкция меняет reward

Разметчикам нужны критерии и tie-опция. «Лучше» можно понимать как фактически точнее, яснее, безопаснее, полнее или приятнее. Без приоритета два человека решают разные задачи.

Качество протокола проверяют:

  • повтором части пар;
  • скрытыми контрольными примерами;
  • перестановкой порядка ответов;
  • временем оценки;
  • коэффициентом согласия;
  • коротким обоснованием выбора;
  • аудитом по языкам и темам.

Положение ответа слева или сверху способно вызвать bias. Длина даёт surface cue: подробный текст выглядит старательнее. Randomization и balanced presentation снижают эффект.

Калибровка и переоптимизация

Reward model хорошо ранжирует пары, похожие на train, но downstream policy начинает искать ответы с максимальным score. Она находит лазейки: лишнюю длину, уверенный тон, повтор ключевых слов. Это reward hacking.

Goodhart's law проявляется как distribution shift: RM обучали на обычных ответах, а оптимизация генерирует экстремальные. Поэтому отдельно проверяют held-out пары, adversarial ответы и score против человеческой оценки после оптимизации.

Calibration curve группирует предсказания по вероятности и сравнивает с фактической долей побед. Accuracy не сообщает, оправдана ли уверенность 0,99.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Связь reward model score и человеческой оценки до и после сильной оптимизации
Рис. 80.3. Оптимизация reward выходит за область разметки

Синие точки обычных ответов лежат в обученном диапазоне и растут вместе с человеческой оценкой. Красная траектория оптимизации уходит вправо: score продолжает расти, оценка людей выходит на плато и падает. Вертикальная полоса отмечает максимум train scores.

Реальные данные HH-RLHF

Anthropic HH-RLHF содержит пары preferred/rejected для helpfulness и harmlessness. Перед опытом изучите card: как собирались prompt, кто сравнивал, какие версии моделей участвовали. Нельзя считать весь набор универсальным голосованием человечества.

Разделять train/test стоит по prompt и близким кластерам, иначе перефразированные ответы одной ситуации пересекаются. Метрики: pairwise accuracy, log-loss, calibration, accuracy по длине и тематике, agreement с отдельными оценщиками.

Данные могут содержать опасные запросы; исследовательский интерфейс должен минимизировать ненужное отображение вредного содержимого.

Мини-исследование: разделить вкус и шум

Пусть сто prompt оценивают две группы по пять человек. Для каждого сравнения сохраните идентификатор группы, но не личные данные. Fit три модели: общий Bradley–Terry, отдельные group scores и hierarchical вариант

rig=ri+δig,r_{ig}=r_i+\delta_{ig},

где δig\delta_{ig} регуляризуется к нулю. Сравните held-out log-loss на новых голосах тех же групп и на новых prompt.

Если отдельные модели выигрывают внутри групп, но плохо работают на малых данных, hierarchy даёт partial pooling. Постройте пары, где Prg(ij)\Pr_g(i\succ j) меняет сторону между группами. Называть их «шумными» нельзя: разногласие воспроизводимо.

Теперь повторите часть пар через неделю. Within-rater inconsistency оценивает шум, between-group difference — структуру предпочтений. Эти два источника нельзя лечить одной агрегацией большинства.

Активный выбор следующей пары

При ограниченном бюджете не сравнивайте все n(n1)/2n(n-1)/2 пар равномерно. Выберите ребро с большой uncertainty или близкой fitted probability к 0,5. После каждого нового голоса обновляйте интервалы.

Сравните random и active sampling на synthetic scores, где истинный порядок известен. Метрики — Kendall rank correlation и максимальная ширина интервала при одинаковом числе голосов. Добавьте один цикл, чтобы увидеть: активный алгоритм может уверенно пытаться исправить то, что одномерная модель не способна описать. Это мост к исследованию в бандитах, но reward здесь — информация, а не клик.

Добавьте tie как третий исход, а не случайно отдавайте ничью одному варианту. Модель Davidson вводит отдельный параметр склонности к ничьим; проще можно обучать три класса. Сравните fitted scores при удалении ties и при их явном учёте.

Если сложные близкие пары чаще получают tie, их удаление оставляет dataset из лёгких сравнений и завышает accuracy. Это связывает preference data с missing-not-at-random: отсутствие бинарного голоса содержит информацию о трудности.

Мост к alignment

Reward model ещё не меняет языковую модель. Она создаёт обучающий сигнал, по которому PPO, DPO или GRPO сдвинут вероятности ответов. Любая систематическая ошибка score станет направлением оптимизации.

Поэтому pipeline предпочтений обязан сохранять uncertainty и данные о происхождении. Удобный скаляр rr — интерфейс оптимизатора, а не финальная истина.

Скаляр скрывает голоса

Bradley–Terry превращает пары в вероятностный рейтинг и делает неопределённость видимой через граф сравнений. Модель требует связности и примерно транзитивной шкалы. Разногласия, инструкции и position bias принадлежат данным. Самая строгая проверка начинается после оптимизации, когда policy выходит за привычный диапазон reward model.

Задачи