Попарный выбор проще абсолютной оценки: «какой ответ лучше?» вместо «поставьте 8,3 из 10». Но модель Брэдли–Терри сжимает человеческое суждение в разность двух чисел. Чтобы reward model не научилась уверенно повторять шум, надо смотреть на граф сравнений, на ничьи и на разногласие оценщиков — а не только на точность.

Почему сравнить легче, чем поставить 8,3

Два ответа на один вопрос лежат рядом. Эксперт выбирает более точный и полезный — и делает это за пару секунд. Требование поставить каждому независимую оценку по десятибалльной шкале заставляет калибровать внутреннюю шкалу между днями, темами и людьми. Вчерашняя «восьмёрка» и сегодняшняя — разные восьмёрки, а «лучше» остаётся «лучше».

Плата за удобство: сравнение даёт один бит вместо числа. Вопрос урока — как из множества таких битов собрать шкалу, честно показать её неопределённость и вовремя заметить, что одной шкалы не хватает.

Мы будем работать не на игрушке. Возьмём реальный MovieLens 100K, тот же, что в уроке 39, и превратим оценки в турнир: если один и тот же зритель поставил фильму ii больше, чем фильму jj, засчитаем один голос «iji\succ j». Равные оценки станут ничьими. На 60 самых оцениваемых фильмах (у каждого не меньше 259 оценок) 941 зритель порождает 198 026 решающих голосов и ещё 102 731 ничью.

Модель Брэдли–Терри: разность становится вероятностью

У варианта ii есть скрытый балл rir_i. Вероятность предпочесть ii варианту jj:

Pr(ij)=σ(rirj)=11+exp[(rirj)].\Pr(i\succ j)=\sigma(r_i-r_j)=\frac{1}{1+\exp[-(r_i-r_j)]}.

Имеет значение только разность. Сдвиг всех баллов на одну константу cc ничего не меняет:

σ((ri+c)(rj+c))=σ(rirj),\sigma\bigl((r_i+c)-(r_j+c)\bigr)=\sigma(r_i-r_j),

поэтому для идентифицируемости фиксируют калибровку, например iri=0\sum_i r_i=0. Мы всюду пользуемся именно ею.

Удобнее всего думать в шансах. Если oij=Pr(ij)/Pr(ji)o_{ij}=\Pr(i\succ j)/\Pr(j\succ i), то

logoij=rirj.\log o_{ij}=r_i-r_j.

Балл измеряется в логарифмических шансах, а не в «баллах качества» с естественным нулём. Разность log31,10\log 3\approx1{,}10 означает шанс 3:1, то есть вероятность 0,750{,}75; разность log92,20\log 9\approx2{,}20 — шанс 9:1 и вероятность 0,900{,}90.

Обратный перевод так же прост:

rirj=logp1p,p=0,75log3,p=0,90log9,p=0,99log994,6.r_i-r_j=\log\frac{p}{1-p},\qquad p=0{,}75\Rightarrow\log 3,\quad p=0{,}90\Rightarrow\log 9,\quad p=0{,}99\Rightarrow\log 99\approx4{,}6.

Чувствительность вероятности к баллу задаётся производной

ddΔσ(Δ)=σ(Δ)(1σ(Δ))14,\frac{d}{d\Delta}\sigma(\Delta)=\sigma(\Delta)\bigl(1-\sigma(\Delta)\bigr)\le\frac14,

и максимум достигается при Δ=0\Delta=0: возле равенства вариантов один и тот же сдвиг балла меняет вероятность вчетверо сильнее, чем при Δ=2\Delta=2.

Проверим модель на реальных данных. Для каждой из 1770 пар фильмов известна настоящая доля побед; сгруппируем пары по подобранной разности баллов и сравним с σ(Δr)\sigma(\Delta r). Максимальное расхождение по группам — 0,0140{,}014.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Логистическая кривая и красные точки реальных долей побед из MovieLens ложатся на кривую; отмечены уровни 0,50, 0,75 и 0,90
Рис. 80.1. Разность баллов становится вероятностью — и это проверяется

Синяя кривая — модель σ(rirj)\sigma(r_i-r_j), красные точки — реальные доли побед в турнире MovieLens, сгруппированные по разности подобранных баллов; размер точки пропорционален корню из числа голосов. Максимальное отклонение группы от кривой 0,0140{,}014. Логистическая форма здесь не постулат, а проверенный факт.

Правдоподобие попарных голосов

Пусть в сравнении kk участвуют варианты ik,jki_k,j_k, а yk=1y_k=1, если победил первый. Правдоподобие — произведение бернуллиевских множителей, а минус его логарифм совпадает с бинарной кросс-энтропией из урока 20:

L=k[yklogσ(Δrk)+(1yk)log(1σ(Δrk))],Δrk=rikrjk.\mathcal L=-\sum_k\Bigl[y_k\log\sigma(\Delta r_k)+(1-y_k)\log\bigl(1-\sigma(\Delta r_k)\bigr)\Bigr], \qquad \Delta r_k=r_{i_k}-r_{j_k}.

Это в точности максимум правдоподобия для логистической модели, где «признаком» пары служит вектор из +1+1 на месте ii, 1-1 на месте jj и нулей в остальных местах. Производная имеет прозрачный вид: обозначим nijn_{ij} число сравнений пары, wijw_{ij} число побед ii, тогда

Lri=ji[nijσ(rirj)wij].\frac{\partial\mathcal L}{\partial r_i} =\sum_{j\ne i}\Bigl[n_{ij}\,\sigma(r_i-r_j)-w_{ij}\Bigr].

В точке максимума правдоподобия для каждого варианта ожидаемое число побед равно наблюдённому:

jinijσ(r^ir^j)=jiwij.\sum_{j\ne i}n_{ij}\,\sigma(\widehat r_i-\widehat r_j)=\sum_{j\ne i}w_{ij}.

Это условие баланса и есть смысл подгонки: модель обязана воспроизвести суммарное число побед каждого варианта, но не обязана воспроизвести каждую пару отдельно. Отсюда же классический итеративный алгоритм Цермело:

pijiwijjinijpi+pj,ri=logpi,p_i\leftarrow\frac{\sum_{j\ne i}w_{ij}}{\displaystyle\sum_{j\ne i}\frac{n_{ij}}{p_i+p_j}}, \qquad r_i=\log p_i,

сходящийся при связном графе сравнений. Ровно им посчитаны все баллы в этом уроке.

Для reward model балл зависит не от индекса, а от пары «запрос — ответ»:

rϕ(x,y)R,LRM=logσ(rϕ(x,y+)rϕ(x,y)).r_\phi(x,y)\in\mathbb R,\qquad \mathcal L_{\mathrm{RM}}=-\log\sigma\bigl(r_\phi(x,y^+)-r_\phi(x,y^-)\bigr).

Градиент по параметрам показывает, чему именно учится сеть:

ϕLRM=(1σ(Δr))ϕ(rϕ(x,y+)rϕ(x,y)),Δr=rϕ(x,y+)rϕ(x,y),\nabla_\phi\mathcal L_{\mathrm{RM}} =-\bigl(1-\sigma(\Delta r)\bigr)\, \nabla_\phi\bigl(r_\phi(x,y^+)-r_\phi(x,y^-)\bigr), \qquad \Delta r=r_\phi(x,y^+)-r_\phi(x,y^-),

то есть шаг тем больше, чем сильнее модель ошиблась на этой паре, и всегда направлен на увеличение разрыва — никакого «абсолютного уровня» в сигнале нет.

Формально ничего не изменилось — изменилось только то, что баллы теперь вычисляются нейросетью и обобщаются на невиданные ответы. Модель учится порядку внутри одного запроса; сравнивать сырые значения rϕr_\phi между разными запросами без калибровки нельзя.

Реальный турнир: триста тысяч сравнений

Число возможных пар растёт квадратично, и это главный ограничитель дизайна:

(m2)=m(m1)2,m=601770,m=600179700.\binom{m}{2}=\frac{m(m-1)}{2},\qquad m=60\Rightarrow1770,\qquad m=600\Rightarrow179\,700.

В нашем турнире 60 фильмов, все 6059/2=177060\cdot59/2=1770 пар сравнивались хотя бы раз, медиана — 110 голосов на пару, минимум 42. Это очень богатый граф; именно поэтому на нём видно, как ведёт себя модель в идеальных условиях, и тем поучительнее сломать эти условия дальше.

Размах подобранных баллов 2,842{,}84: наверху «Schindler's List» с r=1,41r=1{,}41 и средней оценкой 4,474{,}47. Медианная стандартная ошибка балла — 0,0270{,}027, максимальная 0,0360{,}036.

Балл сравнений и средняя оценка

Раз голоса выведены из оценок, естественно спросить: не проще ли усреднить оценки? Корреляция подобранного балла со средней оценкой равна 0,9820{,}982, ранговая τ=0,918\tau=0{,}918 — почти одно и то же. Напомним определение:

τ=CDC+D,\tau=\frac{C-D}{C+D},

где CC — число согласованных пар объектов, DD — число инверсий; τ=1\tau=1 означает совпадение порядков, τ=0\tau=0 — независимость. Это хорошая проверка вменяемости, а не открытие: было бы тревожно, если бы вышло иначе.

Разница появляется там, где состав оценщиков разный. Средняя оценка считается по всем, кто посмотрел фильм, — а посмотрели его не случайные люди. Балл сравнений считается только по зрителям, видевшим оба фильма, и потому свободен от части этого отбора. Наибольшее расхождение рангов у «The English Patient»: 38-е место по баллу сравнений против 47-го по средней оценке, разрыв в 9 позиций.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Точечная диаграмма: по горизонтали средняя оценка фильма, по вертикали балл Брэдли-Терри, точки почти на прямой, красным отмечен фильм с наибольшим расхождением рангов
Рис. 80.2. Балл сравнений и средняя оценка — родственники, но не близнецы

Каждая точка — фильм; размер отражает число оценок, усы — 95% интервал балла. Корреляция 0,9820{,}982, но ранги совпадают не всюду: красным отмечен фильм с наибольшим расхождением, 9 позиций. Средняя оценка смешивает «какой фильм» и «кто его смотрел»; попарное сравнение внутри одного зрителя убирает вторую часть.

Граф сравнений должен быть связным

Вершины графа — варианты, ребро — хотя бы одно сравнение. Если граф распался на компоненты, баллы внутри компонент можно двигать независимо: правдоподобие не изменится, максимум не единственен. Никакое количество голосов внутри групп не свяжет две шкалы.

Даже в связном графе тонкий «мост» делает межгрупповой контраст хрупким. Проверим это на реальных голосах. Возьмём 12 самых сравниваемых фильмов, разобьём на две шестёрки, оставим все голоса внутри шестёрок и ровно одно связующее ребро. 95%-интервал разности средних баллов двух групп получается ±0,46\pm0{,}46. Добавим ещё три перекрёстных ребра — это всего +9,7%+9{,}7\% голосов — и интервал сжимается до ±0,18\pm0{,}18, в 2,5 раза.

Var(r^ir^j)=(L+)ii+(L+)jj2(L+)ij,\operatorname{Var}\bigl(\widehat r_i-\widehat r_j\bigr) =\bigl(L^{+}\bigr)_{ii}+\bigl(L^{+}\bigr)_{jj}-2\bigl(L^{+}\bigr)_{ij}, Lij=nijp^ij(1p^ij) (ij),Lii=jinijp^ij(1p^ij).L_{ij}=-n_{ij}\,\widehat p_{ij}\bigl(1-\widehat p_{ij}\bigr)\ (i\ne j), \qquad L_{ii}=\sum_{j\ne i}n_{ij}\,\widehat p_{ij}\bigl(1-\widehat p_{ij}\bigr).

Матрица LL — это лапласиан взвешенного графа сравнений, где вес ребра равен информации Фишера, накопленной на этой паре. Дисперсия контраста — эффективное сопротивление между вершинами, если считать граф электрической сетью. Отсюда буквально: узкое место в графе — большое сопротивление — широкий интервал.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Два плотных кластера по шесть вершин, слева соединённые одним ребром, справа четырьмя; подписан разрыв групп 0,46 и 0,18
Рис. 80.3. Разница между двумя сообществами держится на переходных рёбрах

Слева: все голоса внутри двух шестёрок плюс один мост, интервал межгруппового контраста ±0,46\pm0{,}46. Справа: добавлены три перекрёстных ребра, всего +9,7%+9{,}7\% голосов, интервал ±0,18\pm0{,}18. Плотность внутри групп не помогает: разность шкал определяется только переходными сравнениями.

Сколько голосов стоит один знак после запятой

Информация Фишера одного сравнения пары равна p(1p)p(1-p) и максимальна при p=1/2p=1/2: сравнение близких вариантов информативнее, чем очевидное. Для собранных nn голосов стандартная ошибка ведёт себя как

se(r^i)    1n,\operatorname{se}(\widehat r_i)\;\asymp\;\frac{1}{\sqrt{n}},

то же самое n1/2n^{-1/2}, что и в уроке 46. Точнее, для отдельного варианта

se(r^i)[jinijp^ij(1p^ij)]1/2,\operatorname{se}(\widehat r_i)\approx \Bigl[\sum_{j\ne i}n_{ij}\,\widehat p_{ij}\bigl(1-\widehat p_{ij}\bigr)\Bigr]^{-1/2},

и знаменатель — сумма информаций всех рёбер, входящих в вершину ii. Проверим на реальных данных: прореживая турнир от 2% голосов до 100%, получаем наклон логарифма ошибки по логарифму числа голосов ровно 0,50-0{,}50, а при всех 198 026 голосах медианная ошибка балла 0,02670{,}0267.

Практический вывод жёсткий: точность reward model в один знак после запятой стоит примерно в сто раз больше голосов, чем точность в один знак до неё. Поэтому бюджет разметки — центральный проектный параметр, а не мелочь.

Ничьи — это данные, а не мусор

В нашем турнире 102 731 ничья против 198 026 решающих голосов: ничьи составляют 34,2%34{,}2\% всех сравнений. Куда они попадают? Там, где подобранная разность баллов мала (Δr<0,15|\Delta r|<0{,}15), ничьими оказываются 37,9%37{,}9\% сравнений; там, где разность велика (Δr>1,1|\Delta r|>1{,}1) — 28,3%28{,}3\%.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Столбчатая диаграмма: доля ничьих падает с 37,9 процента для близких пар до 28,3 процента для далёких
Рис. 80.4. Ничьи скапливаются там, где модель сомневается

Доля ничьих по группам пар с разной величиной Δr|\Delta r|. Разница не огромна, но систематична и направлена именно так, как подсказывает здравый смысл: чем ближе варианты, тем чаще человек отказывается выбирать. Выбрасывая ничьи, мы выбрасываем непропорционально много трудных пар.

Отсюда неприятность: если удалить ничьи, оставшийся набор смещён в сторону лёгких сравнений, и точность модели на нём завышена. Это тот же механизм, что и неслучайные пропуски: сам факт отсутствия голоса несёт информацию о трудности пары.

Честный путь — моделировать ничью как третий исход. Модель Дэвидсона вводит параметр склонности к ничьим ν>0\nu>0:

Pr(ij)=pipi+pj+νpipj,\Pr(i\succ j)=\frac{p_i}{p_i+p_j+\nu\sqrt{p_i p_j}}, Pr(ничья)=νpipjpi+pj+νpipj,pi=eri.\Pr(\text{ничья})=\frac{\nu\sqrt{p_ip_j}}{p_i+p_j+\nu\sqrt{p_ip_j}}, \qquad p_i=e^{r_i}.

При ν0\nu\to0 она превращается в обычную Брэдли–Терри. Проверка нормировки очевидна:

Pr(ij)+Pr(ji)+Pr(ничья)=pi+pj+νpipjpi+pj+νpipj=1.\Pr(i\succ j)+\Pr(j\succ i)+\Pr(\text{ничья}) =\frac{p_i+p_j+\nu\sqrt{p_ip_j}}{p_i+p_j+\nu\sqrt{p_ip_j}}=1.

Доля ничьих в такой модели максимальна при pi=pjp_i=p_j и равна ν/(2+ν)\nu/(2+\nu): из наблюдённых 37,9%37{,}9\% ничьих на близких парах получается оценка ν1,2\nu\approx1{,}2.

Лаборатория предпочтений

Попарные голоса, скрытый балл и предел одной шкалы

Загружается живая иллюстрация…

Здесь голоса порождаются заданной «истиной», а модель всегда одна и та же — один скрытый балл на вариант. Начните с режима «одна шкала» и двигайте бюджет: средняя ширина 95%-интервала падает с 1,461{,}46 при 120 голосах до 0,290{,}29 при 3000, а максимальный промах модели мимо истины — с 0,180{,}18 до 0,050{,}05. Всё работает так, как обещает теория.

Теперь переключите «два вкуса»: голоса поровну дают две группы с почти противоположными предпочтениями. Интервалы сжимаются точно так же — до 0,270{,}27 при 3000 голосов, — а промах мимо истины каждой группы остаётся около 0,400{,}40 и не уменьшается. При этом остаток «факт минус модель» по объединённым данным мал: смесь двух логистических кривых сама выглядит почти как логистическая. Данные не выдают смешение, если не хранить, кто голосовал.

В режиме «цикл» модель ломается заметнее: остаток по данным держится на уровне 0,270{,}270,310{,}31 и не падает с ростом бюджета. А если включить активный выбор пар, остаток по данным упадёт до 0,060{,}06 — не потому, что модель стала верной (промах мимо истины вырастет до 0,600{,}60), а потому, что алгоритм перестал собирать голоса на неудобных парах. Диагностика ослепла ровно там, где была нужна.

Циклы: где одной оси не хватает

Люди могут предпочитать краткий AA подробному BB, точный BB дружелюбному CC, а дружелюбный CC краткому AA. Брэдли–Терри предполагает одномерную шкалу и устойчивый цикл воспроизвести не может: из rA>rBr_A>r_B и rB>rCr_B>r_C обязательно следует rA>rCr_A>r_C.

Есть ли циклы в наших реальных данных? Мы проверили все 3422034\,220 троек фильмов по мажоритарному правилу и не нашли ни одного цикла. Это честный результат, и он в пользу одномерной шкалы — на этих данных, при этом способе получения голосов. Ожидать того же от сравнений длинных текстовых ответов оснований нет.

Отсутствие циклов не означает идеального описания. Диагностика — остаток

eij=p^ijσ(r^ir^j),p^ij=wijnij.e_{ij}=\widehat p_{ij}-\sigma(\widehat r_i-\widehat r_j), \qquad \widehat p_{ij}=\frac{w_{ij}}{n_{ij}}.

Среднеквадратичный остаток по всем 1770 парам равен 0,0430{,}043, максимальный — 0,160{,}16: пара «Pulp Fiction» — «L.A. Confidential», где реальная доля побед 0,640{,}64, а модель предсказывает 0,480{,}48 (73 голоса). Одна ось не различает «крутое кино вообще» и «кино, которое любит именно этот зритель».

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Слева тепловая карта остатков модели по 24 фильмам, справа модельный треугольник с циклом A B C и вероятностями две трети
Рис. 80.5. Одномерная шкала: где держится и где ломается

Слева — реальные остатки «факт минус модель» для 24 фильмов с наибольшим баллом; цвет насыщается на ±0,2\pm0{,}2. Структура слабая, но не нулевая: строки и столбцы с систематическим цветом указывают на пропущенное измерение. Справа — модельный пример (не данные): три группы оценщиков с разными приоритетами дают мажоритарный цикл ABCAA\succ B\succ C\succ A с вероятностями 2/32/3, который одномерная модель описать не может ни при каком бюджете.

Связь с самоигрой прямая: Elo и Брэдли–Терри — одна и та же конструкция, и обе теряют циклы стратегий, сколь бы много партий ни было сыграно.

Два вкуса, сжатые в один скаляр

Разделим реальных зрителей по полу: 668 мужчин и 273 женщины. Обучим две отдельные модели Брэдли–Терри. Корреляция баллов 0,8690{,}869 — согласие велико. Но 285 пар фильмов из 1770 меняют сторону: то, что одна группа предпочитает, другая отвергает. Из них 152 пары различаются статистически значимо, то есть разногласие нельзя списать на нехватку голосов.

Крайний случай: «Sense and Sensibility» против «2001: A Space Odyssey». Разность баллов у мужчин 0,47-0{,}47, у женщин +0,99+0{,}99. Единая модель поставит между ними что-то среднее и будет уверенно ошибаться в обе стороны.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Диаграмма рассеяния баллов по голосам мужчин и женщин, точки вдоль диагонали, красная и золотая точки соединены линией и подписаны
Рис. 80.6. Один скаляр усредняет два вкуса

Каждая точка — фильм; по осям баллы, подобранные отдельно по голосам мужчин и женщин. Корреляция 0,8690{,}869, но 285 пар меняют сторону, 152 из них значимо. Отмеченная пара расходится сильнее всех: 0,47-0{,}47 против +0,99+0{,}99. Агрегат даёт число, которого не придерживается ни одна из групп.

Иерархическая модель даёт компромисс: балл варианта для группы gg

rig=ri+δig,δigN(0,τ2),r_{ig}=r_i+\delta_{ig},\qquad \delta_{ig}\sim\mathcal N(0,\tau^2),

где общий rir_i обучается на всех голосах, а поправки δig\delta_{ig} регуляризуются к нулю. Это частичное объединение из урока 48: малые группы стягиваются к общему баллу, большие получают собственный. Величина стягивания известна явно: если у группы ngn_g голосов с информацией IgI_g, то

δ^ig=IgIg+1/τ2δ^igсырое,\widehat\delta_{ig}=\frac{I_g}{I_g+1/\tau^2}\,\widehat\delta^{\,\text{сырое}}_{ig},

и при Ig1/τ2I_g\ll1/\tau^2 поправка почти обнуляется, а при Ig1/τ2I_g\gg1/\tau^2 сохраняется целиком.

Инструкция разметки создаёт reward

Разметчикам нужны критерии и опция ничьей. «Лучше» можно понимать как фактически точнее, яснее, безопаснее, полнее или приятнее. Без явного приоритета два человека решают разные задачи, а модель усредняет две разные цели — тот самый случай из предыдущего раздела, только созданный нами самими.

Качество протокола проверяют повтором части пар, скрытыми контрольными примерами, перестановкой порядка ответов, временем оценки, коэффициентом согласия и коротким обоснованием выбора.

Особенно коварен позиционный сдвиг: ответ, показанный первым, выигрывает чаще просто из-за места. Смоделируем это на честной синтетике с фиксированным seed: 40 вариантов, по 40 голосов на пару, к разности всегда добавлен сдвиг 0,350{,}35 в пользу первого. Максимальное искажение оценок — 0,510{,}51, то есть больше, чем половина типичного шага между соседними вариантами в этом ряду.

Длина даёт другую поверхностную подсказку: подробный текст выглядит старательнее. Проверим силу таких подсказок на наших данных. Обучим reward model, которой доступны только «поверхностные» признаки фильма — популярность и год выпуска. Она угадывает исход реальных сравнений в 58,6%58{,}6\% случаев, тогда как полная модель Брэдли–Терри, знающая сам фильм, — в 68,3%68{,}3\%. Корреляция её баллов с настоящими — 0,410{,}41.

Гудхарт: чем сильнее давим, тем меньше получаем

Reward model хорошо ранжирует пары, похожие на обучающие. Но политика начинает искать ответы с максимальным баллом и уходит туда, где модель никогда не проверялась. Это не абстракция — вот измерение на наших данных.

Обучим слабую reward model: возьмём всего 200 голосов, разбросанных по 200 парам из 1770 (по одному голосу на пару). Её корреляция с настоящими баллами 0,440{,}44 — посредственно, но не бессмысленно. Теперь применим давление оптимизации в чистом виде: выберем лучший фильм по мнению модели из nn случайных и посмотрим, каков его настоящий балл.

При n=12n=12 настоящий балл выбранного максимален, 0,500{,}50. При n=40n=40 он падает до 0,340{,}34 — на треть — хотя балл в глазах самой модели всё это время растёт. Богатая модель, обученная на всех голосах, ведёт себя иначе: её выбор монотонно приближается к настоящему лидеру, 1,321{,}32 при потолке 1,411{,}41.

E[rtrue(argmaxySnr^(y))]    n    rtrue(argmaxyr^(y)),\mathbb E\Bigl[r_{\text{true}}\bigl(\arg\max_{y\in S_n}\widehat r(y)\bigr)\Bigr] \;\xrightarrow[\;n\to\infty\;]{}\; r_{\text{true}}\bigl(\arg\max_y \widehat r(y)\bigr),

и этот предел равен настоящему максимуму только тогда, когда r^\widehat r и rtruer_{\text{true}} достигают максимума на одном объекте. Всё остальное время рост nn (или силы оптимизации) уводит нас к ошибкам модели, а не к цели.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
График: штриховая линия балла по мнению слабой reward model растёт, красная линия настоящего балла достигает пика при n равном 12 и падает, зелёная линия для богатой модели растёт монотонно
Рис. 80.7. Переоптимизация: сильнее давим на proxy — теряем то, что мерили

Лучший из nn случайных фильмов по мнению reward model. Слабая модель (200 голосов): её собственный балл растёт неограниченно, а настоящий балл выбранного достигает пика 0,500{,}50 при n=12n=12 и падает до 0,340{,}34. Богатая модель растёт монотонно к 1,321{,}32 при потолке 1,411{,}41. Переоптимизация — не свойство оптимизатора, а произведение силы давления на ошибку модели.

Отсюда стандартная практика: держать штраф за уход от reference-модели, ограничивать силу оптимизации и проверять политику людьми после оптимизации, а не только точность reward model до неё. Механику штрафа разбирает урок 81.

Калибровка важнее точности

Точность на парах отвечает на вопрос «часто ли модель угадывает победителя»; калибровка — на вопрос «можно ли верить её уверенности». Для оптимизации важнее второе: политика взвешивает шаги величиной reward, а не его знаком.

Практическая проверка — та же, что в уроке 31: разбить пары по предсказанной вероятности и сравнить с фактической долей побед. На нашем турнире максимальное расхождение по группам 0,0140{,}014 — модель откалибрована. Полезна и сводная мера:

ECE=bnbnyˉbpˉb,\mathrm{ECE}=\sum_{b}\frac{n_b}{n}\bigl|\bar y_b-\bar p_b\bigr|,

где bb — интервалы предсказанной вероятности, yˉb\bar y_b — фактическая доля побед в интервале, pˉb\bar p_b — средняя предсказанная вероятность. Точность 95%95\% при плохой калибровке хуже, чем 85%85\% при хорошей: первая модель уверенно врёт там, где вторая честно сомневается.

Полезно смотреть и на счёт Брайера, который разом наказывает и за ошибку, и за неоправданную уверенность:

BS=1nk=1n(pkyk)2,\mathrm{BS}=\frac1n\sum_{k=1}^{n}\bigl(p_k-y_k\bigr)^2,

и его разложение на калибровку и разрешающую способность:

BS=bnbn(pˉbyˉb)2калибровкаbnbn(yˉbyˉ)2разрешение+yˉ(1yˉ)неустранимое.\mathrm{BS}=\underbrace{\sum_b\frac{n_b}{n}\bigl(\bar p_b-\bar y_b\bigr)^2}_{\text{калибровка}} -\underbrace{\sum_b\frac{n_b}{n}\bigl(\bar y_b-\bar y\bigr)^2}_{\text{разрешение}} +\underbrace{\bar y\bigl(1-\bar y\bigr)}_{\text{неустранимое}}.

Активный выбор пары: не панацея

Раз информация одного сравнения равна p(1p)p(1-p), соблазнительно спрашивать людей только про близкие пары. Проверим жадный вариант на реальном турнире: на каждом шаге выбираем пары, максимизирующие произведение дисперсии контраста на p(1p)p(1-p), и сравниваем со случайным выбором (усреднение по восьми seed).

При бюджете 200 голосов активный выбор впереди: ранговая τ\tau к истине 0,300{,}30 против 0,240{,}24. Но к 900 голосам он проигрывает: 0,580{,}58 против 0,640{,}64. Жадность концентрирует бюджет на трудных парах и хуже связывает шкалу целиком — тот же баланс исследования и использования, что в бандитах.

Борис Миркин и проблема группового выбора

В 1974 году в издательстве «Наука» вышла книга Бориса Григорьевича Миркина «Проблема группового выбора». В ней аксиоматически разбирается ровно наш вопрос: как из индивидуальных предпочтений собрать одно коллективное и что именно теряется при любом способе сборки. Миркин работал с отношениями предпочтения как с математическими объектами — включая неполные и нетранзитивные, — и развивал теорию согласования ранжирований и расстояний между ними; его более поздние работы связали эту линию с анализом данных и кластеризацией.

Для нас важен методологический вывод этой школы: агрегирование — выбор аксиом, а не техническая операция. Когда мы обучаем одну reward model на голосах разных людей, мы молча выбираем правило агрегирования и вместе с ним соглашаемся на потери, которые это правило гарантирует. Никакая точность обучения этих потерь не компенсирует, потому что они внесены до обучения.

Мост к alignment

Reward model ещё не меняет языковую модель. Она создаёт обучающий сигнал, по которому PPO, DPO или GRPO сдвинут вероятности ответов. Любая систематическая ошибка балла станет направлением оптимизации: если модель переоценивает длину, политика научится быть многословной.

Поэтому конвейер предпочтений обязан хранить не только итоговые баллы, но и происхождение голосов: обезличенные идентификаторы групп, порядок показа, повторы и ничьи. Всё, что выброшено на этапе агрегирования, потом придётся восстанавливать по последствиям — то есть по поведению обученной модели.

Скаляр скрывает голоса

Брэдли–Терри превращает пары в вероятностный рейтинг, и на реальных данных делает это отлично: логистическая форма подтверждается с точностью 0,0140{,}014, ошибка балла падает строго как n1/2n^{-1/2}, циклов нет ни в одной из 3422034\,220 троек. Ровно поэтому важно помнить, чего модель не видит: разногласия 285 пар между группами, 34%34\% ничьих, хрупкости контраста через тонкий мост в графе и того, что при сильном давлении оптимизации выбранный по слабой модели вариант теряет треть настоящего качества.

Удобное число rr — интерфейс оптимизатора, а не итог человеческого суждения. Самая строгая проверка reward model начинается после того, как по ней уже оптимизировали.

Задачи