Можно ли свести человеческую ценность к одному reward?
Попарный выбор проще абсолютной оценки: «какой ответ лучше?» вместо «поставьте
8,3 из 10». Но модель Брэдли–Терри сжимает человеческое суждение в разность двух
чисел. Чтобы reward model не научилась уверенно повторять шум, надо смотреть на
граф сравнений, на ничьи и на разногласие оценщиков — а не только на точность.
Почему сравнить легче, чем поставить 8,3
Два ответа на один вопрос лежат рядом. Эксперт выбирает более точный и полезный
— и делает это за пару секунд. Требование поставить каждому независимую оценку
по десятибалльной шкале заставляет калибровать внутреннюю шкалу между днями,
темами и людьми. Вчерашняя «восьмёрка» и сегодняшняя — разные восьмёрки, а
«лучше» остаётся «лучше».
Плата за удобство: сравнение даёт один бит вместо числа. Вопрос урока — как из
множества таких битов собрать шкалу, честно показать её неопределённость и
вовремя заметить, что одной шкалы не хватает.
Мы будем работать не на игрушке. Возьмём реальный MovieLens 100K, тот же, что в
уроке 39, и превратим оценки в турнир: если один и тот же
зритель поставил фильму i больше, чем фильму j, засчитаем один голос
«i≻j». Равные оценки станут ничьими. На 60 самых оцениваемых фильмах
(у каждого не меньше 259 оценок) 941 зритель порождает 198 026 решающих голосов
и ещё 102 731 ничью.
Модель Брэдли–Терри: разность становится вероятностью
У варианта i есть скрытый балл ri. Вероятность предпочесть i варианту j:
Pr(i≻j)=σ(ri−rj)=1+exp[−(ri−rj)]1.
Имеет значение только разность. Сдвиг всех баллов на одну константу c ничего
не меняет:
σ((ri+c)−(rj+c))=σ(ri−rj),
поэтому для идентифицируемости фиксируют калибровку, например ∑iri=0.
Мы всюду пользуемся именно ею.
Удобнее всего думать в шансах. Если oij=Pr(i≻j)/Pr(j≻i), то
logoij=ri−rj.
Балл измеряется в логарифмических шансах, а не в «баллах качества» с
естественным нулём. Разность log3≈1,10 означает шанс 3:1, то есть
вероятность 0,75; разность log9≈2,20 — шанс 9:1 и вероятность
0,90.
Чувствительность вероятности к баллу задаётся производной
dΔdσ(Δ)=σ(Δ)(1−σ(Δ))≤41,
и максимум достигается при Δ=0: возле равенства вариантов один и тот же
сдвиг балла меняет вероятность вчетверо сильнее, чем при Δ=2.
Проверим модель на реальных данных. Для каждой из 1770 пар фильмов известна
настоящая доля побед; сгруппируем пары по подобранной разности баллов и сравним
с σ(Δr). Максимальное расхождение по группам — 0,014.
Рис. 80.1. Разность баллов становится вероятностью — и это проверяется
Синяя кривая — модель σ(ri−rj), красные точки — реальные доли побед в
турнире MovieLens, сгруппированные по разности подобранных баллов; размер точки
пропорционален корню из числа голосов. Максимальное отклонение группы от кривой
0,014. Логистическая форма здесь не постулат, а проверенный факт.
Правдоподобие попарных голосов
Пусть в сравнении k участвуют варианты ik,jk, а yk=1, если победил
первый. Правдоподобие — произведение бернуллиевских множителей, а минус его
логарифм совпадает с бинарной кросс-энтропией из урока 20:
Это в точности максимум правдоподобия для логистической модели,
где «признаком» пары служит вектор из +1 на месте i, −1 на месте j и
нулей в остальных местах. Производная имеет прозрачный вид: обозначим nij
число сравнений пары, wij число побед i, тогда
∂ri∂L=j=i∑[nijσ(ri−rj)−wij].
В точке максимума правдоподобия для каждого варианта ожидаемое число побед равно
наблюдённому:
j=i∑nijσ(ri−rj)=j=i∑wij.
Это условие баланса и есть смысл подгонки: модель обязана воспроизвести суммарное
число побед каждого варианта, но не обязана воспроизвести каждую пару отдельно.
Отсюда же классический итеративный алгоритм Цермело:
pi←j=i∑pi+pjnij∑j=iwij,ri=logpi,
сходящийся при связном графе сравнений. Ровно им посчитаны все баллы в этом уроке.
Для reward model балл зависит не от индекса, а от пары «запрос — ответ»:
rϕ(x,y)∈R,LRM=−logσ(rϕ(x,y+)−rϕ(x,y−)).
Градиент по параметрам показывает, чему именно учится сеть:
то есть шаг тем больше, чем сильнее модель ошиблась на этой паре, и всегда
направлен на увеличение разрыва — никакого «абсолютного уровня» в сигнале нет.
Формально ничего не изменилось — изменилось только то, что баллы теперь
вычисляются нейросетью и обобщаются на невиданные ответы. Модель учится порядку
внутри одного запроса; сравнивать сырые значения rϕ между разными
запросами без калибровки нельзя.
Реальный турнир: триста тысяч сравнений
Число возможных пар растёт квадратично, и это главный ограничитель дизайна:
(2m)=2m(m−1),m=60⇒1770,m=600⇒179700.
В нашем турнире 60 фильмов, все 60⋅59/2=1770 пар сравнивались хотя бы раз,
медиана — 110 голосов на пару, минимум 42. Это очень богатый граф; именно поэтому
на нём видно, как ведёт себя модель в идеальных условиях, и тем поучительнее
сломать эти условия дальше.
Размах подобранных баллов 2,84: наверху «Schindler's List» с r=1,41 и
средней оценкой 4,47. Медианная стандартная ошибка балла — 0,027,
максимальная 0,036.
Балл сравнений и средняя оценка
Раз голоса выведены из оценок, естественно спросить: не проще ли усреднить
оценки? Корреляция подобранного балла со средней оценкой равна 0,982, ранговая
τ=0,918 — почти одно и то же. Напомним определение:
τ=C+DC−D,
где C — число согласованных пар объектов, D — число инверсий; τ=1
означает совпадение порядков, τ=0 — независимость. Это хорошая проверка вменяемости, а не
открытие: было бы тревожно, если бы вышло иначе.
Разница появляется там, где состав оценщиков разный. Средняя оценка считается по
всем, кто посмотрел фильм, — а посмотрели его не случайные люди. Балл сравнений
считается только по зрителям, видевшим оба фильма, и потому свободен от части
этого отбора. Наибольшее расхождение рангов у «The English Patient»: 38-е место
по баллу сравнений против 47-го по средней оценке, разрыв в 9 позиций.
Рис. 80.2. Балл сравнений и средняя оценка — родственники, но не близнецы
Каждая точка — фильм; размер отражает число оценок, усы — 95% интервал балла.
Корреляция 0,982, но ранги совпадают не всюду: красным отмечен фильм с
наибольшим расхождением, 9 позиций. Средняя оценка смешивает «какой фильм» и
«кто его смотрел»; попарное сравнение внутри одного зрителя убирает вторую часть.
Граф сравнений должен быть связным
Вершины графа — варианты, ребро — хотя бы одно сравнение. Если граф распался на
компоненты, баллы внутри компонент можно двигать независимо: правдоподобие не
изменится, максимум не единственен. Никакое количество голосов внутри групп не
свяжет две шкалы.
Даже в связном графе тонкий «мост» делает межгрупповой контраст хрупким.
Проверим это на реальных голосах. Возьмём 12 самых сравниваемых фильмов, разобьём
на две шестёрки, оставим все голоса внутри шестёрок и ровно одно связующее ребро.
95%-интервал разности средних баллов двух групп получается ±0,46. Добавим
ещё три перекрёстных ребра — это всего +9,7% голосов — и интервал сжимается
до ±0,18, в 2,5 раза.
Матрица L — это лапласиан взвешенного графа сравнений, где вес ребра равен
информации Фишера, накопленной на этой паре. Дисперсия контраста — эффективное
сопротивление между вершинами, если считать граф электрической сетью. Отсюда
буквально: узкое место в графе — большое сопротивление — широкий интервал.
Рис. 80.3. Разница между двумя сообществами держится на переходных рёбрах
Слева: все голоса внутри двух шестёрок плюс один мост, интервал межгруппового
контраста ±0,46. Справа: добавлены три перекрёстных ребра, всего +9,7%
голосов, интервал ±0,18. Плотность внутри групп не помогает: разность
шкал определяется только переходными сравнениями.
Сколько голосов стоит один знак после запятой
Информация Фишера одного сравнения пары равна p(1−p) и максимальна при
p=1/2: сравнение близких вариантов информативнее, чем очевидное. Для
собранных n голосов стандартная ошибка ведёт себя как
se(ri)≍n1,
то же самое n−1/2, что и в уроке 46. Точнее, для отдельного
варианта
se(ri)≈[j=i∑nijpij(1−pij)]−1/2,
и знаменатель — сумма информаций всех рёбер, входящих в вершину i. Проверим на реальных
данных: прореживая турнир от 2% голосов до 100%, получаем наклон логарифма
ошибки по логарифму числа голосов ровно −0,50, а при всех 198 026 голосах
медианная ошибка балла 0,0267.
Практический вывод жёсткий: точность reward model в один знак после запятой
стоит примерно в сто раз больше голосов, чем точность в один знак до неё.
Поэтому бюджет разметки — центральный проектный параметр, а не мелочь.
Ничьи — это данные, а не мусор
В нашем турнире 102 731 ничья против 198 026 решающих голосов: ничьи составляют
34,2% всех сравнений. Куда они попадают? Там, где подобранная разность
баллов мала (∣Δr∣<0,15), ничьими оказываются 37,9% сравнений; там,
где разность велика (∣Δr∣>1,1) — 28,3%.
Рис. 80.4. Ничьи скапливаются там, где модель сомневается
Доля ничьих по группам пар с разной величиной ∣Δr∣. Разница не огромна,
но систематична и направлена именно так, как подсказывает здравый смысл: чем
ближе варианты, тем чаще человек отказывается выбирать. Выбрасывая ничьи, мы
выбрасываем непропорционально много трудных пар.
Отсюда неприятность: если удалить ничьи, оставшийся набор смещён в сторону лёгких
сравнений, и точность модели на нём завышена. Это тот же механизм, что и
неслучайные пропуски: сам факт отсутствия голоса несёт информацию
о трудности пары.
Честный путь — моделировать ничью как третий исход. Модель Дэвидсона вводит
параметр склонности к ничьим ν>0:
Доля ничьих в такой модели максимальна при pi=pj и равна
ν/(2+ν): из наблюдённых 37,9% ничьих на близких парах получается
оценка ν≈1,2.
Лаборатория предпочтений
Попарные голоса, скрытый балл и предел одной шкалы
График шире экрана — листайте по горизонтали →
Загружается живая иллюстрация…
Здесь голоса порождаются заданной «истиной», а модель всегда одна и та же —
один скрытый балл на вариант. Начните с режима «одна шкала» и двигайте бюджет:
средняя ширина 95%-интервала падает с 1,46 при 120 голосах до 0,29 при
3000, а максимальный промах модели мимо истины — с 0,18 до 0,05. Всё
работает так, как обещает теория.
Теперь переключите «два вкуса»: голоса поровну дают две группы с почти
противоположными предпочтениями. Интервалы сжимаются точно так же — до 0,27
при 3000 голосов, — а промах мимо истины каждой группы остаётся около 0,40
и не уменьшается. При этом остаток «факт минус модель» по объединённым данным
мал: смесь двух логистических кривых сама выглядит почти как логистическая.
Данные не выдают смешение, если не хранить, кто голосовал.
В режиме «цикл» модель ломается заметнее: остаток по данным держится на уровне
0,27–0,31 и не падает с ростом бюджета. А если включить активный выбор
пар, остаток по данным упадёт до 0,06 — не потому, что модель стала верной
(промах мимо истины вырастет до 0,60), а потому, что алгоритм перестал
собирать голоса на неудобных парах. Диагностика ослепла ровно там, где была
нужна.
Циклы: где одной оси не хватает
Люди могут предпочитать краткий A подробному B, точный B дружелюбному C,
а дружелюбный C краткому A. Брэдли–Терри предполагает одномерную шкалу и
устойчивый цикл воспроизвести не может: из rA>rB и rB>rC обязательно
следует rA>rC.
Есть ли циклы в наших реальных данных? Мы проверили все 34220 троек фильмов
по мажоритарному правилу и не нашли ни одного цикла. Это честный результат, и он
в пользу одномерной шкалы — на этих данных, при этом способе получения голосов.
Ожидать того же от сравнений длинных текстовых ответов оснований нет.
Отсутствие циклов не означает идеального описания. Диагностика — остаток
eij=pij−σ(ri−rj),pij=nijwij.
Среднеквадратичный остаток по всем 1770 парам равен 0,043, максимальный —
0,16: пара «Pulp Fiction» — «L.A. Confidential», где реальная доля побед
0,64, а модель предсказывает 0,48 (73 голоса). Одна ось не различает
«крутое кино вообще» и «кино, которое любит именно этот зритель».
Рис. 80.5. Одномерная шкала: где держится и где ломается
Слева — реальные остатки «факт минус модель» для 24 фильмов с наибольшим баллом;
цвет насыщается на ±0,2. Структура слабая, но не нулевая: строки и столбцы
с систематическим цветом указывают на пропущенное измерение. Справа — модельный
пример (не данные): три группы оценщиков с разными приоритетами дают
мажоритарный цикл A≻B≻C≻A с вероятностями 2/3, который
одномерная модель описать не может ни при каком бюджете.
Связь с самоигрой прямая: Elo и Брэдли–Терри — одна и та же
конструкция, и обе теряют циклы стратегий, сколь бы много партий ни было сыграно.
Два вкуса, сжатые в один скаляр
Разделим реальных зрителей по полу: 668 мужчин и 273 женщины. Обучим две
отдельные модели Брэдли–Терри. Корреляция баллов 0,869 — согласие велико. Но
285 пар фильмов из 1770 меняют сторону: то, что одна группа предпочитает,
другая отвергает. Из них 152 пары различаются статистически значимо, то есть
разногласие нельзя списать на нехватку голосов.
Крайний случай: «Sense and Sensibility» против «2001: A Space Odyssey». Разность
баллов у мужчин −0,47, у женщин +0,99. Единая модель поставит между ними
что-то среднее и будет уверенно ошибаться в обе стороны.
Каждая точка — фильм; по осям баллы, подобранные отдельно по голосам мужчин и
женщин. Корреляция 0,869, но 285 пар меняют сторону, 152 из них значимо.
Отмеченная пара расходится сильнее всех: −0,47 против +0,99. Агрегат
даёт число, которого не придерживается ни одна из групп.
Иерархическая модель даёт компромисс: балл варианта для группы g
rig=ri+δig,δig∼N(0,τ2),
где общий ri обучается на всех голосах, а поправки δig
регуляризуются к нулю. Это частичное объединение из урока 48: малые
группы стягиваются к общему баллу, большие получают собственный. Величина стягивания
известна явно: если у группы ng голосов с информацией Ig, то
δig=Ig+1/τ2Igδigсырое,
и при Ig≪1/τ2 поправка почти обнуляется, а при Ig≫1/τ2
сохраняется целиком.
Инструкция разметки создаёт reward
Разметчикам нужны критерии и опция ничьей. «Лучше» можно понимать как фактически
точнее, яснее, безопаснее, полнее или приятнее. Без явного приоритета два
человека решают разные задачи, а модель усредняет две разные цели — тот самый
случай из предыдущего раздела, только созданный нами самими.
Качество протокола проверяют повтором части пар, скрытыми контрольными
примерами, перестановкой порядка ответов, временем оценки, коэффициентом
согласия и коротким обоснованием выбора.
Особенно коварен позиционный сдвиг: ответ, показанный первым, выигрывает чаще
просто из-за места. Смоделируем это на честной синтетике с фиксированным seed:
40 вариантов, по 40 голосов на пару, к разности всегда добавлен сдвиг 0,35
в пользу первого. Максимальное искажение оценок — 0,51, то есть больше, чем
половина типичного шага между соседними вариантами в этом ряду.
Длина даёт другую поверхностную подсказку: подробный текст выглядит
старательнее. Проверим силу таких подсказок на наших данных. Обучим reward
model, которой доступны только «поверхностные» признаки фильма — популярность и
год выпуска. Она угадывает исход реальных сравнений в 58,6% случаев, тогда
как полная модель Брэдли–Терри, знающая сам фильм, — в 68,3%. Корреляция её
баллов с настоящими — 0,41.
Гудхарт: чем сильнее давим, тем меньше получаем
Reward model хорошо ранжирует пары, похожие на обучающие. Но политика начинает
искать ответы с максимальным баллом и уходит туда, где модель никогда не
проверялась. Это не абстракция — вот измерение на наших данных.
Обучим слабую reward model: возьмём всего 200 голосов, разбросанных по 200 парам
из 1770 (по одному голосу на пару). Её корреляция с настоящими баллами 0,44
— посредственно, но не бессмысленно. Теперь применим давление оптимизации в
чистом виде: выберем лучший фильм по мнению модели из n случайных и посмотрим,
каков его настоящий балл.
При n=12 настоящий балл выбранного максимален, 0,50. При n=40 он падает
до 0,34 — на треть — хотя балл в глазах самой модели всё это время растёт.
Богатая модель, обученная на всех голосах, ведёт себя иначе: её выбор монотонно
приближается к настоящему лидеру, 1,32 при потолке 1,41.
и этот предел равен настоящему максимуму только тогда, когда r и
rtrue достигают максимума на одном объекте. Всё остальное время рост
n (или силы оптимизации) уводит нас к ошибкам модели, а не к цели.
Рис. 80.7. Переоптимизация: сильнее давим на proxy — теряем то, что мерили
Лучший из n случайных фильмов по мнению reward model. Слабая модель (200
голосов): её собственный балл растёт неограниченно, а настоящий балл выбранного
достигает пика 0,50 при n=12 и падает до 0,34. Богатая модель растёт
монотонно к 1,32 при потолке 1,41. Переоптимизация — не свойство
оптимизатора, а произведение силы давления на ошибку модели.
Отсюда стандартная практика: держать штраф за уход от reference-модели,
ограничивать силу оптимизации и проверять политику людьми после оптимизации,
а не только точность reward model до неё. Механику штрафа разбирает
урок 81.
Калибровка важнее точности
Точность на парах отвечает на вопрос «часто ли модель угадывает победителя»;
калибровка — на вопрос «можно ли верить её уверенности». Для оптимизации важнее
второе: политика взвешивает шаги величиной reward, а не его знаком.
Практическая проверка — та же, что в уроке 31: разбить пары по
предсказанной вероятности и сравнить с фактической долей побед. На нашем турнире
максимальное расхождение по группам 0,014 — модель откалибрована. Полезна и
сводная мера:
ECE=b∑nnbyˉb−pˉb,
где b — интервалы предсказанной вероятности, yˉb — фактическая доля
побед в интервале, pˉb — средняя предсказанная вероятность. Точность
95% при плохой калибровке хуже, чем 85% при хорошей: первая модель
уверенно врёт там, где вторая честно сомневается.
Полезно смотреть и на счёт Брайера, который разом наказывает и за ошибку, и за
неоправданную уверенность:
BS=n1k=1∑n(pk−yk)2,
и его разложение на калибровку и разрешающую способность:
Раз информация одного сравнения равна p(1−p), соблазнительно спрашивать людей
только про близкие пары. Проверим жадный вариант на реальном турнире: на каждом
шаге выбираем пары, максимизирующие произведение дисперсии контраста на
p(1−p), и сравниваем со случайным выбором (усреднение по восьми seed).
При бюджете 200 голосов активный выбор впереди: ранговая τ к истине
0,30 против 0,24. Но к 900 голосам он проигрывает: 0,58 против
0,64. Жадность концентрирует бюджет на трудных парах и хуже связывает шкалу
целиком — тот же баланс исследования и использования, что в бандитах.
Борис Миркин и проблема группового выбора
В 1974 году в издательстве «Наука» вышла книга Бориса Григорьевича Миркина
«Проблема группового выбора». В ней аксиоматически разбирается ровно наш вопрос:
как из индивидуальных предпочтений собрать одно коллективное и что именно
теряется при любом способе сборки. Миркин работал с отношениями предпочтения как
с математическими объектами — включая неполные и нетранзитивные, — и развивал
теорию согласования ранжирований и расстояний между ними; его более поздние
работы связали эту линию с анализом данных и кластеризацией.
Для нас важен методологический вывод этой школы: агрегирование — выбор аксиом, а
не техническая операция. Когда мы обучаем одну reward model на голосах разных
людей, мы молча выбираем правило агрегирования и вместе с ним соглашаемся на
потери, которые это правило гарантирует. Никакая точность обучения этих потерь
не компенсирует, потому что они внесены до обучения.
Мост к alignment
Reward model ещё не меняет языковую модель. Она создаёт обучающий сигнал, по
которому PPO, DPO или GRPO сдвинут вероятности ответов. Любая
систематическая ошибка балла станет направлением оптимизации: если модель
переоценивает длину, политика научится быть многословной.
Поэтому конвейер предпочтений обязан хранить не только итоговые баллы, но и
происхождение голосов: обезличенные идентификаторы групп, порядок показа,
повторы и ничьи. Всё, что выброшено на этапе агрегирования, потом придётся
восстанавливать по последствиям — то есть по поведению обученной модели.
Скаляр скрывает голоса
Брэдли–Терри превращает пары в вероятностный рейтинг, и на реальных данных
делает это отлично: логистическая форма подтверждается с точностью 0,014,
ошибка балла падает строго как n−1/2, циклов нет ни в одной из 34220
троек. Ровно поэтому важно помнить, чего модель не видит: разногласия 285 пар
между группами, 34% ничьих, хрупкости контраста через тонкий мост в графе и
того, что при сильном давлении оптимизации выбранный по слабой модели вариант
теряет треть настоящего качества.
Удобное число r — интерфейс оптимизатора, а не итог человеческого суждения.
Самая строгая проверка reward model начинается после того, как по ней уже
оптимизировали.