Продолжаем историю спам-фильтра — но теперь у нас нет четырёх тысяч размеченных сообщений. Есть деньги на несколько сотен меток, гора неразмеченного текста и четыре стратегии: метить случайное, метить трудное, доверять собственным догадкам и писать правила вместо меток. Мы измерим каждую на настоящих данных, и две из них проиграют поучительно.
Разметка снова стоит денег
В уроке о классификации мы позволили себе роскошь: 4000 размеченных SMS достались нам бесплатно, вместе с коллекцией. В жизни так не бывает. Открывая фильтр для нового языка, новой платформы или нового вида мошенничества, вы начинаете с горы неразмеченных сообщений и пустого столбца ответов; каждую метку покупают у разметчика за деньги и время, и урок о режимах уже оценивал эту статью бюджета как главную.
Сегодняшний вопрос практичен до копейки: как получить лучший фильтр за фиксированный бюджет меток? Полигоном будет та же коллекция SMS Spam и та же восьмипризнаковая логистическая модель — но мы притворимся, что меток нет, и будем покупать их по одной. Правила игры: пул из 4000 сообщений без меток, отложенные 1574 для честного измерения, качество меряем F-мерой из урока 07, все запуски детерминированы и воспроизводятся скриптом репозитория.
Кривая обучения: сколько метка приносит
Начнём с простейшей стратегии: метим случайные сообщения и смотрим, как растёт качество. Вот настоящая кривая для нашей модели:
| Меток | 25 | 50 | 100 | 200 | 500 | 4000 |
|---|---|---|---|---|---|---|
| F-мера | 0,875 | 0,895 | 0,908 | 0,915 | 0,940 | 0,930 |
Два наблюдения, каждое на вес золота. Первое: уже 25 случайных меток дают F-меру 0,875 — восемь прозрачных признаков настолько сильны, что модели хватает горстки примеров расставить веса по знакам. Второе: отдача убывает стремительно. Первые 25 меток принесли 0,875; следующие 475 — ещё 6,5 пункта; следующие 3500 — ничего, кроме шума вокруг потолка. Кривая обучения — это финансовый отчёт разметки, и читать его надо как инвестору: где-то на этой кривой каждая следующая метка начинает стоить дороже, чем приносит.
причём предел достигается не в бесконечности, а на нескольких сотнях примеров: потолок задан не данными, а бедностью признаков — тем самым полом шума из урока о регрессии, только в мире классификации. Никакая разметка не вытащит модель выше её признаков.
Почему хватает горстки? Прикиньте на пальцах: у модели восемь весов, и каждому, чтобы устояться, нужно порядка десятка информативных примеров — эмпирическое правило «десять наблюдений на параметр» из арсенала прикладной статистики:
для — около сотни меток, что кривая и подтверждает. У нейросети с миллионом весов та же прикидка требует уже не сотен, а такого объёма, при котором слово «бюджет» меняет магнитуду; поэтому весь арсенал этого урока — не факультатив, а условие выживания больших моделей, и урок о переобучении покажет, что случается с моделями, которым примеров на параметр не хватило.

Качество фильтра на отложенных данных по числу купленных случайных меток; лог-шкала по горизонтали. Рост кончается у нескольких сотен: дальше кривая шумит вокруг потолка признаков. Прежде чем покупать тысячную метку, посмотрите, что принесла пятисотая.
Метить трудное: активное обучение
Случайная разметка тратит большинство меток впустую: очередное «Ok lar» не сообщает модели ничего нового. Урок 07 уже подсказал, где живёт информация: сомнительное скапливается у границы. Активное обучение делает из этого стратегию: обучи модель на том, что есть; выбери из неразмеченного пула сообщения, где она сомневается сильнее всего,
купи для них метки, дообучись и повтори. Мы прогнали этот цикл на нашем пуле: старт с 25 случайных меток, затем по 25 самых сомнительных за раунд. Результат стоит таблицы:
| Меток | 150 | 175 | 225 | 275 |
|---|---|---|---|---|
| F-мера (активно) | 0,929 | 0,933 | 0,942 | 0,942 |
Потолок 0,94, на который случайной разметке нужно 500 меток, активная стратегия берёт за 225 — вдвое дешевле. Для бюджета в сотни тысяч примеров «вдвое» означает месяцы работы разметчиков; в медицинских задачах, где метка — час времени врача, активное обучение часто вообще единственный способ довести проект до конца.

Обе кривые — настоящие прогоны на SMS-пуле, одинаковый старт с 25 меток. Активная стратегия (сомнительные сообщения) обгоняет случайную на всём протяжении и упирается в тот же потолок признаков вдвое раньше. Обратите внимание и на её хвост: после 300 меток кривая слегка проседает — об этой ложке дёгтя следующий раздел.
Ложка дёгтя видна на хвосте кривой: после трёхсот меток качество активной стратегии слегка проседает, к 0,92. Механизм знаком по уроку о данных: выборка размеченного перестала быть случайной. Мы скупили все пограничные сообщения, и обучающее множество превратилось в коллекцию странностей — модель, которая учится только на трудном, начинает забывать, как выглядит лёгкое. Практики смешивают: львиную долю бюджета — по неуверенности, малую — случайно, как разведку из урока о режимах; случайная добавка заодно даёт честную оценку качества, которую перекошенная выборка дать уже не может. Пропорция смеси — та же дилемма разведки и использования, что у -жадности: доля случайного — это разметки, и убывающее расписание здесь работает так же, как работало у бандитов.
Шумный разметчик: правда с процентом брака
Пока мы считали купленную метку истиной, а это тоже идеализация: разметчики устают, скучают и ошибаются. Урок о данных мерил их согласие каппой; здесь важно другое следствие — шум меток опускает достижимый потолок. Если разметчик путает класс с вероятностью , то даже идеальная модель, всегда отвечающая истинно, будет «ошибаться» против его меток в случаев, а модель, обученная на таких метках, целится в сдвинутую цель:
вероятности сжимаются к половине, уверенных областей становится меньше, и границы плывут. Противоядия покупаются тем же бюджетом: двойная разметка спорных примеров, третий голос при расхождении, контрольные вопросы с известным ответом внутри потока заданий.
::::
Чем мерить сомнение
Расстояние до половины — не единственный термометр неуверенности, и в многоклассовых задачах он вовсе не определён. Универсальнее энтропия предсказанного распределения:
она максимальна, когда классы равновероятны, и нулевая при полной уверенности. Между ними живёт зазор двух лидеров,
разность вероятностей первого и второго кандидатов: маленький зазор значит, что модель мечется между двумя конкретными классами, даже если оба далеки от остальных.
Трёхклассовая модель дала два предсказания: и . Вычислите для каждого зазор лидеров и энтропию (, , , , ). Какой пример сомнительнее по каждому из термометров и почему они разошлись?
Сверить вычисление
Первый: зазор , энтропия . Второй: зазор , энтропия . По зазору сомнительнее первый — дуэль двух лидеров; по энтропии чуть сомнительнее второй — размазанность по всем трём. Зазор ловит споры, энтропия — общую растерянность; для покупки метки под конкретную границу чаще полезнее зазор.
А самый честный термометр вообще не смотрит на одну модель: обучите на тех же метках несколько разных моделей — комитет — и метьте то, о чём они спорят. Несогласие комитета ловит и такую неуверенность, которой одна модель у себя не видит, — систематическую, зашитую в устройство конкретного классификатора.
Все термометры объединяет один принцип, и он важнее формул: информативен пример, о котором текущее знание говорит меньше всего. Экономика меток — это покупка информации, и прибор для измерения «сколько информации в примере» — первое, что стоит выбрать осознанно.
У стратегии «метить самое сомнительное» есть тёмная любовь: выбросы. Обрывок кодировки, сообщение на неожиданном языке, склеенные два SMS — модель в них максимально не уверена, и стратегия честно понесёт их разметчику, где они съедят бюджет, не научив ничему. В реальных конвейерах перед активным отбором ставят фильтр аномалий; без него самые «информативные» примеры оказываются просто самыми грязными — мы видели этот сорт грязи в уроке о данных.
Довериться себе: парадокс self-training
Вторая идея экономии знакома по уроку о режимах: псевдометки. Обучимся на сотне честных меток, разметим собственными уверенными предсказаниями всё, что или , и дообучимся на раздутом наборе. На нашем пуле так удаётся разметить 3308 сообщений из 3900, и точность псевдометок великолепна: 99,4% верных. А теперь результат: F-мера выросла с 0,908 до 0,913. Полпункта.

Предсказания стомерочной модели на 3900 неразмеченных сообщениях. Закрашенные края — то, что self-training пометил: почти весь пул, почти без ошибок. Пустая середина — пограничная зона, где модель ошибается и где метки нужны, — осталась нетронутой: уверенность не роет там, где сомневается. Сравните с прицелом активного обучения — он бьёт ровно в эту середину.
Разгадка парадокса — зеркало активного обучения. Псевдометку получает то, в чём модель уверена, а уверена она в том, что уже выучила: длинные сообщения с цифрами и ссылками, короткие чистые реплики. Три тысячи почти безошибочных меток легли ровно туда, где модель и так не ошибалась; пограничная зона, где живут её ошибки, осталась неразмеченной — самоуверенность не роет там, где сомневается. Self-training размечает лёгкое, активное обучение — трудное; поэтому первый почти бесплатен и почти бесполезен, а второе дорого и эффективно. В задачах, где модель сильна, а признаки богаты (современные нейросети на изображениях), псевдометки приносят больше; но механизм «уверенность метит уже выученное» никуда не девается, и ждать от self-training чуда на слабой модели — типичная ошибка планирования.
Не запуская код, предскажите: у какой доли из 3308 псевдоразмеченных сообщений исходная сотня меток уже «покрывала» правильный ответ — то есть модель на сотне меток и так классифицировала их верно? Проверьте рассуждением через точность псевдометок 99,4% и объясните, почему добавка почти совпадающих с предсказаниями меток слабо меняет веса логистической модели из урока 07.
Сверить рассуждение
Псевдометка по построению совпадает с предсказанием модели, поэтому покрытие — ровно 100%: модель дообучается на собственных ответах, и верных среди них 99,4%. Градиент лог-потери пропорционален ошибке ; на примерах, где уже 0,97 при , ошибка почти нулевая, и тянуть веса нечем. Информацию несут только несогласные с моделью метки — а их self-training как раз не создаёт.
Сколько стоит честный срез
Мы много раз сказали «отдельный случайный срез для оценки», и у этого пункта бюджета есть своя арифметика — та же, что у опросов в уроке 05. Полнота фильтра — доля пойманного спама, и её стандартная ошибка определяется числом спама в срезе:
При доле спама 13,4% срез в 200 сообщений содержит около 27 спамов, и se полноты при уровне 0,9 составляет почти шесть пунктов: интервал — таким прибором не отличить модель на 0,88 от модели на 0,94, то есть весь эффект активного обучения утонет в погрешности измерителя. Для сравнения стратегий из этого урока нужен срез в несколько сотен спамов — тысячи сообщений, и это метки, потраченные не на обучение вовсе. Оценочный срез — самая недооценённая статья бюджета: команды охотно платят за то, что делает модель лучше, и забывают платить за то, что позволяет это увидеть.
Сколько сообщений должно быть в случайном срезе, чтобы se полноты при уровне около 0,9 не превышала двух пунктов? Считайте долю спама 13,4%. Какая доля стартового бюджета в 500 меток уйдёт на такой срез, и что это говорит о честности сравнений «на глазок»?
Сверить вычисление
Нужно спамов, то есть около сообщений — втрое больше всего стартового бюджета. Отсюда честный вывод: при малых бюджетах точно сравнивать стратегии невозможно в принципе, и решения принимаются по грубым различиям и по теории; вот почему в этом уроке мы доверяем разрывам в пять-десять пунктов и не обсуждаем разрывы в один.
Писать правила вместо меток: слабая супервизия
Третья идея звучит совсем заманчиво: зачем платить разметчикам, если эксперт может записать своё знание правилами? «Есть free или win — спам», «есть ссылка — спам», «десять и больше цифр — спам», «короткое без цифр — переписка». Прогоним правила по пулу, разрешим конфликты голосованием — и получим 2026 «бесплатных» меток с точностью 94,7%. Числа выглядят триумфом дешевизны.
Обучим на них модель и измерим честно: F-мера 0,672. Хуже, чем 25 честных случайных меток. Провал при такой точности меток кажется невозможным, пока не спросишь, кого правила пометили. Правила покрывают только то, о чём эксперт вспомнил: спам-правила — три ярких шаблона, правило переписки — один узкий («короткое без цифр»). Длинная честная переписка, спам без ссылок, всё пограничное — в наборе просто отсутствует. Модель выучила мир, где переписка бывает только короткой, и на настоящем потоке рушится. Смещение покрытия убивает качество даже при почти безошибочных метках — это рамка выборки из урока о статистике, собственными руками встроенная в обучение.
Лечится это как в больших системах слабой супервизии: правил должны быть десятки, с перекрытиями и конфликтами; их точности и покрытия оценивают по маленькому честному срезу; итоговые метки взвешивают, а не голосуют поровну; и обязательно добавляют случайно размеченный слой. У каждого правила два паспорта — точность и покрытие,
и катастрофы приходят не от низкой точности, которую видно, а от дырявого суммарного покрытия, которого не видно, пока не наложишь правила на карту всей задачи. Слабая супервизия — рабочий инструмент индустрии, но её валюта — не «точность правил», а покрытие всех углов задачи.

Слева — чем покрыли пул четыре экспертных правила: только яркие углы, пограничная зона и «обычная длинная переписка» не помечены вовсе. Справа — итог: модель, обученная на 2026 метках с точностью 94,7%, проигрывает модели на 25 случайных метках. Кривая обучения из начала урока измеряет ценность случайных меток; смещённые метки живут по другим, худшим законам.
Запомните три ценника этого урока. Случайная метка стоит дорого и несёт гарантированную крупицу правды. Псевдометка бесплатна и не несёт почти ничего. Метка от правила дешева и несёт правду о том углу задачи, который эксперт вспомнил, — и молчание обо всех остальных. Бюджет разметки — это портфель из трёх активов, и катастрофы случаются у тех, кто складывает всё в один.
Когда неразмеченное вредит
У бесплатной горы неразмеченного есть скрытое условие годности: она должна быть из того же мира, что и будущий поток. Долейте в пул SMS переписку с форума или письма электронной почты — предположение гладкости продолжит работать, но уже вдоль чужих направлений: модель станет устойчивой к вариациям форумного стиля, а согласованность закрепит инварианты не того распределения. Ещё коварнее сдвиг доли классов: если в неразмеченной горе спама втрое больше, чем в жизни, самообучение и согласованность потянут приоры модели к чужой пропорции, и порог из урока 07 уедет вместе с ними.
Правило гигиены то же, что для теста: неразмеченный пул — это тоже выборка, и у неё тоже есть рамка. Прежде чем радоваться миллиону бесплатных примеров, спросите, из какого крана они налиты, — вопрос дословно из урока о данных, и он не слабеет от того, что меток у примеров нет.
Согласованность: неразмеченное как тренажёр устойчивости
Есть способ извлечь пользу из неразмеченного, не доверяя ни правилам, ни собственным меткам. Возьмите сообщение и слегка испортите его — замените пару слов синонимами, переставьте фрагменты, внесите опечатку. Правильного ответа мы по-прежнему не знаем, но знаем другое: у испорченной и исходной версии он один и тот же. Этого достаточно для обучающего сигнала — штрафуйте модель за несогласие с собой:
где — искажённая копия.

Первый член учит на честных метках, второй разглаживает предсказания вдоль осмысленных искажений — это предположение гладкости из урока о режимах, превращённое из веры в слагаемое функции потерь. Согласованность — рабочая лошадь современного полуобучения: большие системы распознавания изображений и речи выжимают из неё львиную долю пользы неразмеченных гор. Заметьте, чем она отличается от self-training: та копировала ответы модели, эта навязывает лишь их равенство — куда более скромное и потому более надёжное требование.
Есть метки, которые человеку проще дать, чем кажется: не «оцени ответ по стобалльной шкале», а «какой из двух ответов лучше». Сравнение дешевле и надёжнее абсолютной оценки, и именно на парах сравнений обучают модели-судьи для настройки больших языковых моделей — конвейер, который мы видели в уроке о режимах и разберём в уроке о LLM. Экономика меток дотянулась и до самых больших моделей современности.
Лаборатория бюджета
Порядок опытов. Двигайте бюджет и сравнивайте случайную и активную кривые: найдите бюджет, при котором разрыв максимален, и бюджет, после которого обе упираются в потолок признаков. Включите смесь «активная + 20% случайных» и присмотритесь к хвосту: просадка мягче, но шум у потолка никуда не девается — вблизи предела признаков различия стратегий тонут в случайности, и это тоже честный вывод. Затем сравните столбики стратегий при бюджете 100: псевдометки почти не поднимают базу, правила проваливаются ниже неё — два способа потратить ноль рублей с очень разным результатом. Напоследок задержитесь на числе «цена потолка»: бюджет, при котором каждая стратегия впервые касается своих 0,94, — это и есть главная сводка урока одним числом, и разброс этого числа между стратегиями — весь смысл экономики меток.
Когда меток нет совсем: снова награда
Есть задачи, где метку не купить ни за какие деньги, потому что правильный ответ не знает никто: какое расписание рассылки лучше удержит подписчиков, какой из двух заголовков соберёт больше прочтений. Здесь сигналом становится награда за попытку — режим подкрепления из урока 06, и его простейший случай, многорукий бандит: несколько вариантов действия, у каждого свой неизвестный средний выигрыш, и каждая попытка — одновременно и заработок, и разведка.
-жадность из урока 06 разведывала вслепую — случайным вариантом с постоянной вероятностью. Можно умнее: пусть неуверенность сама решает, что пробовать. Правило верхней доверительной границы (UCB) выбирает вариант с наибольшим оптимистичным потенциалом:
где — средний выигрыш варианта по прошлым попыткам, а — сколько раз его пробовали.

::: Второе слагаемое — доверительная надбавка в духе урока о статистике: у редко пробованных вариантов она велика, и правило само тянется к недоисследованному, а с ростом надбавка тает как , и остаётся чистая эксплуатация. Никакого отдельного «процента на разведку»: разведка встроена в оптимизм и выключается сама, когда неопределённость исчерпана.
Цену стратегии бандита меряют сожалением — недобором относительно всезнающего игрока, который с первого шага жал бы только лучшую ручку:
где — средний выигрыш лучшего варианта. У -жадности с постоянным сожаление растёт линейно: фиксированная доля попыток вечно уходит на разведку. У UCB — логарифмически: разведка сама сворачивается по мере уверенности, и почти все поздние попытки достаются лучшему. Разница между и на горизонте в миллион показов — это разница между «терять десять процентов вечно» и «потерять пару десятков попыток за всю жизнь».
Пусть каждая «неоптимальная» попытка теряет в среднем 0,01 клика. Оцените потерянные клики за миллион показов для -жадности с (три четверти разведочных попыток уходят не лучшим вариантам) и для стратегии с сожалением порядка попыток. Во сколько раз различаются потери?
Сверить вычисление
Жадность: неоптимальных попыток — 750 потерянных кликов. Логарифмическая стратегия: попыток — около 7 кликов. Два порядка разницы, и она растёт с горизонтом: постоянная разведка — налог навсегда, логарифмическая — плата за вход.
::::

Симуляция на четырёх вариантах с близкими выигрышами, усреднение по запускам. -жадность с постоянной разведкой платит фиксированный налог на каждом шаге — её сожаление прямая. UCB сворачивает разведку по мере уверенности, и кривая выполаживается: почти все поздние попытки уходят лучшему варианту. На длинных горизонтах между стратегиями — пропасть.
Родство с активным обучением не случайно: там мы платили меткой за уменьшение неуверенности модели, здесь платим попыткой за уменьшение неуверенности в награде. Вся экономика этого урока — одна идея в трёх костюмах: информация стоит денег, и покупать её надо там, где неопределённость дороже всего. Систематическую теорию бандитов и их баланса построит первый урок блока подкрепления.
Формализовал бандитов статистик Герберт Роббинс в 1952 году, задолго до всякого машинного обучения, — как задачу о последовательных клинических испытаниях: каждому пациенту нужно назначить одно из лечений, эффект которых ещё изучается. Этика и математика здесь сцеплены намертво: слишком много разведки — лечим людей худшим препаратом, слишком мало — никогда не узнаем лучший. Сожаление в этой постановке измеряется не кликами.
Три заголовка рассылки; после девяти показов: вариант A — 4 показа, средний отклик 0,50; B — 3 показа, 0,33; C — 2 показа, 0,25. Вычислите UCB-оценку каждого при () и назовите, кого покажут десятым. Почему выбор не совпадает с «лучшим по среднему», и когда совпадёт?
Сверить вычисление
Надбавки : A — ; B — ; C — . Оценки: A ; B ; C — покажут C, худшего по среднему, но самого недоисследованного. С ростом числа показов надбавки сожмутся, и выбор сойдётся к лучшему среднему — если тот подтвердит себя под нагрузкой.
Конвейер, который кормит себя сам
Соберём стратегии в работающую систему. Живой фильтр из урока 07 уже содержит источник меток — зону отказа: сомнительные сообщения идут человеку, и каждое решение возвращается меткой. Присмотритесь: это активное обучение, возникшее само собой, — зона отказа и есть область максимальной неуверенности. Осталось замкнуть контур: метки из зоны копятся в обучающий набор, модель периодически дообучается, пороги зоны пересматриваются, а небольшой случайный поток — мимо всех стратегий — держит честный срез для измерений и страхует от перекоса. Дрейф спама из урока 07 этот конвейер не побеждает, но замечает и отрабатывает штатно: новые уловки сначала повышают неуверенность, затем приходят к человеку, затем становятся метками.

Зона отказа поставляет трудные метки, случайная ветка — честные измерения, дообучение замыкает цикл. Один конвейер использует почти весь арсенал урока: активный отбор, контроль качества разметки, отдельный срез и регулярное обновление — и его дешевле построить сразу, чем прикручивать после запуска.
Самые ценные обучающие наборы не собирают — они капают из работающих систем: каждое решение секретаря над сомнительным письмом, каждая жалоба «это не спам» — готовая метка с настоящей ценой ошибки. Проектируя систему, закладывайте сбор меток в интерфейс с первого дня; датасет, купленный потом за деньги, всегда беднее того, который система могла писать о себе сама.
В уроке 07 зона отказа вмещала 34 сообщения из 1574 — около 2% потока. Оцените: сколько меток в месяц даст зона при потоке в сто тысяч сообщений, сколько будет стоить их проверка по 3 рубля и как изменится поток по мере того, как дообученная модель станет увереннее. Что означает пересыхание потока меток — победу или слепоту?
Когда меток мало, шатается не только модель, но и любое измерение качества: разбиение 200 меток на обучение и проверку оставляет проверке крохи. Приём для таких случаев — кросс-валидация, многократное разбиение с усреднением — появится в уроке о честной проверке; здесь запомним симптом: при малых данных цифра качества без интервала — не цифра, а настроение.
Сборка: портфель сигналов
Мало разметки — это не бедность, а задача управления портфелем. Кривая обучения оценивает ценность случайной метки и точку, где разметку пора останавливать. Активное обучение покупает трудные примеры и достигает потолка вдвое дешевле — ценой перекоса выборки, который лечится случайной добавкой и отдельным честным срезом для оценки. Self-training раздувает набор почти безошибочными метками лёгких примеров и почти не двигает качество: информация живёт в несогласии, а не в подтверждении. Слабая супервизия меняет разметчиков на правила и проигрывает не точностью, а покрытием: рамка, которую забыли, бьёт больнее ошибки, которую допустили. А когда метки не существует в природе, сигналом становится награда, и оптимизм UCB покупает информацию тем же расчётом, что активное обучение — метку. Бюджет один; искусство — в портфеле. И последняя рифма курса: экономика меток — это статистика урока 05, повёрнутая из измерения в управление. Там мы спрашивали, сколько стоит узнать долю с заданной точностью; здесь — сколько стоит выучить границу с заданным качеством. Ответ в обоих случаях один: дороже всего обходятся не данные, а незнание того, какие данные нужны.
Задачи
Стартап собирает классификатор жалоб на три отдела. Разметка одной жалобы стоит 12 рублей, в архиве 40 000 жалоб, бюджет — 24 000 рублей. Составьте портфель разметки по мотивам урока: сколько меток случайных, сколько активных, сколько отложить на честный срез для оценки; укажите, что будете мерить после каждой тысячи потраченных рублей и по какому признаку остановитесь раньше бюджета. Объясните, почему потратить всё на активную стратегию — ошибка. Рубрика: 1 балл за портфель с тремя статьями и числами, 1 за правило остановки, привязанное к кривой обучения, 1 за роль случайной доли.
По таблице кривой обучения урока постройте график «цена пункта F-меры от достигнутого качества» и найдите участок, где пункт дорожает десятикратно. Затем оцените, сколько меток понадобилось бы случайной стратегии для F-меры 0,93 и сколько — активной (по данным рис. 10.2). Посчитайте экономию в рублях при цене метки 8 рублей и в неделях при скорости разметчика 200 меток в день. Рубрика: 2 балла за корректный график цены пункта, 1 за оценки бюджетов обеих стратегий, 1 за перевод в деньги и время.
Воспроизведите активное обучение урока: пул и признаки из урока 07, старт с 25 случайных меток при seed 7, по 25 самых сомнительных за раунд до бюджета 500. Постройте обе кривые (активную и случайную), сверьте с числами урока (активная 0,942 при 225) и найдите на своей кривой хвостовой спад. Рубрика: 1 балл за воспроизводимость, 2 за совпадение кривых с точностью до сотых, 1 за график с подписанными осями, 1 за объяснение спада через состав выборки.
Смесь стратегий: повторите эксперимент задачи 3, но в каждом раунде берите 20 сомнительных и 5 случайных сообщений. Сравните хвост кривой со стопроцентно активной версией. Затем оцените качество обеих моделей двумя способами: на своей размеченной выборке и на отложенном срезе — и покажите числами, насколько перекошенная выборка врёт о собственном качестве. Какой из двух обманов (вверх или вниз) опаснее в продакшене и почему?
Парадокс self-training количественно: обучите модель на 100 метках, поставьте псевдометки с порогами , как в уроке, и измерьте прирост. Затем повторите с порогами и : псевдометок станет больше, их точность ниже. Постройте зависимость итоговой F-меры от порога и объясните форму: почему и слишком строгий, и слишком щедрый порог не помогают, и где между ними живёт максимум. Рубрика: 2 балла за три корректных прогона, 2 за график, 1 за механизм-объяснение.
Почините слабую супервизию урока. К четырём правилам добавьте ещё минимум четыре своих (включая два правила для переписки с разным покрытием), оцените точность и покрытие каждого по срезу в 200 честных меток, придумайте взвешенное голосование вместо мажоритарного и измерьте F-меру модели на итоговых метках. Доберитесь хотя бы до 0,85 и опишите, какое правило дало наибольший вклад — точное узкое или среднее широкое.
Зона отказа из урока 07 как конвейер разметки: фильтр отправляет сомнительные сообщения секретарю, и каждая проверка возвращается меткой. Спроектируйте годовой цикл: как часто дообучать модель, как менять пороги зоны по мере роста качества, как не дать выборке из зоны перекосить обучение (подсказка: это активное обучение, пришедшее само). Оцените, сколько меток в месяц даёт зона при потоке 1574 сообщения и порогах из урока 07, и когда поток меток иссякнет — что это будет означать? Рубрика: 2 балла за годовой план с числами потока, 2 за защиту от перекоса выборки зоны, 2 за разбор пересыхания потока с двумя гипотезами — победа модели и слепота к новому дрейфу — и тестом, который их различит.
Бандит против A/B-теста: изданию нужно выбрать лучший из четырёх заголовков. Классический сплит-тест делит 10 000 показов поровну; UCB перераспределяет на лету. Просимулируйте оба при истинных откликах с seed: сравните суммарные клики и уверенность в победителе. Объясните размен: что бандит выигрывает в кликах и что теряет в статистической чистоте вывода — и почему урок об A/B-тестах всё равно понадобится. Рубрика: 2 балла за корректную симуляцию обеих схем, 2 за сравнение кликов и надёжности, 2 за грамотный вывод о размене.
Большой воспроизводимый эксперимент «портфель против чистых стратегий»: при бюджетах 100, 200 и 400 меток сравните пять политик — случайная, активная, активная+20% случайных, self-training поверх ста случайных, слабая супервизия с вашими правилами из задачи 6. Для каждой политики и бюджета — три прогона с разными seed, в таблице — среднее и разброс. Сформулируйте рекомендацию для трёх бюджетов отдельно. Рубрика: 3 балла за корректные 45 прогонов с фиксированными seed, 2 за таблицу со средними и разбросами, 2 за рекомендации, согласованные с числами.