# Анализ TROLL: доверительные области на уровне токенов для стабилизации обучения LLM с подкреплением вместо ограничения PPO

Обучение с подкреплением на основе вознаграждения всё чаще применяется для развития способности больших языковых моделей к рассуждению. Один из распространённых подходов — оптимизация политики по принципу PPO. Методы GRPO, Dr.GRPO, GSPO и REINFORCE++ изменяют оценку преимущества или нормализацию, стремясь ограничить чрезмерные изменения политики за одно обновление…

Source: https://www.iplexlaw.co.kr/ru/blog/1533996

ГЛАВНАЯ / Новости и аналитика Новости и аналитика Анализ TROLL: доверительные области на уровне токенов для стабилизации обучения LLM с подкреплением вместо ограничения PPO Обучение с подкреплением на основе вознаграждения всё чаще применяется для развития способности больших языковых моделей к рассуждению. Один из распространённых подходов — оптимизация политики по принципу PPO. Методы GRPO, Dr.GRPO, GSPO и REINFORCE++ изменяют оценку преимущества или нормализацию, стремясь ограничить чрезмерные изменения политики за одно обновление… ИИ и программное обеспечение Опубликовано: 2026.09.08 IPLEX Время чтения: 23 мин. Автор: Ким Ёндок, патентный поверенный IPLEX IP Law Firm Обучение с подкреплением на основе вознаграждений всё чаще используется для развития способности больших языковых моделей к рассуждению. Распространённый подход — оптимизация политики семейства PPO. Методы GRPO, Dr.GRPO, GSPO и REINFORCE++, совершенствующие оценку преимущества или нормализацию, обычно используют ограничение отношения вероятностей по принципу PPO clipping, чтобы политика не менялась слишком резко за одно обновление. Авторы TROLL рассматривают именно этот механизм. Вместо новой функции вознаграждения или оценщика преимущества они заменяют привычное отсечение проекцией в доверительную область KL для каждой позиции токена. Иными словами, вместо отсечения обновлений за пределами диапазона выбирается ближайшее распределение вероятностей внутри допустимой области. Основная идея: TROLL заменяет отсечение PPO дифференцируемой проекцией в доверительную область на уровне токенов и использует разреженное представление значимых вероятностей. Цель — повысить устойчивость и скорость обучения LLM с подкреплением, а также итоговую долю успешно решённых задач. Сведения об исследовании Работа «TROLL: Trust Regions Improve Reinforcement Learning for Large Language Models» представлена на ICLR 2026. Авторы — Philipp Becker, Niklas Freymuth, Serge Thilges, Fabian Otto и Gerhard Neumann из Технологического института Карлсруэ и Microsoft Research. Исследование посвящено замене отсечения PPO дифференцируемыми проекциями дискретных распределений в доверительную область. Применимость метода проверяется на математических задачах и генерации кода, разных семействах моделей и способах оценки преимущества. 1. Почему авторы предлагают пересмотреть отсечение PPO? При дообучении LLM с подкреплением ответы модели оцениваются и получают вознаграждения. Политика обновляется так, чтобы ответы с более высокой оценкой появлялись чаще. Однако чрезмерное обновление может нарушить устойчивость выходного распределения: даже небольшие изменения обучающих данных способны вызвать резкий рост длины ответов, повторение шаблонов или потерю разнообразия исследуемых вариантов. Чтобы ограничить резкие изменения, PPO использует отсечение отношения вероятностей новой и прежней политик. Этот механизм широко применяется благодаря простоте реализации и масштабирования. Авторы, однако, рассматривают его как приближение к исходной идее доверительной области. Для токенов, отношение вероятностей которых выходит за заданные границы, градиент может обнуляться, оставляя недостаточно информации для возвращения политики в допустимую область. Если сравнивать обрезку с автомобилем, обрезка похожа на устройство, которое внезапно отключает вход педали акселератора при превышении скорости. Это может помешать вам двигаться слишком быстро, но это не говорит вам, в каком направлении или как плавно вы должны замедлить машину. С другой стороны, проекция зоны доверия ближе к вычислению ближайшей точки в пределах допустимой области от текущего местоположения и перемещению транспортного средства туда. Разница заключается в том, что состояние объекта управления явно помещается в безопасную зону. PPO clipping ограничивает отношение вероятностей выбранного токена; за установленными границами вклад в целевую функцию и градиент может отсекаться. Это эвристическое приближение доверительной области без отдельной проекции распределения. TROLL, напротив, проецирует распределение для каждой позиции токена в область, заданную KL-ограничением. При выходе за границу вычисляется ближайшее допустимое распределение. Задача формулируется как выпуклая оптимизация с явным ограничением KL, а разреженные распределения снижают затраты при большом словаре. Ни один из этих методов не добавляет вычислений на этапе инференса. Важно различать: TROLL не заменяет способ расчёта преимущества в PPO, GRPO, Dr.GRPO или GSPO. Он заменяет механизм отсечения, используемый при обновлении политики на основе уже рассчитанного преимущества. 2. Основные понятия: политика, преимущество и доверительная область KL 2.1 Политика — это распределение вероятности следующего токена. В языковой модели политика представляет собой распределение вероятностей, назначаемое каждому следующему токену на основе текущего контекста. Например, в одном и том же контексте токенам, таким как «правильно», «поэтому» и «но», присваиваются разные вероятности. Обучение с подкреплением корректирует параметры модели, чтобы увеличить вероятность маркеров, включенных в хорошие ответы, и снизить вероятность маркеров, включенных в плохие ответы. 2.2 Преимущество показывает, насколько действие лучше базового уровня Преимущество (advantage) отражает, насколько ответ или выбор токена лучше базового поведения. PPO может использовать отдельную модель ценности, а GRPO — несколько ответов на один вопрос и относительные вознаграждения внутри группы. TROLL не привязан к конкретному способу расчёта преимущества, поэтому может сочетаться с разными алгоритмами. 2.3 KL дивергенция измеряет, насколько отличаются два распределения вероятностей. Дивергенция KL характеризует различие между распределениями вероятностей токенов новой и прежней политик. TROLL ограничивает её величиной ε для каждой позиции выходной последовательности. Ограничение относится к распределению токенов в этой позиции, а не только к отношению вероятностей одного выбранного токена. 2.4 Доверительная область задаёт допустимое изменение за одно обновление Доверительная область ограничивает отклонение политики на текущем шаге обучения. Слишком узкая область замедляет обучение, слишком широкая допускает нестабильные изменения. В исследовании также показано, что чрезмерно малое ε снижает скорость, а слишком большое может ухудшать итоговую долю успешных решений. Главное без формул: TROLL не стремится сделать новую политику идентичной прежней. Обновление следует сигналу вознаграждения, а при превышении допустимого KL-радиуса корректируется до ближайшего распределения внутри доверительной области. 3. Основная идея TROLL: проекция вместо отсечения Рисунок 1. Слева показаны прежняя, новая и спроецированная политики для распределения по трём токенам; справа сопоставлена скорость обучения TROLL и Clip на математических задачах и генерации кода. Источник: Becker et al., ICLR 2026, с. 2. Как легко читать левую сторону картинки Вершины треугольника соответствуют предельным случаям, когда вся вероятность сосредоточена на одном из токенов: cat, troll или hamster. Красная точка — прежняя политика, использованная при сборе данных, синяя — новая политика после обновления параметров. Если новая политика слишком сильно смещается к hamster и выходит за доверительную область, TROLL переводит распределение в ближайшую допустимую точку, обозначенную зелёным. При этом возврат к прежней политике не обязателен. Распределение внутри доверительной области остаётся без изменений, а вышедшее за границу корректируется минимально. Так сохраняется направление обучения по вознаграждению и ограничивается размер одного обновления. О чем говорит правая сторона картины В эксперименте с Qwen3-14B и GRPO кривая TROLL, показанная сплошной линией, быстрее достигает высокой доли успешных решений, чем Clip, показанный пунктиром. Особенно заметен разрыв при генерации кода за одинаковое фактическое время. Это подтверждает вывод авторов об улучшении не только итогового результата, но и временной эффективности обучения. Отсечение может ослаблять или обнулять градиент за границами диапазона. TROLL сохраняет возможность дифференцирования через проекцию, ограничивающую обновление. Центральная гипотеза работы состоит в том, что это повышает одновременно устойчивость и эффективность обучения. 4. Реальный процессинговый поток TROLL Рисунок 2. Распределения текущей LLM и прежней политики из буфера траекторий представляются в разреженном виде, после чего проекция в доверительную область KL определяет распределение для обучения. Источник: Becker et al., ICLR 2026, с. 4. Шаг 1. Сохранение прежней политики. Вероятности токенов политики, использованной при генерации ответа, сохраняются в буфере траекторий и служат точкой сравнения для нового распределения. Шаг 2. Пересчёт текущей политики. На тех же ответах рассчитываются вероятности токенов модели с обновляемыми параметрами. Шаг 3. Разреженное представление обоих распределений. Вместо полного словаря сохраняются наиболее вероятные токены, охватывающие основную вероятностную массу. Шаг 4. Проверка KL-ограничения. Если отклонение текущего распределения от прежнего не превышает ε, проекция не требуется. Шаг 5. Проекция при выходе за границу. Вычисляется распределение, ближайшее к текущему и одновременно находящееся в доверительной области вокруг прежней политики. Шаг 6. Обновление политики. Спроецированное распределение используется для расчёта отношения вероятностей, а регрессионное слагаемое приближает исходный выход модели к результату проекции. Зачем нужно регрессионное слагаемое? Если использовать проекцию только при расчёте отношения вероятностей, исходное распределение LLM может оставаться вне доверительной области. Поэтому результат проекции задаёт целевое распределение для дополнительного регрессионного слагаемого, которое приближает к нему исходный выход и поддерживает устойчивость последующих обновлений. 5. Проекция в доверительную область без сложных формул 5.1 Наиболее близкий компромисс между текущей и предыдущей политикой TROLL ищет распределение, одновременно удовлетворяющее двум условиям: оно должно быть максимально близко к текущему распределению и отклоняться от прежней политики сбора данных не более чем на KL-границу ε. Задача имеет форму выпуклой оптимизации, а её решение выражается через геометрическую интерполяцию, использующую логарифмы вероятностей текущей и прежней политик. 5.2 Интенсивность проекции автоматически изменяется от положения токена к положению токена Если текущее распределение уже находится внутри допустимой области, интенсивность проекции равна нулю. Чем сильнее нарушена граница, тем больше коррекция в сторону прежней политики. Определение интенсивности сводится к оптимизации одного скаляра, что существенно эффективнее прямого решения всей многомерной задачи. 5.3 Почему важны дифференцируемые проекции При обучении с подкреплением градиент должен проходить от итоговой функции потерь к параметрам модели. TROLL включает численную оптимизацию в проекцию, но с помощью условий KKT и неявного дифференцирования определяет, как оптимальная интенсивность проекции зависит от выхода модели. Это позволяет использовать проекцию как слой вычислительного графа обучения. Для гипотетического примера, если вероятность правильного токена-кандидата была 0,45 в предыдущей политике и увеличилась до 0,60 в текущей политике, TROLL сохраняет направление вознаграждения, но поддерживает изменение, если оно находится в пределах границы KL. Если другие влиятельные токены значительно понижаются с 0,35 до 0,15, некоторые из них восстанавливаются, если изменение является чрезмерным, и если оставшиеся токены изменяются с 0,20 до 0,25, они нормализуются вместе, так что все распределение вероятностей является действительным. Проекция TROLL не сводится к независимому ограничению вероятности каждого токена сверху и снизу. Рассматривается всё категориальное распределение с суммой вероятностей 1, и для него находится допустимое распределение, удовлетворяющее KL-ограничению. 6. Как обработать более 150 000 токенов кандидатов В общем случае для каждой позиции ответа пришлось бы сохранять распределение по всему словарю и выполнять KL-проекцию. У токенизатора Qwen3 в рассматриваемом примере 151 936 вариантов токенов. Для длинных ответов и больших пакетов хранение всех логитов требует непрактичного объёма памяти и вычислений. 6.1 Большая часть вероятностной массы сосредоточена в нескольких токенах. Распределение следующего токена обычно сосредоточено на небольшом числе кандидатов. Метод отбирает не более K токенов и прекращает отбор после достижения суммарной вероятностной массы 1−δ. При настройках K=64 и δ=10⁻⁵ авторы сообщают о сохранении более 99,999% массы при среднем числе 5–10 токенов. 6.2 Фактически выбранный токен должен быть оставлен позади. Если сохранять только наиболее вероятные токены, можно потерять фактически выбранный токен с низкой вероятностью. Но отношение вероятностей и градиент непосредственно зависят от сгенерированных токенов. Поэтому TROLL обязательно включает выбранный токен в разреженное множество независимо от его ранга. 6.3 Выброшенные токены не становятся полностью нулевыми Нулевая вероятность исключённых токенов может сделать расчёт KL-дивергенции неустойчивым. Поэтому им присваивается небольшая базовая вероятность, после чего распределение снова нормируется. Обработка блоками также позволяет избегать пикового потребления памяти на длинных последовательностях. Разрежение объединяет четыре механизма. Ограничение top-K задаёт максимальное число сохраняемых токенов при высокой энтропии; по умолчанию K=64. Отбор прекращается после сохранения необходимой вероятностной массы, с порогом δ=10⁻⁵. Фактически выбранный токен включается всегда для расчёта отношения вероятностей и градиента. Исключённым токенам присваивается малая вероятность pd > 0, а не точный ноль. Для патентного анализа интерес представляет не разрежение само по себе, а его роль в проекции доверительной области для каждой позиции токена. Техническое значение может иметь порядок сочетания порога вероятностной массы, top-K, обязательного включения выбранного токена и повторной нормировки. 7. Как был разработан эксперимент? Авторы сравнивают TROLL и Clip при обучении с проверяемым вознаграждением (RLVR) на математических задачах и генерации кода. Чтобы проверить независимость результата от одной модели или оценщика преимущества, эксперименты охватывают разные семейства моделей, размеры, наборы данных и алгоритмы. Рассматривая экспериментальные данные и модельный состав, в математической области использовались DAPO-Math, оценочная группа MATH, состоящая из MATH500·AMC·AIME·OMNIMATH·OlympiadBench·Minerva, GSM8K и Eurus-Math, а в кодовом поле использовался Eurus-2-RL-Code. Серия Qwen включает Qwen3 0.6B·1.7B·4B·8B·14B и Qwen2.5 0.5B·1.5B·3B·7B. Кроме того, сравнивались Llama 3.1·3.2, SmolLM3, Apertus и FineMath-Llama. Были также рассмотрены методы оптимизации политики, охватывающие GRPO, PPO, Dr.GRPO, GSPO и REINFORCE++, а также возможность комбинирования адаптивной обрезки BAPO и неклиппинговой GPG. Исследуется не только рост итоговой оценки, но и скорость обучения, сокращение случаев его коллапса, воспроизводимость эффекта на других моделях и алгоритмах, а также дополнительные вычислительные затраты. 8. Изменения производительности в модели Qwen Рисунок 3. Результаты для Qwen3 от 600M до 14B: TROLL показан сплошной линией, Clip — пунктиром. В целом кривые TROLL быстрее растут и достигают более высоких значений при обучении и оценке на DAPO и Eurus-Code, а также при оценке на MATH. Источник: Becker et al., ICLR 2026, с. 7. 8.1 Математические рассуждения улучшились на 3-10 процентных пунктов. В статье резюмируется, что в экспериментах, основанных на DAPO-Math, TROLL показал результаты, которые в целом были на 3-10 процентных пунктов выше, чем Clip, или примерно на 5-15% относительного значения. Улучшения в том же направлении наблюдались от малой модели до модели 14В, и различия продолжались не только в тренировочном наборе, но и в оценке DAPO и оценке MATH. 8.2 Разрыв еще больше в генерации кода. Eurus-Code сообщил об улучшении на 7-18 процентных пунктов, или примерно на 18-30% в относительном выражении. В статье представлен пример, когда модель Qwen3-1.7B TROLL показала более высокие результаты, чем модель Qwen3-4B Clip. Этот результат показывает, что повышение устойчивости метода обновления может иметь больший эффект, чем увеличение размера модели. 8.3 Случай, когда небольшая модель TROLL близка к большой модели Clip В математических экспериментах модель Qwen3-4B TROLL показала производительность, близкую к производительности модели Qwen3-14B Clip. Конечно, мы не можем обобщить только этот результат, что меньшая модель заменяет большую модель. Тем не менее, это ясно показывает, что выбор алгоритма постобучения так же важен, как и размер параметра. 9. Сохраняется ли эффект, даже если метод оценки преимущества отличается? Таблица 1. Бумажный стол 1. Сравнение Clip и TROLL версий GRPO, Dr.GRPO, PPO, GSPO и REINFORCE++ в Qwen3-8B и Qwen2.5-7B-Instruct. Источник: Becker et al., ICLR 2026, original page 8. Наиболее заметной частью таблицы является GSPO. При объединении GSPO и Clip в Qwen3-8B показатель успеха рухнул практически до нуля, но использование TROLL привело к рейтингу DAPO 0,706. Даже в Qwen2.5-7B-Instruct GSPO Clip показал низкие результаты, в то время как TROLL стабилизировал обучение. В других алгоритмах TROLL, как правило, увеличивает скорость успеха. В статье объясняется, что в тестируемом диапазоне изменение Clip на TROLL часто давало больше преимуществ, чем изменение метода оценки преимуществ. Это показывает, что TROLL является стабилизатором, который обычно используется в уровне обновления политики, а не вспомогательным методом для конкретного метода расчета заслуг. Если смотреть конкретно на оценку DAPO Qwen3-8B, в GRPO Clip увеличился на 0,051 с 0,640 до TROLL 0,691, а в PPO он увеличился на 0,113 с 0,602 до 0,715. GSPO упала в обучении до 0,000 в Clip, но восстановила обучение, записав 0,706 в TROLL. REINFORCE++ также увеличился на 0,102 с 0,626 до 0,728. Точка интерпретации ТРОЛЛ является не «более эффективным средством оценки преимущества», а «более принципиальным методом ограничения, который отражает результаты оценки преимущества в политике». Поэтому важно, чтобы последствия воспроизводились в различных методах оценки преимущества. 10. Сохраняется ли эффект, даже если модельный ряд меняется? Рисунок 4. Рисунок бумаги 4. Сравнение конечной производительности и кривой обучения TROLL и Clip в различных моделях, таких как Llama, SmolLM3 и Apertus, а также комбинация GSM8K и DAPO. Источник: Becker et al., ICLR 2026, original page 9. Преимущества TROLL не ограничиваются серией Qwen. В частности, была значительная разница в моделях, которые показывали мало обучающего сигнала с существующим Clip. Результаты GSM8K Llama3.1-8B улучшились с Clip 0,000 до TROLL 0.759, а Apertus-8B улучшился с 0,156 до 0.697. Апертус-8В-Инструкция также увеличилась с 0,688 до 0,824. Глядя на кривые обучения, некоторые модели Llama начинают улучшаться в производительности после значительного количества времени в Clip, но сигналы обучения появляются раньше в TROLL. Это означает, что «быстрое обучение» и «стабильное обновление», подчеркиваемые в статье, наблюдаются даже при изменении семейства моделей. Однако не все комбинации обязательно лучше. Результаты GSM8K FineMath-Llama-3B были почти такими же или немного ниже, с Clip 0.750 и TROLL 0.746. Это исключение показывает, что TROLL — это не универсальная формула, которая гарантирует производительность в любое время, а метод, который становится особенно ценным в средах, где традиционная обрезка очень нестабильна. Вместо того, чтобы просто выбирать хорошие результаты, вы также должны смотреть на случаи и исключения, когда количество улучшений невелико. Убедительность этой статьи заключается не в том, что она выигрывает в каждой ячейке, а в том, что улучшения в стабильности обучения неоднократно наблюдаются в различных моделях и алгоритмах. 11. Гиперпараметр, энтропия и вычислительный анализ затрат Рисунок 5. Слева показана зависимость результатов от KL-границы и числа сохраняемых токенов; справа вверху — память и время выполнения, справа внизу — изменение энтропии при обучении. Источник: Becker et al., ICLR 2026, с. 10. 11.1 KL граница ε Если ε слишком мал, обновления будут чрезмерно консервативными, а обучение будет медленным. И наоборот, если он слишком велик, политика может двигаться много сразу, что приводит к плохой конечной производительности. Тем не менее, в статье объясняется, что производительность конвергенции относительно стабильна в достаточно небольшом и консервативном диапазоне. 11.2 Максимальное число токенов K при разрежении К=16 работал плохо, потому что он недостаточно приближен ко всему распределению. K=256 увеличивает вычислительную стоимость, но не имеет существенного прироста производительности по сравнению с K=64 по умолчанию. Другими словами, должен быть баланс между сохранением достаточного количества токенов, которые важны, но не сохранением слишком большого количества токенов без необходимости. 11.3 Сохранение энтропии При использовании Clip энтропия распределения токенов быстро снижалась по мере обучения. Это можно интерпретировать как концентрацию вероятности на нескольких уже известных шаблонах. TROLL сохранял более высокую энтропию одновременно с ростом доли успешных решений. В экспериментах по генерации кода также наблюдалась связь между сохранением энтропии и улучшением результата. 11.4 Дополнительные расходы, измеренные в контролируемой среде В контролируемом эксперименте потребление видеопамяти выросло с 34,574 GiB у Clip до 36,157 GiB у TROLL — примерно на 4,6%. Время выполнения увеличилось с 85,133 до 92,906 секунды, то есть примерно на 9,1%. На этапе обучения дополнительные затраты всё же возникают. Разреженное распределение ограничивает их рост. По объяснению авторов, эти затраты преимущественно зависят от размера словаря, а не числа параметров модели, поэтому с увеличением модели их доля в общей стоимости обучения снижается. При инференсе проекция TROLL не используется и дополнительных затрат не создаёт. 12. О чем следует помнить при интерпретации результатов работы 12.1 TROLL не является способом изменения структуры вывода. TROLL изменяет способ обновления политики на этапе дообучения. Он не меняет архитектуру модели и не добавляет модули при инференсе. Поэтому процесс инференса и задержка обученной модели остаются прежними. 12.2 Метод не решает проблему выбора функции вознаграждения При неудачной функции вознаграждения или ненадёжной проверке модель может устойчиво оптимизировать неправильную цель. TROLL ограничивает резкие изменения политики, но не исправляет сам сигнал, определяющий качество ответа. 12.3 Область эксперимента сосредоточена на математике и коде RLVR. Хотя эксперименты охватывают несколько семейств моделей и алгоритмов, основные задачи — математические рассуждения и генерация кода с проверяемыми ответами. Применимость к общему RLHF, длительным диалогам, агентам с инструментами и визуально-языковым моделям, где предпочтения человека сложнее, требует дополнительной проверки. 12.4 Проверены плотные модели размером до 14B Авторы исследовали плотные модели размером до 14B. В более крупных моделях и архитектурах MoE могут отличаться распределения по словарю, параллелизм, коммуникационные затраты и ошибки разрежения. Авторы относят эти вопросы к дальнейшим исследованиям. 12.5 Значение имеет качество разреженного приближения Практичность TROLL зависит от того, что небольшое число токенов содержит основную вероятностную массу. Для специальных задач и мультимодальных распределений с частыми высокоэнтропийными выходами среднего числа 5–10 токенов может быть недостаточно. В таких случаях могут потребоваться другие значения K и δ либо иной способ разрежения. Вместо того, чтобы просто сказать, что TROLL «всегда лучше, чем обрезка», более точно читать его как исследование, которое показало в ходе обширных экспериментов, что явная проекция области доверия может быть выгодной в ситуациях, когда обрезка нестабильна или потеря градиента велика. 13. Технологический анализ с точки зрения патентного поверенного, специализирующегося на патентах на искусственный интеллект Ниже приведён предварительный технический анализ сведений, раскрытых в статье. Выводы о новизне, изобретательском уровне и объёме прав требуют отдельного поиска уровня техники и проверки соответствующих патентных заявок. 13.1 Связь технических задач и способов их решения Глядя на соответствие между техническими проблемами и решениями, к эвристическим ограничениям и проблеме потери градиента отсечения PPO, проекция области доверия KL по категориальному распределению токенов применяется для явного ограничения ширины обновления при сохранении градиента даже в ограниченном регионе. Для памяти и вычислительной нагрузки, возникающей при проектировании всего распределения словарного запаса, используется скудное распределение, сочетающее критерий вероятностной массы и верхнюю К, что позволяет выполнять проекцию с практической стоимостью даже при размере словарного запаса современного LLM. Для задач, где численная оптимизация нарушает график обучения, мы применяем неявную дифференциацию и дифференцируемую проекцию на основе условий KKT, чтобы обеспечить возможность сквозного обучения от потери политики к параметрам модели. Кроме того, когда существует разрыв между распределением проекции и фактическим выходом LLM, термин регрессии, нацеленный на результат проекции, используется для приближения политики непроекции к области доверия в последующих обновлениях. Для задач, зависящих от конкретного метода оценки преимущества, для обеспечения совместимости с PPO, GRPO, Dr.GRPO, GSPO и т.д. используется структура обновления политики, которая не предполагает метод расчета заслуг. 13.2 Технические отличия могут заключаться в сочетании элементов Доверительные области и KL-ограничения известны по методам семейства TRPO. Также существуют работы по обучению с подкреплением на основе проекций, категориальным распределениям, отбору наиболее вероятных токенов и дифференцируемой оптимизации типа OptNet. Поэтому сильной стороной исследования является конкретное сочетание этих элементов при обновлении политики LLM на уровне токенов. В частности, техническое значение имеет последовательность сохранения, выравнивания и нормировки разреженных вероятностей прежней и текущей политик, решения одномерной двойственной задачи только для позиций с нарушением границы и использования проекции одновременно для отношения вероятностей и регрессионной цели. Это отличается от простого добавления KL-штрафа. 13.3 Важное значение имеют экспериментальные данные, подтверждающие технологическую эффективность В этой области наряду с математической конструкцией важны предотвращение коллапса, сохранение энтропии, фактическое время, рост потребления памяти и воспроизводимость на разных алгоритмах. Вместо одного показателя точности в патентном описании или технической документации полезно показать устойчивость в условиях сбоя Clip, ошибку разрежения, частоту проекций и сходимость при разных границах. 14. Выводы: что TROLL показывает о дальнейшем развитии дообучения Работа TROLL показывает, что для совершенствования обучения LLM с подкреплением важно пересматривать не только вознаграждение, данные и оценку преимущества, но и само правило обновления политики. Отсечение PPO удобно и хорошо изучено, однако приближение доверительной области может сопровождаться нестабильностью и потерей градиента. TROLL использует дифференцируемую KL-проекцию категориального распределения для каждой позиции токена, а разрежение снижает затраты большого словаря. В математических задачах и генерации кода метод продемонстрировал более быстрое обучение, улучшение итоговых результатов, смягчение коллапса и сохранение энтропии на нескольких моделях и алгоритмах. С патентной точки зрения следует рассматривать весь процесс: хранение и разрежение распределений LLM, выявление нарушений границы, проекцию через двойственную задачу, неявное дифференцирование и сочетание отношения вероятностей с регрессионным слагаемым. Отдельных терминов «доверительная область» или «разрежение» недостаточно. При наличии обширного уровня техники возможность охраны зависит от конкретных связей между элементами и подтверждения их эффекта. Дальнейшая проверка нужна для более крупных моделей, MoE, общего обучения по предпочтениям, агентов с инструментами и мультимодальных моделей. Значение работы — в пересмотре привычного выбора отсечения и демонстрации практического способа применять доверительные области в современных LLM. TROLL не просто ограничивает обновление политики, а минимально проецирует распределение в допустимую доверительную область KL. Сочетание разреженных логитов и дифференцируемого решателя делает метод применимым к современным LLM; в рассмотренных математических и программных экспериментах он обеспечил более устойчивое и быстрое обучение, чем Clip. Источник и информация об использовании Оригинальный текст: https://arxiv.org/pdf/2510.03817 Philipp Becker, Niklas Freymuth, Serge Thilges, Fabian Otto, Gerhard Neumann. «TROLL: Trust Regions Improve Reinforcement Learning for Large Language Models». ICLR 2026. Материал представляет собой технический разбор исследовательской статьи. Он не является юридическим заключением по конкретному спору или патентоспособности. Для такой оценки необходимо отдельно изучить соответствующие материалы заявки и уровень техники. Прочитать корейский оригинал Материал отражает ситуацию на дату публикации. Обратитесь в IPLEX, чтобы обсудить обстоятельства вашего дела. Обсудить этот вопрос ↗ Все статьи ОБРАТИТЕСЬ В IPLEX Обсудите с нами вопросы интеллектуальной собственности Мы рассматриваем ваши технологические и бизнес-потребности вместе. ↗ Связаться с нами Новее Почему отклоняются заявки на товарные знаки и как реагировать ↗ Ранее Подача заявок на товарные знаки в России: процедура, регистрация и основные правила ↗ Материалы по теме ИИ и программное обеспечение 2026.10.01 FiX: избирательное забывание признаков в softmax-внимании Патентный поверенный Ким Ёндок рассматривает векторные затворы FiX, устойчивость вычислений и страничный кэш, отделяя результаты экспериментов от открытых вопросов. ↗ Читать статью ИИ и программное обеспечение 2026.09.30 MHAR: выбор информации из предыдущих слоёв по подпространствам признаков Корейский патентный поверенный Ким Ёндок разбирает Multi-Head Attention Residuals: маршрутизацию по глубине, результаты экспериментов, затраты реализации и технические эффекты. ↗ Читать статью ИИ и программное обеспечение 2026.09.28 Колонка в AI Times: как ИИ учится работать с компьютером — анализ патента на обучение агентов В новой колонке для AI Times управляющий партнёр IPLEX Ким Ёндок рассматривает Claude Computer Use и обучение ИИ-агентов на примере патента США № 12 585 862. ↗ Читать статью

- https://www.iplexlaw.co.kr/ru
- https://www.iplexlaw.co.kr/ru/blog/category/ai
- https://www.iplexlaw.co.kr/forum/view/1533996
- https://www.iplexlaw.co.kr/ru/contact
- https://www.iplexlaw.co.kr/ru/blog
- https://www.iplexlaw.co.kr/ru/contact
- https://www.iplexlaw.co.kr/ru/blog/1535508
- https://www.iplexlaw.co.kr/ru/blog/1533936
- https://www.iplexlaw.co.kr/ru/blog/fix-fine-grained-forgetting-attention
- https://www.iplexlaw.co.kr/ru/blog/fix-fine-grained-forgetting-attention
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals
- https://www.iplexlaw.co.kr/ru/blog/claude-computer-use-agent-patent
- https://www.iplexlaw.co.kr/ru/blog/claude-computer-use-agent-patent
