# MHAR: выбор информации из предыдущих слоёв по подпространствам признаков

Корейский патентный поверенный Ким Ёндок разбирает Multi-Head Attention Residuals: маршрутизацию по глубине, результаты экспериментов, затраты реализации и технические эффекты.

Source: https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals

ГЛАВНАЯ / Новости и аналитика Новости и аналитика MHAR: выбор информации из предыдущих слоёв по подпространствам признаков Корейский патентный поверенный Ким Ёндок разбирает Multi-Head Attention Residuals: маршрутизацию по глубине, результаты экспериментов, затраты реализации и технические эффекты. ИИ и программное обеспечение 2026.09.30 опубликованный IPLEX Время чтения: 15 мин. Исследование с позиции патентной практики Автор — Ким Ёндок, патентный поверенный Республики Корея, IPLEX. Работа Multi-Head Attention Residuals посвящена повторному использованию представлений, уже вычисленных языковой моделью. Разным группам признаков может требоваться информация из разных предыдущих слоёв. Обсуждаемые результаты получены авторами статьи, а не в экспериментах IPLEX. Рассматривается статья Cheng Luo, Zefan Cai и Junjie Hu, Multi-Head Attention Residuals, arXiv:2607.27230v2, редакция от 31 июля 2026 года. Указанные авторами аффилиации — Independent Researcher и University of Wisconsin–Madison. Препринт и воспроизведённые научные иллюстрации принадлежат названным авторам и распространяются по лицензии CC BY 4.0. От остаточного потока к выбору предыдущих представлений Обычный Transformer с предварительной нормализацией добавляет выход каждого подслоя к остаточному потоку. Следующий подслой получает накопленное состояние, а не набор отдельных доступных для выбора прошлых выходов. Это не означает исчезновения прежней информации: вопрос состоит в способе доступа к ней. Attention Residuals сохраняет эмбеддинг и предыдущие выходы подслоёв внимания и MLP как отдельные источники. Обучаемый запрос оценивает их, а softmax по глубине задаёт взвешенную сумму. В одноголовом варианте одно распределение применяется ко всем каналам признаков, даже если разные группы нуждаются в разных источниках. Выбор по глубине с одной и несколькими головами: Figure 1 статьи Что меняет MHAR MHAR делит запрос размерности d и каждое исходное представление на H подпространств размерности d/H. Каждая голова отдельно оценивает доступные источники и применяет собственный softmax по глубине. Частичные взвешенные суммы объединяются в вектор размерности d. При H = 1 получается одноголовый Attention Residuals. Отличается ось выбора: обычное многоголовое самовнимание выбирает токены, а MHAR — выходы предыдущих слоёв в текущей позиции. Разные выученные распределения по глубине не доказывают, что отдельные головы отвечают за грамматику или математику. Схему также не следует понимать как добавление крупной самостоятельной сети проекций: метод перегруппировывает существующие измерения запроса и признаков. Иллюстративные веса по глубине, не экспериментальные измерения Порядок обработки и затраты Используются только эмбеддинг и уже вычисленные выходы подслоёв; будущие слои недоступны. RMSNorm формирует нормализованные ключи, а значениями служат исходные представления. Запросы и ключи делятся согласованно, оценка и softmax выполняются независимо для каждой головы, после чего взвешенные группы признаков объединяются для текущего подслоя внимания или MLP. В основных экспериментах с обучением с нуля запросы маршрутизации инициализируются нулями, поэтому начальное распределение равномерно. Отсутствие дополнительных параметров заявлено относительно одноголовой маршрутизации. По сравнению с обычным Transformer авторы указывают примерно 0,02 % дополнительных параметров и 0,5–1,2 % теоретических вычислений. Повторное чтение истории всё же создаёт нагрузку на память, поэтому предлагается объединённое ядро Triton. Обучение с нуля: важно выбрать правильную базу сравнения Основные эксперименты обучают модели архитектуры типа Qwen3 размером 100M, 350M и 1B в течение 20 000 шагов. Используется очищенный англоязычный корпус anneal_pt_v3 с удалёнными дубликатами и значительной долей синтетических данных, STEM и кода. Внутри каждого размера для базовой модели, Hyper-Connections, одной головы и MHAR согласованы данные, график и пакеты обучения. Потери усреднены по 11 оценкам за последние 5 000 шагов; само по себе это не усреднение по случайным инициализациям. Потери базовой модели / одной головы / MHAR составляют 3,031 / 2,970 / 2,969 для 100M; 2,997 / 2,876 / 2,848 для 350M; 2,894 / 2,759 / 2,754 для 1B. Для 350M выигрыш относительно базы равен 0,149, а дополнительный выигрыш относительно одной головы — 0,028. Нельзя приписывать весь эффект разделению на головы. Приложение H также содержит исследование устойчивости на FineWeb-Edu с тремя случайными инициализациями по отдельному протоколу. Эти дополнительные данные следует отличать от усреднения оценок в основной таблице. Они не подтверждают воспроизводимость во всех возможных условиях. Потери валидации при обучении с нуля: Table 1 статьи Результаты на прикладных задачах неоднородны Для 1B при переходе от базы к MHAR перплексия WikiText-2 снижается с 56,4 до 45,4, а точность LAMBADA растёт с 8,8 % до 16,0 %. Но HellaSwag для 100M снижается с 35,0 % до 33,0 %. Авторы отмечают примерно ±3 процентных пункта выборочного шума при оценке на 200 примерах. Длина контекста также различается между размерами, поэтому прежде всего нужно сопоставлять модели одного масштаба. Подключение к уже обученной модели 8B При продолжении предобучения Marin-8B сохраняется исходный остаточный поток и добавляется ветвь маршрутизации приращений. Выходной вентиль инициализируется нулём, сохраняя исходные вычисления в момент преобразования; сообщаемое начальное максимальное различие логитов в fp32 равно нулю. Новая ветвь начинает влиять на результат по мере обучения вентиля. 32 слоя объединены в группы по четыре, образующие восемь блочных приращений; добавлен обучаемый нулевой источник. Восемь голов читают не более девяти источников. Это отличается от хранения всех прошлых выходов подслоёв. Полный пул данных содержит около 1,9 трлн токенов, но фактически использовано около 10 млрд. Обычное продолжение предобучения, Plain CPT, сравнивается при одинаковом графике, порядке данных и пакетах. Отделить эффект дообучения от вклада MHAR Точность GSM8K составляет 19,0 % у исходной модели, 47,0 % у Plain CPT и 50,2 % у MHAR. Дополнительный выигрыш MHAR — 3,2 процентного пункта. GPQA повышается с 31,5 % у Plain CPT до 34,6 % у MHAR, то есть на 3,1 пункта. Значительная часть общего роста относительно исходной модели обусловлена самим продолжением обучения. MATH остаётся на уровне 19,1 % в обоих случаях. Различия по MMLU, HumanEval и MBPP также не описываются как статистически определённые. Парные тесты дают p = 0,004 для GSM8K и p = 0,038 для GPQA, но не заменяют повторные эксперименты с разными инициализациями во всех условиях эксплуатации. Точность после продолжения предобучения 8B: сравнение с Plain CPT Больше голов не всегда лучше В эксперименте 1B на веб-корпусе с восемью KV-головами потери для 1, 4, 8 и 16 голов маршрутизации составляют 3,270, 3,132, 3,129 и 3,173. Четыре и восемь голов дают близкие результаты, а шестнадцать ухудшает их. Слишком мало групп вынуждает объединять разные предпочтения; чрезмерное дробление может разделить признаки, которые полезно обрабатывать совместно. Восемь голов — не универсальное правило. Подходящее разбиение зависит от ширины модели, стадии обучения и данных. Веб-эксперименты отличаются от основных также условиями инициализации, поэтому нельзя объяснять различия только распределением данных. Сравнение числа голов маршрутизации по отдельному протоколу Обмен с памятью важен не меньше числа операций Если пропускную способность базовой модели того же размера принять за 1,00, обычная реализация MHAR даёт 0,54 / 0,32 / 0,23 для 100M / 350M / 1B, а объединённое ядро — 0,88 / 0,71 / 0,55. Объединение уменьшает повторные обращения и промежуточное хранение, но полное обучение всё ещё медленнее базового. Для 1B пиковая память снижается с 47,5 до 20,1 ГБ, приближаясь к базовым 19,0 ГБ, тогда как пропускная способность остаётся на уровне 55 % от базы. Ускорение отдельного ядра не равно ускорению всей модели в той же пропорции. Сравнение при одинаковом числе шагов также не доказывает преимущество при одинаковом бюджете реального времени. Пропускная способность обучения и пиковая память: фрагмент таблицы статьи Границы имеющихся доказательств MHAR предлагает вариант организации новых моделей и дополнительный внутренний путь для продолжения обучения существующих. Однако основные данные относятся к английскому языку и определённым архитектурам и размерам. Они сами по себе не подтверждают пользу для корейскоязычных моделей, мультимодальных систем, длинного контекста или задержки и стоимости промышленного инференса. Для дальнейшей проверки полезны повторения с разными инициализациями по нужному протоколу, сравнения при одинаковом времени или суммарном объёме вычислений, разделение влияния данных и инициализации, а также измерения памяти и задержки инференса. Улучшение учебных метрик не следует выдавать за доказательство ускорения ответа пользователю. Технические признаки и эффекты в патентном анализе Задача конкретнее простого повышения точности: общее распределение по глубине не полностью отражает потребности разных подпространств, а повторный доступ нагружает память. Центральная связь — согласованное разделение признаков, независимая нормализация по источникам, взвешенное агрегирование и последующее объединение. Объединённое исполнение сокращает промежуточные тензоры и доступ к памяти. Блочные приращения и вентиль с нулевой инициализацией ограничивают число источников и сохраняют исходное поведение предобученной модели. Эти решения относятся к разным проблемам реализации; сводить их к одному общему утверждению о росте производительности некорректно. От обычных остаточных связей метод отличается индивидуальным выбором прошлых выходов; от одноголового Attention Residuals — выбором по подпространствам; от токенного внимания — расположением источников по глубине. Эффекты нужно связывать с этими отношениями и фактическими условиями сравнения. Это анализ технического вклада статьи, а не заключение о патентоспособности или о наличии выданного патента. Заключительное замечание MHAR переосмысливает, кто читает уже вычисленную информацию, из каких источников и в каких пропорциях. Для понимания вклада нужно совместно учитывать выбор по подпространствам, сохранение предобученных вычислений и реальные затраты обмена с памятью. Перспективная информационная связь сама по себе не гарантирует более быструю реализацию. Сохранены исходные обозначения и формы иллюстраций; их содержание поясняется в тексте. Связанные материалы: патенты на ИИ Прочитать корейский оригинал Материал отражает ситуацию на дату публикации. Обратитесь в IPLEX, чтобы обсудить обстоятельства вашего дела. Обсудить этот вопрос ↗ Все статьи НА ЭТОЙ СТРАНИЦЕ Исследование с позиции патентной практики От остаточного потока к выбору предыдущих представлений Что меняет MHAR Порядок обработки и затраты Обучение с нуля: важно выбрать правильную базу сравнения Результаты на прикладных задачах неоднородны Подключение к уже обученной модели 8B Отделить эффект дообучения от вклада MHAR Больше голов не всегда лучше Обмен с памятью важен не меньше числа операций Границы имеющихся доказательств Технические признаки и эффекты в патентном анализе Заключительное замечание ОБРАТИТЕСЬ В IPLEX Обсудите с нами вопросы интеллектуальной собственности Мы рассматриваем ваши технологические и бизнес-потребности вместе. ↗ Связаться с нами Новее Уточнение дозировки как изменение патентной формулы: позиция Верховного суда Кореи ↗ Ранее Товарные знаки в ОАЭ: способы подачи, сроки и практические требования ↗ Материалы по теме ИИ и программное обеспечение 2026.10.01 FiX: избирательное забывание признаков в softmax-внимании Патентный поверенный Ким Ёндок рассматривает векторные затворы FiX, устойчивость вычислений и страничный кэш, отделяя результаты экспериментов от открытых вопросов. ↗ Читать статью ИИ и программное обеспечение 2026.09.28 Колонка в AI Times: как ИИ учится работать с компьютером — анализ патента на обучение агентов В новой колонке для AI Times управляющий партнёр IPLEX Ким Ёндок рассматривает Claude Computer Use и обучение ИИ-агентов на примере патента США № 12 585 862. ↗ Читать статью ИИ и программное обеспечение 2026.09.18 Стратегия в сфере интеллектуальной собственности начинается с понимания технологии: интервью IPLEX В интервью рассказываем, как IPLEX объединяет анализ технологий ИИ и программного обеспечения с задачами бизнеса. Делимся опытом обучения предпринимателей, наставничества и взаимодействия с клиентами. ↗ Читать статью

- https://www.iplexlaw.co.kr/ru
- https://www.iplexlaw.co.kr/ru/blog/category/ai
- https://www.iplexlaw.co.kr/ru/ai-patents
- https://www.iplexlaw.co.kr/ko/blog/mhar-multi-head-attention-residuals
- https://www.iplexlaw.co.kr/ru/contact
- https://www.iplexlaw.co.kr/ru/blog
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals#editorial-mhar-en-0
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals#editorial-mhar-en-1
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals#editorial-mhar-en-2
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals#editorial-mhar-en-3
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals#editorial-mhar-en-4
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals#editorial-mhar-en-5
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals#editorial-mhar-en-6
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals#editorial-mhar-en-7
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals#editorial-mhar-en-8
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals#editorial-mhar-en-9
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals#editorial-mhar-en-10
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals#editorial-mhar-en-11
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals#editorial-mhar-en-12
- https://www.iplexlaw.co.kr/ru/contact
- https://www.iplexlaw.co.kr/ru/blog/brunch-case-1781
- https://www.iplexlaw.co.kr/ru/blog/uae-trademark-filing-guide
- https://www.iplexlaw.co.kr/ru/blog/fix-fine-grained-forgetting-attention
- https://www.iplexlaw.co.kr/ru/blog/fix-fine-grained-forgetting-attention
- https://www.iplexlaw.co.kr/ru/blog/claude-computer-use-agent-patent
- https://www.iplexlaw.co.kr/ru/blog/claude-computer-use-agent-patent
- https://www.iplexlaw.co.kr/ru/blog/1539348
- https://www.iplexlaw.co.kr/ru/blog/1539348
