# Разбор исследования Facebook AI: DETR и сквозное обнаружение объектов с помощью трансформеров

ECCV (Европейская конференция по компьютерному зрению) 2020: анализ сквозного обнаружения объектов с помощью трансформеров.

Source: https://www.iplexlaw.co.kr/ru/blog/873032

ГЛАВНАЯ / Новости и аналитика Новости и аналитика Разбор исследования Facebook AI: DETR и сквозное обнаружение объектов с помощью трансформеров ECCV (Европейская конференция по компьютерному зрению) 2020: анализ сквозного обнаружения объектов с помощью трансформеров. ИИ и программное обеспечение Опубликовано: 2023.06.27 IPLEX Время чтения: 8 мин. ECCV (Европейская конференция по компьютерному зрению) 2020: анализ сквозного обнаружения объектов с помощью трансформеров. Если вы нажмете на изображение, вы сможете увидеть полный текст. Эта статья была опубликована командой Facebook AI. Проще, чем традиционные алгоритмы обнаружения объектов и более конкурентоспособные архитектуры. Это привлекло внимание многих людей. Это называется DETR (Detection Transformer). Характеристики DETR таковы: 1) что он использует функцию дихотомии и 2) что он использует трансформер, который часто используется в обработке естественного языка. Так и есть. Проблема, решенная этой статьей? Существующие методы обнаружения объектов слишком сложны и используют множество библиотек. Поэтому использовать существующий метод было довольно сложно. Например, для обнаружения объекта с использованием существующих методов обнаружения объекта необходимо было учитывать форму ограничительного ящика и то, как он обрабатывался при перекрытии ограничительного ящика. Давайте подумаем об этом в целом, потому что это более эффективно. То есть, Для решения проблемы требовалась более простая архитектура, что было довольно сложно использовать существующие методы обнаружения объектов, и это было решено в этой статье. Вся DETR. 1) Для извлечения признаков изображения используется магистральная сеть (CNN), а для получения информации об относительном местоположении на изображении используется позиционное кодирование. ＊ ＊ ＊ Функция, извлеченная из магистральной сети, и относительная информация о местоположении, полученная из позиционного кодирования, вводятся в кодер. Здесь каждая пиксельная информация соответствует последовательным данным. Таким образом, в качестве кодера используется подходящий трансформер для обработки последовательных данных. ＊ ＊ ＊ С другой стороны, выход кодера и объектный запрос (фиксированное количество изученных встраиваемых локаций) являются входными данными декодера, а выход декодера передается в переднюю сеть подачи (FFN), которая генерирует конечный выход. Окончательное значение результата: 1) если конкретный объект существует, он содержит информацию о классе для этого объекта и ограничительной коробке, связанной с тем, где этот объект существует; и 2) если конкретный объект не существует, никакой объект не представлен как класс, что означает, что он не существует. ＊ ＊ ＊ Используйте функцию потери бинарного соответствия, чтобы гарантировать, что соответствие между конечным результатом и фактическим значением будет успешным. Давай сделаем это. Это позволяет ему обнаруживать каждый из не дублированных экземпляров с помощью функции сопоставления потерь. В результате вся структура извлекает признаки из изображения при вводе изображения, а затем преобразует его так, чтобы можно было получить фактические результаты обнаружения объекта. Это двухпартийное совпадение. В прошлом задача предсказания множества решалась косвенно с помощью NMS (немаксимальная подвеска). В частности, задача предсказания множеств решалась путем нахождения случайного местоположения, а затем сжатия их в одно, без указания того, сколько экземпляров объектов существовало во всем изображении. Однако, согласно докладу, Установите проблему прогнозирования с ним. Прямой эфир The New York Times . В частности, задача предсказания набора была решена путем исправления: «Только N изображений может иметь объектный экземпляр». То есть, Он позволяет выходному измерению быть N, и по сравнению с реальной земной истиной он выполняет дихотомию, чтобы соответствовать одному к одному, так что задача предсказания множества решена. . Например, если вы прикрепите N к 6, что во всем изображении может быть до шести экземпляров объекта, вы выполняете двоичное совпадение в процессе обучения, чтобы экземпляр не перекрывался. В этом случае инстанция индуцируется, чтобы не перекрываться. Допустим, что предсказание двух птиц, выполняющих обнаружение объектов с помощью изображения, полученного в процессе обучения, выглядит следующим образом: C = класс b = информация о границах (x координат, y координат, ширина, высота) Поскольку N=6, значение предсказания составляет от C0 до C5. Здесь значение предсказания C2 содержит неправильный результат, который конфигурирует совпадающее значение потерь, чтобы иметь более низкое значение потерь, когда класс одинаков, а информация о ограничивающих полях аналогична. И когда весь матч закончен, вся величина проигрыша выполняет этот матч в самом нижнем направлении. Выполняйте сопоставление на основе информации о классе и ограничительной коробке. (Значение предсказания C1 соответствует фактическому значению C0, а значение предсказания C3 соответствует фактическому значению C3), а остальные значения предсказания без класса случайным образом сопоставляются с другими значениями реального мира. В процессе обучения ограничивающую информацию класса учат уменьшать. Затем, если в предсказательном значении имеется неверное значение предсказания (значение предсказания C2), оно сопоставляется с фактическим значением (значение предсказания C2 без данных, так что его можно отличить без объекта. Таким образом, если обучение будет успешным, можно предсказать только местоположение и количество объектов. Проблема решается проблемой предиката. Если двоичное совпадение выполняется, даже если каждое выходное положение изменяется в результате прогнозирования (например, положения C1 и C3), с двоичным совпадением вообще не будет проблем, поэтому порядок будет изменен, и только два ограничивающих ящика будут научены обнаруживать птицу, чтобы можно было естественным образом избежать избыточности экземпляра. . Почему вы использовали трансформер? Трансформатор является одной из архитектур, которая используется для лучшего обучения встраиванию данных при перечислении последовательных данных. передатчик 1) Он используется для понимания контекстной информации всего изображения посредством внимания, и 2) для облегчения понимания взаимодействия каждого экземпляра изображения. В частности, механизм внимания позволяет каждому пикселю выполнять внимание, присваивая друг другу оценки внимания, в этом случае экземпляр разделен, и контекст понимается для каждого экземпляра. Кроме того, Трансформаторы используются для облегчения связи пикселей от большой ограничительной коробки. Даже при обработке естественного языка, если длина предложения отклоняется, может быть нелегко определить связь между первым словом и последним словом. Трансформеры могут легко определить отношения в этом случае. Подобно обработке изображений на естественном языке, существует проблема, которая затрудняет понимание связи пикселей с большим ограничивающим ящиком. Что такое энкодер? Кодер принимает данные о положении каждого пикселя, который содержит информацию об особенностях изображения и выполняет кодирование. Я делаю это. В частности, кодер получает карту функций с размером d*HW непрерывности. (d = функция изображения, HW = информация о местоположении каждого пикселя) Кроме того, информация позиционного кодирования может быть введена для правильного кодирования и обработки информации о местоположении для фактических данных изображения, присутствующих в 2D. С другой стороны, когда в кодировщик вводится информация об особенностях изображения, информация о взаимодействии и ассоциации для каждого пикселя усваивается при выполнении самостоятельного внимания. Закодированная информация затем используется в декодирующей части. После того, как все кодировки были выполнены, вы можете визуализировать карту самовнимания, чтобы увидеть, что отдельные экземпляры правильно разделены следующим образом: Специфический Вы можете видеть, что каждый пиксель (красная точка) правильно отделен от той части, с которой он связан. Карта самовнимания. Четыре коровы должным образом отделены друг от друга. Функция декодера? Декодер получает N объектных запросов в качестве начального ввода, получает закодированную информацию от кодера и может понимать контекст всего изображения. .. Когда закодированная информация принимается из кодера, информация позиционного кодирования также вводится, и информация о местоположении для фактических данных изображения, присутствующих в 2D, может быть правильно закодирована и обработана. Декодер позволяет каждому объектному запросу выводить класс и ограничивающую коробку информации для одного экземпляра. То есть архитектура выполнена с возможностью различать N различных уникальных экземпляров. В результате, Если кодер разделяет экземпляр через глобальное внимание, декодер извлекает класс и границу каждого экземпляра. На изображении ниже показана карта внимания каждого из N объектов в декодерной части. В конце каждого экземпляра можно увидеть, что значение фокуса внимания высоко сформировано (выражено в синем и оранжевом цветах). .. В этом случае суть заключается в том, чтобы сделать ограничивающий ящик подходящим. DETR показывает хорошую производительность для больших объектов, но низкую производительность для небольших объектов. Проблема с DETR заключается в том, что обучение занимает довольно много времени. Чтобы компенсировать это, необходимо разработать такую технологию, которая может хорошо обрабатывать небольшие объекты при одновременном сокращении времени обучения DETR. Прочитать корейский оригинал Материал отражает ситуацию на дату публикации. Обратитесь в IPLEX, чтобы обсудить обстоятельства вашего дела. Обсудить этот вопрос ↗ Все статьи ОБРАТИТЕСЬ В IPLEX Обсудите с нами вопросы интеллектуальной собственности Мы рассматриваем ваши технологические и бизнес-потребности вместе. ↗ Связаться с нами Новее Повышение эффективности глубокого обучения: Mixup и сглаживание меток ↗ Ранее Обнаружение аномалий оборудования: патенты MakinaRocks на автоэнкодеры и перенос обучения ↗ Материалы по теме ИИ и программное обеспечение 2026.10.01 FiX: избирательное забывание признаков в softmax-внимании Патентный поверенный Ким Ёндок рассматривает векторные затворы FiX, устойчивость вычислений и страничный кэш, отделяя результаты экспериментов от открытых вопросов. ↗ Читать статью ИИ и программное обеспечение 2026.09.30 MHAR: выбор информации из предыдущих слоёв по подпространствам признаков Корейский патентный поверенный Ким Ёндок разбирает Multi-Head Attention Residuals: маршрутизацию по глубине, результаты экспериментов, затраты реализации и технические эффекты. ↗ Читать статью ИИ и программное обеспечение 2026.09.28 Колонка в AI Times: как ИИ учится работать с компьютером — анализ патента на обучение агентов В новой колонке для AI Times управляющий партнёр IPLEX Ким Ёндок рассматривает Claude Computer Use и обучение ИИ-агентов на примере патента США № 12 585 862. ↗ Читать статью

- https://www.iplexlaw.co.kr/ru
- https://www.iplexlaw.co.kr/ru/blog/category/ai
- https://drive.google.com/file/d/13Bx7QS8o9st9OOWO2QPi66_iEF1wXyYY/view
- https://www.iplexlaw.co.kr/forum/view/873032
- https://www.iplexlaw.co.kr/ru/contact
- https://www.iplexlaw.co.kr/ru/blog
- https://www.iplexlaw.co.kr/ru/contact
- https://www.iplexlaw.co.kr/ru/blog/875313
- https://www.iplexlaw.co.kr/ru/blog/870447
- https://www.iplexlaw.co.kr/ru/blog/fix-fine-grained-forgetting-attention
- https://www.iplexlaw.co.kr/ru/blog/fix-fine-grained-forgetting-attention
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals
- https://www.iplexlaw.co.kr/ru/blog/mhar-multi-head-attention-residuals
- https://www.iplexlaw.co.kr/ru/blog/claude-computer-use-agent-patent
- https://www.iplexlaw.co.kr/ru/blog/claude-computer-use-agent-patent
