# Attention Residuals: selección de información entre capas y claves para el análisis de patentes

Explicamos Attention Residuals y Block AttnRes, el alcance de los resultados publicados y los detalles técnicos que conviene analizar al preparar una solicitud de patente de IA.

Source: https://www.iplexlaw.co.kr/es/blog/attention-residuals-ai-patent-analysis

INICIO / Noticias y análisis Noticias y análisis Attention Residuals: selección de información entre capas y claves para el análisis de patentes Explicamos Attention Residuals y Block AttnRes, el alcance de los resultados publicados y los detalles técnicos que conviene analizar al preparar una solicitud de patente de IA. IA y software 2026.10.03 publicado IPLEX 4 min de lectura Portada original en coreano que ilustra la combinación de información de varias etapas Attention Residuals modifica la forma en que la información circula entre las capas de un modelo de IA. En lugar de sumar las salidas anteriores con el mismo peso, aprende cuánto debe aportar cada representación en función de la entrada. Partimos de un ejemplo sencillo para explicar el mecanismo y examinar los aspectos concretos de implementación que pueden resultar relevantes al preparar una solicitud de patente. Documento analizado: Attention Residuals, del Kimi Team, versión arXiv v1 publicada el 16 de marzo de 2026. ¿Por qué replantear las conexiones residuales? El modelo procesa la entrada a través de capas sucesivas. Cada capa constituye una etapa de procesamiento. Una conexión residual añade un resultado nuevo a la información recibida de etapas anteriores y transmite la combinación a la siguiente. En la acumulación residual convencional, las salidas anteriores se incorporan con coeficientes iguales. El trabajo aborda la dilución de la contribución de cada capa a medida que aumenta la profundidad del modelo. Attention Residuals compara las representaciones previas y las combina con pesos dependientes de la entrada. La atención es un mecanismo que asigna pesos a distintas informaciones. En este caso compara las representaciones de un mismo token a lo largo de la profundidad del modelo. Un token es una pequeña unidad de procesamiento del texto; la selección que aquí se analiza se produce entre capas. Un ejemplo: anotaciones en un informe Imaginemos que tres personas dejan anotaciones en un informe. Quien lo revisa puede dar mayor importancia a la nota más útil para la frase que está corrigiendo. De manera análoga, el modelo combina resultados de etapas anteriores en proporciones ajustadas a la entrada. Como ejemplo ilustrativo, se podría combinar un 10% de la nota A, un 20% de la B y un 70% de la C para la siguiente etapa. Estos porcentajes son hipotéticos y no corresponden a resultados experimentales del artículo. En el modelo real, los resultados se expresan mediante representaciones numéricas. Los pesos se calculan con un criterio aprendido; no los establece una persona clasificando manualmente la importancia de las notas. El mecanismo en tres pasos Primero se reúnen las salidas anteriores y se normalizan las representaciones utilizadas para calcular sus pesos. La normalización lleva los valores que se comparan a una escala coherente. Después, un criterio aprendido para cada capa genera puntuaciones. La función softmax las transforma en pesos cuya suma es el 100%. Por último, se combinan con esos pesos las representaciones originales —no únicamente los valores normalizados para compararlas— y se obtiene la entrada de la siguiente etapa. Conservar por separado todas las salidas previas puede elevar el consumo de memoria y el coste de comunicación. Block AttnRes agrupa varias capas: suma sus salidas dentro de cada bloque y utiliza atención para ponderar las representaciones de los distintos bloques. Así reduce la carga de almacenar y transmitir cada salida individualmente. Resultados experimentales y límites de aplicación Los autores comunican mejoras en evaluaciones de conocimientos generales, matemáticas, código y otras tareas tras entrenar modelos basados en Kimi Linear. Los resultados se obtuvieron con la arquitectura y las condiciones de entrenamiento y evaluación descritas en el trabajo. No demuestran que baste con cambiar las conexiones de un modelo existente para reproducir esas mejoras. Pensemos en una posible aplicación a un sistema empresarial de resumen de informes. Habría que medir tanto la calidad del resumen como la memoria destinada a salidas previas, la comunicación entre dispositivos y el tiempo de procesamiento. Es un ejemplo de uso potencial, no una constatación de que un producto comercial concreto incorpore este método. Del planteamiento técnico al análisis para una solicitud de patente Esta sección aporta una valoración independiente desde la práctica de patentes sobre un trabajo publicado. No interpreta el alcance de una patente concedida ni concluye que la solución sea patentable. Las reivindicaciones delimitan la protección solicitada; por ello, el objetivo de seleccionar información debe examinarse a través de los medios y operaciones concretos que lo hacen posible. Objeto de la selección: precisar si se utilizan salidas de capas individuales o representaciones de grupos de capas. Cálculo de pesos: determinar cómo se combinan el criterio aprendido, la normalización y la ponderación, incluido el orden de las operaciones. Almacenamiento y comunicación: describir la configuración y la secuencia de procesamiento que conservan los resultados previos y reducen las transferencias redundantes. Efectos técnicos: documentar el impacto sobre rendimiento, memoria y comunicaciones junto con las condiciones de comparación. Para analizar una invención de IA, conviene preparar un diagrama de procesamiento, las características que difieren de las soluciones anteriores, datos de ensayos comparativos y el calendario previsto de divulgación. IPLEX examina esas diferencias al diseñar la estrategia de protección, a partir de su experiencia pública en análisis de patentes de IA, proyectos de IP-R&D y publicaciones. El perfil profesional de Yongduck Kim recoge esa trayectoria. Análisis a 3 de octubre de 2026, basado en arXiv v1. No hemos reproducido los experimentos de forma independiente. Patentes de IA y estrategia de propiedad industrial Perfil profesional de Yongduck Kim Leer el análisis de In-Place Test-Time Training Leer el original en Tistory Leer el original coreano Este artículo del archivo refleja la situación en su fecha de publicación. Contacte con el despacho para analizar su caso. Consultar sobre este tema ↗ Todos los artículos EN ESTA PÁGINA ¿Por qué replantear las conexiones residuales? Un ejemplo: anotaciones en un informe El mecanismo en tres pasos Resultados experimentales y límites de aplicación Del planteamiento técnico al análisis para una solicitud de patente HABLE CON IPLEX Consulte sus necesidades de propiedad intelectual Analizamos conjuntamente sus necesidades tecnológicas y empresariales. ↗ Contactar Anterior Alcance de una patente coreana tras ensayar y desechar el producto ↗ Artículos relacionados IA y software 2026.10.01 FiX: olvido selectivo por características en la atención softmax Yongduck Kim analiza las compuertas de FiX, su estabilidad numérica y la caché paginada, diferenciando los resultados medidos de las cuestiones aún abiertas. ↗ Lea el artículo IA y software 2026.09.30 MHAR: leer las capas anteriores desde distintos subespacios de características Yongduck Kim analiza Multi-Head Attention Residuals: selección en profundidad, resultados publicados, costes de implementación y relación entre características técnicas y efectos. ↗ Lea el artículo IA y software 2026.09.28 Columna: Claude Computer Use y el aprendizaje de los agentes de IA a través de las patentes Yongduck Kim, socio director de IPLEX, analiza en AI Times los datos y las secuencias de acciones que permiten entrenar a agentes de IA para utilizar software. ↗ Lea el artículo

- https://www.iplexlaw.co.kr/es
- https://www.iplexlaw.co.kr/es/blog/category/ai
- https://www.iplexlaw.co.kr/es/ai-patents
- https://www.iplexlaw.co.kr/es/professionals/yongdeok-kim
- https://www.iplexlaw.co.kr/es/blog/1525199
- https://iplexlaw.tistory.com/3
- https://www.iplexlaw.co.kr/ko/blog/attention-residuals-ai-patent-analysis
- https://www.iplexlaw.co.kr/es/contact
- https://www.iplexlaw.co.kr/es/blog
- https://www.iplexlaw.co.kr/es/blog/attention-residuals-ai-patent-analysis#attnres-0
- https://www.iplexlaw.co.kr/es/blog/attention-residuals-ai-patent-analysis#attnres-1
- https://www.iplexlaw.co.kr/es/blog/attention-residuals-ai-patent-analysis#attnres-2
- https://www.iplexlaw.co.kr/es/blog/attention-residuals-ai-patent-analysis#attnres-3
- https://www.iplexlaw.co.kr/es/blog/attention-residuals-ai-patent-analysis#attnres-4
- https://www.iplexlaw.co.kr/es/contact
- https://www.iplexlaw.co.kr/es/blog/brunch-case-1787
- https://www.iplexlaw.co.kr/es/blog/fix-fine-grained-forgetting-attention
- https://www.iplexlaw.co.kr/es/blog/fix-fine-grained-forgetting-attention
- https://www.iplexlaw.co.kr/es/blog/mhar-multi-head-attention-residuals
- https://www.iplexlaw.co.kr/es/blog/mhar-multi-head-attention-residuals
- https://www.iplexlaw.co.kr/es/blog/claude-computer-use-agent-patent
- https://www.iplexlaw.co.kr/es/blog/claude-computer-use-agent-patent
