# FiX: olvido selectivo por características en la atención softmax

Yongduck Kim analiza las compuertas de FiX, su estabilidad numérica y la caché paginada, diferenciando los resultados medidos de las cuestiones aún abiertas.

Source: https://www.iplexlaw.co.kr/es/blog/fix-fine-grained-forgetting-attention

INICIO / Noticias y análisis Noticias y análisis FiX: olvido selectivo por características en la atención softmax Yongduck Kim analiza las compuertas de FiX, su estabilidad numérica y la caché paginada, diferenciando los resultados medidos de las cuestiones aún abiertas. IA y software 2026.10.01 publicado IPLEX 12 min de lectura Qué información debe conservar el modelo Una conversación larga exige memoria, pero no todas las características merecen conservarse con igual intensidad. FiX modula la contribución de cada componente de un token anterior a la salida actual. Este artículo analiza una investigación; no presenta una patente concedida a IPLEX ni a sus clientes. FiX: Introducing Fine-grained Forget Gate into Softmax Attention, de Runzhong Li, Renjie Liu, Qing Li y Bo Tang, figura en las actas de ICML 2026, PMLR 306, páginas 68619–68640, identificador pmlr-v306-li26dl. El congreso se celebró del 6 al 11 de julio de 2026. Las afiliaciones son Southern University of Science and Technology y The Hong Kong Polytechnic University; también consta una estancia de Renjie Liu en AlayaDB. La ficha oficial no recoge DOI ni identificador arXiv. El artículo y sus figuras se atribuyen a sus autores bajo licencia CC BY 4.0. El límite de una compuerta escalar La atención compara consultas Q y claves K para obtener pesos y combina los valores V correspondientes en la salida O. Decidir dónde prestar atención y qué información conservar son operaciones distintas. FoX introduce un olvido dependiente del contexto, pero aplica una misma tasa escalar de decaimiento a todas las características de un token dentro de cada cabeza. Una compuerta vectorial no puede sumarse directamente al producto escalar Q–K. FiX traslada el olvido a los valores: las compuertas acumuladas actúan componente a componente sobre V antes de combinar sus contribuciones. Así, unas características persisten y otras se atenúan. Los valores 0,2, 0,1 y 0,3 de la figura 1 son ilustrativos, no resultados de exactitud. Para el token actual, el producto acumulado vacío vale uno. Ilustración 2 — El límite de una compuerta escalar Funciones de RMSNorm y RoPE La justificación matemática pasa por RMSNorm en la salida. En su forma ideal, un factor positivo común se cancela, permitiendo trasladar el olvido escalar desde las puntuaciones a la ruta valor–salida y después generalizarlo. La equivalencia es exacta con ε = 0; FiX utiliza ε = 10⁻³⁰ en esta normalización. Softmax sigue formando parte del cálculo: no se demuestra que cualquier transformador pueda prescindir de él. Cada capa obtiene Q, K, V y las compuertas de la entrada. La mayoría utiliza una proyección de bajo rango con dimensión intermedia 128 para contener los parámetros adicionales. RoPE, si se incorpora, actúa sobre Q y K; las compuertas acumuladas modulan V. Tras la combinación ponderada se aplican RMSNorm y una transformación lineal. FiX y RoPE pueden, por tanto, coexistir. En la primera capa se emplean embeddings de compuerta aprendidos e indexados por el token, porque la proyección convencional generaba gradientes inestables. También se utiliza una activación de tipo Mamba. Sustituir el ε muy pequeño, esos embeddings o la activación elevó la pérdida de entrenamiento en las ablaciones. Ilustración 3 — Funciones de RMSNorm y RoPE Viabilidad numérica y computacional Los productos de compuertas entre cero y uno pueden hacerse diminutos en secuencias largas. Dividir V directamente por ellos produce valores excesivos. Calcular cada posición por separado evita esa división, pero aprovecha peor la multiplicación matricial de la GPU. Flash Fine-grained Attention combina reescalado respecto de puntos de referencia por bloques con la organización en bloques de FlashAttention. Los cocientes de compuertas acumuladas no superan uno; los bloques anteriores se procesan mayoritariamente mediante multiplicación matricial y los diagonales reciben tratamiento específico. Se fusionan además atención, RMSNorm y la capa lineal siguiente para mantener float32 en operaciones sensibles. Añadir una compuerta, por sí solo, no reproduce esta solución. El equilibrio de memoria de Paged VF Cache La atención autorregresiva habitual conserva K y V; FiX necesita también las compuertas F. Con las precisiones del artículo, guardar todas las F en float32 añade aproximadamente tanta memoria como la caché KV existente. Absorber F en V después de cada token evita almacenarlas aparte, pero obliga a releer y reescribir todos los valores anteriores, con coste de ancho de banda y errores de conversión acumulados. Paged VF Cache agrupa los tokens en páginas. Al llenarse una, integra sus compuertas acumuladas en V, congela esos valores y conserva un producto representativo. En la página incompleta, valores y compuertas siguen separados. La figura 2 ilustra páginas de tres tokens; la configuración práctica comentada utiliza 16. La memoria adicional de compuertas es aproximadamente 1/p de la caché KV estándar. Con p = 16, equivale a un 6,25% adicional respecto de KV; no supone reducir un 6,25% la memoria total de la GPU. La paginación evita asimismo actualizar todos los valores históricos en cada paso de decodificación. Ilustración 4 — El equilibrio de memoria de Paged VF Cache Qué comparan los experimentos Los modelos principales tienen unos 760 millones de parámetros y se entrenan con 48.000 millones de tokens de FineWeb-Edu. Las ablaciones emplean unos 340 millones de parámetros y 10.000 millones de tokens. Se comparan RoPE, FoX, FoX-RoPE, FiX y FiX-RoPE con una arquitectura común que incluye SwiGLU, QK-Norm, normalización de salida y Short-Conv. Las proyecciones de compuerta añaden unos 8–10 millones de parámetros, además de los embeddings de la primera capa. FiX reduce la pérdida frente a RoPE, FoX y FoX-RoPE; FiX-RoPE la reduce aún más. Sin embargo, una pérdida de entrenamiento menor no determina el ganador de cada tarea posterior. Mejoras moderadas y desiguales La media aritmética de ocho tareas de exactitud de la tabla 1 es 54,82% para RoPE, 54,42% para FoX, 54,67% para FoX-RoPE, 55,24% para FiX y 54,85% para FiX-RoPE. FiX supera a RoPE en 0,42 puntos porcentuales. Las dos métricas de perplejidad no integran esa media ni la media geométrica de exactitud. FiX destaca en PIQA (72,58%), HellaSwag (56,32%) y BoolQ (60,86%). FoX-RoPE resulta mejor en ARC-easy, ARC-challenge y perplejidad de Wikitext. FiX-RoPE mejora LAMBADA, pero no la exactitud media. Son avances acotados a las condiciones ensayadas, no un salto general en todas las tareas. Ilustración 5 — Mejoras moderadas y desiguales Contextos largos y razonamiento no son lo mismo Tras entrenar con 4.096 tokens, se evalúa hasta 16.384, sin ajuste adicional, en CodeParrot, PG-19 y NarrativeQA. La pérdida predictiva del RoPE de referencia aumenta fuera de la longitud de entrenamiento; FoX y FiX son más estables, con cierta ventaja de FiX. No se comparan aquí las variantes combinadas con RoPE. El resultado no permite descalificar todos los modelos RoPE ni otras técnicas de ampliación de contexto. BABILong evalúa respuestas basadas en hechos dispersos por documentos largos. En cinco tareas, FiX es especialmente competitivo entre 1k y 4k tokens, pero también pierde mucha exactitud con 8k y 16k. Una predicción estable del siguiente token no equivale a razonar correctamente sobre documentos extensos. Ilustración 6 — Contextos largos y razonamiento no son lo mismo Ilustración 7 — Contextos largos y razonamiento no son lo mismo Alcance, costes y análisis de patentes FiX modifica la arquitectura y requiere entrenamiento; no se presenta como una opción activable sin más en un modelo ya desplegado. La atención sigue interactuando con tokens anteriores. Los bloques no convierten esas interacciones en tiempo lineal ni eliminan la caché KV. El cálculo de compuertas y la gestión de precisión tienen sus propios costes. La evidencia principal procede de unos 760 millones de parámetros. Faltan comprobaciones específicas a mayor escala, con otros datos y sobre rendimiento o latencia en producción. Las pequeñas diferencias de la tabla principal no se acompañan de barras de error de repeticiones ni intervalos de confianza; no establecen una clasificación universal. Desde la práctica de patentes interesa la combinación: compuertas acumuladas por característica en V–O, normalización con ε muy pequeño, embeddings iniciales, reescalado por bloques, fusión de operaciones sensibles y almacenamiento paginado. Importan la ubicación y granularidad de la compuerta y su relación con normalización y memoria, no su mera presencia. Los efectos medidos apoyan el análisis técnico, pero no determinan por sí solos novedad, actividad inventiva o patentabilidad. La aportación de FiX FiX concreta una retención selectiva por características sin abandonar la atención softmax. Su reformulación matemática se acompaña de una implementación y una caché que abordan los problemas que introduce. Los resultados prometedores a escala moderada deben valorarse junto con las limitaciones de contexto largo y la necesidad de verificar prestaciones y costes en modelos mayores. Se conservan las indicaciones y formas originales; su contenido se explica en el texto. Recursos relacionados: patentes de IA Leer el original coreano Este artículo del archivo refleja la situación en su fecha de publicación. Contacte con el despacho para analizar su caso. Consultar sobre este tema ↗ Todos los artículos EN ESTA PÁGINA Qué información debe conservar el modelo El límite de una compuerta escalar Funciones de RMSNorm y RoPE Viabilidad numérica y computacional El equilibrio de memoria de Paged VF Cache Qué comparan los experimentos Mejoras moderadas y desiguales Contextos largos y razonamiento no son lo mismo Alcance, costes y análisis de patentes La aportación de FiX HABLE CON IPLEX Consulte sus necesidades de propiedad intelectual Analizamos conjuntamente sus necesidades tecnológicas y empresariales. ↗ Contactar Más reciente Alcance de una patente coreana tras ensayar y desechar el producto ↗ Anterior Marcas en Arabia Saudita: solicitud, plazos y vía de Madrid ↗ Artículos relacionados IA y software 2026.09.30 MHAR: leer las capas anteriores desde distintos subespacios de características Yongduck Kim analiza Multi-Head Attention Residuals: selección en profundidad, resultados publicados, costes de implementación y relación entre características técnicas y efectos. ↗ Lea el artículo IA y software 2026.09.28 Columna: Claude Computer Use y el aprendizaje de los agentes de IA a través de las patentes Yongduck Kim, socio director de IPLEX, analiza en AI Times los datos y las secuencias de acciones que permiten entrenar a agentes de IA para utilizar software. ↗ Lea el artículo IA y software 2026.09.18 La estrategia de propiedad intelectual comienza con la comprensión de la tecnología: una entrevista de IPLEX Presentamos el enfoque de IPLEX en materia de propiedad intelectual, que analiza conjuntamente la tecnología de IA y software y la estrategia empresarial. Incluye experiencias relacionadas con la formación empresarial, la mentoría y la comunicación con los clientes. ↗ Lea el artículo

- https://www.iplexlaw.co.kr/es
- https://www.iplexlaw.co.kr/es/blog/category/ai
- https://www.iplexlaw.co.kr/es/ai-patents
- https://www.iplexlaw.co.kr/ko/blog/fix-fine-grained-forgetting-attention
- https://www.iplexlaw.co.kr/es/contact
- https://www.iplexlaw.co.kr/es/blog
- https://www.iplexlaw.co.kr/es/blog/fix-fine-grained-forgetting-attention#editorial-fix-en-0
- https://www.iplexlaw.co.kr/es/blog/fix-fine-grained-forgetting-attention#editorial-fix-en-1
- https://www.iplexlaw.co.kr/es/blog/fix-fine-grained-forgetting-attention#editorial-fix-en-2
- https://www.iplexlaw.co.kr/es/blog/fix-fine-grained-forgetting-attention#editorial-fix-en-3
- https://www.iplexlaw.co.kr/es/blog/fix-fine-grained-forgetting-attention#editorial-fix-en-4
- https://www.iplexlaw.co.kr/es/blog/fix-fine-grained-forgetting-attention#editorial-fix-en-5
- https://www.iplexlaw.co.kr/es/blog/fix-fine-grained-forgetting-attention#editorial-fix-en-6
- https://www.iplexlaw.co.kr/es/blog/fix-fine-grained-forgetting-attention#editorial-fix-en-7
- https://www.iplexlaw.co.kr/es/blog/fix-fine-grained-forgetting-attention#editorial-fix-en-8
- https://www.iplexlaw.co.kr/es/blog/fix-fine-grained-forgetting-attention#editorial-fix-en-9
- https://www.iplexlaw.co.kr/es/contact
- https://www.iplexlaw.co.kr/es/blog/brunch-case-1787
- https://www.iplexlaw.co.kr/es/blog/saudi-arabia-trademark-filing-guide
- https://www.iplexlaw.co.kr/es/blog/mhar-multi-head-attention-residuals
- https://www.iplexlaw.co.kr/es/blog/mhar-multi-head-attention-residuals
- https://www.iplexlaw.co.kr/es/blog/claude-computer-use-agent-patent
- https://www.iplexlaw.co.kr/es/blog/claude-computer-use-agent-patent
- https://www.iplexlaw.co.kr/es/blog/1539348
- https://www.iplexlaw.co.kr/es/blog/1539348
