NEWS & INSIGHTS

AI가 잊는 방식까지 세밀하게, FiX

김용덕 변리사가 FiX의 특징별 망각 게이트, 수치 안정성과 캐시 설계, 실험 결과 및 적용 한계를 분석합니다.

인공지능 특허 전문 변리사의 논문 분석

자료 1 — AI가 잊는 방식까지 세밀하게, FiX

작성자: 김용덕 변리사

안녕하세요. 아이피렉스 특허법률사무소, 김용덕 변리사입니다.

긴 대화를 이해하려면 앞의 내용을 잘 기억해야 합니다. 그런데 모든 정보를 같은 강도로 계속 붙들고 있는 것이 항상 유리한 것은 아닙니다. 지금도 필요한 단서는 남기고, 문맥이 바뀌면서 의미가 약해진 단서는 덜 반영하는 능력도 중요합니다.

이번에 살펴볼 FiX는 트랜스포머의 어텐션 안에서 이 ‘잊는 정도’를 더 세밀하게 조절하는 연구입니다. 과거 토큰 하나를 통째로 같은 비율로 줄이는 데서 나아가, 그 토큰이 담은 특징의 각 차원마다 서로 다른 감쇠를 적용합니다. 이 글은 연구진의 논문과 실험을 분석한 해설입니다.

FiX의 핵심은 어텐션 점수만 조절하는 대신, 실제 전달되는 정보의 각 성분에 서로 다른 망각 게이트를 적용한다는 데 있습니다.

1. 논문 기본 정보

논문 제목: FiX: Introducing Fine-grained Forget Gate into Softmax Attention

연구진: Runzhong Li, Renjie Liu, Qing Li, Bo Tang. 이름은 원문 PDF 표기를 따랐습니다. 소속은 중국 남방과기대학교 컴퓨터과학·공학과와 홍콩이공대학교 컴퓨팅학과이며, Renjie Liu의 연구에는 AlayaDB 인턴십 관련 주석이 있습니다.

발표 및 분석 버전: ICML 2026 학회 논문집 수록본. 학회 일정은 2026년 7월 6~11일이며, PMLR 306권 68619~68640쪽에 실려 있습니다. 학술 식별자는 pmlr-v306-li26dl입니다. 공식 논문 페이지에는 별도의 DOI나 arXiv 번호가 표시되어 있지 않습니다.

공식 논문 정보: PMLR · Li 외, ICML 2026

논문·도표 이용 조건: CC BY 4.0 (저작권: 논문 저자들)

2. 기술적 과제: 망각의 단위가 너무 거칠다

어텐션 점수와 전달되는 정보는 다릅니다

어텐션은 현재 위치의 질문에 해당하는 Q(Query)와 과거 위치의 색인에 해당하는 K(Key)를 비교해 가중치를 구합니다. 그 가중치로 실제 정보인 V(Value)를 섞어 출력 O(Output)를 만듭니다. 책에서 참고할 쪽을 고르는 과정과, 선택한 쪽에서 실제 내용을 읽어 오는 과정을 구분하면 이해하기 쉽습니다.

앞선 연구인 FoX는 문맥에 따라 과거 정보의 영향이 줄어들도록 망각 게이트를 넣었습니다. 다만 해당 게이트가 스칼라이므로, 한 헤드에서 특정 과거 토큰의 특징 성분들이 같은 감쇠율을 받습니다. 하나의 음량 손잡이로 여러 악기의 소리를 한꺼번에 줄이는 것에 비유할 수 있습니다.

특징마다 다른 손잡이를 만들기 어려운 이유

연구진이 해결하려는 문제는 특징 차원마다 서로 다른 망각 정도를 주는 것입니다. 하지만 Q와 K의 내적은 숫자 하나입니다. 이 스칼라 점수에 여러 차원의 게이트 벡터를 그대로 더하는 방식으로는 기존 FoX를 단순 확장할 수 없습니다. 어느 위치에 게이트를 적용할 것인지부터 바꾸어야 합니다.

3. 핵심 아이디어: 점수에서 값 벡터로 시선을 옮기다

FiX는 과거의 값 벡터 V가 현재 출력에 기여하기 전에, 각 성분에 누적 망각 게이트를 곱합니다. 과거 토큰 이후부터 현재 위치까지의 게이트를 성분별로 누적하기 때문에, 같은 토큰이라도 어떤 특징은 오래 유지되고 다른 특징은 더 빠르게 약해질 수 있습니다.

자료 2 — AI가 잊는 방식까지 세밀하게, FiX
자료 2 — AI가 잊는 방식까지 세밀하게, FiX

그림 1. 과거 값 벡터의 성분마다 서로 다른 누적 감쇠가 적용되는 FiX의 개념도. Li 외, ICML 2026, Figure 1.

그림의 첫 번째 값 벡터에는 0.2, 0.1, 0.3처럼 서로 다른 비율이 예시되어 있습니다. 두 번째 값 벡터에는 다른 비율이 적용되고, 현재 토큰의 값에는 아직 지나온 구간이 없으므로 1이 적용됩니다. 이 수치는 작동 원리를 보여 주는 예시이며 실험 정확도는 아닙니다.

기술적으로 중요한 연결 고리는 출력 뒤의 RMSNorm입니다. 출력 전체에 곱해진 공통 양의 배율은 이상적인 RMSNorm에서 상쇄됩니다. 연구진은 이를 이용해 스칼라 망각을 어텐션 점수 쪽에서 값·출력 쪽으로 옮겨도 같은 결과가 되는 조건을 보이고, 그 값·출력 경로를 성분별 게이트로 확장했습니다.

여기에는 조건이 있습니다. 수학적 등가는 RMSNorm의 작은 안정화 상수 ε가 0일 때 정확히 성립합니다. 실제 FiX는 출력 정규화에서 ε=10⁻³⁰을 사용합니다. 따라서 ‘모든 트랜스포머에서 소프트맥스가 불필요하다’고 읽으면 안 됩니다. FiX의 실제 계산식에도 소프트맥스 어텐션은 남아 있습니다.

4. 실제 처리 흐름과 RoPE의 역할

자료 3 — AI가 잊는 방식까지 세밀하게, FiX
자료 3 — AI가 잊는 방식까지 세밀하게, FiX

그림 2. FiX와 RoPE를 함께 쓰는 어텐션 층의 구조. Q·K 경로와 V·O 경로의 역할을 구분해 볼 수 있습니다. Li 외, ICML 2026, Figure 9.

① 입력에서 Q, K, V와 망각 게이트를 만듭니다. 일반 층의 게이트는 저차원으로 줄였다가 다시 확장하는 저랭크 변환을 사용해 추가 파라미터를 줄입니다. 논문에서는 중간 차원을 128로 두었습니다.

② Q와 K의 관계로 어텐션 가중치를 구합니다. RoPE를 함께 사용하는 경우에는 이 Q·K 경로에서 위치 관계를 반영합니다.

③ V의 각 성분에 누적 망각 정도를 반영하고, 어텐션 가중치에 따라 합산합니다. 어떤 과거 위치를 참고할지와 그 위치에서 어떤 특징을 얼마나 남길지가 함께 작동합니다.

④ 어텐션 출력을 RMSNorm으로 정규화한 뒤 선형 변환합니다. FiX의 게이트는 V·O 경로에 작용하므로 Q·K 경로의 RoPE와 병용할 수 있습니다.

첫 번째 층에는 별도의 처리가 있습니다. 이 층에서 게이트를 일반 투영층으로 만들면 학습 중 기울기가 불안정해져, 연구진은 토큰 ID에 대응하는 학습 가능한 게이트 임베딩을 사용했습니다. 작은 ε, 첫 층 임베딩, Mamba 방식의 활성화 함수를 바꾼 제거 실험에서는 완성된 FiX보다 학습 손실이 높아졌습니다.

5. 수식이 작동하도록 만드는 구현 장치

작아지는 수로 나누는 문제

게이트는 0과 1 사이의 값입니다. 긴 구간에서 계속 곱하면 누적값이 매우 작아질 수 있습니다. 행렬 연산을 쉽게 만들려고 V를 이 누적값으로 직접 나누면 수치가 지나치게 커집니다. 반대로 각 위치를 따로 계산하면 GPU의 빠른 행렬 곱을 충분히 활용하기 어렵습니다.

연구진은 구간의 기준점을 잡아 누적 게이트의 비율이 1을 넘지 않도록 재조정하는 방법과 FlashAttention의 블록 처리를 결합했습니다. 과거 블록 대부분은 행렬 곱으로 처리하고, 현재 위치를 포함하는 대각 블록은 별도로 계산합니다. 이 구현을 Flash Fine-grained Attention이라고 부릅니다.

정규화와 선형층을 함께 다루는 이유

ε를 매우 작게 설정하면 정규화의 정밀도도 중요해집니다. 연구진은 어텐션·RMSNorm·뒤의 선형층을 결합해 필요한 계산을 float32 정밀도로 수행하고, 중간값이 낮은 정밀도로 바뀌며 생기는 불안정을 줄였습니다. 단순히 게이트 하나를 추가하는 것만으로 동일한 효과를 얻는 구성은 아닙니다.

6. 추론 메모리: 게이트도 저장해야 한다

자료 4 — AI가 잊는 방식까지 세밀하게, FiX
자료 4 — AI가 잊는 방식까지 세밀하게, FiX

그림 3. 게이트를 모두 따로 저장하는 방식, 값에 계속 합치는 방식, 페이지 단위로 관리하는 방식의 비교. Li 외, ICML 2026, Figure 2.

일반적인 생성 과정은 과거 K와 V를 캐시에 보관합니다. FiX에는 망각 게이트 F도 필요합니다. 논문의 정밀도 조건에서는 F를 float32로 모두 저장하는 단순 방식이 기존 KV 캐시와 비슷한 크기의 추가 공간을 요구합니다.

F를 매번 V에 흡수하면 별도의 F 저장량은 줄지만, 새 토큰이 나올 때마다 과거 V 전체를 읽고 다시 써야 합니다. 낮은 정밀도와 높은 정밀도를 반복해서 오가는 과정에서 오차가 누적될 수도 있습니다.

Paged VF Cache는 일정 개수의 토큰을 한 페이지로 묶습니다. 페이지가 차면 그 안의 게이트를 V에 흡수해 고정하고, 페이지를 대표하는 게이트의 곱만 남깁니다. 아직 덜 찬 페이지에서는 V와 F를 따로 유지합니다. 그림의 페이지 크기 3은 설명용 예시이고, 본문에서 제시한 실용적 설정은 16입니다.

연구진은 이때 추가 게이트 저장량이 대략 기존 KV 캐시의 1/p 수준이라고 설명합니다. p=16이면 약 6.25%에 해당한다는 계산이 가능하지만, 이는 게이트 캐시의 근사적 추가량입니다. 모델 전체 GPU 메모리가 6.25% 줄어든다는 뜻은 아닙니다.

7. 실험은 무엇을 비교했을까

주요 실험은 약 7억 6천만 파라미터 모델을 FineWeb-Edu의 480억 토큰으로 학습한 결과입니다. 제거 실험에는 약 3억 4천만 파라미터 모델과 100억 토큰을 사용했습니다. 비교 대상은 RoPE, FoX, FoX-RoPE, FiX, FiX-RoPE입니다.

모델들은 SwiGLU, QK-Norm, 출력 정규화와 Short-Conv 등을 포함한 공통 구조를 사용했습니다. 따라서 결과는 이러한 실험 구성 안에서의 비교로 읽어야 합니다. 게이트의 저랭크 투영만으로도 약 800만~1,000만 개의 파라미터가 더해지며, 첫 층의 별도 게이트 임베딩도 있습니다.

학습 손실에서는 FiX가 RoPE·FoX·FoX-RoPE보다 낮았고, FiX-RoPE가 FiX보다 더 낮았습니다. 다만 학습 손실이 가장 낮은 모델이 모든 평가 과제에서도 가장 높은 점수를 받은 것은 아닙니다.

8. 성능 결과: 개선의 크기와 예외를 함께 보기

자료 5 — AI가 잊는 방식까지 세밀하게, FiX
자료 5 — AI가 잊는 방식까지 세밀하게, FiX

표 1. 제로샷 상식 평가와 언어모델 퍼플렉서티. Avg.와 Geo Mean.은 정확도 8개 항목의 평균이며, 퍼플렉서티 2개 항목은 포함하지 않습니다. Li 외, ICML 2026, Table 1.

평균 정확도는 55.24, 모든 항목의 1위는 아닙니다

8개 과제의 평균 정확도는 RoPE 54.82%, FoX 54.42%, FoX-RoPE 54.67%, FiX 55.24%, FiX-RoPE 54.85%입니다. FiX와 RoPE의 차이는 0.42%포인트입니다. 전반적인 개선은 확인되지만, 큰 폭의 성능 도약이라고 표현하기에는 차이가 작습니다.

세부 항목도 갈립니다. FiX는 PIQA 72.58%, HellaSwag 56.32%, BoolQ 60.86% 등에서 가장 높았습니다. 반면 ARC-easy와 ARC-challenge는 FoX-RoPE가 더 높았고, Wikitext 퍼플렉서티도 FoX-RoPE가 가장 낮았습니다. FiX-RoPE는 LAMBADA에서 더 좋은 결과를 보였지만 평균 정확도에서는 FiX에 미치지 못했습니다.

학습한 길이를 넘어설 때

자료 6 — AI가 잊는 방식까지 세밀하게, FiX
자료 6 — AI가 잊는 방식까지 세밀하게, FiX

그림 4. 4,096토큰으로 학습한 모델을 최대 16,384토큰까지 평가한 위치별 평균 손실. 값이 낮을수록 좋습니다. Li 외, ICML 2026, Figure 4.

CodeParrot, PG-19, NarrativeQA에서 별도 미세조정 없이 길이를 늘렸을 때, 이 실험의 RoPE 모델은 학습 길이를 넘어서며 손실이 커졌습니다. FoX와 FiX는 상대적으로 안정적이었고, FiX가 FoX보다 다소 낮은 손실을 보였습니다. 여기서는 RoPE를 결합한 두 변형은 비교하지 않았습니다.

이 결과는 학습 때보다 긴 입력에서도 다음 토큰 예측을 비교적 안정적으로 유지했다는 근거입니다. 모든 RoPE 기반 모델이나 별도의 길이 확장 기법까지 성능이 나쁘다는 뜻은 아닙니다.

긴 문서 추론은 여전히 어렵습니다

자료 7 — AI가 잊는 방식까지 세밀하게, FiX
자료 7 — AI가 잊는 방식까지 세밀하게, FiX

그림 5. 문서 속에 흩어진 사실을 묻는 BABILong 5개 과제의 평균 정확도. 문맥이 길어질수록 모든 모델의 정확도가 낮아집니다. Li 외, ICML 2026, Figure 5.

BABILong에서는 FiX가 특히 1k~4k 구간에서 유리했습니다. 그러나 문맥이 8k, 16k로 길어지면 FiX도 정확도가 크게 내려갑니다. 앞선 그림의 낮은 예측 손실과 이 그림의 질문 답변 정확도는 서로 다른 지표이므로 구분해야 합니다. 이 논문이 장문 추론의 어려움을 모두 해결했다고 보기는 어렵습니다.

9. 적용 범위와 남은 한계

FiX는 어텐션 층의 구조를 바꾸고 학습하는 방법입니다. 이미 서비스 중인 언어모델에 설정 하나를 켜는 것만으로 같은 효과를 얻는 방법으로 제시된 것은 아닙니다. 문맥에 따라 과거 특징의 영향력을 다르게 관리해야 하는 언어모델 구조 연구에 직접적인 의미가 있습니다.

또한 FiX는 여전히 과거 토큰들과 어텐션을 계산합니다. 블록 처리와 캐시 관리가 계산을 실용적으로 만들지만, 토큰 사이 상호작용 자체를 선형 시간으로 바꾸거나 KV 캐시를 없애는 방식은 아닙니다. 추가 게이트 계산과 정밀도 관리도 필요합니다.

논문의 주된 검증 규모는 약 7억 6천만 파라미터입니다. 더 큰 모델, 다른 학습 데이터, 실제 서비스의 처리량·지연시간에서 같은 이점이 유지되는지는 별도 확인이 필요합니다. 표의 평균 점수 차이에 반복 실행의 오차 막대나 신뢰구간이 함께 제시된 것도 아니므로, 작은 차이를 확정적인 보편 우위로 확대하지 않는 편이 타당합니다.

10. 변리사 관점에서 본 기술적 의미

기술적 과제

첫 번째 과제는 소프트맥스 어텐션에서 스칼라 게이트의 거친 제어를 넘어 특징별 망각을 구현하는 것입니다. 두 번째 과제는 그 구조가 초래하는 작은 누적값, 정규화 정밀도, 추가 캐시 부담을 함께 해결하는 것입니다.

해결 수단과 구성의 결합

해결 수단은 V·O 경로의 성분별 누적 게이트, 매우 작은 ε를 사용하는 출력 RMSNorm, 첫 층의 게이트 임베딩, 블록 기준의 재조정, 정규화·선형층을 포함한 결합 연산, 페이지 단위 VF 캐시로 이어집니다. 수학적 변환과 수치 안정성 및 메모리 구조가 서로 맞물린다는 점이 중요합니다.

기존 접근과 구별되는 부분

FoX가 스칼라 감쇠를 어텐션 점수에 반영하는 데 비해, FiX는 실제 전달되는 값의 각 차원에 다른 감쇠를 적용합니다. Q·K의 위치 표현과 V·O의 망각 처리를 나눈 구성은 RoPE와의 병용을 가능하게 합니다. 기술 분석의 관점에서는 게이트의 존재 자체보다 적용 위치, 제어 단위, 정규화와의 관계가 차별성을 설명하는 핵심입니다.

입증된 효과와 해석의 경계

연구진의 실험은 설정된 모델 규모와 데이터에서 학습 손실, 평균 정확도, 길이 외삽 손실의 개선을 보여 줍니다. 페이지 단위 저장은 게이트 캐시의 추가 부담을 줄이는 구조적 근거를 제공합니다. 다만 이를 모든 과제의 성능 향상이나 모든 환경의 추론 가속으로 일반화할 수는 없습니다. 제가 주목하는 부분은 특징별 선택성을 실제 연산·저장 구조까지 연결했다는 점입니다.

11. 마무리

FiX는 AI의 기억을 단순히 오래 유지하는 데서 한 걸음 더 들어갑니다. 과거 정보의 어느 특징을 얼마나 남길지 조절하고, 그 제어를 소프트맥스 어텐션과 함께 작동시키는 방법을 제시합니다. 값·출력 경로의 망각 게이트와 이를 뒷받침하는 정규화·블록 연산·캐시 설계가 하나의 기술적 구성으로 연결됩니다.

이번 연구의 의미는 모든 성능 문제를 한 번에 해결했다는 데 있지 않습니다. 비교적 작은 모델에서 확인한 개선과 장문 추론의 남은 한계를 함께 놓고 보면, 트랜스포머가 정보를 선택하는 단위를 더 세밀하게 설계할 수 있다는 가능성이 분명해집니다. 앞으로 규모를 키웠을 때의 재현성과 실제 처리 비용을 함께 살펴볼 가치가 있는 접근입니다.

관련 자료 · AI 특허

이 글은 표시된 게시일을 기준으로 작성된 자료입니다. 개별 사안에 대한 검토는 상담을 통해 안내합니다.
관련 업무 상담 ↗전체 글 보기

기술과 브랜드를 위한 다음 결정, 아이피렉스와 상의하세요.