# In-Place Test-Time Training 인공지능 논문 분석

대부분의 대규모 언어모델은 학습이 끝나면 가중치를 고정한 채 배포됩니다. 사용자가 아무리 긴 문서를 넣어도 모델은 입력 토큰을 attention과 컨텍스트 창 안에서 처리할 뿐, 그 문서에 맞춰 내부 가중치를 직접 바꾸지는 않습니다. In-Place Test-Time Training은 이 고정된 추론 방식을…

Source: https://www.iplexlaw.co.kr/forum/view/1525199

HOME / NEWS & INSIGHTS NEWS & INSIGHTS In-Place Test-Time Training 인공지능 논문 분석 대부분의 대규모 언어모델은 학습이 끝나면 가중치를 고정한 채 배포됩니다. 사용자가 아무리 긴 문서를 넣어도 모델은 입력 토큰을 attention과 컨텍스트 창 안에서 처리할 뿐, 그 문서에 맞춰 내부 가중치를 직접 바꾸지는 않습니다. In-Place Test-Time Training은 이 고정된 추론 방식을… 소식 2026.08.20 게시 IPLEX 21분 읽기 2604.06169v1_.pdf(1010.58 KB) 대부분의 대규모 언어모델은 학습이 끝나면 가중치를 고정한 채 배포됩니다. 사용자가 아무리 긴 문서를 넣어도 모델은 입력 토큰을 attention과 컨텍스트 창 안에서 처리할 뿐, 그 문서에 맞춰 내부 가중치를 직접 바꾸지는 않습니다. In-Place Test-Time Training은 이 고정된 추론 방식을 바꾸려는 논문입니다. 논문의 제안은 의외로 보수적입니다. Attention을 제거하거나 새로운 순환 메모리 층을 끼워 넣지 않습니다. 대신 Transformer에 원래 존재하는 MLP 블록의 마지막 출력 프로젝션 Wdown을 추론 중 업데이트되는 fast weights로 사용합니다. 여기에 다음 토큰 예측에 맞춘 목표값과 대규모 병렬 처리에 적합한 청크 업데이트를 결합합니다. 한 문장으로 이해하면, Attention이 현재 문맥을 펼쳐 놓고 읽는 장치라면 In-Place TTT의 Wdown은 문맥에서 반복적으로 유용할 정보를 임시로 적어 두는 모델 내부의 화이트보드에 가깝습니다. 다만 이 화이트보드는 문서가 끝나면 초기 상태로 되돌아갑니다. 1. In-Place Test-Time Training이 해결하려는 문제 1.1 학습 후 고정되는 LLM의 한계 현재 LLM의 기본 패러다임은 먼저 대규모 사전학습을 하고, 배포 후에는 모델 가중치를 고정하는 방식입니다. 새로운 정보는 프롬프트나 검색 결과 형태로 컨텍스트에 넣을 수 있지만, 입력이 길어질수록 attention의 계산량과 메모리 부담이 커지고, 컨텍스트 창을 벗어난 정보는 직접 유지하기 어렵습니다. 논문은 이 문제를 장기적이고 변화하는 작업에서의 적응 한계로 정의합니다. 논문 pp. 1-2. 1.2 Test-Time Training과 fast weights Test-Time Training, 즉 TTT는 추론 시점에 모델 파라미터 일부를 빠르게 업데이트하는 접근입니다. 고정된 사전학습 가중치와 달리, fast weights는 입력 스트림에서 생성되는 자기지도 학습 목표를 이용해 계속 바뀝니다. 이때 fast weights는 과거 문맥을 압축해 저장하고 다음 입력에 반영하는 동적 메모리처럼 작동합니다. 논문 p. 3. 일반적인 TTT는 키와 값을 fast weights에 연관시키는 업데이트 단계와, 업데이트된 fast weights를 질의에 적용하는 단계로 구성됩니다. 문제는 이 방식이 대규모 LLM 생태계와 잘 맞지 않았다는 점입니다. 1.3 기존 TTT가 대규모 LLM에 어려웠던 세 가지 이유 기존 TTT가 대규모 LLM에 적용되기 어려웠던 이유는 크게 세 가지입니다. 첫째, attention을 대체하는 전용 TTT 층을 넣는 방식이 많아 이미 학습된 수십억 파라미터 모델을 그대로 출발점으로 쓰기 어렵습니다. 둘째, 토큰마다 fast weights를 순차적으로 업데이트하면 GPU와 TPU의 병렬 처리 능력을 충분히 활용하기 어렵습니다. 셋째, 현재 토큰을 복원하는 reconstruction objective가 언어모델의 핵심 목표인 다음 토큰 예측과 직접 정렬된다고 보기 어렵습니다. 기존 TTT와 In-Place TTT의 차이는 구조와 실행 방식에서 분명합니다. 기존 TTT는 전용 층을 추가하거나 attention을 대체하는 경우가 많고, 처음부터 다시 학습해야 하는 경우도 적지 않습니다. 업데이트 역시 토큰 단위나 작은 청크 단위로 이루어져 순차 처리 병목이 생기기 쉽고, 현재 토큰 표현을 복원하는 reconstruction objective를 사용하는 경우가 많습니다. 반면 In-Place TTT는 기존 MLP의 Wdown을 그대로 fast weights로 재활용하고, 기존 체크포인트에서 추가 학습을 시작할 수 있습니다. 업데이트는 512~1024 토큰 수준의 비교적 큰 청크에서 수행하며, 미래 토큰 정보를 포함한 LM-aligned target을 사용합니다. 또한 prefix scan 기반 context parallelism으로 병렬화를 가능하게 하고, attention을 없애지 않은 채 MLP의 동적 적응을 보완적으로 사용합니다. 2. 핵심 원리 1: 기존 MLP의 Wdown을 fast weights로 바꾼다 Transformer의 gated MLP는 입력을 두 개의 프로젝션 경로로 변환한 뒤, 게이트를 적용해 중간 활성값 Z를 만들고, 마지막 출력 프로젝션 Wdown을 통해 모델 차원으로 되돌립니다. 논문은 Wup과 Wgate는 고정한 채 Wdown만 추론 중 업데이트합니다. 즉, MLP 블록의 구조와 사전학습된 나머지 가중치는 유지하면서 마지막 행렬에 문맥별 임시 상태를 축적합니다. 논문 p. 4. 수식 없이 보면, gated MLP의 두 프로젝션 경로가 결합되어 중간 활성값 Z가 만들어지고, 현재 시점의 Wdown을 Z에 적용해 출력 O를 얻습니다. 이후 목표 표현 V와 Z를 이용해 Wdown의 업데이트량 ΔWdown을 계산합니다. 논문에서 제시한 단순화된 형태는 ΔWdown = η · Vᵀ · Z입니다. 그림 1. In-Place TTT 전체 구조. Attention은 유지하고 MLP의 Wdown만 fast weights로 갱신한다. 출처: Feng et al., 논문 p. 6, Figure 1. 이 설계의 실무적 장점은 구조 변경이 작다는 점입니다. 새로운 대형 메모리 모듈을 무작위 초기화해 삽입하는 대신, 이미 언어 능력을 갖춘 MLP의 출력 행렬을 그대로 시작점으로 삼습니다. 논문은 이를 drop-in enhancement라고 부릅니다. 여기서 주의할 점은 drop-in이라는 표현이 추가 학습이 전혀 필요 없다는 뜻은 아니라는 것입니다. Qwen3-4B 실험에서는 32k 문맥에서 약 20B 토큰, 128k 문맥에서 약 15B 토큰의 continual training을 수행했습니다. 즉, 핵심은 모델 구조를 전면 교체하거나 처음부터 사전학습하지 않고 기존 체크포인트에서 출발할 수 있다는 데 있습니다. 3. 핵심 원리 2: 청크별로 먼저 적용하고 나중에 업데이트한다 In-Place TTT는 입력 시퀀스를 여러 청크로 나눕니다. 각 청크에서는 현재 fast weights를 먼저 적용해 출력을 만든 다음, 그 청크에서 얻은 중간 활성값과 목표값으로 Wdown을 업데이트합니다. 업데이트된 행렬은 다음 청크부터 사용됩니다. 이 순서가 apply-then-update입니다. 논문 pp. 4-5. 작동 순서는 다음과 같습니다. 제1 청크는 사전학습된 초기 Wdown으로 처리하고, 그 청크에서 얻은 Z와 목표 V를 이용해 다음 상태의 Wdown을 만듭니다. 제2 청크는 이렇게 갱신된 Wdown으로 처리한 뒤 다시 제3 청크에 사용할 업데이트를 계산합니다. 중요한 점은 현재 청크의 출력이 항상 업데이트 이전 상태에서 만들어진다는 것입니다. 이 순서를 지키면 현재 청크가 자신의 정답 정보를 미리 반영하는 누출을 피할 수 있습니다. 기존 TTT 층은 attention을 대체하는 token mixer 역할까지 맡았기 때문에 작은 청크가 필요했습니다. 반면 In-Place TTT는 attention이 청크 내부의 세밀한 토큰 상호작용을 담당하고, MLP fast weights는 청크를 넘어가는 적응 상태를 담당합니다. 이 역할 분담 덕분에 512 또는 1024와 같은 큰 청크에서도 성능이 좋았다는 것이 논문의 설명입니다. 4. 핵심 원리 3: 현재 토큰 복원이 아닌 다음 토큰 예측 기존 TTT는 대개 현재 입력 토큰의 표현을 복원하는 목표를 사용합니다. 하지만 언어모델이 실제로 잘해야 하는 일은 현재 토큰 자체를 재현하는 것이 아니라, 지금까지의 문맥을 바탕으로 다음 토큰을 예측하는 것입니다. 논문은 이 불일치를 핵심 문제로 봅니다. 제안된 목표값은 토큰 임베딩 X0에 1차원 convolution과 학습 가능한 projection Wtarget을 적용해 만듭니다. 식으로는 V̂ = Conv1D(X0) · Wtarget입니다. convolution 커널을 조절하면 다음 토큰 하나 또는 가까운 미래 토큰들의 조합을 목표에 담을 수 있습니다. 업데이트는 ΔWdown = η · V̂의 전치 · Z 형태로 단순화됩니다. 논문 p. 5. A 다음에 B가 나오는 패턴을 예로 들면, 문맥 앞부분에서 A 다음에 B가 등장한 뒤 뒤쪽에서 A가 다시 나타날 수 있습니다. Reconstruction target은 A를 보면서 A 자체의 표현을 저장하는 방향으로 작동하기 쉽지만, LM-aligned target은 A를 보면서 그 다음에 나온 B의 표현을 저장합니다. 따라서 A가 다시 등장했을 때 B의 로짓을 높이는 방향으로 fast weights가 작동할 수 있습니다. 5. 이론 분석: 왜 정답 토큰의 로짓이 올라가는가 논문의 Theorem 1은 induction head 형태의 단순화된 상황을 분석합니다. 앞에서 키 토큰과 그 다음 값 토큰이 한 번 등장하고, 뒤에서 같은 키가 다시 나타났을 때 다음 값 토큰을 맞혀야 하는 상황입니다. 토큰 임베딩이 서로 거의 직교하고, 같은 키의 중간 활성값이 정렬된다는 가정 아래 LM-aligned target은 정답 토큰의 기대 로짓을 유의미하게 증가시키고 다른 토큰의 로짓은 거의 바꾸지 않습니다. 반면 reconstruction target은 정답 로짓을 올린다고 보장되지 않습니다. 논문 pp. 5-6, Appendix A. 이 이론 결과는 제한적으로 읽어야 합니다. Theorem 1은 실제 모든 LLM과 모든 입력에 대한 보장이 아니라, 임베딩의 근사 직교성과 key-query alignment 등의 가정을 둔 기대값 분석입니다. 따라서 실험 결과를 설명하는 이론적 근거로는 의미가 있지만, 일반적인 성능 보증으로 확대해서 해석해서는 안 됩니다. 6. Context Parallelism: 순차 업데이트를 병렬로 계산하는 방법 청크별 업데이트는 개념적으로 순차적이지만, 논문의 업데이트 델타는 더하기가 가능한 결합적 형태입니다. 연구진은 이 성질을 이용해 각 청크의 ΔW를 병렬로 계산하고, exclusive prefix sum으로 각 청크 직전까지의 누적 업데이트를 구한 뒤, 각 청크에 필요한 유효 Wdown과 출력을 병렬 계산합니다. 논문 pp. 6-7, Algorithm 1. 구현상으로는 모든 청크에서 중간 활성값 Z와 업데이트 델타 ΔW를 먼저 병렬로 계산한 다음, 현재 청크 이전까지의 델타만 합산하는 prefix scan을 수행합니다. 이후 초기 Wdown에 이 누적 델타를 더해 각 청크가 사용할 fast weights를 만들고, 각 청크의 출력을 병렬로 계산합니다. 청크 경계에서는 목표 생성용 convolution이 다른 청크의 미래 정보를 끌어오지 않도록 패딩과 경계를 관리합니다. 독립 문서가 끝나면 fast weights를 사전학습 상태로 리셋해 문서 간 정보 누출을 막습니다. Qwen3-4B의 장문 평가에서는 업데이트 델타의 Frobenius norm을 임계값 1e-5로 제한해 수치적 안정성을 확보했습니다. Appendix C.2. 구현에서는 모든 MLP 층에 TTT를 적용하지 않고 매 여섯 번째 MLP 블록에 적용해 상태 크기와 계산 비용을 조절했습니다. 목표 표현은 kernel size 5의 depthwise Conv1D와 Wtarget을 이용해 가까운 미래 토큰의 예측 신호를 담도록 구성했습니다. Conv1D는 0으로 초기화하고 Wtarget은 희소 대각 형태로 초기화해 초기 업데이트가 거의 0에서 시작하도록 했습니다. 또한 문서 경계에서는 Wdown을 사전학습 상태로 되돌려 독립 시퀀스 사이의 context leakage를 막고, 긴 시퀀스에서는 업데이트 norm clipping을 사용해 누적 업데이트가 폭주하는 것을 방지했습니다. 7. 실험 결과: LLM 장기 컨텍스트 성능은 얼마나 좋아졌나 7.1 Qwen3-4B에 대한 drop-in continual training 연구진은 Qwen3-4B-Base와 여기에 In-Place TTT를 적용한 모델을 같은 continual training 커리큘럼으로 학습했습니다. 32k 길이에서 약 20B 토큰, 128k 길이에서 약 15B 토큰을 사용했고, 128k 단계에서는 YaRN으로 RoPE를 확장했습니다. 평가 지표는 장문 문맥 활용을 측정하는 RULER 평균 정확도입니다. 논문 pp. 7-8. Qwen3-4B의 RULER 결과를 문맥 길이별로 보면, 4k에서는 baseline 96.6에 비해 In-Place TTT가 96.1로 0.5점 낮았습니다. 그러나 8k에서는 94.1에서 95.6으로 1.5점, 16k에서는 92.1에서 92.7로 0.6점, 32k에서는 88.7에서 89.3으로 0.6점 개선됐습니다. 더 긴 문맥에서는 개선 폭이 커졌습니다. 64k에서는 74.3에서 78.7로 4.4점 상승해 가장 큰 개선을 보였고, 128k에서는 74.8에서 77.0으로 2.2점, 학습 길이를 넘어선 256k에서도 41.7에서 43.9로 2.2점 높았습니다. 따라서 짧은 문맥에서 항상 우월하다기보다, 문맥이 길어질수록 이점이 커지는 경향으로 해석하는 것이 정확합니다. 가장 큰 개선은 64k에서 +4.4점입니다. 128k와 학습 길이를 넘어선 256k에서도 각각 +2.2점을 유지했습니다. 다만 4k에서는 오히려 0.5점 낮았습니다. 따라서 이 논문을 짧은 문맥에서도 항상 우월한 방법으로 요약하기보다는, 문맥이 길어질수록 이점이 커지는 경향으로 읽는 것이 정확합니다. 7.2 LLaMA-3.1-8B와 Qwen3-14B에서도 개선 같은 아이디어를 다른 모델 계열과 크기에 적용했을 때도 64k 성능이 개선됐습니다. LLaMA-3.1-8B는 81.6에서 83.7로, Qwen3-14B는 67.9에서 70.6으로 상승했습니다. Qwen3-14B에 YaRN을 함께 적용한 64k 설정에서도 81.3에서 82.5로 개선돼, 위치 임베딩 확장 기법과 병행할 수 있음을 보였습니다. 논문 p. 8, Table 2. 다른 기반 모델에서도 개선이 확인됐습니다. LLaMA-3.1-8B의 RULER 64k 점수는 81.6에서 83.7로 2.1점 높아졌고, Qwen3-14B는 67.9에서 70.6으로 2.7점 상승했습니다. Qwen3-14B에 YaRN을 함께 적용한 64k 설정에서도 81.3에서 82.5로 1.2점 개선됐습니다. 7.3 처음부터 학습했을 때의 비교 500M과 1.5B 규모에서는 Sliding Window Attention, Gated Linear Attention, DeltaNet, LaCT와 비교했습니다. Figure 2의 sliding window perplexity는 앞 문맥을 길게 제공했을 때 마지막 블록의 예측 난도가 얼마나 낮아지는지 보는 지표이며, 낮을수록 좋습니다. In-Place TTT는 2k에서 32k까지 두 모델 규모 모두에서 가장 낮은 perplexity를 보였습니다. 논문 p. 9. 4B 모델에서는 Full Attention과 Sliding Window Attention 각각에 In-Place TTT를 더했습니다. 상식 추론 과제의 변화는 대체로 작았지만, 장문 RULER에서는 큰 개선이 나타났습니다. 4B 규모의 처음부터 학습한 실험에서도 장문 RULER 성능 개선이 나타났습니다. Full Attention에서는 4k가 45.77에서 49.98로 4.21점, 8k가 38.09에서 43.82로 5.73점, 16k가 6.58에서 19.99로 13.41점 상승했습니다. Sliding Window Attention에서는 개선 폭이 더 큰 구간도 있었습니다. RULER 4k는 14.77에서 28.33으로 13.56점, 8k는 9.91에서 26.80으로 16.89점 높아졌고, 16k는 5.07에서 7.57로 2.50점 개선됐습니다. 상식 추론 과제의 변화는 대체로 작았지만, 장문 문맥을 요구하는 RULER에서는 분명한 개선이 나타났다는 것이 이 실험의 핵심입니다. 7.4 Ablation: 무엇이 실제로 중요했나 그림 3. 상태 크기, 청크 크기, LM-aligned objective의 구성 요소를 제거하며 성능을 비교한 결과. 출처: 논문 p. 10, Figure 3. Ablation 결과를 보면 fast weights의 상태 크기가 클수록 RULER 성능이 높아져, 큰 MLP 행렬을 동적 상태로 재사용하는 설계의 장점을 뒷받침했습니다. 청크 크기는 512와 1024가 가장 경쟁력 있었고, 논문은 효율까지 고려하면 1024를 유리한 선택으로 평가합니다. 또한 미래 토큰 정보를 만드는 Conv1D와 표현을 변환하는 Wtarget projection을 함께 사용할 때 성능이 가장 좋았으며, Conv1D는 긴 문맥에서, projection은 짧은 문맥에서 특히 중요한 역할을 했습니다. 7.5 효율: 성능 향상에 비해 오버헤드는 작은가 그림 4. H800 환경에서 8k·32k·128k 문맥의 prefill throughput과 peak memory 비교. 논문은 실무적 오버헤드가 작다고 평가한다. 출처: 논문 p. 10, Figure 4. 그래프를 보면 In-Place TTT 적용 시 throughput은 소폭 낮아지고 메모리는 소폭 증가하지만, 특히 긴 문맥에서 attention 자체가 차지하는 비용에 비해 차이가 크지 않습니다. 다만 이 결론은 Nvidia H800, batch size 1, 논문 구현이라는 특정 조건의 prefill 측정입니다. 다중 사용자 서빙, decode 단계, 다양한 하드웨어의 비용까지 일반화한 결과는 아닙니다. 8. 논문이 실제로 입증한 것과 아직 입증하지 않은 것 논문이 보여 준 범위와 아직 보여 주지 못한 범위는 구분할 필요가 있습니다. 장기 문맥에서는 RULER와 sliding window perplexity의 개선을 확인했지만, 모든 장문 추론이나 에이전트 과제에서 자동으로 성능이 좋아진다고 단정할 수는 없습니다. 모델 호환성 역시 Qwen3와 LLaMA의 4B~14B 규모에서 continual training을 거쳐 확인된 것이므로, 추가 학습 없이 임의의 체크포인트에 즉시 적용할 수 있다는 의미는 아닙니다. 또한 fast weights는 한 문서나 시퀀스 안에서는 계속 변하지만 문서가 끝나면 초기화되므로 세션을 넘어 영구 지식을 유지하지 않습니다. 효율 측면에서는 H800의 prefill 환경에서 throughput과 memory 오버헤드가 작았지만, decode 단계나 대규모 배치, 멀티테넌트 환경의 총비용은 평가되지 않았습니다. norm clipping을 통해 장문 업데이트의 수치적 안정성을 확보했지만 악성 프롬프트, 데이터 오염, fast-weight poisoning에 대한 검증도 없습니다. 이론 분석 역시 induction setting에서 LM-aligned target이 로짓에 미치는 효과를 설명하는 수준이며, 현실의 모든 상황을 포괄하는 보편 정리는 아닙니다. 가장 중요한 비판적 포인트는 논문이 continual learning을 지향하면서도 실제 구현에서는 문서 경계마다 fast weights를 초기화한다는 점입니다. 따라서 현재 단계의 In-Place TTT는 영구적 지식 업데이트라기보다 세션 내부에서 작동하는 적응형 메모리 또는 문맥 압축 장치로 보는 편이 정확합니다. 9. AI 특허 전문 변리사의 관점에서 본 발명의 중심 이 절은 논문 저자의 실험 주장과 구별되는 특허 실무적 해석입니다. 실제 신규성·진보성 판단에는 특허와 비특허문헌을 포함한 별도의 선행기술조사가 필요합니다. 9.1 단일 요소보다 결합 관계가 중요하다 Fast weights, Test-Time Training, chunk-wise update, Transformer FFN을 메모리로 보는 관점, 미래 토큰 예측, prefix scan은 각각 선행 연구 축이 존재합니다. 따라서 특허성의 중심을 단순히 추론 중 가중치를 업데이트한다는 문구에 두면 넓지만 취약한 청구항이 될 가능성이 큽니다. 이 논문에서 상대적으로 강한 발명 개념은 다음 세 층의 결합입니다. 이 논문에서 상대적으로 강한 발명 개념은 세 층의 결합에서 찾을 수 있습니다. 아키텍처 측면에서는 사전학습 Transformer의 feed-forward block에서 마지막 출력 프로젝션을 fast weights로 선택해 구조를 교체하지 않고 warm start가 가능하도록 했습니다. 목표 함수 측면에서는 현재 토큰을 복원하는 대신 하나 이상의 후속 토큰 정보를 포함하는 target representation을 만들어 언어모델의 다음 토큰 예측과 업데이트 방향을 맞췄습니다. 실행 측면에서는 현재 청크에는 업데이트 전 행렬을 적용하고, 현재 청크에서 계산한 델타는 후속 청크에만 반영하면서 이를 exclusive prefix scan으로 병렬화했습니다. 9.2 청구항 구성요소와 기술적 효과 특허 청구항을 구성할 때는 개별 요소보다 이들 요소의 결합 관계를 기술적 효과와 연결하는 것이 중요합니다. 먼저 feed-forward block의 output projection을 fast weights로 지정하면 사전학습 구조를 유지하면서 동적 적응을 구현한다는 효과를 강조할 수 있습니다. Apply-then-update 방식은 현재 청크의 출력 이후에 계산된 델타로 다음 상태를 만들고 이를 후속 청크에 적용하므로, 인과성을 유지하고 정보 누출을 막는 효과와 연결됩니다. LM-aligned target은 현재 청크의 임베딩에서 후속 토큰 정보를 포함한 목표 표현을 생성해 다음 토큰 예측에 유용한 문맥을 저장하도록 하는 구성으로 정리할 수 있습니다. 토큰별이 아니라 복수 토큰 단위로 행렬을 업데이트하는 청크 방식은 GPU 병렬성과 throughput 개선에 연결되고, 각 청크의 델타를 병렬로 산출한 뒤 이전 청크까지 누적하는 prefix scan은 순차적 의미와 context parallelism을 동시에 유지하는 구성으로 볼 수 있습니다. 여기에 문서 경계 리셋, norm clipping, near-zero initialization을 결합하면 문서 간 누출 방지, 수치 안정성, 초기 동작 보존이라는 효과를 추가로 설명할 수 있습니다. 9.3 출원 전략과 권리행사 관점 출원 전략에서는 추론 방법 독립항과 별도로 fast weights를 학습 가능하게 만드는 continual training 방법 자체를 독립항으로 검토할 수 있습니다. Context parallel 구현은 하드웨어 효율이라는 별도의 기술적 효과를 가지므로 병렬 처리 방법이나 시스템 청구항으로 분리할 여지도 있습니다. 장치, 서버 시스템, 컴퓨터 판독 가능 기록매체 범주를 함께 준비하면 실시 주체와 집행 가능성을 보완할 수 있습니다. 다만 서버 내부에서만 가중치가 변하는 공정은 외부에서 침해를 입증하기 어렵기 때문에, 모델 파일, 런타임 로그, 업데이트 상태 API, 오픈소스 코드, 성능·메모리 흔적 등 외부에서 확인 가능한 단서와 연결되는 구성요소를 고려할 필요가 있습니다. 또한 장문 성능 개선과 작은 오버헤드라는 논문 수치는 소프트웨어 발명의 기술적 효과를 설명하는 자료로 활용할 수 있지만, 실제 명세서에는 재현 가능한 실시예와 파라미터 범위를 충분히 남겨 두는 것이 중요합니다. 10. 산업적 의미: 어디에 유용할 수 있나 In-Place TTT가 특히 매력적인 영역은 문맥이 길고, 같은 문서나 세션 안에서 패턴이 반복되며, 모든 토큰을 attention으로 다시 읽는 비용이 큰 작업입니다. 예를 들면 장문 계약서·특허 명세서 분석, 대규모 코드 저장소 이해, 긴 에이전트 작업 기록, 스트리밍 로그 분석, 세션 내 사용자 선호 적응이 있습니다. 반대로 fast weights가 입력에 의해 직접 갱신된다는 것은 공격 표면이 늘어날 수 있다는 뜻이기도 합니다. 악성 입력이 임시 메모리를 오염시키는지, 여러 사용자 요청을 어떻게 격리할지, 업데이트 상태를 언제 리셋할지, 감사 로그를 어떻게 남길지는 실제 서비스에서 중요한 설계 문제가 됩니다. 이 항목들은 논문에서 실험적으로 검증되지 않았습니다. 11. 자주 묻는 질문 Q1. In-Place TTT는 일반적인 fine-tuning과 같은가? 같지 않습니다. Fine-tuning은 별도 학습 데이터와 절차로 모델을 장기적으로 변경하는 경우가 일반적입니다. In-Place TTT는 입력 시퀀스를 처리하는 동안 일부 Wdown을 임시로 업데이트하고 문서 경계에서 되돌립니다. 다만 이 메커니즘이 잘 작동하도록 만들기 위한 continual training은 필요합니다. Q2. 모든 모델 가중치가 추론 중 바뀌는가? 아닙니다. 논문은 gated MLP의 Wup과 Wgate는 고정하고 Wdown을 fast weights로 사용합니다. 대규모 모델 실험에서는 매 여섯 번째 층에 적용했습니다. Q3. Attention을 대체하는 기술인가? 아닙니다. 이 논문의 핵심 차별점은 attention을 유지하고 MLP adaptation이 이를 보완한다는 점입니다. Attention이 청크 내부 토큰 관계를 처리하기 때문에 In-Place TTT는 더 큰 청크 단위 업데이트를 사용할 수 있습니다. Q4. 컨텍스트 길이가 사실상 무제한이 되는가? 그렇게 단정할 수 없습니다. 128k 학습 모델이 256k RULER에서 baseline보다 나았지만 절대 점수는 43.9였습니다. 장문 활용과 외삽이 개선됐다는 증거이지, 무제한 문맥을 완전하게 기억한다는 증거는 아닙니다. Q5. 특허적으로 가장 중요한 한 줄은 무엇인가? 사전학습 Transformer의 기존 MLP 출력 프로젝션을 fast weights로 사용하고, 현재 청크에는 업데이트 전 상태를 적용하며, 후속 토큰 정보를 포함한 목표로 계산한 업데이트를 다음 청크부터 반영한다는 결합 관계입니다. 12. 결론 In-Place Test-Time Training은 LLM에 동적 적응 능력을 넣기 위해 완전히 새로운 아키텍처를 제안하지 않습니다. 이미 존재하는 MLP의 Wdown을 빠르게 바뀌는 상태로 재해석하고, 언어모델 목적에 맞는 target과 병렬 하드웨어에 맞는 chunk-wise scan을 설계합니다. 이 점이 기술적으로도, 특허적으로도 가장 흥미로운 부분입니다. 실험은 장문 RULER와 perplexity에서 의미 있는 개선을 보여 주지만, drop-in을 무학습 적용으로 오해해서는 안 됩니다. 35B 토큰 규모의 continual training이 사용됐고, fast weights는 문서 경계에서 리셋되며, 실제 에이전트·보안·멀티테넌트 환경은 아직 검증되지 않았습니다. 최종적으로 보면, 이 논문은 영구적으로 스스로 학습하는 LLM을 완성했다기보다 사전학습 LLM의 내부 MLP를 세션별 적응 메모리로 전환하는 실용적 설계에 가깝습니다. 특허 관점에서는 개별 요소 하나보다 Wdown의 in-place 적응, LM-aligned target, apply-then-update 인과성, context-parallel scan이 결합되는 관계를 중심으로 보는 것이 적절합니다. 이 글은 표시된 게시일을 기준으로 작성된 자료입니다. 개별 사안에 대한 검토는 상담을 통해 안내합니다. 관련 업무 상담 ↗ 전체 글 보기 TALK TO IPLEX 우리 기업에 맞는 IP 전략이 필요하다면 기술과 사업의 상황에 맞춰 필요한 업무를 함께 살펴봅니다. ↗ 상담 문의 최근 글 싱가포르 상표 출원 가이드｜출원 절차부터 등록·갱신 및 권리관리까지 ↗ 이전 글 상표공존동의제도｜유사한 상표가 있어도 등록할 수 있을까? ↗ 함께 읽을 인사이트 소식 2026.08.03 [기고 소식] C3.ai 특허 분석, 엔터프라이즈 AI 에이전트가 바꾸는 기업 AI의 미래 아이피렉스 특허법률사무소 김용덕 대표변리사의 생성형 AI 특허 관련 칼럼이 국내 AI 전문 매체인 인공지능신문(AI Times)에 게재되었습니다. ↗ 본문 읽기 소식 2026.07.29 아이디어는 권리가 될 때 사업의 언어가 된다 아이디어를 공개하기 전 권리를 준비하고, 사업비 집행기간 안에 적절한 방식으로 결제하며, 정산에 필요한 결과물을 남기는 것. 창업기업의 IP 업무는 이 세 가지가 함께 맞아야 합니다. 아이피렉스 특허법률사무소는 김용덕 대표 변리사가 창업기업의 기술, 브랜드, 제품 외관을 분석하고 특허·상표·디자인 출원과 카드… ↗ 본문 읽기 소식 2026.06.29 아이피렉스 특허법률사무소 김용덕 변리사, OASIS 외국인 창업자 대상 지식재산권 강의 진행 아이피렉스 특허법률사무소 김용덕 변리사는 최근 OASIS 프로그램에서 외국인 창업자를 대상으로 지식재산권(IP) 강의를 진행했습니다. ↗ 본문 읽기

- https://www.iplexlaw.co.kr/
- https://www.iplexlaw.co.kr/%EC%9D%B8%EC%82%AC%EC%9D%B4%ED%8A%B8-%EB%B0%8F-%EB%89%B4%EC%8A%A4/category/firm
- https://www.iplexlaw.co.kr/%EC%97%B0%EB%9D%BD%ED%95%98%EA%B8%B0
- https://www.iplexlaw.co.kr/%EC%9D%B8%EC%82%AC%EC%9D%B4%ED%8A%B8-%EB%B0%8F-%EB%89%B4%EC%8A%A4
- https://www.iplexlaw.co.kr/%EC%97%B0%EB%9D%BD%ED%95%98%EA%B8%B0
- https://www.iplexlaw.co.kr/forum/view/1527725
- https://www.iplexlaw.co.kr/forum/view/1524571
- https://www.iplexlaw.co.kr/forum/view/1516153
- https://www.iplexlaw.co.kr/forum/view/1516153
- https://www.iplexlaw.co.kr/forum/view/1514224
- https://www.iplexlaw.co.kr/forum/view/1514224
- https://www.iplexlaw.co.kr/forum/view/1497206
- https://www.iplexlaw.co.kr/forum/view/1497206
