LLM 컨텍스트 확장 동향: 긴 문맥 처리의 현재와 과제

Photo of author

By 요담

회의록, 코드베이스, 규정집처럼 입력이 길어지면 모델이 한 번에 참조할 수 있는 범위가 바로 병목이 됩니다. 긴 컨텍스트 윈도우를 키우는 일은 스펙 숫자 경쟁이 아니라 검색과 메모리, 추론 비용을 다시 나누는 설계 문제입니다. 이 글은 창 확장의 이유와 희소 어텐션, 위치 인코딩, 실무 비용을 순서대로 정리합니다. 실무 챗봇과 문서 QA에서 이 한도가 먼저 드러납니다.

표준 self-attention은 시퀀스 길이에 이차로 비용이 늘고, KV 캐시는 입력 길이에 선형으로 커져 GPU 메모리를 빠르게 채웁니다. 그래서 희소 어텐션과 위치 인코딩 확장, RAG와 긴 문맥의 역할 분담이 같이 논의됩니다. 숫자와 조건은 논문 보고를 기준으로 적습니다.

컨텍스트 윈도우 확장이 필요한 이유

LLM 컨텍스트 확장 동향 관련 화면
(사진 출처: flipboard.com)

표준 self-attention은 시퀀스 길이에 이차 비용이 들고, KV 캐시는 입력 길이에 선형으로 커져 GPU 메모리를 빠르게 포화시킵니다. RAG는 메모리 부담을 줄이지만 검색기와 생성기의 의미 공간이 어긋나면 다중 hop 추론이 약해지고 환각 위험이 커집니다. 그래서 창을 키우는 일과 검색을 붙이는 일을 같은 문제로 보지 않고 길이·비용·근거 추적을 함께 점검하는 편이 안전합니다. ACL Findings 2026 연구도 학습 없이 쓰는 희소 어텐션을 최대 128K 길이까지 비교하며 이 부담을 숫자로 보여 줍니다.

GPU 한도를 넘기면 배치를 줄이거나 양자화에 의존하게 됩니다. 검색을 붙이면 입력은 줄지만 근거가 청크 단위로 끊길 수 있습니다.

긴 문맥을 다루는 주요 기술 접근법

(출처: AgentOS)

긴 입력을 다루는 방법은 어텐션 연산을 줄이는 쪽과 위치 정보를 더 멀리까지 일반화하는 쪽으로 크게 나뉩니다. 희소 어텐션은 모든 토큰 쌍을 계산하지 않고 패턴이나 중요도 점수로 연결을 고르며 고정 예산보다 길이에 따라 희소도를 바꾸는 편이 나을 수 있습니다. 메모리 계열은 과거 상태를 압축해 두고, 위치 인코딩은 RoPE를 스케일해 학습 길이 밖을 버티게 합니다. 실무에서는 한 가지만 고수하지 않고 창 크기와 희소도, 검색 깊이를 과제 길이에 맞춰 같이 조정합니다.

ACL Findings 2026은 학습 없는 희소 방법 6종을 최대 0.95 희소도에서 비교합니다. 위치 쪽은 YaRN처럼 RoPE를 보간·스케일하는 경로가 대표적이고 캐시 실수 시 장문에서 위치가 어긋납니다.

희소 어텐션과 메모리 기반 방법

ACL Findings 2026 연구는 학습 없이 적용하는 희소 어텐션 6종을 여러 모델과 최대 128K 시퀀스, 최대 0.95 희소도, 9개 과제에서 평가했습니다. 동등 비용에서는 더 큰 희소 모델이 더 작은 밀집 모델보다 낫고 Pareto 경계를 개선합니다. 더 긴 시퀀스는 더 높은 희소도를 견딜 수 있어 고정 예산이 최적이 아닐 수 있습니다. 메모리 방법은 과거 KV를 압축하거나 일부를 선택해 두고, 디코딩 단계의 메모리 한도를 넘기지 않으면서 창을 키우는 쪽에 가깝습니다.

디코딩 비용이 희소 패턴에 민감하므로 프리필과 생성을 같은 희소도로 묶지 않는 실험도 있습니다. 메모리 계열은 토큰을 버리는 대신 요약을 남겨 창 밖의 단서를 붙잡으려 합니다.

위치 인코딩·로프 스케일링 전략

YaRN은 NTK-by-parts 보간과 어텐션 온도 스케일링을 결합해 RoPE 기반 모델의 컨텍스트 창을 확장합니다. 이전 방법보다 약 10배 적은 토큰과 2.5배 적은 학습 단계로 LLaMA 계열을 원래 학습 길이보다 긴 문맥까지 쓰게 했다고 논문이 밝힙니다. Dynamic Scaling을 KV 캐시와 함께 쓸 때는 스케일 s가 바뀔 때 모든 토큰의 RoPE가 바뀌므로 RoPE를 적용하기 전의 KV를 캐시해야 합니다. 문서 단위 RoPE처럼 위치를 문서 경계에 맞추는 방식도 초장문에서 쓰입니다.

스케일 s를 시퀀스 길이에 따라 바꾸면 이미 캐시한 회전이 무효가 됩니다. 그래서 캐시 키·값은 회전 이전 상태로 두고 조회 시에 RoPE를 적용하는 구현이 맞습니다.

MSA 논문은 전체 어텐션 LLM의 실효 컨텍스트가 통상 약 1M 토큰 부근에 묶인다고 보고, 그 이상을 밀집 어텐션만으로 밀기 어렵다고 봅니다. 확장 가능한 희소 어텐션, 문서 단위 RoPE, KV 압축을 쓰면 16K에서 100M 토큰까지 정밀도 저하가 9% 미만이라고 주장합니다. 2×A800에서 100M 추론이 가능하다고도 적혀 있습니다. 인프라에서는 KV 캐시 최적화가 창 확장과 같은 줄에서 다뤄지며, 캐시 레이아웃과 양자화, 오프로딩이 실제 서빙 한도를 정합니다.

밀집 어텐션만으로 창을 키우면 메모리 대역폭이 먼저 한계에 닿습니다. 서빙에서는 페이지 단위 KV, 양자화, CPU 오프로딩을 같이 켜 100M급 실험을 작은 GPU 묶음에서 버티게 합니다.

실무 적용 시 성능·비용 트레이드오프

창을 키우면 프롬프트에 근거를 더 넣을 수 있지만 프롬프트 토큰 요금과 KV 메모리가 같이 늘어나 동시 처리 수가 줄어듭니다. 희소 어텐션은 동등 연산에서 더 큰 모델을 택할 여지를 주지만 희소 패턴이 과제와 안 맞으면 정확도가 먼저 떨어집니다. 고정 희소 예산은 짧은 입력에서 연산을 과도하게 줄이고, 긴 입력에서는 필요한 토큰 연결을 놓칠 수 있습니다. 지연 시간과 GPU 달러 비용, 재현 가능한 평가를 같은 기준으로 맞춰 본 뒤에 창 크기와 희소도를 고르는 편이 안전합니다.

같은 과제를 짧은 창 RAG와 긴 창 직접 조회로 나누어 보면 실패 지점이 검색 누락과 어텐션 희석으로 갈립니다. 비용이 낮아도 바늘 찾기나 다중 hop에서 점수가 무너지면 운영 품질은 내려갑니다.

접근비용 특성실무에서 볼 지점
밀집 어텐션이차 연산, KV 선형 증가실효 창 약 1M 제약 보고
희소 어텐션희소도로 연산·메모리 조절긴 시퀀스에서 높은 희소도 허용
RAG검색으로 입력 길이 축소의미 공간 불일치, 다중 hop 약화
RoPE 확장(YaRN)추가 학습 토큰 절감스케일 변동 시 RoPE 이전 KV 캐시

검색 증강과 긴 컨텍스트의 역할 분담

REFORM은 RAG처럼 입력을 독립 청크로 인코딩하지 않고 전체 입력에 조건화된 검색 임베딩으로 단편화를 피해 청크 경계를 넘나드는 조회를 유지합니다. RULER needle-in-a-haystack 300k 맥락에서 희소·밀집 RAG보다 점수가 일관되게 높았습니다. RAG 점수와 혼합하면 더 좋아진다고 하며, 검색만으로 긴 의존을 대체하기는 어렵습니다. 검색은 외부 최신 근거를 붙이고, 긴 창은 이미 올라온 문서 안에서 다중 hop 관계를 유지하는 쪽에 가깝습니다.

최신 규정이나 로그처럼 인덱스 밖의 사실은 검색이 필요합니다. 이미 프롬프트에 올라온 장문에서 숫자와 조항을 대조하는 일은 긴 창과 전역 조건 검색이 유리합니다.

LLM 컨텍스트 확장 동향 정리와 결론

학습 없는 희소 어텐션 6종 비교는 128K와 0.95 희소도, 9개 과제에서 큰 희소 모델의 Pareto 이점을 보여 줍니다. YaRN은 적은 추가 학습으로 창을 늘리고, Dynamic Scaling에서는 RoPE 적용 전 KV를 캐시해야 합니다. MSA는 100M 토큰과 9% 미만 저하, 2×A800 추론을 주장하지만 과제의 정밀도 정의를 같이 읽어야 합니다. 검색과 긴 창은 서로를 완전히 대체하지 않으며, 외부 근거 연동과 문서 내부 관계 유지를 나누어 설계해야 합니다.

창 길이를 스펙 한 줄로만 고르지 말고 희소도, 캐시 정책, 검색 깊이를 같이 적는 편이 재현에 유리합니다. 평가 과제와 실제 문서 분포가 다르면 긴 창의 이득이 사라질 수 있습니다.

요담

글쓴이

요담

AI를 실무에 활용할 수 있도록 도움드리는 요담입니다.