본문 바로가기
SEO·GEO 용어사전

컨텍스트 윈도우 (Context Window)

마지막 업데이트

컨텍스트 윈도우는 AI 모델이 한 요청에서 다룰 수 있는 토큰의 총량입니다. 모델의 작업 기억에 비유되는 개념으로, 학습으로 쌓인 지식과 달리 지금 이 대화에서 참조할 수 있는 범위를 정합니다. 단위는 토큰입니다.

이 글은 OpenAI와 Anthropic의 공식 문서, 컨텍스트 활용을 다룬 원 논문을 기준으로 작성했습니다. 모델 수치는 2026년 8월 확인 시점 기준입니다.

한도에 포함되는 항목

컨텍스트 윈도우는 흔히 입력만의 한도로 오해되지만, 대화 기록과 도구 결과, 생성할 출력도 함께 고려해야 합니다. 다만 어떤 항목을 한도에 넣고 어떻게 계산하는지는 모델과 제품마다 다릅니다. Anthropic과 OpenAI의 API도 시스템 프롬프트, 도구 정의와 결과, 출력과 추론 토큰을 다루는 방식이 완전히 같지 않습니다. 실제 한도는 사용 중인 모델의 공식 문서와 사용량 필드에서 확인해야 합니다.

한도를 넘었을 때의 동작은 제품과 설정마다 다릅니다. 요청을 오류로 거부하거나, 입력을 잘라내거나, 오래된 대화를 요약하는 방식 등이 가능합니다. 사용하는 API와 챗 서비스의 공식 안내를 확인해야 합니다.

커진 창과 남아 있는 한계

일부 모델은 매우 긴 컨텍스트를 지원하지만, 최대 수치는 제품과 모델 버전에 따라 자주 바뀝니다. 크기가 곧 활용 능력은 아니라는 점도 함께 봐야 합니다.

  • Anthropic은 컨텍스트가 길어질수록 그 안의 정보를 정확히 회상하는 능력이 점진적으로 떨어지는 현상을 컨텍스트 로트(context rot)라고 부르며, 급락이 아니라 완만한 성능 저하 곡선이라고 설명합니다
  • 이와 별개로 2023년의 Lost in the Middle 연구(Liu 외)는 문서 여러 개에서 답을 찾는 과제에서 관련 정보가 컨텍스트의 처음이나 끝에 있을 때 성능이 가장 높고 중간에 있을 때 크게 떨어지는 위치 편향을 보고했습니다. 특정 과제, 당시 모델 세대 기준의 실험이라는 단서는 붙지만, 긴 컨텍스트 모델에서도 나타났다는 것이 논문의 보고입니다

두 현상은 근거 연구와 메커니즘이 다른 별개의 한계입니다. 공통 결론만 취하면, 넣을 수 있다고 다 잘 읽히는 것은 아니라는 것입니다.

커진 창이 RAG를 대체하는 범위

긴 컨텍스트가 RAG를 항상 대체하는 것은 아닙니다. 자료 전체를 한 번에 넣는 방식과 필요한 부분을 검색해 넣는 방식은 자료 규모, 변경 빈도, 비용, 지연과 정확도를 함께 비교해 고릅니다. 특정 토큰 수를 모든 제품에 적용되는 경계선으로 삼을 수는 없습니다.

검색과 콘텐츠에 갖는 의미

공개 AI 검색 서비스가 웹사이트를 어떤 단위로 자르고 선택하는지는 제품마다 다르며 모두 공개되지 않습니다. Lost in the Middle 연구도 긴 컨텍스트 안에서 정보를 찾는 특정 실험이므로 웹 글의 앞부분을 AI 인용 전술로 만들 근거는 아닙니다. 컨텍스트 윈도우는 자체 챗봇과 RAG에서 입력 자료와 출력 길이, 비용을 설계할 때 직접 확인하는 값입니다.

자주 묻는 질문

컨텍스트 윈도우는 입력의 한도 아닌가요?

입력과 출력을 합친 한도입니다. 긴 자료를 넣을수록 답변에 쓸 수 있는 공간이 줄어드는 구조라, 대용량 입력과 긴 출력을 동시에 원하면 한도 설계가 필요합니다. 추론 모델은 내부 사고 토큰도 이 공간을 씁니다.

긴 컨텍스트 모델이면 책을 통째로 읽힐 수 있나요?

지원 한도 안에서는 넣을 수 있습니다. 다만 긴 자료를 모두 넣었다고 모든 부분을 똑같이 잘 활용하는 것은 아닙니다. 실제 과제에서 답의 정확도와 누락을 평가하고, 필요하면 검색과 청킹을 함께 씁니다.

창이 계속 커지면 RAG는 사라지나요?

그렇게 단정할 수 없습니다. 자료의 규모뿐 아니라 변경 빈도, 접근 권한, 비용과 정확도에 따라 검색이 계속 필요할 수 있습니다. 통짜 입력과 RAG를 실제 평가 자료로 비교해야 합니다.

한도를 넘으면 어떻게 되나요?

오류로 거부하거나 입력을 자르고, 오래된 내용을 요약하는 등 제품마다 다릅니다. 실제 요청의 입력 토큰과 출력 한도, 초과 응답을 테스트하고 공식 문서를 확인합니다.

함께 알아두면 좋은 용어

  • 토큰: 컨텍스트 윈도우를 재는 단위
  • RAG: 한도를 우회해 큰 자료를 다루는 구조
  • 청킹: 한도에 맞춰 문서를 자르는 전처리
  • LLM: 컨텍스트 윈도우를 갖는 모델

참고 문서