2026-07-13

컨텍스트 길이란 무엇인가? (그리고 실제로 무엇이 그것을 채우나)

컨텍스트 길이는 기능이 아니라 예산입니다. 무엇이 그것을 소모하는지, 오늘의 실제 한계는 어디인지, 그리고 자리가 떨어지면 무슨 일이 생기는지.

컨텍스트 길이란 무엇인가? (그리고 실제로 무엇이 그것을 채우나)

모델 카드마다 "200K 컨텍스트"나 "1M 컨텍스트" 같은 숫자가 적혀 있습니다. 디스크 용량처럼 성능 사양으로 보이지만, 실은 요청마다 써 없애는 예산에 가깝습니다 — 그리고 그것을 소모하는 대부분은 당신이 입력한 글이 아닙니다.

수치 최종 확인: 2026년 8월 26일.

컨텍스트 길이란 무엇인가

모델에는 기억이 없습니다. 호출할 때마다 대화 전체를 다시 보냅니다 — 시스템 프롬프트, 이전의 모든 턴, 첨부한 파일 전부 — 그리고 모델은 한 단어를 쓰기 전에 그 전부를 읽습니다.

컨텍스트 길이는 그 묶음의 최대 크기이며, 토큰으로 잽니다. 토큰은 작은 텍스트 조각으로, 영어에서는 대략 한 단어의 ¾입니다.

그러니 저장 공간이 아닙니다. 모델이 당신의 문서를 펼쳐 놓을 수 있는 책상의 크기이고, 요청마다 말끔히 치워집니다.

오늘의 실제 한계

컨텍스트 길이그 크기의 모델
32,768Qwen 2.5 Coder 32B
200,000Claude Haiku 4.5
262,144Kimi K2.7 Code
400,000GPT-5 계열 전체, 모든 Codex 변형 포함
1,000,000Claude Opus 5, Claude Sonnet 5, Qwen3 Coder Flash와 Plus
1,048,576Gemini 2.5 및 3.x 계열, DeepSeek V4 Pro

두 가지가 눈여겨볼 만합니다.

백만 토큰은 대략 75만 단어 — 긴 소설 여러 권입니다. 그만큼 필요한 애플리케이션은 거의 없고, 필요하다고 느끼는 쪽은 대개 컨텍스트 문제가 아니라 검색 문제를 안고 있습니다.

1,048,576은 2²⁰이지, 마케팅용 어림수가 아닙니다. 공급자가 정확히 1,000,000이라고 적었다면 반올림한 것이고, 1,048,576이라고 적었다면 실제 버퍼 크기를 보고한 것입니다.

모든 텍스트 모델의 토큰 가격과 컨텍스트 길이는 채팅 모델 페이지에 있습니다.

실제로 무엇이 그것을 채우는가

모델 카드가 말해 주지 않는 대목입니다. Anthropic 문서는 최소한의 요청 몇 가지에 대한 정확한 토큰 수를 공개하는데, 시사하는 바가 큽니다.

무엇을 보냈나입력 토큰
다섯 단어짜리 시스템 프롬프트 + 두 단어 메시지14
아홉 단어 질문 + 도구 정의 하나403
이미지 한 장 + "Describe this image"1,028
PDF 하나 + "Please summarize this document."2,188

도구 정의 하나에 대략 390토큰. 도구가 스무 개인 에이전트는 사용자가 무엇도 입력하기 전에 자기 창의 8,000토큰가량을 쓰고, 게다가 요청마다 그 값을 냅니다.

이미지는 약 1,000토큰. 스크린샷 스무 장이면 20,000입니다.

그리고 대화 자체가 자랍니다. 10번째 턴은 1번부터 9번 턴을 지고 갑니다. 시작할 때 작아 보이던 대화가 끝에는 요청에서 가장 큰 덩어리가 됩니다.

그러니 "200K 컨텍스트" 모델이라도, 도구 열다섯 개와 긴 시스템 프롬프트와 스크린샷 몇 장을 든 에이전트 안에서는 200K에서 시작하지 않습니다. 훨씬 아래에서 시작해, 턴마다 줄어듭니다.

함정: 같은 글이 같은 토큰 수는 아니다

컨텍스트 길이는 토큰으로 재는데, 토큰은 모델을 건너뛰면 안정된 단위가 아닙니다.

Anthropic 자체 문서는 Claude 4.7 이후가 새 토크나이저를 쓰며 "같은 입력 텍스트가 이전 모델보다 약 30퍼센트 더 많은 토큰을 만든다"고 밝힙니다.

즉, 예전 모델에서 150,000토큰으로 측정된 프롬프트가 새 모델에서는 195,000쯤 될 수 있습니다 — 같은 낱말, 30퍼센트 더 많은 창, 30퍼센트 더 많은 비용. 어떤 모델에 맞춰 문서 처리 파이프라인의 크기를 잡아 두고 모델을 바꿨다면, 아직 들어간다고 단정하기 전에 다시 재십시오.

공급자가 확인할 방법을 줍니다. Anthropic의 토큰 계산 엔드포인트는 호출이 무료입니다. 실제로 돌릴 바로 그 모델에 대고 세십시오.

자리가 떨어지면 무슨 일이 생기나

우아한 성능 저하가 아닙니다. 공급자에 따라 오류가 나거나, 입력이 잘리거나, 기록이 조용히 버려집니다 — 세 번째가 위험합니다. 모델이 이제는 전부 볼 수 없는 대화를 근거로 자신 있게 대답하기 때문입니다.

빠져나갈 길은 셋, 품이 적게 드는 순서로:

잘라내기. 가장 오래된 턴을 버리거나 요약합니다. 만들기가 가장 싸고, 채팅이라면 대개 이걸로 충분합니다.

캐싱. 컨텍스트의 큰 부분이 고정된 접두부라면 — 긴 시스템 프롬프트, 참고 문서 — 프롬프트 캐싱으로 공급자가 그것을 저장하고 다시 읽는 값으로 일부만 청구합니다. 창이 커지지는 않지만, 채우는 비용의 대부분이 사라집니다.

검색. 말뭉치 전체를 보내는 대신 관련 있는 부분만 보냅니다. 공수는 늘지만, 데이터가 커져도 나빠지지 않는 유일한 방법입니다.

더 큰 컨텍스트 창으로 손을 뻗는 것이 네 번째 선택지이고 대개 가장 비쌉니다 — 그 창에 든 모든 토큰을 요청마다 지불하기 때문입니다.

창이 크면 더 비싼가

토큰당으로는 아닙니다. 같은 요청이라면 1M 컨텍스트 모델이 200K 모델보다 높은 요율로 청구되지 않습니다. Claude Sonnet 5는 입력 100만 토큰당 2.00달러이며, 500토큰을 보내든 50만 토큰을 보내든 같습니다.

다만 창이 크면 더 쓰기가 쉬워집니다. 당신을 멈춰 세웠을 오류가 사라지기 때문입니다. 100만 토큰 창을 100만당 2.00달러로 채우면 요청당 2.00달러 — 그 요청이 한 달에 5만 번 일어나는 채팅 한 턴이라면, 산수는 금세 심각해집니다.

어느 쪽이든 규율은 같습니다. 허용된 최대가 아니라, 할 수 있는 최소를 보내십시오.

짧게 정리하면

ElliSekiz에서 더 보기

컨텍스트 길이와 토큰 가격을 나란히 비교. 채팅 모델 페이지에 모든 텍스트 모델의 입력·출력 요율이 있습니다.

그다음 자기 프롬프트를 재 보기. 모든 모델 페이지에는 playground가 있습니다 — 무엇의 크기를 잡기 전에 실제 요청을 돌려 진짜 토큰 수를 읽으십시오.

출처

전체 글