Claw Compactor — 토큰을 97%까지 줄이는 오픈소스 압축 엔진
선택적 정보 증류 방식으로 LLM 입력 토큰을 최대 97% 압축하는 오픈소스 프로젝트 Claw Compactor의 알고리즘·압축 레벨·API 호환성과 실제 비용 절감 시뮬레이션을 정리한다.
2026-08-14 · 최초 발행 2026-03-19
LLM API 호출 비용이 프로덕션 AI 시스템의 최대 운영 장벽으로 떠오르는 가운데, 2026년 초 등장한 오픈소스 프로젝트 Claw Compactor가 토큰 사용량을 최대 97%까지 줄이는 압축 엔진으로 주목받고 있다. PyTorch Korea 커뮤니티를 비롯한 국내외 AI 개발자들 사이에서 빠르게 확산되고 있으며, 단순한 텍스트 단축이 아닌 의미 보존형 압축 기술로 모델 응답 품질을 유지하면서도 비용을 극적으로 낮추는 접근법이 큰 관심을 끌고 있다.
입력 토큰이 비용의 핵심 레버가 된 이유
Claw Compactor(클로 컴팩터)는 2026년 2월 GitHub에 MIT 라이선스로 공개됐으며, LLM 입력 토큰 수를 최소화해 API 호출 비용을 절감하는 것을 핵심 목표로 삼는다. GPT-4o, Claude 3.5 같은 고성능 모델은 입력 토큰 비용이 출력 대비 수 배에 달하는 구조적 문제가 있고, GPT-4o 기준 입력 1M 토큰당 $5, 출력 1M 토큰당 $15라는 가격 구조에서 입력 최소화가 핵심 레버가 된다. 기존 요약 기반 압축의 정보 손실 문제, RAG 시스템에서 retrieved chunk를 그대로 넘길 때 생기는 중복과 노이즈 문제를 해결하려는 것이 개발 동기였다. 벤치마크 기준 평균 83%, 최대 97%의 토큰 압축률을 달성했고, Python을 우선 지원하며 REST API 래퍼로 언어 독립적으로도 쓸 수 있다.
요약이 아니라 증류
Claw Compactor는 단순 요약이 아닌 선택적 정보 증류(Selective Information Distillation) 방식을 채택한다. 각 문장·구문의 쿼리 관련성을 벡터 유사도로 측정하는 중요도 스코어링(Importance Scoring), 유사 의미를 가진 문장을 그룹화한 뒤 대표 문장을 선택하는 의미 클러스터링(Semantic Clustering), 단위 토큰당 정보량을 최대화하는 정보 밀도 최적화(Information Density Optimization), 시스템 프롬프트·유저 인스트럭션·컨텍스트를 역할별로 차등 압축하는 역할 기반 보존(Role-Aware Preservation)이 핵심 알고리즘을 구성한다.
압축 레벨은 네 단계로 나뉜다. Level 1은 압축률 약 30%에 정보 보존율 약 98%로 법률·의료 텍스트 같은 중요 문서에 적합하고, Level 2는 압축률 약 60%에 보존율 약 92%로 일반 RAG 컨텍스트에 쓰인다. Level 3는 압축률 약 83%에 보존율 약 85%로 FAQ나 반복 패턴 데이터에, Level 4는 압축률 약 97%에 보존율 약 72%로 고속 처리·비용 우선 시나리오에 적합하다.
토크나이저 연동에서는 GPT 계열에 tiktoken 라이브러리를 직접 연동해 정확한 토큰 수를 계산하고, Claude 계열은 Anthropic 공식 토크나이저 API를 호출하며, 오픈소스 모델은 transformers 라이브러리의 AutoTokenizer를 활용한다. 압축 전후 토큰 수 비교 리포트도 자동으로 생성된다.
프롬프트를 압축할 것인가, 컨텍스트를 압축할 것인가
Claw Compactor는 두 가지 압축 모드를 명확히 분리해 지원한다. 프롬프트 압축(Prompt Compression)은 시스템 프롬프트·인스트럭션 템플릿을 대상으로 지시문 중복 제거, 불필요한 예시 축약, 조건 병합 방식을 쓰며, 1회 처리 후 캐싱이 권장되고 모델 동작에 직접 영향을 주기 때문에 의미 왜곡을 막기 위해 압축률은 최대 60% 수준으로 권장된다. 긴 시스템 프롬프트를 재사용할 때 토큰을 절약하는 데 쓰인다.
컨텍스트 압축(Context Compression)은 RAG retrieved chunks, 대화 히스토리, 문서 전문을 대상으로 쿼리 관련성 기반 문장 필터링과 의미 보존 요약 방식을 쓴다. 쿼리마다 동적으로 압축되고 관련성 낮은 내용을 우선 제거하며, 최대 97%까지 압축률을 낼 수 있는 영역이다. 긴 문서를 RAG 소스로 쓸 때 핵심만 추출하는 데 활용된다. 하이브리드 모드에서는 프롬프트 압축과 컨텍스트 압축을 동시에 적용하고, 총 토큰 예산(Token Budget)을 설정한 뒤 배분을 최적화하며 비용-품질 트레이드오프를 자동으로 조정하는 옵션도 제공한다.
어떤 모델과 맞물리는가
공식 지원 LLM은 OpenAI의 GPT-4o·GPT-4o-mini·GPT-4 Turbo·o1·o3, Anthropic의 Claude 3.5 Sonnet·Claude 3.5 Haiku·Claude 3 Opus, Google의 Gemini 1.5 Pro·Gemini 2.0 Flash, Meta의 Llama 3.1/3.2/3.3(로컬 및 API 모두), Mistral의 Mistral Large·Mixtral 8x22B, 그리고 vLLM·Ollama 엔드포인트 호환 오픈소스 모델까지 아우른다. OpenAI SDK 드롭인 대체(Drop-in Replacement)를 지원하고, claw_compactor.wrap() 한 줄로 기존 코드에 압축을 적용할 수 있으며, LangChain·LlamaIndex 공식 통합 모듈과 FastAPI 미들웨어로 API 서버에 투명하게 적용하는 것도 가능하다.
from claw_compactor import ClawCompactor
cc = ClawCompactor(
model="gpt-4o",
compression_level=3,
preserve_instructions=True
)
compressed = cc.compress(
system_prompt=long_system_prompt,
context=retrieved_chunks,
query=user_query
)
response = openai_client.chat.completions.create(
model="gpt-4o",
messages=compressed.to_messages()
)
실제로 얼마나 아끼는가
GPT-4o에 평균 8,000토큰 컨텍스트, 월 100만 쿼리로 구성된 RAG 기반 고객 지원 챗봇 시나리오에서는 압축 전 비용이 8,000 tokens × 1M queries × $5/1M = $40,000/월이었다. Level 3(83% 압축) 적용 후에는 1,360 tokens × 1M queries × $5/1M = $6,800/월로, 월 $33,200(약 83%)이 절감된다.
Claude 3.5 Sonnet에 평균 15,000토큰 문서, 일 10만 건 처리로 구성된 문서 분석 에이전트 시나리오에서는 압축 전 월 비용이 15,000 × 3M × $3/1M = $135,000/월이었다. Level 2(60% 압축) 적용 후에는 6,000 × 3M × $3/1M = $54,000/월로, 월 $81,000(약 60%)이 절감된다.
GPT-4o-mini에 월 1만 건, 평균 2,000토큰으로 구성된 개인 개발자 토이 프로젝트 시나리오에서는 압축 전 비용이 $0.30/월, 압축 후 비용이 $0.05/월로 절대 금액은 작지만, 소규모에서는 절감액보다 레이트리밋 여유 확보가 실익이라는 의미가 있다.
입력부터 응답까지, 압축이 끼어드는 지점
내부 모듈은 모델별 토크나이저를 추상화하는 Tokenizer Adapter, 임베딩 기반 문장 중요도를 계산하는 Importance Scorer, 코사인 유사도 기반으로 문장을 군집화하는 Semantic Clusterer, 정보 밀도를 극대화해 재구성하는 Density Optimizer, 토큰 예산 할당과 초과를 감지하는 Budget Manager, 압축 전후 메트릭을 수집·리포팅하는 Stats Collector로 구성된다. 동일 컨텍스트를 다시 압축하지 않도록 SHA-256 기반 캐시 키를 쓰고, Redis·로컬 파일시스템·인메모리 캐시 백엔드를 선택할 수 있으며, TTL 설정으로 캐시 신선도를 관리한다.
커뮤니티는 어디까지 왔나
2026년 3월 기준 GitHub 스타는 12,400개 이상, 컨트리뷰터는 87명, 포크는 1,900개 이상이며 주요 언어는 Python 82%, TypeScript 11%, Rust 7%이고 라이선스는 MIT다. PyTorch Korea Discord에서 활발히 사용 사례가 공유되고, 국내 스타트업 3곳이 프로덕션 적용 후기를 공개했으며, 한국어 문서화 기여자가 10명 이상 참여하고 discuss.pytorch.kr에는 종합 벤치마크 결과가 게시돼 있다. 한국어·일본어 등 비영어권 최적화 튜닝, 신규 LLM 토크나이저 연동 모듈, 도메인 특화 압축 품질 평가셋, LangChain·Haystack·AutoGPT 연동 확장, Rust 코어 모듈 고도화가 기여 가능 영역으로 열려 있다. 로드맵은 2026 Q2에 이미지 토큰을 포함한 멀티모달 토큰 압축(v1.3), Q3에 실시간 스트리밍 압축 지원(v1.4), Q4에 자체 경량 임베딩 모델을 번들링해 외부 의존성을 제거하는 v2.0을 예정하고 있다.
Claw Compactor는 LLM API 비용이 AI 서비스 운영의 핵심 변수가 된 현실에서 실용적인 해답을 제시한다. 97%라는 극단적 압축률은 특수 시나리오에 한정되지만, 실제 프로덕션 환경에서도 60~83% 수준의 압축을 안정적으로 달성하며 의미 있는 비용 절감을 이끌어낸다. 기존 코드에 최소한의 변경으로 도입 가능한 드롭인 방식과 오픈소스 특성이 진입 장벽을 낮추는 강점이다.
Sources
- https://github.com/claw-compactor/claw-compactor
- https://discuss.pytorch.kr/t/claw-compactor-token-compression/2847
- https://arxiv.org/abs/2310.06839 (LLMLingua: Compressing Prompts for Accelerated Inference)
- https://platform.openai.com/docs/guides/production-best-practices
- https://docs.anthropic.com/en/docs/build-with-claude/token-counting
- https://python.langchain.com/docs/integrations/document_compressors/