HRM-Text가 흔든 파운데이션 모델 학습 비용
계층적 추론과 데이터 큐레이션으로 파운데이션 모델 프리트레이닝 비용 구조를 바꾼 HRM-Text의 설계와 성능, 오픈 모델 생태계의 변화를 분석한다.
2026-08-14 · 최초 발행 2026-08-02
거대한 클러스터 없이 처음부터 학습하다
2026년 5월 Sapient Intelligence 연구팀은 1B 파라미터 파운데이션 모델 HRM-Text-1B를 처음부터 학습하는 데 성공했다. 투입된 클라우드 GPU 비용은 1,500달러였고, 상용 GPU 16장을 가동한 시간은 1.9일이었다.
규모만 작은 실험은 아니었다. HRM-Text-1B는 MMLU 60.7%, GSM8K 84.5%, MATH 56.2%를 기록했다. 2B~7B 파라미터 오픈 모델과 경쟁할 수 있는 결과다. 수백만 달러 규모의 프리트레이닝을 당연하게 여기던 관점에서 보면 비용뿐 아니라 학습 방법을 다시 묻게 하는 사례다.
출력 전에 내부 표현을 반복해서 다듬는 구조
HRM-Text-1B는 표준 Transformer의 단일 포워드 패스를 그대로 따르지 않는다. **계층적 추론 모델(Hierarchical Reasoning Model, HRM)**을 채택해 두 개의 스택이 연속 잠재 공간(continuous latent space)에서 중첩 순환(nested recurrence)을 수행한 뒤 출력을 만든다.
일반적인 다음 토큰 예측처럼 입력에서 곧바로 답을 생성하기보다, 내부 표현을 반복적으로 정제(refinement)해 추론 깊이를 확보하는 접근이다. 학습 파이프라인에는 잠재 공간 추론(latent space reasoning)과 스파스 학습(sparse training)이 함께 사용됐다.
인프라는 전용 슈퍼컴퓨팅 클러스터가 아니라 범용 클라우드 GPU 인스턴스 16장으로 구성됐다. H100급 전용 클러스터 없이도 분산 학습을 안정적으로 수행할 수 있음을 보인 셈이다.
데이터 구성도 기존 대형 언어 모델과 다르다. 대규모 원시 텍스트를 그대로 늘리는 대신 고품질 인스트럭션-응답 쌍(instruction-response pairs)을 큐레이션해 학습량을 40B 토큰으로 제한했다. 현대 LLM보다 100~900배 적은 학습 토큰이다. 표준 다음 토큰 예측 대신 태스크 완료 목표(Task Completion Objective)와 PrefixLM 마스킹을 조합해 광범위한 암기보다 태스크를 끝내는 추론 능력에 초점을 맞췄다.
1B 파라미터는 추론 효율과 배포 비용 사이에서 선택한 규모다. 소형 GPU 클러스터로 전체 학습을 수행하면서 실질적인 다운스트림 태스크 성능을 확보할 수 있는 최소 실용 규모라는 판단이다.
컴퓨팅 규모에서 학습 효율로 옮겨간 경쟁
대형 언어 모델의 프리트레이닝은 더 많은 토큰과 파라미터, GPU, 시간을 투입할수록 성능이 향상된다는 스케일링 법칙(Scaling Law)을 따라 발전해 왔다. GPT-4 학습에는 약 7,900만 달러, Gemini Ultra에는 수억 달러가 투입됐다.
HRM-Text-1B가 제시한 방향은 컴퓨팅 자원의 단순한 확대가 아니다. 데이터 큐레이션과 효율적인 아키텍처를 결합해 적은 자원으로 경쟁 가능한 성능을 얻는 것이다. 이 모델이 사용한 40B 토큰은 LLaMA 3의 15T 토큰과 비교하면 약 375분의 1이다.
이 변화는 모델을 직접 학습할 수 있는 조직의 범위에도 영향을 준다. 1,500달러는 중급 노트북 한 대 가격이다. 대학 연구실과 스타트업, 도메인 특화 기업도 자체 파운데이션 모델 학습을 현실적인 선택지로 검토할 수 있다. 의료·법률·금융처럼 민감한 데이터를 다루는 분야에서는 외부 API에 데이터를 보내지 않고 내부 인프라에서 모델 전체를 학습하는 경로가 열린다.
Chinchilla 법칙은 모델 파라미터와 학습 토큰 사이의 최적 비율을 설명한다. HRM-Text의 결과는 그 관계가 Transformer 아키텍처의 특성을 전제로 한다는 점을 시사한다. 중첩 순환으로 내부 계산 깊이를 높이면 기존 스케일링 법칙의 전제도 달라질 수 있다.
작은 모델이 만든 비용 대비 성능 차이
주요 오픈 모델과 비교하면 HRM-Text-1B의 학습 규모와 성능이 어느 지점에 놓이는지 더 분명해진다.
| 모델 | 파라미터 | 학습 토큰 | 추정 비용 | MMLU | GSM8K |
|---|---|---|---|---|---|
| HRM-Text-1B | 1B | 40B | ~$1,500 | 60.7% | 84.5% |
| Qwen2.5-1.5B | 1.5B | 18T | ~수백만 달러 | 60.4% | 76.9% |
| Gemma-2B | 2B | 3T | ~수백만 달러 | 51.3% | 46.1% |
| LLaMA 3.2-3B | 3B | 9T | ~수천만 달러 | 63.4% | 77.7% |
| Mistral-7B | 7B | 8T | ~수천만 달러 | 64.1% | 74.2% |
HRM-Text-1B는 표에서 파라미터 수가 가장 작지만 GSM8K 성능은 비교 대상 모두를 앞선다. MMLU 60.7%도 1.5배7배 많은 파라미터를 가진 모델과 비슷하거나 더 높다. 연구팀은 비용 대비 성능 효율(Cost-Efficiency Ratio)이 기존 오픈 모델보다 96432배 높다고 추정했다.
이 사례를 AI 학습 인프라 관점에서 보면 모델 아키텍처만큼 시스템 설계가 중요하다. 16개 GPU 노드 사이에서 파라미터를 동기화하려면 AllReduce와 Ring AllReduce 전략, 배치 크기, 그래디언트 누적의 트레이드오프를 다뤄야 한다.
40B 토큰 큐레이션은 데이터 품질 필터링과 중복 제거, 언어 균형 조정이 포함된 대규모 ETL 파이프라인 문제이기도 하다. 스파스 학습으로 연산량을 줄이는 작업은 CPU와 메모리 사용을 최적화하는 정보처리시스템 설계와 맞닿아 있다. 인프라 투자와 성능 개선 곡선을 함께 비교해야 한다는 점에서는 IT 시스템 도입 타당성 분석과도 연결된다.
재현 가능한 오픈 모델이 넓히는 선택지
HRM-Text-1B는 Apache 2.0 라이선스의 완전한 오픈소스로 공개됐다. GitHub의 sapientinc/HRM-Text 저장소에서 아키텍처 설계와 학습 코드, 사전 학습 가중치를 확인할 수 있어 연구자가 직접 재현하거나 개량할 수 있다. Llama 시리즈가 오픈소스 생태계에 미친 영향과 비교할 만한 움직임이다.
도메인 특화 모델을 만드는 방식도 달라질 수 있다. 일반 파운데이션 모델을 1,500달러에 학습할 수 있다면 의료 기록이나 법률 문서, 금융 리포트로 특화된 파운데이션 모델의 학습 비용 역시 같은 수준으로 낮아진다. 기존의 대형 범용 모델을 파인튜닝하는 방법과 함께, 소규모 도메인 파운데이션 모델을 처음부터 만드는 선택지가 현실성을 얻는다.
비용 하락의 흐름은 이미 나타나고 있었다. DeepSeek-V3의 프리트레이닝 비용은 약 557만 달러로, GPT-4의 수십 분의 일 수준까지 내려왔다. 이것도 불과 2024~2025년의 일이었다. HRM-Text-1B는 이제 1B 스케일에서 1,500달러라는 새로운 기준점을 제시했다.
물론 1B 파라미터 모델을 프론티어 모델과 같은 수준으로 볼 수는 없다. 다만 특정 태스크에 특화하면 대형 범용 모델에 필적하는 성능을 낼 수 있으며, 대형 AI 연구소에 집중됐던 프리트레이닝 노하우가 오픈 생태계로 확산되고 있다는 흐름은 분명하다.
배포 측면에서도 1B 파라미터는 소비자용 GPU인 RTX 4090 등에서 추론할 수 있는 규모다. 1,500달러에 학습한 모델을 엣지 디바이스에 배치하면 클라우드 API에 의존하지 않는 자립형 AI 시스템을 구성할 수 있다. 산업용 IoT와 의료 기기, 국방처럼 데이터 주권이 중요한 분야에서 주목받을 전망이다.
HRM-Text-1B가 만든 균열은 단순히 학습비를 낮춘 데 있지 않다. 계층적 추론 아키텍처와 고품질 소규모 데이터 큐레이션을 결합하면 수백 배 더 많은 컴퓨팅을 사용한 모델과도 경쟁할 수 있음을 보였다. 1B~3B 파라미터 규모의 효율적인 프리트레이닝 연구가 빨라지면서 중소 조직과 연구 집단이 자체 파운데이션 모델을 보유하는 시점도 예상보다 앞당겨질 전망이다.
Sources
- Researchers say they trained a foundation model from scratch for about $1,500 | VentureBeat
- HRM-Text: Efficient Pretraining Beyond Scaling (arXiv:2605.20613)
- Sapient Intelligence launches HRM-Text — PR Newswire
- HRM-Text — sapient.inc
- GitHub: sapientinc/HRM-Text
- Foundation model training: $1,500 breakthrough in 2026
- Toward more economical large-scale foundation models — NCBI PMC