텍스트 모델에 비전 모듈을 붙이는 증분 멀티모달 학습 설계
검증된 텍스트 모델의 능력을 보존하면서 비전 모듈을 통합하는 증분 멀티모달 학습 아키텍처와 운영 설계 원칙
2026-09-02 · 최초 발행 2026-09-01
이미 검증된 텍스트 능력을 버리지 않는 확장 방식
DeepSeek은 V4 계열의 첫 실험적 멀티모달 모델인 DeepSeek-V4-Flash-Vision-Exp를 305B 파라미터 규모로 공개했다. 이 모델은 처음부터 멀티모달로 학습한 구조가 아니다. DeepSeek-V4-Flash 아키텍처에 비전 모듈을 통합하고 추가 학습을 거쳐 시각 이해 능력을 확보했다.
DeepSeek은 DeepSeek-V4-Flash-0731과 비교해 멀티모달 에이전트 능력이 상당히 개선됐고, 텍스트 전용 에이전트 과제에서는 동등한 수준을 유지했다고 밝혔다. 텍스트와 이미지 혼합 입력을 지원하며, 이미지는 base64·외부 URL·Files API로 전달할 수 있다. 모델은 MIT 라이선스로 Hugging Face 공식 저장소에 공개됐고 Chat Completions, Messages·Responses 인터페이스를 지원한다.
멀티모달 모델을 처음부터 다시 학습하는 일은 비용과 시간이 감당하기 어렵다. 이미 검증된 텍스트 능력도 다시 확보해야 한다. 그래서 문제는 재학습보다, 기존 본체를 유지한 채 시각 경로를 추가하는 증분 확장으로 옮겨간다. 대신 시각 능력과 텍스트 능력 사이의 균형을 관리해야 한다.
비전 경로를 붙일 때 함께 결정할 설계 항목
비전 인코더는 사전 학습된 것을 사용할지, 언어 모델과 함께 학습할지를 먼저 정해야 한다. 사전 학습 인코더는 학습 자원을 크게 절약하지만 도메인 편향도 함께 가져온다. 인코더 출력 차원과 토큰 수는 이후 컨텍스트 소비량을 결정하므로, 선정 단계부터 예산 영향을 검토해야 한다.
인코더가 만든 시각 표현은 모달 정렬 프로젝터를 통해 언어 모델의 임베딩 공간으로 옮긴다. 이 계층이 증분 확장의 실질적인 접합부다. 프로젝터를 크게 두면 정렬은 쉬워지지만 추론 비용이 증가하고, 작게 두면 정렬 부담이 학습으로 넘어간다.
언어 모델 본체를 어디까지 동결할지도 핵심 변수다. 전면 동결은 텍스트 능력을 확실히 보존하지만 시각 성능의 상한을 낮춘다. 상위 몇 개 층만 여는 부분 해동은 실무에서 절충안으로 쓰이지만, 동결 범위는 관행이 아니라 실험으로 정해야 한다.
학습 데이터도 이미지-텍스트 쌍만으로 구성하면 안 된다. 텍스트 전용 데이터가 함께 들어가지 않으면 텍스트 능력이 조용히 떨어질 수 있다. 혼합 비율은 회귀 감시 결과에 따라 조정해야 하며, 고정 비율만 유지하면 학습 후반의 저하를 놓칠 수 있다.
프로젝터만 학습한 뒤 상위 층을 해동하고, 필요하면 전체 미세조정으로 넘어가는 단계적 방식이 적합하다. 처음부터 전체를 열면 시각 정렬이 자리 잡기 전에 본체가 흔들릴 수 있다. 단계 전환은 정해진 스텝 수가 아니라 지표 조건으로 결정해야 한다.
회귀를 학습 종료 뒤에 발견하지 않으려면
텍스트 능력 회귀는 학습 중 정기적으로 텍스트 전용 평가를 실행해야 추적할 수 있다. 학습이 끝난 뒤에만 측정하면 어느 단계에서 저하가 발생했는지 알 수 없다. 허용 임계는 학습 전에 정하고, 초과하면 학습을 멈추도록 해야 한다.
해상도 처리도 학습과 서빙을 함께 고려해야 한다. 고해상도 이미지를 타일로 나누면 세부 정보는 살릴 수 있지만 토큰 수가 급증해 컨텍스트 예산을 잠식한다. 축소와 타일 분할 사이의 선택, 용도별 해상도 상한은 추론 비용을 예측 가능하게 만드는 장치다.
이미지가 없는 요청에서는 시각 경로를 건너뛰어야 한다. 이 분기가 없으면 텍스트 전용 요청도 멀티모달 비용을 부담한다. 분기 조건은 입력 검사 단계에서 확정해 요청마다 실행 경로가 흔들리지 않도록 한다.
학습 전 준비해야 할 운영 조건
확장할 텍스트 모델이 목표 수준의 텍스트 능력을 이미 충족하는지부터 확인한다. 부족한 텍스트 능력은 시각 확장으로 메울 수 없다. 증분 확장은 가중치 접근이 전제이므로 라이선스와 가중치 공개 범위도 함께 검토해야 한다.
정렬 데이터의 품질은 학습 속도뿐 아니라 정렬 방향 자체를 좌우한다. 캡션이 부정확하면 단순히 정렬이 늦어지는 것이 아니라 잘못된 정렬이 만들어진다. 일반 도메인 데이터만으로는 실사용 성능이 나오지 않을 수 있으므로, 목표 도메인의 이미지 특성을 반영한 데이터를 확보해야 한다.
전면 동결, 부분 해동, 전체 미세조정은 소규모 조건으로 비교한다. 각 조건에서 텍스트와 시각 지표를 함께 기록해야 균형점을 찾을 수 있다. 확장 전 텍스트 능력은 범주별로 측정해 기준선을 고정하고, 회귀 평가 세트는 학습 데이터와 분리한다. 학습에 사용한 데이터로 회귀를 측정하면 저하가 감춰진다.
단계별 학습 예산을 나누고, 단계 전환 조건은 지표로 둔다. 초기 단계에 예산을 집중하면 후반 조정 여지가 줄어든다. 회귀가 발생했을 때 되돌릴 체크포인트 보관 비용도 예산에 포함해야 한다.
롤백은 실패한 뒤에 정하는 절차가 아니다. 어느 체크포인트로 되돌릴지와 재시도 시 바꿀 항목을 미리 정하고, 롤백 판정 기준을 회귀 임계와 연동해야 판단이 늦어지지 않는다. 학습 데이터의 출처와 라이선스 확인을 필수 절차로 두고, 실험 모델의 배포 범위와 사용 제한을 명시해 검증되지 않은 모델이 운영에 유입되지 않도록 한다.
선택지는 성능뿐 아니라 운영 경로를 바꾼다
| 구분 | 증분 비전 확장 | 처음부터 멀티모달 학습 |
|---|---|---|
| 학습 비용 | 낮음 | 매우 높음 |
| 텍스트 능력 | 보존 가능 | 재확보 필요 |
| 시각 성능 상한 | 제한 | 높음 |
| 소요 기간 | 짧음 | 김 |
| 모달 융합 깊이 | 얕음 | 깊음 |
| 실패 위험 | 낮음 | 높음 |
증분 비전 확장은 검증된 텍스트 능력을 가져오므로 이를 재확보하는 비용이 들지 않는다. 학습 자원과 기간이 크게 줄고, 실패하더라도 기반 모델은 남아 있어 위험이 제한된다. DeepSeek이 텍스트 전용 과제에서 동등한 성능을 유지하면서 멀티모달 능력을 크게 개선했다고 밝힌 점도 이 경로의 성립 근거다.
다만 텍스트 중심으로 학습된 본체에서는 시각과 언어의 융합이 얕은 층에 머물 수 있다. 시각 성능의 상한도 프로젝터와 해동 범위에 묶인다. 처음부터 멀티모달로 학습하면 두 모달이 사전 학습 단계부터 함께 표현돼 융합이 깊고 시각 성능 상한도 높다. 반면 자원과 기간이 감당하기 어려운 수준이며, 실패하면 처음부터 다시 시작해야 하고 텍스트 능력도 새로 확보해야 한다. 검증된 텍스트 본체가 있는 조직에서는 증분 확장이 사실상 유일한 현실적 경로다.
본체를 동결하면 텍스트 능력이 구조적으로 보존돼 회귀 위험이 거의 없고, 학습해야 할 파라미터가 적어 자원과 시간이 크게 줄어든다. 실패 시에는 프로젝터만 다시 만들면 된다. 그러나 본체가 시각 정보를 받아들이도록 조정되지 않으므로 시각 성능은 프로젝터의 표현력에 갇히며, 복잡한 시각 추론에서 한계가 드러난다.
전체 미세조정은 본체가 시각 표현을 직접 다루도록 조정돼 시각 성능과 모달 간 상호작용을 높일 수 있다. 그 대신 텍스트 능력이 조용히 저하될 위험이 계속 존재하고 학습 자원도 급증한다. 저하를 발견해도 원인이 된 층을 특정하기 어렵다. 프로젝터로 정렬을 먼저 잡고 상위 층만 여는 단계적 해동은 이 두 위험을 나눠 관리하는 방식이다.
통합 단일 모델은 이미지와 텍스트를 하나의 컨텍스트에서 추론하므로 상호 참조가 가능하고, 호출이 한 번이라 지연이 짧으며 운영 구성이 단순하다. 다만 텍스트 전용 요청에도 멀티모달 모델 비용이 들며 시각 성능을 높이려면 모델 전체를 교체해야 한다.
시각 전용 모델을 분리 호출하면 모달별로 최적 모델을 사용해 성능과 비용을 따로 조정할 수 있고, 시각 모델만 교체하는 부분 갱신도 가능하다. 호출이 늘어 지연이 커지고, 시각 결과를 텍스트로 옮기는 과정에서 정보가 손실될 수 있으며, 두 모델의 버전 조합을 관리해야 한다. 시각 결과를 그대로 언어 추론에 사용해야 하는 과제는 통합 모델이 맞고, 이미지 분류나 추출처럼 결과가 구조화되는 과제는 분리 호출이 실용적이다.
모델 학습과 서빙을 연결하는 관점
사전 학습 모델에 모듈을 더해 능력을 확장하는 구조는 전이학습의 형태를 따른다. 동결 범위는 전이학습의 강도를 결정하고, 단계별 해동 스케줄은 학습 안정성을 위한 커리큘럼 설계에 해당한다.
모달 정렬 프로젝터는 서로 다른 표현 공간을 잇는 어댑터 계층이다. 입력에 따라 시각 경로를 선택하는 모달 분기는 요청 특성에 맞춰 실행 경로를 나누는 시스템 통합 설계다.
해상도 처리와 용도별 상한은 자원 소비를 예측 가능하게 하는 용량 계획의 일부다. 텍스트 회귀를 학습 중 반복 측정하는 방식은 성능 저하를 조기에 포착하기 위한 모니터링 설계이기도 하다.
증분 확장이 향하는 방향
검증된 텍스트 모델에 모달 모듈을 더하는 증분 확장은 멀티모달 능력을 확보하는 기본 경로로 굳어지는 방향이다. 동결 범위와 혼합 데이터 비율을 모델 카드에 공개하도록 요구하는 관행, 멀티모달 모델 공개 때 텍스트 회귀 지표를 함께 제시하는 관행도 확산되는 흐름이다.
서빙 계층에서는 추론 시 모달 분기를 이용한 비용 최적화가 기본 기능으로 편입되는 방향이다. 결국 비전 모듈 통합은 인코더를 붙이는 작업만으로 끝나지 않는다. 정렬, 해동, 회귀 감시, 해상도, 요청 분기를 하나의 운영 설계로 묶어야 텍스트 능력과 시각 능력을 함께 유지할 수 있다.
Sources
- deepseek-ai/DeepSeek-V4-Flash-Vision-Exp | Hugging Face
- DeepSeek-V4-Flash-Vision-Exp Release: Multimodal API Now Live | DeepSeek API Docs
- deepseek-ai/DeepSeek-V4-Flash | Hugging Face
- unsloth/DeepSeek-V4-Flash-Vision-Exp-GGUF | Hugging Face
- DeepSeek V4 Pro: Model Overview, Features & Performance Guide | DeepInfra