멀티모달 입력 조립과 토큰 예산을 설계하는 방법

멀티모달 입력에서 문서·이미지·비디오를 선별하고 토큰 예산, 프레임 샘플링, 해상도 정책을 운영하는 아키텍처

2026-09-02 · 최초 발행 2026-08-04

Qwen3.8-Max가 최대 100만 토큰 컨텍스트 윈도에서 텍스트·이미지·비디오를 받고 텍스트를 출력하는 구성으로 제시되면서, 문서와 화면 캡처, 영상 기록을 한 요청에 결합하는 선택지가 현실에 가까워졌다. 다만 입력 가능량이 곧 최적 입력량은 아니다. 이미지와 비디오는 텍스트보다 토큰 단가가 훨씬 비싸며, 관련 없는 자료를 계속 더하면 핵심 정보는 오히려 묻힌다.

입력 조립의 핵심은 무엇을 넣을지보다 무엇을 제외하거나 줄일지 정하는 데 있다. 원문 보존, 요약, 프레임 추출, 해상도 축소를 나누는 규칙이 비용과 정확도를 함께 좌우한다.

긴 컨텍스트가 해결하지 못하는 입력 설계 문제

텍스트, 이미지, 비디오, 문서를 하나의 요청에 섞어 넣고 텍스트 결과를 받는 방식은 멀티모달 모델의 기본적인 활용 형태다. Qwen3.8-Max는 트리리언급 파라미터 규모 모델 중 최초의 멀티모달 계열로 제시됐다.

같은 정보량이라도 모달리티별 토큰 환산량은 수십 배 차이 날 수 있다. 순수 텍스트가 가장 저렴하고 비디오가 가장 비싸다. 컨텍스트를 늘린다고 정확도가 단조롭게 오르는 것도 아니다. 무관한 입력이 누적되면 필요한 정보가 희석된다.

그래서 컨텍스트 한도가 커졌다는 이유로 검색 단계를 제거하면 안 된다. 요청당 단가는 급격히 오르지만 정확도는 나아지지 않는 경우가 많다. 필요한 것은 모달리티별 토큰 환산 계측, 프레임 샘플링, 해상도 조정, 요약 정책, 배치 순서, 관련성 선별을 하나의 조립 체계로 묶는 일이다.

입력을 예산 안에 넣기 전 거치는 경로

이미지 토큰 수는 해상도와 타일 분할 방식의 영향을 받고, 비디오 토큰 수는 프레임 수와 프레임당 해상도에 좌우된다. 요청을 보내기 전에 환산량을 계산하지 않으면 비용을 통제하기 어렵다. 예산을 넘으면 자동으로 입력을 축소하는 게이트가 필요하다.

비디오에서는 초당 몇 프레임을 뽑을지가 비용을 결정한다. 균일하게 추출하는 방식보다 장면 전환을 기준으로 적응적으로 샘플링하면 정보 밀도를 높일 수 있다. 화면 녹화처럼 정적인 화면이 이어지는 구간은 대표 프레임 하나로 대체하는 편이 효과적이다.

이미지는 용도에 따라 해상도 정책을 달리해야 한다. 텍스트가 담긴 화면 캡처는 해상도를 낮추면 판독 자체가 실패할 수 있다. 반면 장면 중심 이미지는 축소할 여지가 있다. 모든 이미지를 원본 해상도로 보내는 관행은 흔한 낭비 지점이다.

긴 문서는 전량 투입 대신 관련 구간을 발췌하거나 계층 요약을 적용할 수 있다. 이때 요약으로 잃을 정보 유형을 미리 정의해야 한다. 표와 수치는 요약 손실이 크므로 원문 유지 대상으로 별도 분류한다.

고정 지시와 공통 컨텍스트는 앞에 배치하고, 요청마다 달라지는 입력은 뒤로 둔다. 이 순서는 프리픽스 캐시 적중률을 유지하는 데 도움이 된다. 이미지와 비디오를 앞쪽에 두면 캐시가 통째로 무력화되는 경우가 많으므로, 대용량 모달리티는 후방 배치가 기본이다.

관련성 선별도 조립 단계에 포함된다. 검색으로 후보를 먼저 압축하고 남은 자료만 원본으로 넣는 2단 구성은 비용과 정확도 모두에서 유리한 경우가 많다. 선별 기준은 코드로 고정해야 변경 효과를 측정하고 되돌릴 수 있다.

⤢✕텍스트이미지예아니오비디오초과이내원시 입력 (문서 · 캡처 · 영상)모달리티 분류관련 구간 발췌 · 계층 요약문서형 캡처?해상도 유지 (판독 보장)해상도 축소장면 전환 기반 프레임 샘플링모달리티별 토큰 환산 계측토큰 예산 상한 초과?관련성 낮은 입력 제외 · 샘플링간격 확대배치 순서 결정 (고정 앞 · 가변뒤)요청 전송입력 구성 · 비용 · 정확도 기록

업무 유형별 정책을 운영 규칙으로 만들기

회의 녹화 요약, 장애 화면 분석, 계약서 검토는 필요한 입력 형식이 다르다. 업무별로 어떤 모달리티를 어떤 형태로 받을지 표준을 정의해야 한다. 이를 각 담당자 판단에 맡기면 비용 편차가 수십 배까지 벌어질 수 있다.

영상은 성격에 맞춰 프레임 추출 간격을 설정하고 장면 전환 감지로 보정한다. 조작 화면을 녹화한 영상과 실사 영상은 같은 기준으로 다룰 수 없다. 간격을 좁혔을 때의 정확도 개선폭을 실측해 수확 체감 지점을 찾아야 한다.

예산 상한은 요청당, 업무당, 팀당으로 계층화한다. 요청 단위에만 제한을 두면 총량은 통제되지 않는다. 상한 초과를 단순 거부로 처리하는 대신 자동 축소로 연결하면 업무 중단을 피할 수 있다.

요약 품질은 요약본 입력과 원문 입력의 결과를 표본으로 비교해 검증한다. 차이가 허용 범위를 넘는 업무는 원문 유지 대상으로 분류한다. 이 검증은 도입 시점에 한 번으로 끝나지 않는다. 입력 데이터의 성격이 바뀌면 결과도 달라진다.

비용 관리는 모달리티별 토큰 사용량, 요청당 평균 비용, 업무별 비용 귀속을 함께 집계하는 방식이 적합하다. 정확도 지표와 나란히 보지 않으면 비용 절감이 실제 품질 저하를 가릴 수 있다. 입력 구성 변경은 비용과 품질을 동시에 바꾸므로 코드 변경과 같은 리뷰 절차를 적용할 필요가 있다.

영상과 캡처에는 의도하지 않은 개인정보가 포함될 수 있다. 사전에 처리 기준을 정하고, 입력 구성 이력의 보존 기간과 접근 권한도 함께 정의해야 한다.

일괄 투입과 선별 투입의 선택 기준

구분 장문 컨텍스트 일괄 투입 검색 기반 선별 투입
구현 난도 낮음 인덱싱 필요
요청당 단가 높음 낮음
정보 누락 위험 낮음 선별 실패 시 발생
희석 효과 발생 억제
지연 김 짧음
재현성 높음 인덱스 상태 의존

장문 컨텍스트 일괄 투입은 인덱싱 인프라 없이 바로 시작할 수 있다. 선별 실패로 핵심 정보를 누락할 위험이 적고, 입력 구성이 단순해 재현도 쉽다. 대신 요청당 토큰이 급증해 단가와 지연이 커지며, 무관한 내용이 섞이면 정답이 희석된다.

검색 기반 선별은 필요한 구간만 넣어 단가와 지연을 낮추고 정확도도 개선되는 경우가 많다. 반면 인덱스를 만들고 유지해야 하며, 선별 로직이 실패하면 모델이 보지 못하는 정보가 생긴다. 실무에서는 검색으로 후보를 좁힌 뒤 남은 후보를 넉넉히 투입하는 절충이 안정적이다. 컨텍스트 한도 확대는 선별 단계를 없애는 수단이 아니라 이 절충의 여유 폭을 넓힌다.

비디오도 같은 관점에서 판단한다. 원본을 투입하면 순간 동작이나 짧은 전환을 놓치지 않고 시간 연속성을 전달할 수 있지만, 토큰 환산량이 폭증해 짧은 영상 하나로 예산이 소진될 수 있다. 실제로는 대부분 프레임이 직전 프레임과 거의 동일한 경우도 많다.

프레임 샘플링은 비용을 수십분의 일로 낮추고 정적 구간의 중복을 없앤다. 그러나 샘플링 간격보다 짧게 일어난 사건은 구조적으로 관측되지 않는다. 순간 동작 판별이 목적이라면 간격을 좁히고, 진행 경과 요약이 목적이라면 장면 전환 기준으로 크게 벌리는 차등 적용이 맞다.

단일 멀티모달 모델은 파이프라인을 하나로 줄여 연동 지점을 없애고, 모달리티 간 교차 참조가 필요한 과제에서 장점이 있다. 특정 모달리티 성능이 약해도 부분 교체가 어렵고 모든 품질 책임이 한 모델에 집중된다는 한계도 있다.

모달리티별 전용 모델 조합은 단계마다 높은 성능의 모델을 고를 수 있고 문제 구간만 교체할 수 있다. 대신 단계별 중간 산출물에서 정보가 손실되고 연동 코드의 유지 부담이 쌓인다. 교차 모달 추론이 핵심이면 단일 모델이, 단계별 정확도 요구가 뚜렷하면 조합 방식이 유리하다.

비용·품질·재현성을 함께 관리하는 관점

프레임 샘플링과 해상도 조정은 정보 손실을 감수하는 압축이다. 설계의 중심은 업무별 손실 허용선을 정하는 데 있다. 문서형 이미지와 장면형 이미지는 판독 요구가 다르므로 하나의 해상도 정책으로 처리할 수 없다.

입력 배치 순서는 캐시 적중과 정보 전달 효율을 함께 결정한다. 관련성 선별 기준을 코드로 고정하는 일은 입력 조립을 재현 가능한 자산으로 만드는 작업이기도 하다.

모달리티별 토큰 환산 계측은 원가 산정의 출발점이며, 계층적 예산 상한은 총량을 제어하는 수단이다. 요청 단위로 어떤 입력이 어떤 형태로 얼마나 들어갔는지 남기고 모달리티별 토큰 사용량을 저장해야 비용을 귀속할 수 있다. 품질 문제가 생겼을 때 원인이 모델인지 입력 구성인지 판별하려면 이 이력이 필요하다.

컨텍스트 한도 확대가 이어지면서 경쟁의 기준은 한도 크기에서 유효 활용 정확도로 옮겨가는 흐름이다. 모달리티별 토큰 환산기와 예산 게이트는 SDK 기본 기능으로 제공되는 방향이며, 장면 전환 기반 적응 샘플링은 비디오 전처리의 표준 관행으로 자리잡는 흐름이다. 입력 구성 이력도 AI 시스템 감사 항목으로 요구되며 기록 의무가 강화되는 방향이다.

Sources

멀티모달 AI토큰 예산프레임 샘플링LLM 아키텍처전처리