멀티모달 통합 벡터 검색 설계와 모달 편향 제어
텍스트·이미지·비디오를 공유 벡터 공간에서 검색할 때 필요한 정규화, 유사도 보정, 재순위, 편향 감시 설계를 다룬다.
2026-08-31
WeMM-Embedding은 텍스트, 이미지, 비디오, 시각 문서, 교차 입력을 단일 임베딩 모델군으로 다룬다. 대규모 멀티모달 정렬 뒤에 정제 데이터와 세밀한 관련성 감독, 교차 규모 지식 전이로 정교화하는 학습 구조를 제시했다. 2B 변형은 8B 오픈소스 베이스라인을 앞섰고, 9B 변형은 MMEB-v2 종합 80.6을 기록했다.
이 모델군은 위챗 채널스, 공식 계정, 모먼츠, 전자상거래의 검색과 추천에 사용된다. 이런 변화는 텍스트와 이미지를 별도 경로에서 검색한 뒤 결과를 합치던 구조를, 하나의 벡터 공간에서 질의하는 구조로 옮긴다. 다만 통합 자체가 품질을 보장하지는 않는다. 모달리티 사이의 거리 척도가 어긋나면 결과가 특정 모달에 집중될 수 있다.
결과 융합 대신 거리 왜곡을 관리하는 구조
분리 검색은 하나의 질의에서 결과 집합을 둘 이상 만든다. 그 뒤의 융합 규칙이 검색 품질을 결정한다. 반면 공유 벡터 공간에서는 결과가 한 벌로 반환되고, 교차 모달 질의도 별도 우회 경로 없이 처리할 수 있다.
이 구조의 전제는 모달 간 대응 관계가 같은 방향으로 정렬되는 것이다. 대규모 정렬 학습은 대응 쌍을 공유 공간에 배치하고, 이후 단계는 관련성의 미세한 차이를 구분한다. 통합 검색의 품질은 동일 모달 검색 성능만으로 판단할 수 없다. 교차 모달 검색 정확도까지 확인해야 한다.
모달마다 임베딩 노름 분포가 다르면 유사도 계산에서 어느 한쪽이 구조적으로 유리해진다. 모달별 정규화는 이 노름 차이가 순위에 개입하지 않도록 하는 장치다. 이어 텍스트-텍스트와 텍스트-이미지처럼 서로 다른 조합의 유사도 척도를 따로 보정해야 한다. 단일 보정 계수로는 조합별 왜곡을 남길 수 있다.
고유명사, 코드, 수치처럼 벡터 검색이 약한 대상은 키워드 검색을 병행한다. 이때 결합 가중치는 질의 유형에 따라 달라져야 한다. 모든 질의에 같은 가중치를 적용하면 두 방식의 강점이 희석된다.
후보를 넓게 가져온 뒤 재순위 모델로 상위를 다시 정렬하는 단계도 필요하다. 재순위는 교차 모달 순위의 왜곡을 마지막에 교정하는 위치이며, 대상 개수는 지연 예산과 정확도 사이의 교환 지점을 실측해 정한다.
색인은 모달과 도메인별로 파티셔닝하고, 질의 유형에 따라 탐색 범위를 제한할 수 있다. 그러나 파티션을 과도하게 세분하면 교차 모달 검색의 장점이 줄어든다. 분할 기준은 질의 로그로 검증해야 한다. 질의가 요구하는 결과 모달을 판정해 가중치를 조정하되, 판정에 실패한 경우에는 균등 가중으로 돌아가는 안전 기본값을 둔다.
쏠림은 정확도보다 구성 비율에서 먼저 보인다
통합 공간에서는 상위 k개 결과가 어떤 모달로 구성되는지 계속 관찰해야 한다. 모달 쏠림은 정확도 지표보다 구성 비율에서 먼저 드러날 수 있다. 전체 평균만 보면 이런 현상이 가려지므로, 질의 모달별 결과 모달 분포를 분리해 확인한다.
색인 대상 문서의 모달 구성과 실제 질의의 모달 구성도 따로 측정한다. 두 분포가 다르면 균등 가중부터 편향일 수 있다. 모달별 문서량 차이가 크다면 파티셔닝과 가중치 설계에서 무엇을 먼저 조정할지도 달라진다.
평가 질의는 동일 모달 질의와 교차 모달 질의로 나누고, 각각의 정답은 사람이 판정한다. 교차 모달 질의의 비중은 실제 트래픽에 맞추되 최소 표본 수를 확보한다. 보정 계수는 질의 모달과 문서 모달의 조합별로 탐색하며, 전체 평균이 아니라 조합별 정확도를 기준으로 변경 여부를 판단한다.
재순위는 정확도를 높이는 대신 지연을 더하므로 질의 유형별 적용 여부를 구분한다. 재순위가 없어도 충분한 유형을 식별하면 자원을 아낄 수 있다. 상위 k개 정확도 목표와 응답 지연 상한을 함께 정하고, 후보 개수·재순위 개수·파티션 수를 그 균형의 조절 항목으로 관리한다.
분리 검색과 통합 검색을 병행 운영하면서 질의 유형별 통합 비율을 높이는 방식도 가능하다. 모달 쏠림이 확인되면 해당 유형만 분리 경로로 되돌리는 부분 롤백을 허용한다. 보정 계수와 가중치는 형상 관리 대상으로 등록해 변경 이력을 남긴다. 이미지와 비디오 색인은 저작권 및 개인정보 처리 기준을 색인 대상 선정 단계에서 검토한다.
검색 경로별 선택 기준
| 구분 | 단일 통합 공간 | 모달별 분리 색인 |
|---|---|---|
| 융합 규칙 | 불필요 | 필수 |
| 교차 모달 질의 | 자연 지원 | 우회 필요 |
| 구현 복잡도 | 중간 | 높음 |
| 모달 쏠림 | 발생 가능 | 구조적 방지 |
| 모델 교체 | 전량 영향 | 부분 영향 |
| 튜닝 지점 | 보정 계수 | 융합 가중치 |
단일 통합 공간은 결과 융합 규칙을 별도로 설계하지 않아도 되고, 교차 모달 질의를 자연스럽게 처리한다. 모달이 추가되어도 색인 구조를 바꿀 필요가 없다. 대신 모달 간 유사도 척도가 맞지 않으면 결과가 한쪽으로 쏠릴 수 있으며, 임베딩 모델을 바꾸면 모든 모달의 색인이 함께 영향을 받는다.
모달별 분리 색인은 각 모달에 맞춘 모델과 색인 설정을 사용할 수 있고, 한 모달의 모델 교체가 다른 모달에 영향을 주지 않는다. 모달 쏠림도 구조적으로 발생하지 않는다. 그러나 결과 집합을 합치는 융합 가중치가 품질을 좌우하고, 교차 모달 질의에는 별도 우회 경로가 필요하다. 교차 모달 질의 비중이 낮다면 분리 색인이 단순하며, 비중이 높아질수록 통합 공간의 이점이 커진다.
이미지를 캡션으로 바꾼 뒤 텍스트 검색으로 처리하는 방법도 비교 대상이다. 교차 모달 검색은 시각적 특징을 임베딩에 직접 반영하므로 캡션에 포함되지 않은 세부 요소로도 검색할 수 있다. 전처리 단계가 없어 색인 지연이 짧고, 캡션화가 어려운 비디오와 시각 문서도 같은 방식으로 처리한다. 반면 결과의 근거가 벡터 유사도에 머물러 설명이 어렵고, 척도 보정이 부족하면 정확도가 불안정해질 수 있다.
캡션 변환 후 텍스트 검색은 근거가 텍스트로 남아 설명하기 쉽고 기존 텍스트 검색 인프라 및 키워드 검색과 자연스럽게 결합된다. 다만 캡션 생성 비용은 문서 수에 비례하며, 캡션이 놓친 시각 정보는 이후에도 검색되지 않는다. 캡션 모델의 편향 역시 검색 결과에 반영된다. 설명 가능성이 중요한 도메인에서는 교차 모달 검색 결과에 캡션을 부가 정보로 제시하는 절충이 사용된다.
재순위를 적용하면 1차 검색에서 놓친 미세한 관련성 차이를 교정하고, 넓은 후보군으로 재현율을 확보할 수 있다. 교차 모달 척도 왜곡도 마지막 단계에서 바로잡을 수 있다. 그 대가로 재순위 대상 개수만큼 연산과 지연이 늘며, 별도 서빙 자원과 검증 대상이 생긴다. 원 유사도만 사용하는 방식은 지연이 짧고 구성이 단순하지만, 근접 후보의 순위를 세밀하게 가르기 어렵고 모달 간 척도 차이가 그대로 순위에 반영된다. 상위 순위 정확도가 사용자 체감에 큰 영향을 주는 검색이라면 재순위의 지연 비용이 대체로 정당화된다.
검색·멀티미디어·데이터 아키텍처에서 보는 설계 지점
1차 검색과 재순위의 조합은 재현율을 먼저 확보한 뒤 정밀도를 높이는 검색 파이프라인의 형태다. 하이브리드 키워드 결합은 어휘 일치와 의미 유사가 서로 보완한다는 점을 활용한다.
모달별 정규화와 조합별 보정 계수는 이종 특징 공간의 척도를 통일하는 문제다. 비디오와 시각 문서의 분할 단위를 텍스트와 다르게 정하는 일은 매체 특성에 맞춘 색인 단위 설계에 해당한다.
색인 파티셔닝과 질의별 탐색 범위 제한은 분할 기준과 조회 패턴을 맞추는 일이다. 보정 계수 및 가중치를 형상 관리 대상으로 다루는 것은 검색 품질에 영향을 주는 설정을 변경 통제하는 방식이기도 하다.
통합 임베딩이 향하는 방향
텍스트·이미지·비디오·시각 문서를 하나의 임베딩으로 처리하는 구성은 RAG 파이프라인의 기본형으로 자리 잡는 방향이다. 검색 품질 대시보드에는 상위 결과의 모달 구성 비율이 상시 지표로 포함되는 흐름이 나타난다.
교차 모달 유사도 보정을 학습 단계에서 모델 내부에 흡수하려는 연구도 늘어나는 방향이며, 멀티모달 재순위 모델은 지연 부담 없이 기본 적용되는 쪽으로 경량화되는 흐름이다.
통합 벡터 공간의 핵심 이점은 결과 집합을 합치는 규칙을 없애는 데 있다. 대신 모달리티 간 거리 왜곡이 새로운 관리 대상이 된다. 조합별 보정 계수, 재순위, 그리고 상위 결과의 모달 구성 비율 감시는 이 왜곡을 다루는 핵심 장치다.
Sources
- WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report | arXiv
- Tencent/WeMM-Embedding | GitHub
- Paper page - WeMM-Embedding | Hugging Face
- Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking | arXiv
- TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings | arXiv