데이터 어노테이션 기법 — 바운딩 박스부터 시맨틱 분할까지

이미지 어노테이션의 대표 기법인 바운딩 박스·폴리곤·폴리라인·포인트·큐보이드·시맨틱 분할의 특징과 활용 사례, 프로젝트별 선택 기준을 정리한다.

2026-08-14 · 최초 발행 2025-05-23

이미지 한 장에 사각형을 그릴지, 픽셀 단위로 색을 칠할지는 단순한 작업 방식의 차이가 아니다. 모델이 무엇을 배울 수 있고 무엇을 배울 수 없는지를 결정하는 선택이다. 데이터 어노테이션은 원본 데이터에 '태그' 형태의 메타데이터를 추가해 AI가 그 의미를 인식하도록 만드는 과정이며, 이미지·텍스트·오디오·비디오 등 어떤 유형의 데이터에도 적용된다. 양질의 어노테이션이 곧 모델의 패턴 인식과 의사결정 능력을 좌우하기 때문에, 기법 선택은 프로젝트 초기에 내려야 할 핵심 결정 중 하나다.

사각형 하나로 빠르게 — 바운딩 박스

바운딩 박스는 객체의 가장자리에 맞춘 사각형으로 위치를 표시하는 가장 단순한 어노테이션 기법이다. 구현이 간단하고 가공이 빨라 객체 탐지(Object Detection)의 기본 방식으로 널리 쓰이지만, 사각형이라는 형태 특성상 불필요한 배경 픽셀을 함께 포함하게 되어 복잡한 형태의 객체에는 부정확할 수 있다.

자율주행 차량이 보행자·차량·신호등을 인식하거나, 의료 영상에서 종양이나 특정 조직을 탐지하거나, 보안 카메라가 사람과 물체를 감지하는 시스템 모두 바운딩 박스를 기본 어노테이션으로 삼는다.

원본 이미지객체 식별좌표 지정: 좌상단·우하단 x,y사각형 형태 바운딩 박스 생성메타데이터 저장: 클래스, 좌표

윤곽을 따라 그리는 폴리곤

폴리곤은 다수의 점(버텍스)으로 객체를 둘러싸 비규칙적 형태를 정확하게 선택하는 기법이다. 바운딩 박스보다 정교한 분류가 가능하지만, 겹쳐진 객체를 인식할 때는 다소 부정확할 수 있다.

위성 이미지에서 지형을 분석하거나, 의료 영상에서 특정 장기·조직의 세밀한 경계를 인식하거나, 농업 분야에서 작물 상태를 모니터링하는 작업이 폴리곤을 필요로 한다.

원본 이미지객체 윤곽 식별다수의 점으로 외곽선 표시점들을 연결해 다각형 형성메타데이터 저장: 클래스,점의 좌표

선을 쫓는 폴리라인

폴리라인은 시작점과 끝점이 서로 다른, 연결되지 않은 열린 형태의 선 어노테이션이다. 선형 객체 인식에 특화되어 있어 전선·도로·차선처럼 1픽셀 너비인 경우에도 유용하게 쓸 수 있고, 폴리곤과 달리 시작점과 끝점을 다시 연결하지 않는다는 점이 구조적 차이다.

도로 인프라의 차선 감지, 전력선 모니터링, 지도 제작과 경로 탐색, 의료 영상에서의 혈관 추적이 대표적인 활용 사례다.

원본 이미지선형 객체 식별주요 순차 지정점들을 선으로 연결메타데이터 저장: 종류, 좌표시퀀스

점 하나로 충분한 포인트

포인트는 이미지 상의 단일 픽셀이나 작은 영역을 표시하는 가장 가벼운 어노테이션 기법이다. 작업이 쉽고 빠르며 최소한의 메타데이터로 위치 정보를 표현할 수 있지만, 객체의 윤곽 자체가 불명확한 경우에는 적용이 어렵다.

얼굴 인식에서 눈·코·입 같은 특징점을 찍거나, 포즈 추정(Pose Estimation)에서 관절 위치를 표시하거나, 군중 밀도를 분석하거나, 천문학 이미지에서 별과 천체의 위치를 표시하는 데 주로 쓰인다.

원본 이미지관심 지점 식별x,y 좌표 지정포인트 마커 표시메타데이터 저장: 종류, 좌표값

깊이를 담는 큐보이드

큐보이드는 길이·너비·높이를 모두 고려한 직육면체 형태의 어노테이션으로, 2D 이미지가 가진 한계를 넘어 3D 환경의 깊이 정보를 식별하게 해준다. 다만 객체가 불규칙하거나 일부가 잘려 보이는 경우에는 작업이 까다로워진다.

자율주행 차량의 3D 물체 인식, 증강현실(AR)·가상현실(VR) 콘텐츠 개발, 로봇의 물체 조작과 공간 인식, 컴퓨터 비전 기반 3D 모델링에서 필수적으로 쓰인다.

3D 스캔 데이터/이미지3D 객체 식별8개 꼭지점 좌표 지정직육면체 형태 생성메타데이터 저장: 클래스, 3D좌표, 방향

픽셀 단위까지 파고드는 시맨틱 분할

시맨틱 분할은 이미지의 모든 픽셀에 클래스 레이블을 할당해 색상으로 구분하는 가장 정밀한 어노테이션 기법이다. 장면 전체를 완벽히 이해할 수 있는 고차원 방법이지만, 그만큼 작업량과 비용이 크게 요구된다.

정밀한 의료 영상 분석(조직 분할), 위성 이미지의 토지 이용 분류, 자율주행 차량의 환경 인식, 증강현실에서의 배경·전경 분리가 대표적인 적용 사례다.

원본 이미지픽셀 단위 분석 픽셀을 클래스로 분류클래스별 색상 지정메타데이터 저장: 픽셀별클래스

무엇을 기준으로 고를 것인가

여섯 기법 중 무엇을 쓸지는 몇 가지 축으로 결정된다.

  • 정확도와 세부 수준: 높은 정밀도가 필요하면 시맨틱 분할이나 폴리곤을, 빠른 처리가 중요하면 바운딩 박스나 포인트를 선택한다.
  • 데이터 유형: 2D 이미지에는 바운딩 박스·폴리곤·시맨틱 분할이, 3D 데이터에는 큐보이드가, 선형 객체에는 폴리라인이 맞는다.
  • 리소스: 예산과 시간이 한정적이면 바운딩 박스나 포인트로, 리소스가 충분하면 시맨틱 분할이나 폴리곤으로 간다.
  • 적용 분야: 자율주행은 큐보이드와 시맨틱 분할을, 의료 영상은 폴리곤과 시맨틱 분할을, 얼굴 인식은 포인트와 바운딩 박스를 조합해 쓰는 경우가 많다.

도구 선택과 품질 관리

일반적인 어노테이션 작업에는 LabelImg, VGG Image Annotator, CVAT 같은 범용 도구가 쓰이고, 3D 데이터는 LabelCloud, 의료 영상은 ITK-SNAP처럼 도메인에 특화된 도구를 쓴다.

품질은 도구만으로 보장되지 않는다. 여러 어노테이터가 동일 데이터를 처리하는 교차 검증, 동일 클래스에 대한 어노테이션 방식을 통일하는 일관성 검사, 결과를 표본 추출해 확인하는 정기적 리뷰가 함께 돌아가야 한다. 데이터셋 규모가 커질수록 작업 분배 방안, 자동화·반자동 어노테이션 도구 도입, 크라우드소싱을 활용할 때의 품질 관리 방안까지 함께 설계해야 한다.

데이터 어노테이션바운딩 박스시맨틱 분할컴퓨터 비전객체 탐지