서열 정렬·BLAST·프로파일 HMM을 조합하는 생물정보학 분석

서열 정렬, BLAST, 프로파일 HMM의 원리와 성능 특성, 유전체 주석 및 도메인 탐지 파이프라인 설계 방법을 정리한다.

2026-08-14 · 최초 발행 2024-04-29

유사성을 찾는 방식은 분석 목적에 따라 달라진다

유전체와 단백질 서열에서 유사 영역, 변이, 보존 패턴을 찾는 일은 동일한 알고리즘 하나로 끝나지 않는다. 두 서열을 정밀하게 비교할 때는 Sequence Alignment를, 대규모 데이터베이스에서 후보를 빠르게 찾을 때는 BLAST를, 패밀리와 도메인의 보존 특성을 해석할 때는 Hidden Markov Models(HMM)를 사용한다.

Sequence Alignment는 두 서열의 최적 정렬을 구하는 절차다. 전체 구간의 대응 관계가 필요하면 Needleman–Wunsch 전역 정렬을, 일부 보존 구간을 찾으려면 Smith–Waterman 국소 정렬을 선택한다. 여러 서열을 함께 맞추는 다중 서열 정렬(MSA)도 이 범주에 속한다.

BLAST는 k-mer 인덱싱과 HSP(High-scoring Segment Pair) 확장을 이용하는 시드-확장 휴리스틱이다. 모든 후보를 정밀 정렬하는 대신 가능성 있는 구간부터 탐색해 검색 공간을 줄인다. HMM은 은닉 상태 전이와 방출 확률로 서열 패턴을 표현하며, 프로파일 HMM은 단백질 패밀리와 도메인에서 유지되는 특징을 포착하는 데 쓰인다.

점수와 확률이 정렬 결과를 결정하는 방식

정렬 점수는 매치와 미스매치, 갭 오픈 및 익스텐션 페널티의 조합으로 계산한다. 단백질 정렬에서는 PAM 또는 BLOSUM 치환 행렬을 적용해 진화적 거리를 반영한다. 갭 페널티는 민감도와 특이도 사이의 균형에 영향을 주므로 데이터 특성에 맞춰 다뤄야 한다.

Needleman–Wunsch와 Smith–Waterman은 동적 계획법(DP)으로 계산하며 O(mn)의 시간·공간 복잡도를 가진다. 긴 서열이나 대량 비교에서는 밴딩(banded DP), 히르쉬버그(Hirschberg)의 O(n) 공간 기법, SIMD/GPU 가속으로 부담을 줄일 수 있다.

BLAST는 k-mer 시드를 찾고, 매칭된 시드를 양방향으로 확장한 뒤 통계 점수를 산출한다. SEG/DUST로 저복잡도 영역을 마스킹하고 인덱스를 사용하면 10~100배 수준의 속도 향상을 얻을 수 있지만, 일부 민감도 손실은 감수해야 한다.

프로파일 HMM은 매치·인서트·딜리트 상태와 전이·방출 확률로 구성된다. Viterbi는 최우도 경로를, Forward-Backward는 우도의 합산을 이용해 정렬과 점수를 계산한다. 이 방식은 원거리 상동성 검출에 강점이 있다.

BLAST의 E-value와 HMMER의 bit score·독립 E-value는 결과를 필터링하는 기준이다. 다중 가설 보정(FDR)과 임계값 캘리브레이션을 함께 적용해 위양성을 통제한다.

입력 데이터가 분석 경로로 이어지는 흐름

전처리/품질 통제Pairwise 정렬유사 서열 검색패밀리/도메인 탐지허용저품질 필터입력: Query 서열/DB, MSA작업 유형DP 정렬: NW/SW스코어링: 치환행렬+갭 페널티출력: 정렬 결과+정렬 점수BLAST: k-mer 인덱싱HSP 확장통계: E-value 산출출력: 히트 목록+정렬 스니펫Profile HMMViterbi/Forward 추론출력: 도메인 히트+bit score저복잡도/반복 마스킹DB 인덱스 구축MSA→HMM 학습(hmmbuild)앰비규어스 염기 'N'?

유전체 주석과 품질 관리에 연결하기

유전체 주석 파이프라인에서는 유전자 후보를 예측하고 단백질로 번역한 뒤, BLASTP로 최근접 상동체를 검색할 수 있다. 이어 HMMER로 도메인 주석을 보강하며, 이 과정에서 저복잡도 마스킹과 E-value/FDR 기준을 적용한다.

원거리 상동성이나 도메인을 탐지할 때는 Pfam/InterPro 프로파일 HMM이 기능 모듈 식별에 쓰인다. 신규 단백질 패밀리를 클러스터링한 후 MSA→hmmbuild→hmmsearch 순서로 적용할 수 있다.

오염 또는 혼합 시료의 QC에는 BLASTN/MEGABLAST로 컨티그 오염을 스크리닝한다. 종 레벨 판별에 사용할 E-value, coverage, identity 임계값은 분석 정책으로 정해 둘 필요가 있다. 프라이머와 프로브의 특이성은 국소 정렬 또는 BLAST로 오프타겟 후보를 찾고, 미스매치 허용 기준과 녹는점(Tm) 범위 정책에 연결해 검토한다.

속도와 최적성 사이의 운영 선택

알고리즘 성능(속도) 확장성 일관성(최적성) 안정성(잡음/저복잡도 대응) 운영 편의
DP 정렬(NW/SW) 낮음~중간, O(mn) 중간, 밴딩/GPU로 개선 높음, 전역 최적성 보장 중간, 마스킹·스코어 튜닝 필요 중간, 파라미터 단순
BLAST 높음, 10~100× SW 높음, 인덱스/분산 병렬 중간, 휴리스틱 근사 중간~높음, 저복잡도 필터 제공 높음, 도구/DB 표준화
Profile HMM(HMMER) 중간 높음, DB 스캔 최적화 높음, 확률 모델 강건 높음, 원거리 상동성 강점 중간, MSA/HMM 관리 필요

정밀도보다 탐색 범위가 먼저 필요한 경우 BLAST를 앞단에 둔다. 반대로 두 서열의 정렬 자체가 분석 대상이면 DP 정렬이 적합하다. 도메인 수준의 보존 패턴과 원거리 상동성을 확인해야 할 때는 프로파일 HMM이 더 잘 맞는다.

파라미터를 데이터셋 정책으로 관리하기

파이프라인은 품질 필터·저복잡도 마스킹·프레임 변환으로 전처리한 뒤, BLAST로 광범위하게 스크리닝하고, DP 정렬 또는 HMMER로 정밀 검증하는 방식으로 구성할 수 있다. 마지막 단계에서는 E-value, coverage, identity, bit score 기준을 표준화하고 다중 가설 보정 결과를 보고서에 반영한다.

BLAST에서는 word_size를 늘리면 속도는 높아지고 민감도는 낮아진다. -seg yes-evalue 1e-5~1e-10 범위를 운영 기준으로 둘 수 있다. DP 정렬은 단백질에서 BLOSUM62, 갭 오픈 11/익스텐션 1을 관례로 사용하며, 밴딩 폭은 기대 변이율을 바탕으로 정한다. HMMER에서는 GA(Trusted) 임계값과 도메인 E-value, 시퀀스 E-value를 함께 적용한다.

속도와 민감도, 휴리스틱 편향과 최적성, 단일 서열 정렬 점수와 확률적 패밀리 모델의 해석 가능성은 서로 맞바꾸는 요소다. 데이터셋에 맞춘 임계값 캘리브레이션이 필요하다.

최소 실행 예시

환경 전제는 Linux x86_64, Python 3.10, Biopython 1.81, BLAST+ 2.14+, HMMER 3.3.2이다.

Python으로 Smith–Waterman 국소 정렬을 실행하는 예시는 다음과 같다.

from Bio import pairwise2
from Bio.SubsMat import MatrixInfo as mat

query = "PAWHEAE"
target = "HEAGAWGHEE"
matrix = mat.blosum62
aligns = pairwise2.align.localds(query, target, matrix, -11, -1)
best = max(aligns, key=lambda a: a.score)
print(best.score, pairwise2.format_alignment(*best))

BLASTP 데이터베이스를 만들고 빠른 검색을 수행할 수 있다.

makeblastdb -in swissprot.fasta -dbtype prot -out db/sp
blastp -query q.faa -db db/sp -evalue 1e-5 -seg yes -max_target_seqs 5 -outfmt "6 qseqid sseqid pident length evalue bitscore"

MSA에서 프로파일 HMM을 만든 뒤 단백질 데이터베이스를 스캔한다.

# MSA로부터 프로파일 HMM 생성
hmmbuild myfam.hmm myfam.sto
# 단백질 DB 스캔
hmmsearch --cpu 8 --cut_ga --tblout hits.tbl myfam.hmm proteome.faa

BLAST를 도입하면 전수 SW 대비 평균 10100배 검색 시간 단축을 기대할 수 있다. 밴디드 SW+SIMD 적용 시 최대 520배 가속과 F1 손실 ≤ 13% 수준이 제시되며, HMMER 기반 도메인 검출에서는 원거리 상동성 재현율(Recall) 1030%p 개선 사례가 있다. 파이프라인을 표준화하면 재현성이 높아지고, 임계값 정책화는 위양성을 줄이며 기능 주석의 일관성을 확보하는 데 도움이 된다.

생물정보학서열 정렬BLASTHMM유전체 분석