AI 코딩 CLI 기능 수렴 이후의 도구 선택 기준

Claude Code, Codex CLI, Gemini CLI, OpenCode의 공통 기능과 성능 평가 기준, 태스크별 병용 전략을 비교한다.

2026-08-14 · 최초 발행 2026-05-08

2026년 5월의 AI 코딩 CLI 시장에서 Claude Code, Codex CLI, Gemini CLI, OpenCode는 서로 다른 출발점에도 불구하고 상당히 비슷한 기능 목록을 갖추게 됐다. 플랜 모드, 샌드박싱, 서브에이전트, ask-user 툴, 병렬 실행, 메모리 레이어, MCP 통합이라는 7대 핵심 기능이 대표적이다.

기능 패리티가 형성되면 비교 질문도 달라진다. 이제는 특정 기능의 유무보다 코드베이스를 어떻게 탐색하고, 변경을 얼마나 일관되게 수행하며, 어떤 태스크에서 비용과 시간을 줄이는지가 더 중요한 판단 기준이다.

기능 경쟁에서 실행 품질 경쟁으로

2025년 7월 투자자 Deedy Das가 공개한 자료에 따르면 Claude Code는 115,000명의 개발자가 사용하고 있었으며, 주간 1억 9,500만 줄의 코드를 처리했다. 2026년 1월 GlobalData 인플루언서 연구에서는 Twitter/X의 코딩 에이전트 언급 가운데 Claude Code가 75%를 차지했다.

Gemini CLI는 무료 티어와 Cloud Shell 통합으로 진입 장벽을 낮추며 사용자를 확보했다. OpenAI는 Codex CLI를 Rust로 재구현해 성능 경쟁에 합류했고, OpenCode는 오픈소스 대안으로 입지를 다졌다.

기능 수렴은 빠르게 진행됐다. 한 도구가 새로운 작업 방식을 선보이면 수주 안에 경쟁 도구가 유사한 기능을 내놓았다. Gemini CLI는 2026년 3월 Plan Mode를 추가했으며, OpenCode는 Build와 Plan을 기본 에이전트로 제공한다. MCP 역시 네 도구가 모두 지원한다.

계획과 실행을 분리하는 플랜 모드

플랜 모드는 에이전트가 코드를 곧바로 수정하지 않고 읽기 전용 상태에서 코드베이스를 분석한 뒤 실행 계획을 제시하는 방식이다. 사용자가 계획을 검토하고 승인하면 실제 변경 단계로 넘어간다.

Claude Code는 에이전틱 실행에 앞서 계획을 세우는 단계를 내장한다. Gemini CLI는 2026년 3월 Plan Mode를 공식 추가했다. OpenCode는 읽기 전용인 Plan과 전체 도구를 사용할 수 있는 Build를 기본 Primary Agent로 나눠 계획과 구현의 경계를 구조화했다.

이 모드는 변경 범위가 넓거나 잘못된 판단의 비용이 큰 작업에서 특히 유용하다. 구현 전에 영향 파일과 접근법을 확인할 수 있어 에이전트의 자율성과 사용자의 통제를 함께 유지할 수 있다.

자율 실행의 경계를 만드는 샌드박싱

샌드박싱은 에이전트가 파일 시스템, 네트워크, 시스템 리소스에 접근할 수 있는 범위를 격리하고 제한한다. 에이전트가 의도하지 않은 파괴적 명령을 수행하거나 필요 이상의 자원에 접근하는 일을 막는 안전장치다.

구현 방식에는 차이가 있다. Claude Code는 권한 시스템을 통해 도구별 허용 범위를 세밀하게 제어한다. Codex CLI는 Rust 기반 프로세스 격리로 빠른 샌드박스 초기화를 구현한다. OpenAI Agents SDK와 Codex CLI는 엔터프라이즈 보안 배포를 위한 강화된 샌드박싱을 2026년에 발표했다.

서브에이전트와 병렬 작업 분해

서브에이전트는 메인 에이전트가 탐색, 구현, 검증처럼 성격이 다른 작업을 나눠 맡길 때 호출하는 보조 에이전트다. 독립적인 태스크를 동시에 처리할 수 있어 대규모 코드베이스 분석이나 멀티 파일 변경에 적합하다.

OpenCode는 Primary Agent인 Build·Plan과 Subagent인 General·Explore를 명시적으로 구분한다. Claude Code는 서브에이전트를 호출해 여러 파일을 병렬로 분석한다. Codex CLI는 Rust 기반 멀티스레딩으로 병렬 서브태스크를 처리한다.

병렬 실행도 같은 맥락에 있다. 서로 의존하지 않는 분석과 수정 작업을 동시에 진행하면 대규모 리팩토링이나 멀티 파일 조사에 필요한 시간을 줄일 수 있다. Claude Code의 병렬 서브에이전트 호출과 Codex CLI의 Rust 기반 병렬 처리가 대표적인 구현이다.

외부 시스템과 연결하는 MCP

MCP(Model Context Protocol)는 AI 에이전트가 외부 도구, 서비스, 데이터 소스에 표준화된 방식으로 접근하도록 연결하는 프로토콜이다. Claude Code, Codex CLI, Gemini CLI, OpenCode는 모두 MCP를 지원하며 GitHub, PostgreSQL, 파일시스템 같은 MCP 서버를 구성 파일에 추가할 수 있다.

OpenCode에서는 opencode.json으로 로컬 및 원격 MCP 서버를 관리한다. 내장 도구와 커스텀 도구, MCP 도구의 권한에는 같은 와일드카드 패턴을 적용할 수 있다.

MCP 지원 여부 자체가 공통 기능이 된 뒤에는 연결 가능한 서버의 수보다 구성 관리와 권한 통제가 실제 운영 차이를 만든다.

프로젝트 맥락을 이어가는 메모리

메모리 레이어는 프로젝트 설정과 코딩 규칙, 이전 작업 결과 같은 컨텍스트를 세션 사이에 유지한다. 반복 작업마다 같은 배경을 다시 설명해야 하는 부담을 줄이는 기능이다.

Claude Code는 CLAUDE.md에 저장한 프로젝트 메모리와 세션 안의 대화 히스토리를 함께 사용한다. Gemini CLI는 Google Cloud 기반의 세션 상태 관리를 제공한다.

ask-user 툴은 메모리와는 다른 방식으로 판단의 불확실성을 다룬다. 에이전트가 결정에 필요한 정보나 권한이 부족할 때 임의로 진행하지 않고 사용자에게 승인 또는 추가 정보를 요청한다. 사람이 개입해야 할 지점을 실행 흐름 안에 남겨 두는 안전 메커니즘이다.

Claude Code는 멀티 파일 일관성에 초점을 둔다

Claude Code의 강점은 멀티 파일 리팩토링과 에이전틱 코드베이스 이해에 있다. 사용자가 컨텍스트 파일을 일일이 선택하지 않아도 에이전틱 검색을 통해 관련 코드를 찾고, 여러 파일에 걸친 변경의 일관성을 유지하는 접근이다. SWE-bench Verified에서는 80.9%를 기록해 네 도구 가운데 가장 높은 점수를 보였다.

긴 컨텍스트 창을 이용해 프로젝트 구조를 함께 이해하는 방식은 대규모 모노레포보다 중규모의 복잡한 프로젝트에서 효과적이다. 함수 시그니처, 호출부, 타입, 테스트가 함께 바뀌는 작업이 대표적인 활용 범위다.

Codex CLI는 터미널 작업과 빠른 수정에 강하다

Codex CLI는 2026년에 Rust로 재구현됐다. 시작 시간과 토큰 처리 속도에서 경쟁 도구보다 눈에 띄게 빠르며, Terminal-Bench 2.0에서는 77.3%를 기록했다. 터미널을 중심으로 실행되는 코딩 에이전트 태스크에 특화된 결과다.

작업 성격으로 보면 의도 중심의 단일 파일 태스크에서 강점을 보인다. ChatGPT Plus 구독자는 별도 비용 없이 사용할 수 있다는 점도 비용 효율에 영향을 준다.

Gemini CLI는 큰 코드베이스의 초기 탐색에 어울린다

Gemini CLI의 차별점은 Google Gemini의 긴 컨텍스트 창이다. 모노레포 전체를 컨텍스트에 올려 초기 구조를 파악하고 코드베이스를 이해하는 작업에 적합하다. 무료 티어와 Cloud Shell 통합은 도입 장벽을 낮춘다.

2026년 3월 추가된 Plan Mode는 읽기 전용 탐색 단계에서 전략을 세운 뒤 파일 수정으로 넘어가는 흐름을 제공한다. Gemini CLI로 대규모 코드베이스를 탐색해 초기 이해를 확보하고 Claude Code로 전환해 프로덕션 수준의 구현을 수행하는 병용 방식도 채택되고 있다.

OpenCode는 모델과 에이전트 구성을 열어 둔다

OpenCode는 오픈소스 AI 코딩 CLI다. Primary Agent인 Build·Plan과 Subagent인 General·Explore를 분리해 각 역할을 분명하게 구성한다. OpenAI, Anthropic, Google 모델 가운데 필요한 백엔드를 선택할 수 있다는 점도 특징이다.

MCP 연결은 opencode.json에서 관리하며 권한을 세밀하게 설정할 수 있다. 특정 모델에 종속되지 않으려는 개발팀이나 자체 에이전트 구성이 필요한 조직이라면 벤더 독립성이 중요한 선택 이유가 된다.

벤치마크 하나로는 실전 성능을 설명하기 어렵다

AI 코딩 CLI는 강점을 보이는 태스크가 서로 달라 단일 벤치마크 점수만으로 평가하기 어렵다. 비교하려는 작업부터 분리해야 한다.

평가 대상에는 단일 파일 버그 수정의 SWE-bench 유형, 의존성 추적이 필요한 멀티 파일 리팩토링, 질문 응답 정확도로 확인하는 대규모 코드베이스 이해, Terminal-Bench 유형의 터미널 자동화, 커버리지와 통과율을 보는 테스트 코드 자율 생성 등 5개 영역이 포함된다.

각 태스크에서는 성공률(pass rate), 완료까지 필요한 턴 수(turns to completion), 전체 토큰 비용(total token cost), 첫 응답과 완료 시간으로 나눈 레이턴시를 함께 봐야 한다. 어느 한 지표만 높다고 실제 개발 워크플로우에서도 효율적인 것은 아니다.

비용은 성공한 태스크를 기준으로 계산한다

토큰 가격만 비교하면 재시도 비용을 놓치기 쉽다. 결과 품질이 낮아 수정 요청과 재실행이 반복되면 처음 제시된 가격이 낮아도 최종 비용은 커질 수 있다.

태스크 성공당 비용(Cost per Successful Task)은 다음 관계로 계산한다.

태스크 성공당 비용 = 총 토큰 비용 / 성공한 태스크 수

실제 생산성을 평가하려면 재시도와 수정 요청뿐 아니라 사용자 개입 시간도 비용에 포함해야 한다. Gemini CLI는 무료 티어를 통해 초기 탐색 단계에서 높은 비용 효율을 제공한다. Codex CLI는 ChatGPT 구독에 포함되므로 이미 ChatGPT를 사용하는 개발자에게 사실상 무료다. Claude Code는 복잡한 태스크의 1회 성공률을 높여 재시도 비용을 줄이는 방향으로 비용 효율을 확보한다.

긴 컨텍스트와 선택적 검색의 차이

2026년 차별화 경쟁에서 롱 컨텍스트 코드베이스 이해는 핵심 영역이다. 엔터프라이즈 코드베이스가 수백만 줄에 이르는 경우, 필요한 맥락을 얼마나 빠짐없이 확보하느냐가 CLI의 실용성을 좌우한다.

Gemini CLI는 Gemini 모델의 1M+ 토큰 컨텍스트 창을 이용해 모노레포 전체를 한 번에 처리하는 방향을 택한다. Claude Code는 에이전틱 검색으로 필요한 파일을 골라 컨텍스트를 조립한다.

전체 로딩은 초기 구조를 폭넓게 이해할 수 있지만 비용이 높다. 선택적 검색은 비용 효율이 좋지만 관련 파일을 놓칠 위험이 있다. 코드베이스 규모와 변경 범위를 고려해 어느 접근이 적합한지 판단해야 한다.

리팩토링 품질은 변경의 연결부에서 드러난다

멀티 파일 리팩토링은 코드를 생성하는 것만으로 끝나지 않는다. 함수 시그니처가 바뀌면 모든 호출 지점을 함께 수정해야 하고, import 경로와 타입 시스템, 테스트 코드도 일관되게 반영해야 한다.

Claude Code는 멀티 파일 리팩토링에서 높은 일관성을 보이는 도구로 2026년 개발자 커뮤니티에서 평가받는다. Codex CLI는 단일 파일 수정 품질이 우수하지만 대규모 멀티 파일 리팩토링에서는 상대적인 약점이 있다는 평가가 있다.

테스트 생성은 실행과 검증까지 이어져야 한다

자율 테스트 생성은 에이전틱 코딩 CLI 사이에서 충분히 구분되지 않던 영역이었지만, 2026년에는 차별화 지점으로 부상했다. 구현 코드와 테스트 코드를 함께 작성하고 CI 파이프라인에서 테스트를 실행해 통과 여부까지 확인하는 end-to-end 워크플로우가 중심이다.

Claude Code의 오케스트레이션과 서브에이전트 구조는 구현 에이전트와 테스트 에이전트를 병렬로 실행하는 데 유리하다. OpenCode의 Build·Explore 이중 에이전트 구조도 이러한 작업 흐름에 맞는다.

태스크에 따라 도구를 바꾸는 병용 방식

2026년에는 한 도구만 고정해서 쓰기보다 작업에 맞춰 여러 CLI를 병용하는 개발자가 늘고 있다. 널리 쓰이는 방식은 Gemini CLI로 대규모 코드베이스를 탐색하고 초기 구조를 이해한 다음, Claude Code로 전환해 프로덕션 수준의 구현을 진행하는 흐름이다.

CC Switch는 Claude Code, Codex, Gemini CLI, OpenClaw를 하나의 데스크톱 인터페이스에서 전환하고 관리할 수 있게 한다. 이런 관리 도구의 등장은 병용 워크플로우가 일반화되고 있음을 보여주는 신호다.

선택 기준은 비교적 명확하다. 대규모 코드베이스의 탐색과 초기 이해에는 Gemini CLI가 어울린다. 복잡한 멀티 파일 리팩토링과 버그 수정에는 Claude Code가 강점을 보인다. 빠른 단일 파일 수정과 터미널 자동화에는 Codex CLI가 적합하다. 벤더 독립성이나 커스텀 에이전트 구성이 우선이라면 OpenCode를 검토할 수 있다.

플랜 모드, 샌드박싱, 서브에이전트, MCP 통합, 메모리 레이어, ask-user 툴, 병렬 실행이라는 7대 기능이 네 도구에 자리 잡으면서 기능 목록만으로는 선택하기 어려워졌다. 비교의 무게중심은 실행 품질과 워크플로우 적합성으로 옮겨갔다. 경쟁도 자율 테스트 생성, 롱 컨텍스트 코드베이스 이해, 비용 효율을 중심으로 이어질 전망이다.

Sources

AI 코딩 도구코딩 에이전트개발자 CLIMCP에이전틱 코딩