Claude Managed Agents: 세션 시간 과금이 장기 실행 에이전트의 인프라 부담을 흡수하는 법

Anthropic Claude Managed Agents의 세션 라이프사이클 아키텍처, $0.08/세션시간 하이브리드 과금 모델, 멀티 테넌시 격리, Tool Execution Sandbox 설계와 경쟁 구도를 정리한다.

2026-08-14 · 최초 발행 2026-05-05

Anthropic이 Claude Managed Agents를 출시하며 기업이 별도의 샌드박스 인프라 없이 장기 실행 AI 에이전트를 곧바로 배포할 수 있는 관리형 플랫폼을 공개했다. 핵심 과금 체계는 세션당 시간 기반 요금($0.08/세션시간)과 기존 토큰 요금을 결합한 하이브리드 구조로, 운영 복잡도를 Anthropic이 흡수하고 기업은 에이전트 로직에만 집중할 수 있도록 설계됐다.

장기 실행 에이전트가 떠안겼던 운영 부담

2024년 이후 AI 에이전트는 단순 Q&A를 넘어 수십 분에서 수 시간에 걸쳐 실행되는 복잡한 워크플로우로 진화했다. 코드 리뷰, 데이터 파이프라인 감사, 멀티스텝 리서치 같은 태스크는 단일 API 호출로는 완수할 수 없다. 이 과정에서 기업 개발팀이 직접 해결해야 했던 운영 과제가 쌓였다. 세션 상태 영속성(session state persistence)이 첫 번째다 — HTTP는 본질적으로 무상태(stateless) 프로토콜이므로 에이전트가 수 시간 동안 맥락을 유지하려면 별도의 상태 저장소와 복원 로직을 구현해야 했다. 두 번째는 샌드박스 인프라 구축이다. 에이전트가 코드를 실행하거나 외부 도구를 호출할 때 격리된 실행 환경이 필요하고, 이는 컨테이너 오케스트레이션과 보안 정책 설정을 수반한다. 세 번째는 자원 정리(resource cleanup)로, 에이전트가 비정상 종료될 때 연결된 외부 리소스(파일, DB 커넥션, API 세션 등)가 누수되지 않도록 관리해야 한다. 네 번째는 과금 미터링이다 — 실행 시간과 토큰 소비를 추적해 비용 예측과 제한(throttling)을 구현해야 한다.

Claude Managed Agents는 이 운영 부담을 플랫폼 레벨로 끌어올려, 기업이 에이전트 비즈니스 로직에만 집중할 수 있도록 한다. 핵심 가치 제안은 세 가지다. 인프라 추상화는 개발자가 세션 라이프사이클 관리, 샌드박스 프로비저닝, 장애 복구 로직을 직접 구현하지 않아도 되도록 Anthropic 플랫폼이 투명하게 처리하는 것이고, 예측 가능한 과금은 세션 시간 기반 요금($0.08/세션시간)과 토큰 요금의 결합으로 비용 구조를 명확히 한 것이며 — 기존에는 에이전트 실행 중 발생하는 인프라 비용(컴퓨팅, 네트워크, 스토리지)이 토큰 비용과 별개로 발생했다 — 즉시 배포(zero-to-production)는 별도 인프라 설정 없이 API 키만으로 장기 실행 에이전트를 프로덕션 환경에 즉시 배포할 수 있다는 뜻이다.

시작부터 종료까지 세션이 지나는 경로

Claude Managed Agents의 세션 라이프사이클은 다음과 같다.

실패성공아니오계속종료클라이언트 요청(세션 시작)인증권한 확인401/403 반환샌드박스프로비저닝세션 컨텍스트초기화에이전트 실행루프 시작도구 호출필요?Tool ExecutionSandbox결과 반환 컨텍스트 업데이트응답 생성세션 지속여부상태 스냅샷저장자원 정리(Resource Cleanup)과금 레코드확정세션 아카이브

세션이 시작되면 Anthropic의 오케스트레이션 레이어가 격리된 샌드박스 환경을 프로비저닝한다. 이 샌드박스는 에이전트가 코드를 실행하거나 외부 API를 호출할 수 있는 안전한 컨테이너로, 호스트 시스템과 완전히 격리되어 있다.

장기 실행 에이전트에서 상태 영속성은 핵심 기능이다. Claude Managed Agents는 세 가지 수준의 상태 저장을 지원한다. 인컨텍스트 상태(In-context state)는 현재 실행 중인 대화 컨텍스트 내에서만 유지되는 단기 상태로, 토큰 윈도우 내에 존재하므로 추가 저장소가 필요 없지만 컨텍스트 길이 한계가 있다. 세션 스냅샷(Session snapshot)은 에이전트가 체크포인트를 선언할 때마다 현재 상태를 직렬화해 Anthropic의 관리형 스토리지에 저장하며, 네트워크 장애나 타임아웃 발생 시 마지막 스냅샷으로 복원한다. 영구 메모리(Persistent memory)는 세션 간에 유지되어야 하는 장기 정보를 벡터 스토어 또는 키-값 저장소와 연계해 관리하며, 이 레이어는 개발자가 Anthropic API를 통해 직접 제어할 수 있다.

실제 프로덕션 환경에서는 클라이언트 연결 끊김, 타임아웃, 에이전트 내부 오류 등 다양한 비정상 종료 시나리오가 발생한다. Managed Agents 플랫폼은 각 시나리오를 다르게 처리한다. 클라이언트 연결이 끊어지면 플랫폼은 구성된 grace period(기본 30초) 동안 재연결을 기다리고, 이 시간 내에 재연결되면 세션이 투명하게 복원된다. grace period가 만료되면 현재 상태를 스냅샷으로 저장하고 세션을 일시 중단 상태(suspended)로 전환하며, 일시 중단된 세션은 구성된 보존 기간(retention period) 동안 복원 가능 상태로 유지된다. 에이전트 내부 오류가 발생하면 플랫폼은 지수 백오프(exponential backoff)를 적용한 자동 재시도를 수행하고, 재시도 횟수 한계에 도달하면 세션이 실패 상태로 전환되면서 연결된 모든 외부 리소스에 대한 정리 핸들러가 실행된다.

세션 시간과 토큰을 나눠서 회수하는 과금 설계

Claude Managed Agents의 과금 체계는 세 차원으로 구성된다.

비용세션 시간 요금$0.08/세션시간입력 토큰 요금모델별 단가출력 토큰 요금모델별 단가인프라 비용흡수 (샌드박스,스토리지, 네트워크)LLM 추론 비용(프롬프트 처리)LLM 추론 비용(응답 생성)

세션 시간 요금은 에이전트가 실행되는 동안 소비되는 인프라 비용을 반영한다. 여기에는 샌드박스 컨테이너 실행, 상태 저장소 사용, 네트워크 트래픽, Anthropic 오케스트레이션 레이어의 운영 비용이 포함된다. 시간당 $0.08는 AWS Lambda나 Google Cloud Run 같은 FaaS 서비스와 비교하면 경쟁력 있는 수준이며, 직접 에이전트 인프라를 구축하는 데 드는 엔지니어링 비용을 감안하면 합리적이다. 토큰 요금은 기존 Claude API 단가 체계와 동일하게 적용된다. 장기 실행 에이전트는 긴 컨텍스트를 유지해야 하므로 토큰 비용이 상대적으로 높아지는데, Anthropic은 이를 상쇄하기 위해 프롬프트 캐싱(prompt caching) 기능을 Managed Agents에도 적용하고 있다.

AI 에이전트 서비스의 과금 모델은 크게 세 유형으로 나뉜다. 순수 시간 기반 과금은 에이전트 실행 시간에만 요금을 부과해 예측 가능성이 높지만, 토큰 소비량과 무관하게 비용이 발생하므로 토큰 효율이 낮은 워크플로우에서는 불리하고 개발 중 에이전트가 긴 사고 과정을 거쳐야 하면 비용이 급등할 수 있다. 순수 토큰 기반 과금은 소비된 토큰 수에만 과금하는 전통적인 LLM API 방식으로 단발성 호출에 최적화돼 있지만, 장기 실행 에이전트는 인프라 유지 비용이 토큰 비용과 별개로 발생하므로 이 모델만으로는 플랫폼이 지속 가능하지 않다. Claude Managed Agents가 채택한 세션 기반 하이브리드 과금은 세션 시간 요금으로 인프라 비용을 회수하고 토큰 요금으로 LLM 추론 비용을 회수해, 플랫폼 수익성을 보장하면서도 사용자에게 비용 예측 가능성을 준다.

과금 모델 예측 가능성 토큰 효율 반영 인프라 비용 포함 단발성 호출 적합성
순수 시간 기반 높음 낮음 낮음
순수 토큰 기반 중간 높음 아니오 높음
세션 하이브리드 높음 높음 중간

기업이 Claude Managed Agents 과금을 최적화하려면 몇 가지 전략을 쓸 수 있다. 세션 시간 최소화는 에이전트가 실제로 작업하지 않는 유휴 시간을 줄이는 것이 핵심으로, 외부 API 호출 대기·사용자 입력 대기 같은 유휴 상태에서는 에이전트를 일시 중단(suspend)했다가 입력이 준비되면 재개(resume)하는 패턴을 적용해야 한다. 프롬프트 캐싱 활용은 반복적으로 전송되는 시스템 프롬프트나 긴 컨텍스트 접두사를 캐시해 캐시 히트 시 입력 토큰 비용을 최대 90%까지 절감할 수 있다. 체크포인트 기반 세션 분할은 하나의 긴 에이전트 세션을 여러 체크포인트로 나눠 장애 복구 시 처음부터 재실행하는 비용을 방지하며, 체크포인트 간격은 태스크 중요도와 복구 비용을 고려해 설정한다.

수천 개 세션을 격리하는 인프라 설계

Claude Managed Agents는 수천 개의 동시 에이전트 세션을 지원해야 한다. 멀티 테넌시 아키텍처는 두 격리 수준을 제공하는데, 테넌트 간 격리(Cross-tenant isolation)는 서로 다른 기업의 에이전트 세션이 리소스를 공유하지 않도록 네트워크 정책·스토리지 암호화·컨테이너 격리를 적용하고 한 테넌트의 과부하가 다른 테넌트의 성능에 영향을 미치지 않도록 리소스 쿼터를 강제한다. 세션 간 격리(Cross-session isolation)는 동일 테넌트 내에서도 개별 에이전트 세션이 격리된 실행 환경을 갖도록 해, 세션 A의 파일 시스템·환경 변수·네트워크 연결이 세션 B로 누출되지 않는다.

테넌트 B테넌트 AAnthropic Managed Layer오케스트레이션레이어과금 미터링서비스상태 관리서비스세션 A-1Sandbox세션 A-2Sandbox세션 A-3Sandbox세션 B-1Sandbox세션 B-2Sandbox

에이전트가 코드 실행, 웹 검색, 파일 I/O 같은 도구를 쓸 때는 보안이 핵심이다. Managed Agents의 Tool Execution Sandbox는 gVisor 또는 Firecracker 기반의 마이크로VM으로 구현되며, 다음 보안 경계를 강제한다. 네트워크 정책은 기본적으로 모든 아웃바운드 연결을 차단하고, 에이전트 구성에서 허용할 도메인 목록을 명시적으로 선언해야 한다 — 이 화이트리스트 방식은 에이전트가 의도치 않게 민감한 내부 엔드포인트에 접근하는 것을 막는다. 파일시스템 격리는 각 세션이 독립된 임시 파일시스템을 갖도록 하며 세션 종료 시 완전히 삭제되고, 영구 저장이 필요한 데이터는 Anthropic이 제공하는 관리형 스토리지 API로 명시적으로 저장해야 한다. 리소스 쿼터는 CPU·메모리·디스크 I/O에 상한선을 강제해, 악의적이거나 버그가 있는 에이전트가 플랫폼 전체 리소스를 고갈시키는 것을 막는다.

기업 프로덕션 환경에서 에이전트 디버깅과 성능 모니터링은 필수다. Managed Agents는 세 가지 관찰 가능성 채널을 제공한다. 실시간 로그 스트리밍은 에이전트의 각 단계(도구 호출, 응답 생성, 상태 저장)를 실시간 로그 스트림에 기록하고, 개발자는 WebSocket이나 Server-Sent Events(SSE)로 이 스트림을 구독할 수 있다. 메트릭 대시보드는 세션별 실행 시간·토큰 소비량·도구 호출 횟수·오류율을 시계열 메트릭으로 수집하며, Anthropic 콘솔의 내장 대시보드와 Prometheus/OpenTelemetry 형식 내보내기(export)를 지원한다. 분산 추적(Distributed tracing)은 복잡한 멀티스텝 에이전트 워크플로우에서 개별 도구 호출이 연쇄적으로 발생할 때, OpenTelemetry 기반으로 전체 인과 관계 체인을 시각화한다.

기존 인프라에 붙이는 절차

Anthropic은 Claude Managed Agents를 기존 Anthropic Python/TypeScript SDK에 통합해 러닝 커브를 최소화했다. 기존 Claude API를 쓰던 개발자는 소수의 파라미터 추가만으로 Managed Agents로 마이그레이션할 수 있다. 세션 생성 API는 직관적으로 설계되어 있어, max_session_duration으로 세션 최대 지속 시간을 분 단위로 지정하고 tools에 에이전트가 쓸 도구 목록을 선언하면 플랫폼이 샌드박스 프로비저닝, 세션 추적, 자원 정리를 자동으로 처리한다. 개발자는 에이전트 비즈니스 로직(시스템 프롬프트, 도구 함수, 워크플로우 로직)에만 집중하면 된다.

대기업 환경에서 AI 에이전트를 기존 IT 인프라와 통합할 때 발생하는 과제도 해소한다. SSO/RBAC 통합은 SAML 2.0 및 OIDC를 통한 기업 SSO 통합을 지원해, 에이전트 세션 생성·관리 권한을 역할(role) 기반으로 제어할 수 있다. VPC 피어링은 기업 내부 API나 데이터베이스에 접근해야 하는 에이전트를 위해 기업 VPC와 Anthropic 샌드박스 네트워크 간의 피어링을 지원해, 에이전트가 인터넷을 거치지 않고 내부 리소스에 직접 접근할 수 있게 한다. 컴플라이언스 및 감사(Audit)는 불변(immutable) 감사 로그를 S3나 기업 SIEM 시스템으로 내보낼 수 있게 해 금융·의료 등 규제 산업의 요구를 충족한다.

기존에 자체 에이전트 인프라를 운영하던 기업을 위한 단계적 마이그레이션 경로도 제공된다.

API 호환성검증비용 비교분석SLA 검증(1) 자체 구축에이전트 인프라(2) Hybrid 운영신규 에이전트는Managed로(3) 점진적 마이그레이션기존 에이전트 이전(4) Full Managed전면 전환 완료

Anthropic은 기존 OpenAI Assistants API, LangChain Agents, AutoGen에서 마이그레이션하는 기업을 위한 호환성 레이어와 마이그레이션 가이드를 제공한다. 이 레이어는 기존 에이전트 코드의 변경을 최소화하면서 Managed Agents의 인프라 추상화 혜택을 누릴 수 있도록 한다.

모델 제공사에서 플랫폼 제공사로

Claude Managed Agents의 출시는 AI 에이전트 플랫폼 시장에서 Anthropic의 포지셔닝을 모델 제공사(model provider)에서 플랫폼 제공사(platform provider)로 격상시키는 전략적 움직임이다. OpenAI의 Assistants API와 비교하면 Claude Managed Agents는 세션 시간 기반 과금으로 장기 실행 에이전트에 특화된 가격 구조를 갖는다 — OpenAI Assistants는 스토리지 비용을 별도로 부과하는 반면 Managed Agents는 세션 시간 요금에 인프라 비용을 통합했다. Google의 Vertex AI Agent Engine과 비교하면 Claude Managed Agents는 모델과 인프라가 동일 벤더에서 제공되는 수직 통합의 이점을 가진다. Google Cloud를 이미 쓰는 기업에게는 Vertex AI가 유리하지만, 클라우드 중립(cloud-agnostic) 환경을 선호하는 기업에게는 Managed Agents가 더 매력적이다.

Claude Managed Agents의 출시는 AI 에이전트 개발 생태계에 두 가지 변화를 가져온다. 첫째는 진입 장벽 하락으로, 자체 에이전트 인프라를 구축할 역량이 없는 스타트업과 중소기업도 엔터프라이즈급 장기 실행 에이전트를 배포할 수 있게 되면서 AI 에이전트 활용 사례의 저변이 급격히 넓어질 것이다. 둘째는 표준화 가속으로, Managed Agents의 API 설계와 도구 호출 방식이 업계 표준으로 자리 잡을 가능성이 있다 — Anthropic이 Model Context Protocol(MCP)로 도구 생태계 표준화를 주도하고 있는 것처럼, Managed Agents의 세션 관리 API도 유사한 역할을 할 수 있다.

Claude Managed Agents는 장기 실행 AI 에이전트 배포의 운영 복잡도를 플랫폼 레벨로 흡수해 기업의 진입 장벽을 획기적으로 낮춘 관리형 서비스다. 세션당 시간 기반 요금($0.08/세션시간)과 토큰 요금을 결합한 하이브리드 과금 모델은 인프라 비용과 LLM 추론 비용을 투명하게 분리해 예측 가능한 비용 구조를 제공한다. 자체 인프라 없이 즉시 배포 가능한 관리형 환경, 풍부한 관찰 가능성 도구, 엔터프라이즈 통합 지원은 Anthropic이 단순 모델 제공사를 넘어 AI 에이전트 플랫폼 생태계의 핵심 인프라로 자리매김하려는 전략적 방향성을 명확히 보여준다.

Sources

Claude Managed AgentsAnthropic장기 실행 에이전트세션 과금멀티 테넌시