AI 도구·에이전트
로컬 LLM, 코딩 에이전트, MCP, 모델 비교·선택 — 최대 군집이자 트래픽 성장 축
829 POSTS · 7 / 28
Claude Fable 5와 Mythos 5의 듀얼 트랙 안전 배포
Claude Fable 5의 코딩·비전·영속 메모리 성능과 Mythos 5의 제한 배포 정책을 통해 프런티어 LLM의 안전 거버넌스를 분석한다.
2026-08-02
Claude Managed Agents: 프라이빗 MCP와 동적 워크플로우 보안 자동화
Claude Managed Agents의 프라이빗 MCP 샌드박스, 동적 워크플로우, 감사 로그 기반 엔터프라이즈 보안 자동화 구조를 정리한다.
2026-08-02
Claude 모델 EOL과 Agent SDK 과금 분리 대응
Claude 구형 모델의 API 지원 종료와 Agent SDK 과금 분리가 자동화 파이프라인에 미치는 영향과 마이그레이션 대응책을 다룬다.
2026-08-02
Claude 모델 패밀리 라우팅과 API 비용 최적화
Claude Opus·Sonnet·Haiku의 역할과 혼합 배포, 프롬프트 캐싱, 멀티모달 처리, 안전 아키텍처를 실무 관점에서 비교한다.
2026-08-02
Claude Opus 5 출시가 바꾸는 프런티어 LLM 티어링 전략
Claude Opus 5의 토큰 단가, 캐시·배치 할인, Fast mode와 모델 티어 라우팅을 바탕으로 AI 모델 조달과 비용 거버넌스를 정리한다.
2026-07-26
Claude Fable 5와 Mythos 5의 안전 가드레일 분리 설계
Claude Fable 5와 Mythos 5가 공유하는 MoE 아키텍처, 안전 라우팅 방식, 코딩 성능과 기업 활용 전략을 비교한다.
2026-06-10
Claude Managed Agents의 병렬 실행과 자기 개선 운영 구조
Claude Managed Agents의 병렬 오케스트레이션과 Dreaming 메모리, Outcomes 품질 루프, Webhooks 연동 구조를 분석한다.
2026-06-10
Claude Managed Agents의 프라이빗 MCP 연결과 샌드박스 보안 설계
Claude Managed Agents의 자체 호스팅 샌드박스, MCP 터널, 자격증명 격리와 엔터프라이즈 거버넌스 구조를 분석한다.
2026-06-10
Claude Opus 4.7의 장기 코딩과 멀티모달 비전 아키텍처
Claude Opus 4.7의 장기 코딩 루프, 1M 토큰 컨텍스트, 고해상도 멀티모달 비전 파이프라인과 경쟁 모델 포지셔닝을 분석한다.
2026-06-10
Claude Opus 4.8의 에이전틱 코딩 성능과 운영 아키텍처
Claude Opus 4.8의 SWE-Bench 성능, 적응적 추론, Dynamic Workflows, 코드 정직성, 가격과 에이전틱 배포 전략을 분석한다.
2026-06-10
Claude Opus 4.8 에이전틱 코딩 성능과 벤치마크 해석
Claude Opus 4.8의 코딩·도구 사용 성능을 벤치마크 구조와 하네스 변수, 실무 에이전트 배포 관점에서 분석한다.
2026-06-10
Claude Opus 4.8 Dynamic Workflows와 Ultracode의 에이전트 설계
Claude Opus 4.8의 Dynamic Workflows, 병렬 서브에이전트, 체크포인트, Ultracode 설계를 분석한다.
2026-06-10
Claude Opus 4.7과 SWE-bench로 보는 코딩 에이전트 평가
Claude Opus 4.7의 SWE-bench Verified 87.6% 성과와 멀티스텝 에이전트 구조, 모델 선택 기준을 분석한다.
2026-05-24
Claude Opus 4.7 장문 컨텍스트와 코딩 에이전트 설계
Claude Opus 4.7의 장문 컨텍스트 아키텍처와 코딩 성능, 멀티클라우드 가격 정책, 에이전트 워크플로우의 선택 기준을 실무 관점에서 다룬다.
2026-05-20
Claude Mythos Preview가 GPQA Diamond 94.6%를 찍었을 때, 그 0.3포인트가 의미하는 것
초대 전용 사이버보안 특화 모델 Claude Mythos Preview의 GPQA Diamond·SWE-bench 최고점 경신과 일반 공개 모델 Claude Opus 4.7의 SWE-bench 87.6% 달성, 벤치마크 포화·오염 문제를 함께 정리한다.
2026-05-18
Anthropic이 모델 공급자에서 Harvey AI의 경쟁자로 바뀐 순간
Claude for Legal의 12개 실무 영역 플러그인·20개 이상 MCP 커넥터와 Claude for Small Business의 SMB 통합, Harvey AI·Clio와의 버티컬 AI 경쟁 구도
2026-05-17
Claude Opus 4.7 vs GPT-5.5 — SWE-bench 방법론으로 뜯어보는 프런티어 모델 격차
Task Budget·Adaptive Thinking과 네이티브 옴니모달 병렬 처리로 갈린 Claude Opus 4.7·GPT-5.5의 SWE-bench·Terminal-Bench·MCP-Atlas 벤치마크 비교
2026-05-12
Claude Opus 4.7 — 고해상도 비전과 1M 컨텍스트가 표준 가격에 들어왔다
Claude Opus 4.7의 SWE-bench 87.6% 코딩 성능, 2576px 고해상도 비전 인코더, 1M 토큰 컨텍스트와 프롬프트 캐싱 경제성을 분석한다.
2026-05-11
Claude Managed Agents: 세션 시간 과금이 장기 실행 에이전트의 인프라 부담을 흡수하는 법
Anthropic Claude Managed Agents의 세션 라이프사이클 아키텍처, $0.08/세션시간 하이브리드 과금 모델, 멀티 테넌시 격리, Tool Execution Sandbox 설계와 경쟁 구도를 정리한다.
2026-05-05
Claude Opus 4.7 vs GPT-5.5: SWE-bench Pro와 Terminal-Bench 2.0으로 갈라진 특화 구도
Claude Opus 4.7의 SWE-bench Pro 우위와 GPT-5.5의 Terminal-Bench 2.0 우위가 보여주는 LLM 벤치마크 분야별 특화 구도와 실무 모델 선택 기준을 정리한다
2026-05-03
Claude Opus 4.7의 에이전트 신뢰성 설계: 목표 드리프트를 잡는 법
Claude Opus 4.7의 Constitutional AI·목표 상태 유지 메커니즘과 장기 멀티스텝 에이전트의 오류 복구·상태 관리·툴 호출 체인 검증 설계를 정리한다
2026-05-01
Claude Opus 4.6 LMSYS 1위·SWE-bench 65.3%: 에이전틱 소프트웨어 엔지니어링 LLM 벤치마크 평가 체계와 코딩 에이전트 설계
SWE-bench Verified·Pro의 평가 방법론, LMSYS Chatbot Arena의 Bradley-Terry 통계, Claude 코딩 에이전트의 도구호출·컨텍스트관리·MCP 아키텍처를 정리한다.
2026-04-26
Claude Opus 4.7 벤치마크: SWE-bench Pro에서 GPT-5.4를 앞선 이유
Claude Opus 4.7의 SWE-bench Verified·Pro 벤치마크, Task Budgets·xhigh Effort 컨텍스트 관리 설계, 비전 해상도 개선, GPT-5.4·Gemini 3.1 Pro 대비 포지셔닝을 정리한다
2026-04-23
Claude Opus 4.7의 SWE-bench 성능과 에이전틱 코딩 설계
Claude Opus 4.7의 SWE-bench 성능, 컨텍스트 관리, 비전 통합, 자기 검증 설계를 에이전틱 소프트웨어 엔지니어링 관점에서 분석한다.
2026-04-23
Claude Opus 4.6 vs Gemini 3.1 Pro: 벤치마크 동률 시대의 모델 선택 기준
Claude Opus 4.6과 Gemini 3.1 Pro의 SWE-bench·GPQA·LMSYS 벤치마크 비교와 평가 방법론의 한계, 태스크별 선택 기준과 비용 효율성을 정리한다
2026-04-22
Claude Opus 4.7, LMSYS 1위와 SWE-bench 87.6%가 가리키는 것
Claude Opus 4.7의 LMSYS Chatbot Arena 1위 달성과 SWE-bench Verified·Pro 벤치마크, 도구 오류 감소, 비전 강화와 프론티어 LLM 선택 기준을 정리한다.
2026-04-20
Claude Opus 4.7: 가격은 그대로, 토크나이저가 바뀌면서 달라지는 실질 요금
Anthropic Claude Opus 4.7의 에이전틱 코딩·스케일드 툴 사용 벤치마크, 토크나이저 변경이 실질 요금에 미치는 영향, GitHub Copilot 통합 아키텍처를 정리한다.
2026-04-18
Claude Opus 4.6, LMSYS 아레나 전 부문을 동시에 석권한 첫 모델
Claude Opus 4.6이 LMSYS Chatbot Arena 텍스트·코딩·검색 세 리더보드를 동시 석권한 배경과 SWE-bench 오염 문제, GPT-5.4·Gemini 3.1 Pro와의 3강 비교를 정리한다.
2026-04-17
Claude Opus 4.7: 1M 컨텍스트를 표준 가격에 연 프런티어 모델
Claude Opus 4.7의 1M 토큰 컨텍스트 아키텍처, 도구 호출 안정성 개선, 배포 채널과 활용 사례, 도입 시 고려사항을 정리한다
2026-04-17
Claude Opus 4.6, 벤치마크 숫자보다 눈에 띄는 건 가격이 그대로라는 점이다
2026년 2월 공개된 Claude Opus 4.6의 핵심 기능·벤치마크·가격 정책과 엔터프라이즈 시장에 미친 영향을 정리한다.
2026-02-12