AI 도구·에이전트
로컬 LLM, 코딩 에이전트, MCP, 모델 비교·선택 — 최대 군집이자 트래픽 성장 축
898 POSTS · 29 / 30
프론티어 모델 위험 평가를 위한 제3자 검증 아키텍처
프론티어 모델의 위험 능력을 독립적으로 검증하기 위한 시나리오, 격리 환경, 원자료 접근, 재현 및 공개 규격 설계
2026-08-31
상태 외부화로 설계하는 컨텍스트 프로그래밍 에이전트
영속 IPython 커널과 RLM을 기반으로 컨텍스트를 변수로 분리하고, 상태 조회·격리·스냅숏을 설계하는 방법을 다룬다.
2026-08-06
Sora 2 API 종료에 대비한 Veo 3.1 마이그레이션 설계
Sora 2 API 종료 일정과 Veo 3.1 전환 방법을 짚고, 영상 생성 서비스를 위한 멀티 벤더 추상화와 운영 리스크 관리 방안을 정리한다.
2026-08-02
Sora 종료 이후 영상 생성 AI 플랫폼 아키텍처 비교
Sora 종료 이후 Google Veo 3.1, Kling 3.0, Runway Gen-4.5의 생성 구조와 품질·비용·API 특성을 비교하고 마이그레이션과 이중화 설계를 정리한다.
2026-08-02
스파스 MoE에서 활성 파라미터와 메모리 예산을 분리하는 법
스파스 MoE의 전문가 라우팅 구조와 활성 파라미터, 총 파라미터를 분리해 추론 비용과 자체 호스팅 자원을 산정하는 방법
2026-08-02
Spotify Honk가 보여준 도메인 중심 AI 코딩 전략
Spotify 내부 AI 코딩 에이전트 Honk의 구조와 도메인 전문성이 개발 성과·리뷰·조직 운영을 바꾸는 방식을 Claude Code 세션 분석과 함께 다룬다.
2026-08-02
SubQ 1M-Preview의 희소 어텐션과 초장기 컨텍스트 검증
SubQ 1M-Preview가 주장하는 SSA 구조와 초장기 컨텍스트 성능을 Mamba·RWKV·선형 어텐션과 비교하고 검증 쟁점을 짚는다.
2026-08-02
SubQ SSA가 초장문 컨텍스트의 어텐션 비용을 줄이는 방식
SubQ의 서브쿼드래틱 희소 어텐션 구조와 초장문 컨텍스트 처리 방식, RAG와의 선택 기준 및 독립 검증 과제를 분석한다.
2026-08-02
자율 코딩 에이전트 벤치마크 Terminal-Bench 2.1, Claude Fable 5는 어떻게 85% 벽을 넘었나
Terminal-Bench 2.1 리더보드로 보는 Codex CLI·Claude Fable 5·Gemini CLI 성능 비교와 자율 코딩 에이전트 엔터프라이즈 도입 전략
2026-08-02
Terminal-Bench 2.1로 읽는 AI 코딩 에이전트 선택 기준
Terminal-Bench 2.1 성능과 Claude Code 세션 연구를 바탕으로 Codex CLI, Claude Code, Antigravity의 선택 기준을 비교한다.
2026-08-02
텍스트 투 비디오 모델 선택: Kling v3와 Veo 3.1의 경쟁 구도
Kling v3, Veo 3.1, Seedance 2.0의 텍스트 투 비디오 경쟁 구도와 모델 선택, 품질 평가, 운영 통제 기준을 정리한다.
2026-08-02
소형 모델 특화 학습의 손익분기와 프런티어 모델 라우팅
소형 모델 강화학습 미세조정과 프런티어 모델 폴백을 결합해, 태스크별 추론 비용·품질·운영 부담의 손익분기를 설계하는 방법
2026-07-31
장문 AI 출력에서 스트리밍 검증과 체크포인트를 설계하는 법
장문 AI 출력의 절단·형식 오류·재시도 비용을 줄이기 위한 스트리밍 검증, 섹션 체크포인트, 이어쓰기 재개 설계
2026-07-31
Sora API 종료에 대비하는 영상 생성 파이프라인 이전 설계
Sora API 9월 24일 종료에 맞춰 대체 모델 검증, 규격 매핑, 프롬프트 전환, 검수와 인코딩까지 영상 생성 파이프라인 이전을 설계하는 방법
2026-07-28
Sora API 종료에 대비하는 생성형 미디어 마이그레이션 설계
Sora API 종료 일정에 맞춰 생성형 미디어 서비스를 이전하는 방법과 추상화 계층, 프롬프트 자산, 품질 회귀 게이트 설계를 정리한다.
2026-07-26
Codex와 Claude Code: 터미널 코딩 에이전트의 경쟁 구도
Codex와 Claude Code의 모델 구성, 서브에이전트 오케스트레이션, 품질 게이트와 도입 거버넌스를 비교한다.
2026-07-23
SubQ의 12M 네이티브 컨텍스트와 서브쿼드라틱 어텐션 설계
SubQ가 SSM·선형·희소 어텐션으로 12M 네이티브 컨텍스트를 처리하는 방식과 분산 캐시, 배치 전략, RAG 대체 가능성, 트랜스포머 대비 비용 구조를 분석한다.
2026-06-10
SmallCode: 7B~20B 로컬 LLM으로 터미널 코딩 에이전트를 돌리는 설계법
7B~20B 소형 로컬 LLM으로 온디바이스 프라이버시를 보장하는 터미널 코딩 에이전트 SmallCode의 아키텍처 설계와 클라우드 에이전트 대비 트레이드오프를 정리한다.
2026-05-21
Sora 종료 이후 AI 비디오 생성 플랫폼의 경쟁 구도
OpenAI Sora 종료 배경을 짚고 Runway Gen-4.5, Kling 3.0, LTX-2.3의 아키텍처와 시장 전략을 비교한다.
2026-05-20
SubQ와 Zyphra가 여는 비트랜스포머 LLM 상용화 경쟁
SubQ의 하이브리드 구조와 Zyphra의 AMD 기반 MoE를 중심으로 비트랜스포머 LLM의 메모리 효율과 장문 처리, 상용화 경쟁을 분석한다.
2026-05-19
SubQ가 1,200만 토큰 컨텍스트를 상용화한 방법 — 콘텐츠 의존적 희소 어텐션
마이애미 스타트업 Subquadratic의 SSA(Subquadratic Sparse Attention) 아키텍처가 12M 토큰 컨텍스트를 어떻게 실용화했는지, 선형 어텐션·SSM·희소 어텐션과의 차이와 벤치마크 검증 현황을 정리한다.
2026-05-18
Tokenmaxxing이 드러낸 AI 코딩 비용과 생산성의 간극
Tokenmaxxing 데이터로 AI 코딩 도구의 토큰 소비, 코드 반영률, 품질 지표와 총소유비용을 분석하고 기업의 비용 통제 기준을 짚는다.
2026-05-18
Stripe·OpenAI의 하네스 엔지니어링: 주당 1,300개 PR을 버티는 AI 코딩 에이전트 인프라
Stripe Minions과 OpenAI Codex 팀의 대규모 AI 코딩 에이전트 프로덕션 배포 사례에서 태스크 스코핑·샌드박스 격리·리뷰 게이트로 이어지는 하네스 엔지니어링 원칙을 정리한다
2026-05-11
Stripe Link가 여는 AI 에이전트 자율 결제 인프라
Stripe Link와 Issuing for Agents, SPT가 AI 에이전트의 구매 권한을 어떻게 위임하고 결제 자격증명·한도·감사 로그로 통제하는지 실무 구조를 정리한다.
2026-05-08
TradingAgents는 매수·매도 논거를 일부러 싸우게 설계했다
TradingAgents의 Bull·Bear 리서처 대립 구조, 리스크 가이드 사전 검토, 앙상블 가중치 집계 메커니즘과 범용 멀티에이전트 프레임워크와의 설계 비교
2026-05-04
Steerling-8B — 출력 토큰을 학습 데이터까지 역추적하는 해석 가능 LLM
개념 분해 임베딩과 마스크드 디퓨전으로 모든 출력을 학습 데이터 소스까지 역추적하는 Guide Labs Steerling-8B의 아키텍처와 규제 산업 감사 적용
2026-05-01
TradingAgents는 트레이딩 데스크를 통째로 LLM 에이전트로 옮겼다
TauricResearch가 공개한 LLM 다중 에이전트 금융 거래 프레임워크 TradingAgents의 계층 구조, 통신 프로토콜, 전통 알고리즘 트레이딩과의 차이와 실무 적용 시 고려사항을 정리한다.
2026-04-03
understudy: 사용자 시연으로 학습하는 로컬 데스크톱 AI 에이전트
오픈소스 로컬 데스크톱 에이전트 understudy가 시연 한 번으로 스킬을 추출하는 원리, 점진적 성장 구조, 이중 트랙 녹화와 SKILL.md 구조를 정리한다.
2026-03-27
이슈 티켓 하나로 PR까지 — OpenAI의 자율 개발 오케스트레이션 도구, Symphony
OpenAI가 2026년 3월 공개한 오픈소스 프레임워크 Symphony의 Implementation Run·Proof of Work·WORKFLOW.md 구조와 Elixir 기술 스택 선택 이유, 에이전트 감독 6원칙을 정리한다.
2026-03-14
명세 기반 개발: 코드가 틀렸다고 말할 수 있으려면 명세가 먼저 옳아야 한다
코드가 아닌 명세를 진실의 원천으로 삼는 명세 기반 개발(SDD)의 엄격성 수준, Design by Contract, 명세 기반 테스팅과 AI 시대의 적용 사례를 정리한다.
2026-02-13